COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Prompt Engineeringllm-era2022technique

ReAct — Reason + Act

Interleave reasoning steps com tool calls. 'Pensar → Agir → Observar → Pensar...'. Base de todo agente moderno.

O quê

ReAct (de Reason + Act) é o padrão de prompting proposto por Shunyu Yao e colegas (Princeton / Google) em outubro de 2022 que intercala passos de raciocínio com ações (chamadas a ferramentas externas). Em vez de só pensar (Chain-of-Thought (CoT)) ou só agir, o modelo alterna: Pensar → Agir → Observar → Pensar → … até resolver a tarefa. É o loop fundamental por trás de praticamente todo agente moderno.

A intuição: raciocínio puro alucina e propaga erros porque não tem como verificar fatos; ação pura (chamar ferramentas) age sem planejar. ReAct combina os dois — o raciocínio decide qual ação tomar e interpreta o resultado; a ação traz informação real do mundo de volta para o raciocínio.

Como funciona

O traço ReAct

O prompt induz o modelo a emitir uma sequência estruturada:

Thought: preciso descobrir quando X nasceu.
Action: search("data de nascimento de X")
Observation: X nasceu em 1912.
Thought: agora preciso calcular a idade em 1950.
Action: calculate(1950 - 1912)
Observation: 38
Thought: tenho a resposta.
Answer: 38 anos.

Cada Observation é injetada de volta no contexto, fechando o loop. O modelo planeja, executa, observa o resultado real e ajusta — inclusive recuando de becos sem saída.

A elegância está em que nada disso exige treino especial: ReAct é um padrão de prompting que funciona sobre modelos instruct comuns, descrevendo o formato esperado e dando um ou dois exemplos. As três variantes degeneradas ajudam a entender o valor da combinação: Standard (só a resposta), CoT (só pensamentos, sem ações — alucina porque não verifica) e Act (só ações, sem pensamentos — age sem planejar). ReAct é a interseção que captura o melhor dos dois.

Resultados originais

No paper, ReAct foi testado interagindo com uma API simples da Wikipedia. Em HotpotQA (Q&A multi-hop) e Fever (verificação de fatos), reduziu alucinação e propagação de erro frente a CoT puro, ao ancorar o raciocínio em fatos recuperados. Em benchmarks de decisão interativa (ALFWorld, WebShop), superou métodos de imitação e RL por margens absolutas de 34% e 10%, usando apenas um ou dois exemplos no contexto. Combinar ReAct com Self-Consistency (CoT-SC) deu os melhores resultados.

Por que importa

  • É a base do paradigma agêntico. Function calling, ferramentas, navegação web e computer use são, no fundo, loops ReAct.
  • Ancorou raciocínio em realidade. Ao trazer observações externas, reduziu o problema de o modelo “inventar” fatos no meio de uma cadeia.
  • Interpretável. O traço de pensamentos/ações/observações é legível por humanos — facilita depurar agentes.

Estado em 2026

ReAct deixou de ser técnica de prompting manual e virou comportamento embutido: frameworks (LangChain, LlamaIndex), as APIs de agentes da OpenAI, o function calling nativo, o Computer Use da Anthropic e o MCP — Model Context Protocol todos implementam o loop reason-act-observe sob o capô. Os modelos de raciocínio (o1 / o3 (Reasoning Models), DeepSeek R1 (2025)) internalizaram parte do “Thought” no próprio treino, mas o esqueleto pensar-agir-observar permanece o contrato de qualquer agente que toca o mundo externo. Os desafios atuais são confiabilidade em loops longos, controle de custo (cada passo é uma chamada) e segurança contra Prompt Injection vinda das observações — um agente que lê uma página web maliciosa pode ter seu raciocínio sequestrado por instruções escondidas no conteúdo que ele acabou de “observar”. Como cada observação reentra no contexto como texto, distinguir “dado a ser usado” de “instrução a ser obedecida” é o problema de segurança central dos agentes de 2026, e é exatamente o tipo de ataque que a hierarquia de instruções e o Red Teaming tentam mitigar.

Tratamento de carta — proposta

ReAct Loop Conceito · Neutral · custo

Reason + Act. No fim do seu turno, se você jogou uma Técnica (Act) E ativou uma habilidade de entrada/ETB (Reason) neste turno, compre 1 carta (Observe).

“Pensar. Agir. Observar. Repetir — até o mundo concordar com você.”

A mecânica recompensa fechar o ciclo no mesmo turno: pensamento + ação geram uma observação (compra), exatamente como o loop.

Veja também

Chain-of-Thought (CoT) · Function Calling / Tool Use · LLM Agents · MCP — Model Context Protocol · Self-Consistency

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. arXiv:2210.03629.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in LLMs. NeurIPS 2022. arXiv:2201.11903.
  • Nakano, R. et al. (2021). WebGPT: Browser-assisted question-answering. arXiv:2112.09332.