Self-Consistency
Faça N respostas com sampling diferente; pegue a resposta mais frequente. Robustifica CoT.
O quê
Self-Consistency é a técnica de decodificação proposta por Xuezhi Wang e colegas (Google) em março de 2022 que melhora Chain-of-Thought (CoT) de forma simples e robusta: em vez de gerar uma cadeia de raciocínio (decodificação gulosa), gere N cadeias diversas com amostragem (temperatura > 0) e escolha a resposta final mais frequente — uma votação por maioria.
A intuição é elegante: para um problema com resposta única, há muitos caminhos de raciocínio errados, mas eles tendem a discordar entre si, enquanto os caminhos corretos tendem a convergir para a mesma resposta. Marginalizar sobre múltiplas cadeias e votar filtra o ruído dos erros idiossincráticos.
Como funciona
- Prompt CoT: peça ao modelo para raciocinar passo a passo.
- Amostre N cadeias: rode o modelo N vezes (ex.: N = 5 a 40) com temperatura > 0, gerando trajetórias de raciocínio diferentes.
- Extraia a resposta final de cada cadeia.
- Vote: a resposta que aparece com mais frequência vence (maioria sobre as respostas, não sobre os textos das cadeias).
Não exige nenhum treino, verificador externo ou modelo extra — só mais amostras na inferência. No paper, melhorou substancialmente benchmarks de aritmética e raciocínio (GSM8K, SVAMP, AQuA, etc.) sobre CoT puro, em vários modelos.
Por que votar nas respostas, não nos textos
Um detalhe importante: a agregação é feita sobre a resposta final extraída, não sobre o texto literal da cadeia. Duas cadeias podem raciocinar com palavras totalmente diferentes e chegar ao mesmo “42” — e isso deve contar como dois votos para “42”. Marginalizar sobre os caminhos de raciocínio (tratando-os como variáveis latentes) e contar só o resultado é o que dá robustez. O método pressupõe que existe uma resposta discreta e verificável por igualdade; para saídas abertas (um ensaio, um trecho de código longo) a “votação por maioria” não se aplica diretamente, e usam-se variantes como ranqueamento por um verificador ou universal self-consistency (um LLM escolhe a resposta mais consistente entre as amostras).
Relação com test-time compute
Self-Consistency é uma das formas mais antigas de Test-Time Compute / Inference Scaling: troca compute extra (N forward passes) por acurácia. O custo é N× mais tokens — o preço de “pensar várias vezes”. O paper de Snell et al. (2024) depois mostrou que estratégias mais sofisticadas (busca com verificador de processo) podem ser mais eficientes que best-of-N/maioria simples, mas a maioria continua um baseline forte e barato de implementar.
Por que importa
- Robustez quase de graça. Some três linhas de orquestração e ganhe acurácia mensurável, sem retreinar nada.
- Reduz variância. Decodificação gulosa pode azarar em um único caminho ruim; a votação suaviza isso.
- Conceito fundante. Estabeleceu a ideia de “amostrar e agregar” que reaparece em Tree-of-Thought (ToT), best-of-N e nos pipelines de RL que treinam reasoning models por rejection sampling.
Estado em 2026
Como técnica de prompting manual, self-consistency foi amplamente absorvida pelos modelos de raciocínio: o1 / o3 (Reasoning Models), DeepSeek R1 (2025) e similares fazem busca/seleção interna de boas trajetórias durante o próprio treino e inferência, escolhendo “o melhor pensamento” sem que o usuário orquestre N chamadas. Ainda assim, a votação por maioria permanece útil onde se usa um modelo-base sem raciocínio embutido, em pipelines de avaliação, e como engrenagem dentro de métodos de geração de dados sintéticos (Synthetic Data Generation) por rejection sampling. O trade-off é eterno: mais amostras = mais custo, com retorno decrescente.
Tratamento de carta — proposta
Self-Consistency Conceito · Neutral · custo
Majority Vote. Ao resolver um efeito aleatório, pague 2 ⚡ para gerar 3 resultados; aplique o que se repetir (ou, em empate, você escolhe).
“Pergunte cinco vezes. Confie na resposta que insistir em aparecer.”
A mecânica encena a votação por maioria: pagar compute extra para amostrar várias vezes e ficar com o resultado convergente, reduzindo o azar de uma única tentativa.
Veja também
Chain-of-Thought (CoT) · Tree-of-Thought (ToT) · Test-Time Compute / Inference Scaling · o1 / o3 (Reasoning Models) · Synthetic Data Generation
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023. arXiv:2203.11171.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in LLMs. NeurIPS 2022. arXiv:2201.11903.
- Snell, C. et al. (2024). Scaling LLM Test-Time Compute Optimally. arXiv:2408.03314.
