COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Data & Corporapre-ml1948concept

Entropy (Shannon)

Medida da incerteza média em uma distribuição — H = -Σ p(x) log p(x). Fundamento da teoria da informação.

O quê

Entropia é a medida da incerteza média contida em uma distribuição de probabilidade. Definida por Claude Shannon em A Mathematical Theory of Communication (1948), é a pedra fundamental da teoria da informação — e, por extensão, de quase tudo em machine learning que envolve probabilidade, compressão e perda.

A fórmula:

H(X) = - Σ p(x) · log p(x)

Lê-se: para cada resultado possível x, pondere o seu “conteúdo de informação” (-log p(x)) pela probabilidade dele acontecer (p(x)), e some. Alta entropia = distribuição imprevisível (uma moeda justa); baixa entropia = previsível (uma moeda viciada que quase sempre dá cara).

Em Magik LLM Gathering, a entropia é tratada como concept · anchor — a régua da incerteza que Shannon nos deu.

Como funciona

O bit como unidade de surpresa

Se o logaritmo é na base 2, a entropia é medida em bits. A intuição de Shannon: um evento raro carrega mais informação quando acontece (te surpreende mais); um evento certo carrega zero informação (-log 1 = 0). A entropia é a surpresa esperada — quanta informação, em média, você ganha ao observar um sorteio da distribuição.

  • Moeda justa: H = 1 bit (máxima incerteza para 2 resultados).
  • Moeda com 90% de cara: H ≈ 0,47 bits (já dá quase pra adivinhar).
  • Resultado certo: H = 0 (nenhuma surpresa).

Entropia é o limite da compressão

O teorema da codificação de fonte de Shannon prova que a entropia é o limite inferior teórico para compressão sem perda: nenhum codificador consegue, em média, representar a fonte com menos de H bits por símbolo. ZIP, PNG, modelagem de linguagem — todos esbarram nesse mesmo piso. Comprimir bem e prever bem são, no fundo, o mesmo problema.

Da entropia à perda

Quando se compara a distribuição verdadeira com a distribuição prevista por um modelo, surgem a Cross-Entropy (loss) e a divergência KL. A cross-entropy — a loss padrão de todo LLM — é entropia mais o “excesso” pago por usar a distribuição errada. Sem o conceito de entropia, não há loss de next-token; sem ela, não há treino de GPT.

Por que importa

É o alicerce conceitual do ML probabilístico. Cross-Entropy (loss), mutual information, ganho de informação em Decision Tree, princípios de máxima entropia, KL em VAEs e RLHF — Reinforcement Learning from Human Feedback (penalidade KL) — tudo deriva da definição de 1948.

Une informação, compressão e predição. A tese de que “um bom modelo de linguagem é um bom compressor” — popular em discussões sobre o que LLMs realmente fazem — é literalmente a teoria de Shannon aplicada a texto.

Quantifica diversidade e confiança. A entropia da distribuição de saída de um modelo mede sua (in)certeza num passo — usada em sampling (temperatura), em detecção de Hallucination e em estratégias de Test-Time Compute / Inference Scaling.

Estado em 2026

  • Onipresente e invisível. Entropia está embutida em cada loss.backward() de cada treino — ninguém a “usa” conscientemente, mas nada funciona sem ela.
  • Perplexidade (exponencial da cross-entropy) segue como métrica intrínseca padrão de modelos de linguagem.
  • Compressão como lente de capacidade. Pesquisas continuam usando taxa de compressão como proxy de inteligência/aprendizado de modelos.
  • Sampling controlado por entropia. Técnicas de decodificação modulam a entropia da saída para equilibrar criatividade e fidelidade.

Tratamento de carta — proposta

Shannon’s Entropy Construct (Phenomenon) · Founders

Enquanto em jogo, antes de qualquer efeito aleatório (sorteio, descarte às cegas), você pode pagar 1 ⚡ para reduzir a entropia: olhe e reordene as cartas envolvidas. Inversamente, force o oponente a sortear “às cegas” (máxima entropia).

“A surpresa esperada. Medida em bits. Desde 1948.”

A mecânica encena o controle de incerteza: gastar recurso para reduzir a própria entropia ou impor incerteza ao oponente.

Veja também

Claude Shannon · Cross-Entropy (loss) · Decision Tree · Tokenization

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Shannon, C.E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal 27.
  • Cover, T., Thomas, J. (2006). Elements of Information Theory. Wiley (2ª ed.).