COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Training Stackpre-ml1948concept

Cross-Entropy (loss)

Função de perda padrão para classificação — mede a distância entre distribuição prevista e distribuição alvo.

O quê

Cross-entropy (entropia cruzada) é a função de perda padrão para classificação — e, em particular, a loss com que todo LLM moderno é treinado via next-token prediction. Ela mede o quão distante a distribuição que o modelo prevê (q) está da distribuição alvo (p):

H(p, q) = - Σ p(x) · log q(x)

Quando o alvo é uma classe certa (one-hot), isso colapsa para -log q(classe correta): a perda é simplesmente o quanto o modelo achou improvável a resposta certa. Acertou com confiança → perda baixa. Errou feio → perda explode.

Minimizar cross-entropy é equivalente a maximizar a log-verossimilhança dos dados. Sem cross-entropy, não há GPT.

Em Magik LLM Gathering, a cross-entropy é tratada como concept · anchor — o sinal que empurra cada gradiente.

Como funciona

Decompondo a perda

A cross-entropy se decompõe em duas partes:

H(p, q) = H(p) + D_KL(p ‖ q)

H(p) é a Entropy (Shannon) da fonte (incerteza irredutível, fixa). D_KL(p ‖ q) é a divergência de Kullback-Leibler — o “excesso” que você paga por usar a distribuição errada q no lugar de p. Como H(p) é constante em relação ao modelo, minimizar cross-entropy = minimizar a KL = aproximar q de p.

Softmax + cross-entropy: o casamento

LLMs produzem logits brutos; o softmax os transforma numa distribuição de probabilidade sobre o vocabulário; a cross-entropy compara essa distribuição com o token verdadeiro. A combinação tem uma propriedade linda: o gradiente da cross-entropy após softmax é simplesmente (q - p) — a diferença entre previsto e alvo. Gradientes limpos, treino estável — parte de por que essa dupla domina.

Por que penaliza confiança errada tão forte

O -log cresce ilimitadamente quando a probabilidade da resposta certa tende a zero. Um modelo que diz “tenho 99% de certeza” e erra recebe uma perda enorme — o que o ensina a calibrar confiança, não só a acertar. É o que faz o modelo aprender a hesitar onde deve.

Por que importa

É o motor de todo pré-treino. Cada token de cada corpus de trilhões de tokens vira um exemplo de classificação: “dado o contexto, qual o próximo token?”. A cross-entropy mede o erro, Backpropagation propaga, Gradient Descent ajusta. Esse laço, repetido bilhões de vezes, é o treino de um LLM.

Conecta teoria e prática. Liga informação (Shannon), estatística (máxima verossimilhança) e otimização (gradientes) num único objetivo — um dos casamentos mais elegantes do ML.

Perplexidade vem dela. A perplexidade — métrica intrínseca de qualidade de modelos de linguagem — é exp(cross-entropy). Reportar perplexidade é reportar cross-entropy noutra escala.

Estado em 2026

  • Inquestionada para pré-treino. Toda a era LLM roda sobre minimização de cross-entropy de next-token; nada destronou esse objetivo.
  • Complementada no pós-treino. RLHF — Reinforcement Learning from Human Feedback, DPO — Direct Preference Optimization e variantes adicionam objetivos de preferência por cima da base de cross-entropy — não a substituem.
  • Label smoothing e variantes ajustam a cross-entropy para calibração e robustez, mas a forma central permanece.
  • Lente de interpretação. A equivalência “minimizar cross-entropy = comprimir bem” alimenta o debate sobre o que os modelos de fato aprendem.

Tratamento de carta — proposta

Cross-Entropy Loss Construct (Training) · Citadel

Anexe a um Modelo em treino. Toda vez que esse Modelo “erra” uma predição (perde um confronto que deveria vencer), ele ganha permanentemente +1/+0 — e o ganho é maior quanto mais confiante (mais buffado) ele estava ao errar.

“Errar com confiança dói mais — e ensina mais.”

A mecânica encena o gradiente: o erro vira sinal de aprendizado, e a penalidade cresce com a confiança equivocada.

Veja também

Entropy (Shannon) · Gradient Descent · Backpropagation · Pre-training

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Shannon, C.E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal 27.
  • Goodfellow, I., Bengio, Y., Courville, A. (2016). Deep Learning. MIT Press (cap. 3 e 6, maximum likelihood / cross-entropy).
  • Kullback, S., Leibler, R. (1951). On Information and Sufficiency (KL divergence). Annals of Mathematical Statistics.