Cross-Entropy (loss)
Função de perda padrão para classificação — mede a distância entre distribuição prevista e distribuição alvo.
O quê
Cross-entropy (entropia cruzada) é a função de perda padrão para classificação — e, em particular, a loss com que todo LLM moderno é treinado via next-token prediction. Ela mede o quão distante a distribuição que o modelo prevê (q) está da distribuição alvo (p):
H(p, q) = - Σ p(x) · log q(x)
Quando o alvo é uma classe certa (one-hot), isso colapsa para -log q(classe correta): a perda é simplesmente o quanto o modelo achou improvável a resposta certa. Acertou com confiança → perda baixa. Errou feio → perda explode.
Minimizar cross-entropy é equivalente a maximizar a log-verossimilhança dos dados. Sem cross-entropy, não há GPT.
Em Magik LLM Gathering, a cross-entropy é tratada como concept · anchor — o sinal que empurra cada gradiente.
Como funciona
Decompondo a perda
A cross-entropy se decompõe em duas partes:
H(p, q) = H(p) + D_KL(p ‖ q)
H(p) é a Entropy (Shannon) da fonte (incerteza irredutível, fixa). D_KL(p ‖ q) é a divergência de Kullback-Leibler — o “excesso” que você paga por usar a distribuição errada q no lugar de p. Como H(p) é constante em relação ao modelo, minimizar cross-entropy = minimizar a KL = aproximar q de p.
Softmax + cross-entropy: o casamento
LLMs produzem logits brutos; o softmax os transforma numa distribuição de probabilidade sobre o vocabulário; a cross-entropy compara essa distribuição com o token verdadeiro. A combinação tem uma propriedade linda: o gradiente da cross-entropy após softmax é simplesmente (q - p) — a diferença entre previsto e alvo. Gradientes limpos, treino estável — parte de por que essa dupla domina.
Por que penaliza confiança errada tão forte
O -log cresce ilimitadamente quando a probabilidade da resposta certa tende a zero. Um modelo que diz “tenho 99% de certeza” e erra recebe uma perda enorme — o que o ensina a calibrar confiança, não só a acertar. É o que faz o modelo aprender a hesitar onde deve.
Por que importa
É o motor de todo pré-treino. Cada token de cada corpus de trilhões de tokens vira um exemplo de classificação: “dado o contexto, qual o próximo token?”. A cross-entropy mede o erro, Backpropagation propaga, Gradient Descent ajusta. Esse laço, repetido bilhões de vezes, é o treino de um LLM.
Conecta teoria e prática. Liga informação (Shannon), estatística (máxima verossimilhança) e otimização (gradientes) num único objetivo — um dos casamentos mais elegantes do ML.
Perplexidade vem dela. A perplexidade — métrica intrínseca de qualidade de modelos de linguagem — é exp(cross-entropy). Reportar perplexidade é reportar cross-entropy noutra escala.
Estado em 2026
- Inquestionada para pré-treino. Toda a era LLM roda sobre minimização de cross-entropy de next-token; nada destronou esse objetivo.
- Complementada no pós-treino. RLHF — Reinforcement Learning from Human Feedback, DPO — Direct Preference Optimization e variantes adicionam objetivos de preferência por cima da base de cross-entropy — não a substituem.
- Label smoothing e variantes ajustam a cross-entropy para calibração e robustez, mas a forma central permanece.
- Lente de interpretação. A equivalência “minimizar cross-entropy = comprimir bem” alimenta o debate sobre o que os modelos de fato aprendem.
Tratamento de carta — proposta
Cross-Entropy Loss Construct (Training) · Citadel
Anexe a um Modelo em treino. Toda vez que esse Modelo “erra” uma predição (perde um confronto que deveria vencer), ele ganha permanentemente +1/+0 — e o ganho é maior quanto mais confiante (mais buffado) ele estava ao errar.
“Errar com confiança dói mais — e ensina mais.”
A mecânica encena o gradiente: o erro vira sinal de aprendizado, e a penalidade cresce com a confiança equivocada.
Veja também
Entropy (Shannon) · Gradient Descent · Backpropagation · Pre-training
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- Shannon, C.E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal 27.
- Goodfellow, I., Bengio, Y., Courville, A. (2016). Deep Learning. MIT Press (cap. 3 e 6, maximum likelihood / cross-entropy).
- Kullback, S., Leibler, R. (1951). On Information and Sufficiency (KL divergence). Annals of Mathematical Statistics.
