COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Phenomena & Lawsdl-era1989phenomenon

Catastrophic Forgetting

Quando fine-tuna em tarefa B, modelo esquece tarefa A. Por que treinos continuais são difíceis.

O quê

Catastrophic forgetting (esquecimento catastrófico) é o fenômeno em que uma rede neural, ao ser treinada numa nova tarefa B, apaga abruptamente o que sabia da tarefa A anterior. Documentado por McCloskey e Cohen (1989) em redes conexionistas, é a razão fundamental pela qual aprendizado contínuo (continual learning) é difícil — e por que LLMs fronteira não são “atualizados continuamente”.

A causa é estrutural: o conhecimento de uma rede vive nos mesmos pesos compartilhados. Quando o Gradient Descent ajusta esses pesos para minimizar a perda em B, ele sobrescreve, sem cerimônia, as configurações que codificavam A.

Em Magik LLM Gathering, é tratado como phenomenon · anchor — o preço do plasticidade dos pesos.

Como funciona

O dilema estabilidade-plasticidade

Toda rede vive uma tensão: ser plástica o suficiente para aprender o novo, e estável o suficiente para reter o velho. Gradient descent puro é todo plasticidade — otimiza o batch atual sem memória do passado. Se os dados de A param de aparecer, nada protege os pesos de A.

Mitigações

A pesquisa de continual learning desenvolveu três famílias de defesa:

  1. Rehearsal / replay. Reintroduzir exemplos antigos (ou sintéticos) junto com os novos, para que o gradiente “lembre” de A. Simples e eficaz, mas exige guardar dados antigos.
  2. Regularização. EWC (Elastic Weight Consolidation, Kirkpatrick et al., 2017) estima quais pesos são importantes para A e penaliza alterá-los — uma “rigidez seletiva” inspirada em consolidação de memória no cérebro.
  3. Isolamento de parâmetros. Dar pesos novos para tarefas novas. É aqui que entra o LoRA / QLoRA: ao congelar o modelo base e treinar só pequenos adaptadores, ele preserva o conhecimento original por construção — fine-tuning sem esquecimento catastrófico.

Por que importa

Explica por que LLMs fazem retrains, não updates. Atualizar um modelo fronteira com dados novos arrisca degradar capacidades existentes de forma imprevisível. Por isso os labs preferem re-treinar do zero (caro, mas controlado) a costurar atualizações incrementais — e por que “data cutoff” existe.

Justifica a arquitetura de fine-tuning moderna. Adaptadores (LoRA / QLoRA) e RAG (RAG — Retrieval-Augmented Generation) prosperaram em parte como respostas ao esquecimento catastrófico: em vez de mexer nos pesos (e arriscar apagar conhecimento), você adiciona uma camada fina ou injeta contexto externo.

É um problema de IA e de neurociência. O cérebro humano não sofre esquecimento catastrófico — aprende continuamente sem apagar o passado. Entender por que (consolidação, replay durante o sono, neurogênese) inspira algoritmos e mantém o tema vivo na fronteira.

Estado em 2026

  • Continual learning segue não-resolvido em escala. Não há método que atualize um LLM gigante indefinidamente sem regressão; retrains periódicos continuam sendo o padrão da indústria.
  • LoRA e adaptadores são a defesa prática dominante: personalizar sem tocar no base.
  • RAG como memória externa. Em vez de “ensinar” fatos novos ao modelo (e arriscar esquecimento), injeta-se conhecimento via recuperação — contornando o problema.
  • Pesquisa ativa em model merging, replay sintético e arquiteturas modulares busca o santo graal do aprendizado verdadeiramente contínuo.

Tratamento de carta — proposta

Catastrophic Forgetting Win Condition · Safety

Enquanto em jogo: se um jogador precisar comprar de um deck vazio (esgotou a “memória”), ele perde imediatamente. Modelos protegidos por um adaptador (LoRA / QLoRA) ignoram este efeito.

“Aprenda B. Esqueça A. Esqueça quem você era.”

A mecânica (do dataset) encena o deck como memória finita: esgotá-la é fatal, a menos que se preserve a base via adaptador.

Veja também

LoRA / QLoRA · Gradient Descent · RAG — Retrieval-Augmented Generation · Supervised Fine-Tuning (SFT)

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • McCloskey, M., Cohen, N. (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation 24.
  • Kirkpatrick, J. et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks (EWC). PNAS 114(13). arXiv:1612.00796.