S1 · #146 · NEUTRAL
DPO
Technique — training Incomum
- Custo
- 2 de energia
Texto de regras
Aumente o Alinhamento de um Modelo que você controla em +2. Se você descartar uma carta como a resposta rejeitada, aumente em +3 em vez disso.
Não recompense; apenas prefira. Entre duas respostas, a balança já sabe qual queria.
O que esta carta ensina
Toda carta do Magik ancora um conceito real da história da IA. Estes são os desta:
- DPO — Direct Preference Optimization Training Stack Alternativa a RLHF — pula o reward model, treina direto em pares de preferência. Mais simples, igual ou melhor.
- RLHF — Reinforcement Learning from Human Feedback Training Stack Humanos ranqueiam respostas; modelo aprende a maximizar essa preferência via RL.
Esta carta pode ser sua.
Todo dia a Forja libera uma carta para a sua coleção — ela entra no álbum, abre o conceito que ancora e conta para o seu streak. É de graça.
Ficha do colecionador
- Colecionador
- MLG · S1 · 146/200 · NEUTRAL · K.RIDOLFI
- Arte
- K.RIDOLFI
- Set
- S1