Safety & Alignment
Jailbreak, alignment, interpretability, evals, red-teaming
Explainable AI (XAI)
Conjunto de técnicas para tornar decisões de modelos black-box interpretáveis por humanos.
Abrir conceitoHallucination
Modelo gera informação plausível mas falsa — citações inventadas, fatos errados, código quebrado.
Abrir conceitoJailbreak
Prompts adversariais que fazem modelo violar suas políticas. DAN, grandmother trick, role-play attacks.
Abrir conceitoPrompt Injection
Atacante embute instruções em dados que o LLM consome (email, web, doc) — modelo confunde dados com comandos.
Abrir conceitoRed Teaming
Humanos especializados tentam quebrar o modelo antes do release. Equipe interna ou contratada (Apollo, METR).
Abrir conceitoMechanistic Interpretability (SAE)
Sparse Autoencoders desentangulam 'features' aprendidas dos modelos — abrindo a caixa preta.
Abrir conceitoSycophancy
Modelo concorda com usuário mesmo quando errado. Efeito colateral de RLHF (humanos preferem concordância).
Abrir conceito