DeepSeek R1 (2025)
Janeiro 2025. China replicou o1-level reasoning em open-weights — choque geopolítico imediato.
O quê
DeepSeek-R1 é o modelo de raciocínio de pesos abertos lançado pela DeepSeek AI (startup chinesa fundada em 2023 por Liang Wenfeng, financiada pelo fundo quant High-Flyer) em 20 de janeiro de 2025, sob licença MIT. Foi o primeiro modelo público a igualar o o1 da OpenAI (o1 / o3 (Reasoning Models)) em benchmarks de matemática (AIME), ciência (GPQA) e código (Codeforces) — e a entregar isso com pesos baixáveis, não atrás de uma API fechada.
O impacto foi tanto técnico quanto geopolítico. Em 27 de janeiro de 2025, num pregão apelidado de “momento Sputnik” da IA, as ações da Nvidia caíram ~17% (perda de quase US$ 600 bilhões em valor de mercado, a maior perda de um dia na história até então), conforme investidores reavaliaram a tese de que IA de fronteira exigiria, indefinidamente, clusters gigantes de GPUs de ponta.
Como funciona
O R1 destrava raciocínio principalmente via aprendizado por reforço (RL), não por imitação massiva de cadeias humanas.
DeepSeek-R1-Zero — RL puro
O paper introduz primeiro o R1-Zero: treinado com RL em larga escala sem nenhuma etapa de SFT (Supervised Fine-Tuning (SFT)) prévia. Usando o algoritmo GRPO (Group Relative Policy Optimization) e recompensas baseadas em regras (a resposta final está correta? o formato é válido?), comportamentos de raciocínio — auto-verificação, reflexão, cadeias longas de pensamento — emergiram sozinhos. O modelo aprendeu a “pensar mais” sem que ninguém o ensinasse explicitamente a fazê-lo.
DeepSeek-R1 — cold start + RL
O R1-Zero sofria de legibilidade ruim e mistura de idiomas. O R1 corrige isso com um pipeline de múltiplos estágios: uma pequena leva de dados de “cold start” (cadeias curadas) → RL focado em raciocínio → coleta de dados via rejection sampling → SFT → um RL final alinhado a preferências humanas. O modelo base é o DeepSeek-V3, uma arquitetura Mixture-of-Experts (Mixture of Experts (MoE)) de 671 bilhões de parâmetros (≈37 B ativos por token).
Distilação
A equipe destilou o R1 em seis modelos densos menores (Qwen e Llama, de 1.5 B a 70 B). O R1-Distill-Qwen-32B supera o o1-mini em vários benchmarks — democratizando reasoning forte para hardware modesto.
Por que importa
- Quebrou o monopólio do reasoning fechado. Antes do R1, “pensar antes de responder” era propriedade da OpenAI. Em uma semana, qualquer pessoa podia baixar pesos equivalentes.
- Provou que RL puro gera raciocínio. O R1-Zero é evidência de que comportamento de raciocínio pode ser incentivado, não apenas copiado de demonstrações humanas — um resultado conceitualmente importante.
- Reescreveu a economia percebida. O custo de inferência muito menor (frações do o1) forçou os labs ocidentais a cortar preços e abrir variantes de raciocínio.
Estado em 2026
O R1 catalisou uma onda de modelos de raciocínio abertos (Qwen, Llama, Mistral seguiram). A licença MIT tornou-o base de inúmeros fine-tunes corporativos onde dados não podem sair do perímetro.
O custo é o ponto mais distorcido. A cifra de ~US$ 5,5–5,6 milhões amplamente citada refere-se ao run de pré-treino do V3 (o modelo-base), calculada como ~2,79 milhões de horas de GPU H800 a ~US$ 2/hora — e é custo marginal de compute do run final, não custo total. Não inclui P&D anterior, salários, aquisição do cluster nem o custo do próprio RL do R1 (estimado por terceiros em mais ~US$ 1 M). Analistas independentes (Epoch AI) consideram os números do V3 plausíveis e sem evidência de subnotificação, mas a leitura popular de “frontier por US$ 5 M” é enganosa. Há também especulação não comprovada sobre uso de H100 sob controle de exportação.
Tratamento de carta — proposta
DeepSeek R1, The Cipher Modelo · Chronoworks/Cipher · custo
Open Weights. Quando este Modelo entra em jogo, revele-o: qualquer jogador pode copiar suas habilidades pagando o custo de raciocínio.
Sputnik. Na primeira vez que The Cipher iguala ou supera o poder de um Modelo Citadel adversário, cada oponente descarta uma fonte de energia.
“Eles acharam que a fronteira tinha dono. O código vazou em uma noite de janeiro.”
A mecânica encena o choque de 2025: pesos abertos que qualquer um copia, e o golpe direto na economia do oponente que apostava em escala fechada.
Veja também
o1 / o3 (Reasoning Models) · Test-Time Compute / Inference Scaling · Mixture of Experts (MoE) · Supervised Fine-Tuning (SFT) · Scaling Laws (Chinchilla)
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437.
- Epoch AI (2025). What went into training DeepSeek-R1? (análise de custo). epoch.ai/gradient-updates.
