COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
LLM Erallm-era2024system

Phi-3

Família de SLMs da Microsoft que prova que dados de alta qualidade ("textbooks are all you need") batem escala bruta.

O quê

Phi-3 (abril de 2024) é a terceira geração da família Phi da Microsoft Research — uma linha de Small Language Models (SLMs) construída sobre uma tese provocadora: dados de altíssima qualidade batem escala bruta. O slogan herdado do Phi-1 (“Textbooks Are All You Need”) resume a aposta: treinar em conteúdo curado, “estilo livro-texto”, em vez de despejar a web inteira.

As variantes: Phi-3-mini (3,8B), treinada em 3,3 trilhões de tokens, atinge 69% no MMLU e 8,38 no MT-bench — rivalizando com Mixtral 8×7B e GPT-3.5, sendo pequena o bastante para rodar num celular. As maiores, Phi-3-small (7B) e Phi-3-medium (14B) (treinadas em 4,8T tokens), chegam a 75% e 78% no MMLU. Pesos abertos sob licença MIT.

Em Magik LLM Gathering, o Phi-3 é tratado como system — o símbolo de que curadoria pode vencer brutalidade.

Como funciona

A inovação está nos dados, não na arquitetura

O relatório técnico é explícito: o Phi-3-mini usa uma arquitetura Transformer decoder-only padrão (semelhante ao Llama), tokenizer e tudo. “A inovação reside inteiramente no nosso dataset de treino” — uma versão escalada da receita do Phi-2: web fortemente filtrada + dados sintéticos de qualidade “didática”.

Por que dados curados rendem mais por token

A intuição: a web é cheia de ruído, repetição e conteúdo de baixo valor pedagógico. Um corpus selecionado para densidade de raciocínio — explicações claras, exercícios, progressão lógica — ensina mais por token consumido. Isso “dobra” as Scaling Laws (Chinchilla) ingênuas: com dados melhores, você precisa de menos parâmetros e menos tokens para a mesma capacidade. Conecta-se diretamente ao uso de Synthetic Data Generation.

Pequeno por design, alinhado por padrão

O Phi-3-mini passou por fine-tuning supervisionado (Supervised Fine-Tuning (SFT)) e DPO (DPO — Direct Preference Optimization) para seguir instruções e segurança, e veio em variantes de contexto de 4K e 128K tokens — pronto para uso prático em Edge Inference.

Por que importa

Provou a tese SLM. Ao bater modelos várias vezes maiores em benchmarks, o Phi-3 deu munição empírica ao movimento de modelos pequenos: nem toda tarefa exige um gigante de trilhões de parâmetros.

Habilitou IA no dispositivo. Um modelo 3,8B competente que cabe num smartphone é a peça que faltava para Edge Inference em massa — privacidade, latência e custo zero por token.

Reposicionou “qualidade de dados” como alavanca de primeira classe. Junto com FineWeb-Edu (RedPajama / Dolma / FineWeb), o Phi-3 ajudou a deslocar o foco de “mais tokens” para “melhores tokens” — uma das mudanças conceituais mais importantes do período.

Estado em 2026

  • Linha viva e expandida. A família seguiu evoluindo (Phi-3.5, variantes MoE e vision), e SLMs viraram categoria consolidada ao lado dos modelos fronteira.
  • Curadoria é consenso. “Dados melhores rendem mais que dados maiores” deixou de ser heresia e virou prática padrão de pré-treino.
  • Ressalvas honestas. O próprio relatório nota que SLMs têm teto de conhecimento factual (cabe menos “mundo” em 3,8B) — daí o casamento natural com RAG — Retrieval-Augmented Generation para suprir fatos.
  • Pressão competitiva. Gemma, Llama 3.2 e Qwen pequenos disputam o mesmo nicho de “capaz e leve”.

Tratamento de carta — proposta

Phi-3, The Textbook Scholar Modelo · Foundry · custo baixo

Pequeno (3/3), mas Curado: enquanto seu deck tiver 20 cartas ou menos (deck enxuto, sem “lixo”), o Phi-3 ganha +2/+2 e pode ser jogado de qualquer lugar (roda no edge).

“Não li a internet inteira. Li só os bons livros.”

A mecânica encena a tese “textbooks”: um deck pequeno e curado torna o modelo desproporcionalmente forte.

Veja também

Edge Inference · Synthetic Data Generation · Knowledge Distillation · Scaling Laws (Chinchilla) · DPO — Direct Preference Optimization

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Abdin, M. et al. (2024). Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone. arXiv:2404.14219.
  • Gunasekar, S. et al. (2023). Textbooks Are All You Need (Phi-1). arXiv:2306.11644.