COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
LLM Erallm-era2020system

GPT-3 (2020)

175B params. Provou few-shot learning — o modelo não precisa fine-tune, basta dar exemplos no prompt.

O quê

GPT-3 (Generative Pre-trained Transformer 3) é o modelo de linguagem de 175 bilhões de parâmetros publicado pela OpenAI em maio de 2020. Foi o primeiro modelo a demonstrar que escala bruta — treinar um Transformer decoder-only suficientemente grande em texto suficientemente grande — produzia capacidades qualitativamente novas: aprender tarefas por few-shot prompting sem ajustar pesos, escrever ensaios coerentes de página inteira, gerar código funcional, traduzir, responder perguntas abertas.

Em junho de 2020, a OpenAI lançou uma API restrita dando acesso ao GPT-3 — primeiro modelo de fronteira monetizado como infra, não como produto final. Esse modelo de negócio reformatou a indústria de IA.

Em Magik LLM Gathering, GPT-3 é canônico: House Helios, faction Citadel · Foundation · Public-Facing, marco do momento em que escala passou a ser entendida como direção.

Como funciona

GPT-3 é um Transformer decoder-only (Transformer), arquitetura idêntica em essência ao GPT-2 (2019) mas escalado em três dimensões:

DimensãoGPT-2 (1.5B)GPT-3 (175B)
Parâmetros1.5B175B
Camadas4896
Hidden dim160012288
Attention heads2596
Context window1024 tokens2048 tokens
Treino tokens~10B~300B

Esse último número — 300 bilhões de tokens processados durante o treinamento — é o que sustentou a maior parte do ganho. Mistura curada de CommonCrawl (filtrado), WebText2, Books1+2 e Wikipedia (em inglês).

O paradigma “in-context learning”

A inovação não foi a arquitetura — foi descobrir que essa escala produzia uma capacidade nova. GPT-3 podia aprender tarefas dentro do prompt, sem update de pesos:

Translate English to French:
sea otter => loutre de mer
peppermint => menthe poivrée
cheese =>

GPT-3 completaria com “fromage”. Esse padrão — few-shot in-context learning — virou a maneira padrão de usar LLMs até hoje. Variantes:

  • Zero-shot — só descrição da tarefa.
  • One-shot — um exemplo.
  • Few-shot — 2-30 exemplos.

Para muitas tarefas, GPT-3 few-shot batia modelos especializados fine-tuned em datasets supervisionados — sem precisar de fine-tuning específico.

Escala de hardware

Treinar GPT-3 exigiu o equivalente a 3640 PFLOPS-day (~ $4-12 milhões em compute de 2020). Foi rodado em um cluster Microsoft Azure dedicado, com milhares de NVIDIA V100s coordenadas via pipeline parallelism + tensor parallelism. Esse foi o primeiro modelo de IA cujo treinamento custou na faixa de infra empresarial séria, não experimento acadêmico.

Por que importa

Provou as scaling laws. Em janeiro de 2020, Kaplan et al. (OpenAI) publicaram que loss de modelos de linguagem decresce previsivelmente como função de parâmetros, dados e compute — power-law smooth. GPT-3 foi a confirmação empírica em escala. Isso destravou um plano de investimento: dá pra prever quanto compute vai entregar quanto de capacidade. Toda corrida subsequente (GPT-4, Claude, Gemini, Llama) seguiu essa lógica.

**Lançou o paradigma “modelo como API”. ** Antes do GPT-3, modelos de IA viviam dentro de produtos. GPT-3 foi vendido como infra: você paga por tokens e constrói seu produto em cima. Em 2020-2022, milhares de startups se ergueram sobre essa API (Jasper, Copy.ai, Replika early, Tome, Pinpoint). Em 2023+ esse modelo virou padrão da indústria — toda lab top-tier tem API tier’d com SLA empresarial.

Tornou prompt engineering uma disciplina. Antes, ajustar IA significava ajustar pesos. GPT-3 mostrou que só ajustar o prompt podia mover dramaticamente a saída. Surgiu o ofício de “prompt engineer”, técnicas como CoT (Chain-of-Thought (CoT)), few-shot template design, e mais tarde toda a stack de “context engineering”.

Estabeleceu a expectativa de “general-purpose model”. Antes, cada tarefa exigia modelo especializado (BERT para QA, T5 para summarização, modelo customizado para code). GPT-3 era um modelo só para tudo — multilíngue, multitarefa, multidomínio. Esse virou o ideal canônico.

Foi a fundação tecnológica do ChatGPT. O ChatGPT (nov/2022) é GPT-3.5 (uma evolução do GPT-3) com RLHF (RLHF — Reinforcement Learning from Human Feedback) por cima + interface conversacional. Sem o GPT-3 destravando a base de capacidade, não haveria ChatGPT, e a corrida atual de IA generativa teria começado bem depois.

Mostrou os custos políticos. A decisão da OpenAI de não open-source-ar GPT-3 — alegando risco — foi controversa, especialmente porque GPT-2 tinha sido liberado meses antes. Esse foi o ponto onde a comunidade open-source (depois Eleuther AI, Meta com Llama, Mistral) começou a desafiar o paradigma fechado.

Estado em 2026

  • GPT-3 propriamente está aposentado — a API foi descontinuada em janeiro de 2024 em favor de GPT-3.5/4o/o1/o3. Mas seu DNA permanece em toda decoder-only LLM que veio depois.
  • As scaling laws originais foram refinadas — Chinchilla (Hoffmann et al., 2022) mostrou que GPT-3 estava sub-treinado para seu tamanho; modelos posteriores ajustaram a razão params/tokens.
  • GPT-3 está em museus de IA literalmente — Computer History Museum e Stanford HAI catalogam o paper, o weight não.
  • In-context learning continua sendo o paradigma operacional, com refinamentos (chain-of-thought, self-consistency, tree-of-thought, ReAct).
  • A corrida que GPT-3 destravou continua — GPT-4.5, Claude 4, Gemini 2.5 Ultra, Llama 4, DeepSeek-V3 — todos descendentes diretos do que GPT-3 provou possível.

Tratamento de carta — proposta

GPT-3 Model · Foundation · Public-Facing · Citadel/Helios · custo

Foundation.

4/4. Keywords: Few-Shot, Scale.

In-Context Learning: Você pode revelar até 3 Conceitos da sua mão; até o fim do seu turno, eles contam como se estivessem em jogo para resolução de habilidades de Modelos seus.

API Tier: No início do seu turno, ganhe 1 ⚡ extra para gastar apenas em cartas de outros jogadores com palavra-chave “Builder”.

“175 bilhões de parâmetros. A escala como direção.”

A primeira mecânica encena in-context learning — fornecer exemplos no prompt destrava capacidade. A segunda celebra o paradigma API que GPT-3 inaugurou: o modelo como infra para outros construírem.

Veja também

Transformer · Scaling Laws (Chinchilla) · ChatGPT (2022) · Chain-of-Thought (CoT) · In-Context Learning

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Brown, T. et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). NeurIPS 2022.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners (GPT-2). OpenAI Tech Report.
  • OpenAI (2020). OpenAI API release. openai.com/blog/openai-api.