COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Inference & Tokensagentic-era2022concept

Input/Output Token Pricing

Tokens de input e output têm preços diferentes — output custa 2-5× mais. Saber isso muda como você escreve prompts.

O quê

O preço por token das APIs de LLM é cobrado separadamente para entrada e saída — e a saída custa, tipicamente, 2 a 5× mais que a entrada. Essa assimetria não é detalhe contábil: ela muda como vale a pena escrever prompts e desenhar produtos. Tokens de input (seu prompt, contexto, documentos) são processados em paralelo num único forward pass; tokens de output são gerados autoregressivamente, um a um, cada um exigindo um forward pass completo — daí serem mais caros.

Preço é por milhão de tokens (MTok). Um token equivale, grosso modo, a ~4 caracteres em inglês (ver Tokenization).

Como funciona

Por que output custa mais

Na geração, o modelo recalcula a atenção a cada novo token (aliviado pelo KV Cache, que guarda chaves/valores já computados). Ainda assim, gerar 1.000 tokens é ~1.000 passos sequenciais, enquanto ler 1.000 tokens de input é, essencialmente, um passo. Latência e custo de saída dominam em cargas generativas.

O efeito na arquitetura de prompts

  • Prompt longo, saída curta = barato. Classificação, extração e Q&A com resposta de uma linha são eficientes mesmo com muito contexto.
  • Saída longa = caro. Agentes que geram código, planos, cadeias de raciocínio (Test-Time Compute / Inference Scaling) ou documentos explodem custo — porque output é o lado caro e eles produzem muito.

Prompt caching

Quando o mesmo prefixo (system prompt, documentos, exemplos) repete entre chamadas, prompt caching reaproveita o estado já computado e cobra a leitura do cache a uma fração do preço — na ordem de ~10× mais barato (90% de desconto no cache hit). É a maior alavanca prática de economia em agentes e chats com contexto fixo.

Batch e níveis

Processamento em batch costuma custar ~50% do preço em troca de latência. Modelos de raciocínio cobram os “thinking tokens” como output — por isso reasoning fica caro.

Uma conta concreta

Suponha um agente que carrega 50k tokens de contexto fixo (instruções + documentos) e gera 2k tokens de resposta, em um modelo a US$ 3 / US$ 15 por MTok. Sem cache: 50k × US$ 3/M + 2k × US$ 15/M ≈ US$ 0,15 + US$ 0,03 = ~US$ 0,18 por chamada. Repita isso mil vezes num loop agêntico e são US$ 180 — quase todo gasto relendo o mesmo contexto. Com prompt caching (90% de desconto na leitura do prefixo repetido), a parte de input cai para ~US$ 0,015 por chamada, derrubando o total. É por isso que, em sistemas reais, o desenho de cache costuma importar mais para a fatura do que a escolha do modelo.

Por que importa

  • Custo é restrição de design. A escolha entre modelo grande/pequeno, RAG vs. contexto longo, e quanto deixar um agente “pensar” é, no fim, uma conta de tokens.
  • Preço por tarefa > preço por token. Com reasoning e agentes, o que importa é o custo de completar a tarefa inteira, não o preço unitário.
  • Caching mudou o jogo. Tornou viável carregar grandes contextos fixos sem pagar por eles a cada turno.

Estado em 2026

Os preços caíram fortemente e a hierarquia de modelos ficou explícita. Exemplos de acesso em junho de 2026 (entrada / saída por MTok): Claude Opus 4.8 ~US$ 5 / US$ 25, Claude Sonnet 4.6 ~US$ 3 / US$ 15, Claude Haiku 4.5 ~US$ 1 / US$ 5, GPT-4o ~US$ 2,5 / US$ 10. Vale notar a queda histórica: o Opus 4/4.1 custava US$ 15 / US$ 75 e sofreu corte de ~67% a partir do Opus 4.5 (preços mudam com frequência — sempre confira a tabela oficial). Prompt caching (~90% de desconto em cache hit) e batch (~50%) são padrão. A consequência estratégica é que rotear cada requisição para o menor modelo que resolve virou disciplina de FinOps de IA.

Tratamento de carta — proposta

Token Economics Conceito · Chronoworks · custo

Output Tax. Toda Técnica do oponente custa +1 ⚡ ao ser jogada — e +2 ⚡ se gerar 3 ou mais efeitos (saída longa).

Caching. A segunda vez que você jogar uma cópia da mesma carta no turno, ela custa metade.

“Ler é barato. Falar é que cobra a conta.”

A mecânica encena a assimetria input/output (saída longa = taxa maior) e a economia do caching (repetição barateia).

Veja também

Tokenization · Context Window · Prompt Caching · KV Cache · Test-Time Compute / Inference Scaling

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • OpenAI (2024). API Pricing (GPT-4o input/output rates). openai.com/pricing (acesso jun. 2026).
  • Anthropic (2026). Pricing & prompt caching (Claude Opus/Sonnet/Haiku). platform.claude.com/docs (acesso jun. 2026).
  • Anthropic (2024). Prompt caching with Claude. docs.anthropic.com.