Input/Output Token Pricing
Tokens de input e output têm preços diferentes — output custa 2-5× mais. Saber isso muda como você escreve prompts.
O quê
O preço por token das APIs de LLM é cobrado separadamente para entrada e saída — e a saída custa, tipicamente, 2 a 5× mais que a entrada. Essa assimetria não é detalhe contábil: ela muda como vale a pena escrever prompts e desenhar produtos. Tokens de input (seu prompt, contexto, documentos) são processados em paralelo num único forward pass; tokens de output são gerados autoregressivamente, um a um, cada um exigindo um forward pass completo — daí serem mais caros.
Preço é por milhão de tokens (MTok). Um token equivale, grosso modo, a ~4 caracteres em inglês (ver Tokenization).
Como funciona
Por que output custa mais
Na geração, o modelo recalcula a atenção a cada novo token (aliviado pelo KV Cache, que guarda chaves/valores já computados). Ainda assim, gerar 1.000 tokens é ~1.000 passos sequenciais, enquanto ler 1.000 tokens de input é, essencialmente, um passo. Latência e custo de saída dominam em cargas generativas.
O efeito na arquitetura de prompts
- Prompt longo, saída curta = barato. Classificação, extração e Q&A com resposta de uma linha são eficientes mesmo com muito contexto.
- Saída longa = caro. Agentes que geram código, planos, cadeias de raciocínio (Test-Time Compute / Inference Scaling) ou documentos explodem custo — porque output é o lado caro e eles produzem muito.
Prompt caching
Quando o mesmo prefixo (system prompt, documentos, exemplos) repete entre chamadas, prompt caching reaproveita o estado já computado e cobra a leitura do cache a uma fração do preço — na ordem de ~10× mais barato (90% de desconto no cache hit). É a maior alavanca prática de economia em agentes e chats com contexto fixo.
Batch e níveis
Processamento em batch costuma custar ~50% do preço em troca de latência. Modelos de raciocínio cobram os “thinking tokens” como output — por isso reasoning fica caro.
Uma conta concreta
Suponha um agente que carrega 50k tokens de contexto fixo (instruções + documentos) e gera 2k tokens de resposta, em um modelo a US$ 3 / US$ 15 por MTok. Sem cache: 50k × US$ 3/M + 2k × US$ 15/M ≈ US$ 0,15 + US$ 0,03 = ~US$ 0,18 por chamada. Repita isso mil vezes num loop agêntico e são US$ 180 — quase todo gasto relendo o mesmo contexto. Com prompt caching (90% de desconto na leitura do prefixo repetido), a parte de input cai para ~US$ 0,015 por chamada, derrubando o total. É por isso que, em sistemas reais, o desenho de cache costuma importar mais para a fatura do que a escolha do modelo.
Por que importa
- Custo é restrição de design. A escolha entre modelo grande/pequeno, RAG vs. contexto longo, e quanto deixar um agente “pensar” é, no fim, uma conta de tokens.
- Preço por tarefa > preço por token. Com reasoning e agentes, o que importa é o custo de completar a tarefa inteira, não o preço unitário.
- Caching mudou o jogo. Tornou viável carregar grandes contextos fixos sem pagar por eles a cada turno.
Estado em 2026
Os preços caíram fortemente e a hierarquia de modelos ficou explícita. Exemplos de acesso em junho de 2026 (entrada / saída por MTok): Claude Opus 4.8 ~US$ 5 / US$ 25, Claude Sonnet 4.6 ~US$ 3 / US$ 15, Claude Haiku 4.5 ~US$ 1 / US$ 5, GPT-4o ~US$ 2,5 / US$ 10. Vale notar a queda histórica: o Opus 4/4.1 custava US$ 15 / US$ 75 e sofreu corte de ~67% a partir do Opus 4.5 (preços mudam com frequência — sempre confira a tabela oficial). Prompt caching (~90% de desconto em cache hit) e batch (~50%) são padrão. A consequência estratégica é que rotear cada requisição para o menor modelo que resolve virou disciplina de FinOps de IA.
Tratamento de carta — proposta
Token Economics Conceito · Chronoworks · custo
Output Tax. Toda Técnica do oponente custa +1 ⚡ ao ser jogada — e +2 ⚡ se gerar 3 ou mais efeitos (saída longa).
Caching. A segunda vez que você jogar uma cópia da mesma carta no turno, ela custa metade.
“Ler é barato. Falar é que cobra a conta.”
A mecânica encena a assimetria input/output (saída longa = taxa maior) e a economia do caching (repetição barateia).
Veja também
Tokenization · Context Window · Prompt Caching · KV Cache · Test-Time Compute / Inference Scaling
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- OpenAI (2024). API Pricing (GPT-4o input/output rates). openai.com/pricing (acesso jun. 2026).
- Anthropic (2026). Pricing & prompt caching (Claude Opus/Sonnet/Haiku). platform.claude.com/docs (acesso jun. 2026).
- Anthropic (2024). Prompt caching with Claude. docs.anthropic.com.
