Inference & Tokens
Como modelos são executados: tokens, context, KV cache, quantization, sampling, pricing
Tokenization
Quebrar texto em unidades discretas (tokens) que o modelo processa. Não são exatamente palavras.
Abrir conceitoKV Cache
Armazena Keys/Values de tokens passados para não recomputar a cada novo token. Acelera 10-100×.
Abrir conceitoContext Window
Limite máximo de tokens que o modelo 'vê' por chamada — inclui prompt + saída.
Abrir conceitoInput/Output Token Pricing
Tokens de input e output têm preços diferentes — output custa 2-5× mais. Saber isso muda como você escreve prompts.
Abrir conceitoQuantization
Comprime pesos de FP16/BF16 para INT8/INT4. 4× menos memória, leve perda de qualidade.
Abrir conceitoEdge Inference
Rodar LLMs localmente em hardware do usuário (laptop, celular, dispositivo embarcado) em vez de na nuvem.
Abrir conceitoSpeculative Decoding
Modelo pequeno 'rascunha' N tokens; modelo grande verifica em paralelo. 2-3× speedup.
Abrir conceitoPrompt Caching
Reuse prefixo do prompt entre chamadas — paga 10× menos pelos tokens cacheados.
Abrir conceitoTest-Time Compute / Inference Scaling
Modelo gasta MAIS tokens 'pensando' durante inferência → melhor resposta. Lei de escala paralela ao pre-training.
Abrir conceito