NVIDIA B100/B200 Blackwell
Geração 2024-2025 da NVIDIA. ~2.5× mais throughput vs H100. FP4 nativo.
O quê
Blackwell é a arquitetura de data center que a NVIDIA anunciou na GTC de 18 de março de 2024, com ramp de produção ao longo de 2025. As GPUs B100 (variante de menor consumo, drop-in para infra de H100) e B200 (topo de linha) sucederam a Hopper (NVIDIA H100) como a plataforma de fronteira para treino E inferência dos modelos maiores.
O salto físico é notável: 208 bilhões de transistores distribuídos em dois dies unidos como uma única GPU coerente (design dual-reticle) no processo TSMC 4NP, 192 GB de HBM3e a 8 TB/s de banda. A novidade de arquitetura é o suporte nativo a FP4 e FP6 — precisões de 4 e 6 bits — via a 2ª geração da Transformer Engine. Um B200 entrega cerca de 20 PFLOPS densos em FP4 (até 40 com esparsidade 2:4).
Em Magik LLM Gathering, Blackwell é tratada como hardware · companion de NVIDIA H100 — a próxima dobra da curva de compute.
Como funciona
FP4: menos bits, mais tokens por segundo
A aposta central de Blackwell é que inferência pode rodar em 4 bits sem perda inaceitável de qualidade, especialmente com quantização cuidadosa (NVFP4, com escalas por microbloco). Como FP4 ocupa metade da memória de FP8 e dobra o throughput de tensor cores, o resultado é mais instâncias de modelo por GPU, respostas mais rápidas e custo por token menor. Em benchmarks MLPerf, sistemas Blackwell reportaram até ~2× o treino e até ~4× a inferência de sistemas H100.
GB200 e o rack como produto
A NVIDIA parou de vender “uma GPU” e passou a vender sistemas. O GB200 acopla duas GPUs Blackwell a uma CPU Grace; o GB200 NVL72 integra 72 GPUs num único rack refrigerado a líquido, agindo como uma GPU gigante via NVLink de 5ª geração (1,8 TB/s por GPU). Dell, HPE e Supermicro brigam pelos contratos de montagem desses racks.
Continuidade, não ruptura
Blackwell não muda o paradigma — continua sendo Transformer denso/esparso acelerado por tensor cores. A inovação é eficiência: mais memória, mais banda, precisão menor utilizável. As Scaling Laws (Chinchilla) não mudam em forma; mudam as constantes de custo, e a fronteira de “$10M de treino” sobe de patamar.
Por que importa
Move a fronteira de custo. Cada geração que dobra throughput por dólar permite treinar modelos maiores ou rodar os atuais por menos — o que sustenta o ritmo de lançamentos.
Inferência virou o jogo principal. Com modelos de raciocínio que gastam muito compute em test-time (o1 / o3 (Reasoning Models), Test-Time Compute / Inference Scaling), inferência rápida e barata passou a importar tanto quanto treino. Blackwell foi desenhada para os dois.
Reforça o fosso da NVIDIA. O valor não está só no silício, mas no NVLink + CUDA + ecossistema de racks. Concorrentes têm chips competitivos, mas raramente a malha integrada.
Estado em 2026
- Plataforma de fronteira corrente. Os maiores treinos de 2025-2026 rodam em Blackwell; H100/H200 migram para inferência e fine-tuning.
- Blackwell Ultra (GB300). Refresh com mais memória (288 GB HBM3e) e mais throughput NVFP4, mirando inferência de escala.
- Restrições de fornecimento e energia. O gargalo deixou de ser projetar o chip e passou a ser HBM, capacidade de fundição TSMC e energia elétrica dos data centers.
- Pressão de alternativas. TPUs (Google TPU v5/v6), chips de inferência (Groq / Cerebras (Inference)) e aceleradores internos de hyperscalers disputam fatias específicas.
Tratamento de carta — proposta
Blackwell Foundry Site (infraestrutura) · Foundry · upgrade de H100 Cluster
Se você controla um H100 Cluster, pode transformá-lo em Blackwell Foundry: agora ele gera 3 ⚡⚡⚡ em vez de 2, mas custa 1 de manutenção por turno (energia).
“Quatro bits bastam para responder. Dezesseis para pensar.”
A mecânica encena a troca real: mais throughput por unidade, ao custo de consumo (energia/calor) que precisa ser sustentado.
Veja também
NVIDIA H100 · Google TPU v5/v6 · Groq / Cerebras (Inference) · Scaling Laws (Chinchilla) · Test-Time Compute / Inference Scaling
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- NVIDIA (2024). NVIDIA Blackwell Architecture Technical Brief.
- NVIDIA (2024). Anúncio Blackwell e GB200 NVL72 na GTC, 18 de março de 2024.
- MLCommons (2024-2025). MLPerf Training & Inference results (Blackwell vs Hopper).
