NVIDIA H100
GPU Hopper da NVIDIA — workhorse do treino LLM 2023-2025. ~$30k cada. HBM3, FP8 nativo.
O quê
A NVIDIA H100 é a GPU de data center da arquitetura Hopper, anunciada na GTC de março de 2022 e disponível em volume a partir de 2023. Foi o cavalo de batalha do treino de LLMs entre 2023 e 2025 — praticamente todo modelo fronteira desse período (GPT-4, Claude, Gemini, Llama 2/3, Mistral) passou por clusters de H100.
Em números: 80 GB de HBM3 com ~3,35 TB/s de banda de memória, 80 bilhões de transistores no processo TSMC 4N, e uma Transformer Engine que introduziu suporte nativo a FP8 — precisão de 8 bits que dobra throughput de treino mantendo estabilidade numérica. A versão SXM consome até 700 W e nunca opera sozinha: cresce em clusters de 1.024 a 16.384+ GPUs interligadas por NVLink e InfiniBand.
Em Magik LLM Gathering, a H100 é tratada como Site (infraestrutura) · anchor — o solo de onde toda a era moderna brotou.
Como funciona
Transformer Engine e FP8
A inovação central da Hopper foi a Transformer Engine: hardware + software que escolhe dinamicamente entre FP8 e FP16 por camada, mantendo precisão onde importa e ganhando velocidade onde dá. Em treino de Transformers, isso rende roughly 2–3× o throughput de uma A100 (geração anterior, Ampere).
Banda de memória é o gargalo
LLMs são memory-bound: o limite prático não é quantas multiplicações a GPU faz, e sim quão rápido pesos e ativações entram e saem da memória. Os 80 GB de HBM3 a 3,35 TB/s definiram o tamanho de modelo que cabe por GPU e quantas GPUs eram necessárias para um modelo de centenas de bilhões de parâmetros. A H200 (2024) manteve a mesma arquitetura e subiu a memória para 141 GB de HBM3e a 4,8 TB/s — pura folga de memória para inferência de contexto longo.
NVLink e o cluster como unidade
Uma H100 isolada é quase irrelevante para fronteira. O que importa é a malha: NVLink de 4ª geração (900 GB/s por GPU) une 8 GPUs num nó, e InfiniBand conecta milhares de nós. Treinar um modelo grande é um exercício de paralelismo (dados, tensores, pipeline) coordenado por essa malha. Foi a disponibilidade de clusters de H100 — não a GPU em si — que separou quem pôde treinar fronteira de quem não pôde.
Por que importa
Concentrou poder. Com H100s custando dezenas de milhares de dólares cada e treinos exigindo milhares delas por meses, treinar um modelo fronteira passou a custar dezenas a centenas de milhões só em compute. Isso restringiu a competição a poucos labs com acesso a clusters dedicados.
Virou moeda geopolítica. Controles de exportação dos EUA (2022, endurecidos em 2023) miraram justamente a H100 e variantes, tornando-a peça de tabuleiro em política industrial entre EUA e China.
Definiu o ritmo da indústria. “Quantas H100 você tem?” virou proxy de seriedade. Meta, xAI, OpenAI e Microsoft anunciaram clusters de 100.000+ GPUs como demonstração de força.
Estado em 2026
- Sucedida, não aposentada. A linha Blackwell (NVIDIA B100/B200 Blackwell) assumiu a fronteira de treino em 2025, mas a base instalada de H100/H200 continua enorme e rodando inferência e fine-tuning em produção.
- Mercado secundário aquecido. Conforme labs migram para Blackwell, H100s usadas alimentam clouds menores e laboratórios acadêmicos.
- Alternativas pressionam. Google TPU v5/v6 (Google) e chips de inferência dedicados (Groq / Cerebras (Inference)) atacam nichos onde a economia da H100 não fecha.
- Aluguel sobre compra. A maioria acessa H100 via cloud (AWS, Azure, GCP, CoreWeave, Lambda) por hora, não comprando hardware.
Tratamento de carta — proposta
H100 Cluster Site (infraestrutura) · Foundry
Toque: gere 2 ⚡⚡ tokens de compute. Você pode ter no máximo 4 H100 Clusters em jogo.
“Não a GPU. A malha de dezesseis mil delas.”
A mecânica encena que o valor está na acumulação em escala: um cluster gera recurso, mas é o teto de quatro que representa o limite físico-econômico de quanto compute um jogador consegue erguer.
Veja também
NVIDIA B100/B200 Blackwell · Google TPU v5/v6 · Groq / Cerebras (Inference) · Scaling Laws (Chinchilla)
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- NVIDIA (2022). NVIDIA H100 Tensor Core GPU Architecture Whitepaper.
- NVIDIA (2022). NVIDIA Hopper Architecture In-Depth. developer.nvidia.com.
- NVIDIA (2024). NVIDIA Blackwell Architecture Technical Brief (comparativo Hopper).
