COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Hardware & Infrallm-era2022hardware

NVIDIA H100

GPU Hopper da NVIDIA — workhorse do treino LLM 2023-2025. ~$30k cada. HBM3, FP8 nativo.

O quê

A NVIDIA H100 é a GPU de data center da arquitetura Hopper, anunciada na GTC de março de 2022 e disponível em volume a partir de 2023. Foi o cavalo de batalha do treino de LLMs entre 2023 e 2025 — praticamente todo modelo fronteira desse período (GPT-4, Claude, Gemini, Llama 2/3, Mistral) passou por clusters de H100.

Em números: 80 GB de HBM3 com ~3,35 TB/s de banda de memória, 80 bilhões de transistores no processo TSMC 4N, e uma Transformer Engine que introduziu suporte nativo a FP8 — precisão de 8 bits que dobra throughput de treino mantendo estabilidade numérica. A versão SXM consome até 700 W e nunca opera sozinha: cresce em clusters de 1.024 a 16.384+ GPUs interligadas por NVLink e InfiniBand.

Em Magik LLM Gathering, a H100 é tratada como Site (infraestrutura) · anchor — o solo de onde toda a era moderna brotou.

Como funciona

Transformer Engine e FP8

A inovação central da Hopper foi a Transformer Engine: hardware + software que escolhe dinamicamente entre FP8 e FP16 por camada, mantendo precisão onde importa e ganhando velocidade onde dá. Em treino de Transformers, isso rende roughly 2–3× o throughput de uma A100 (geração anterior, Ampere).

Banda de memória é o gargalo

LLMs são memory-bound: o limite prático não é quantas multiplicações a GPU faz, e sim quão rápido pesos e ativações entram e saem da memória. Os 80 GB de HBM3 a 3,35 TB/s definiram o tamanho de modelo que cabe por GPU e quantas GPUs eram necessárias para um modelo de centenas de bilhões de parâmetros. A H200 (2024) manteve a mesma arquitetura e subiu a memória para 141 GB de HBM3e a 4,8 TB/s — pura folga de memória para inferência de contexto longo.

Uma H100 isolada é quase irrelevante para fronteira. O que importa é a malha: NVLink de 4ª geração (900 GB/s por GPU) une 8 GPUs num nó, e InfiniBand conecta milhares de nós. Treinar um modelo grande é um exercício de paralelismo (dados, tensores, pipeline) coordenado por essa malha. Foi a disponibilidade de clusters de H100 — não a GPU em si — que separou quem pôde treinar fronteira de quem não pôde.

Por que importa

Concentrou poder. Com H100s custando dezenas de milhares de dólares cada e treinos exigindo milhares delas por meses, treinar um modelo fronteira passou a custar dezenas a centenas de milhões só em compute. Isso restringiu a competição a poucos labs com acesso a clusters dedicados.

Virou moeda geopolítica. Controles de exportação dos EUA (2022, endurecidos em 2023) miraram justamente a H100 e variantes, tornando-a peça de tabuleiro em política industrial entre EUA e China.

Definiu o ritmo da indústria. “Quantas H100 você tem?” virou proxy de seriedade. Meta, xAI, OpenAI e Microsoft anunciaram clusters de 100.000+ GPUs como demonstração de força.

Estado em 2026

  • Sucedida, não aposentada. A linha Blackwell (NVIDIA B100/B200 Blackwell) assumiu a fronteira de treino em 2025, mas a base instalada de H100/H200 continua enorme e rodando inferência e fine-tuning em produção.
  • Mercado secundário aquecido. Conforme labs migram para Blackwell, H100s usadas alimentam clouds menores e laboratórios acadêmicos.
  • Alternativas pressionam. Google TPU v5/v6 (Google) e chips de inferência dedicados (Groq / Cerebras (Inference)) atacam nichos onde a economia da H100 não fecha.
  • Aluguel sobre compra. A maioria acessa H100 via cloud (AWS, Azure, GCP, CoreWeave, Lambda) por hora, não comprando hardware.

Tratamento de carta — proposta

H100 Cluster Site (infraestrutura) · Foundry

Toque: gere 2 ⚡⚡ tokens de compute. Você pode ter no máximo 4 H100 Clusters em jogo.

“Não a GPU. A malha de dezesseis mil delas.”

A mecânica encena que o valor está na acumulação em escala: um cluster gera recurso, mas é o teto de quatro que representa o limite físico-econômico de quanto compute um jogador consegue erguer.

Veja também

NVIDIA B100/B200 Blackwell · Google TPU v5/v6 · Groq / Cerebras (Inference) · Scaling Laws (Chinchilla)

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • NVIDIA (2022). NVIDIA H100 Tensor Core GPU Architecture Whitepaper.
  • NVIDIA (2022). NVIDIA Hopper Architecture In-Depth. developer.nvidia.com.
  • NVIDIA (2024). NVIDIA Blackwell Architecture Technical Brief (comparativo Hopper).