COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Architecturesllm-era2022architecture

Stable Diffusion

Modelo de difusão latente open-weights que tornou geração text-to-image acessível em GPU de consumidor.

O quê

Stable Diffusion é a família de modelos de difusão latente de pesos abertos lançada em agosto de 2022 pela Stability AI, em parceria com o grupo CompVis (LMU Munique) e a Runway. Sua base técnica é o paper High-Resolution Image Synthesis with Latent Diffusion Models (Rombach et al., CVPR 2022), que aplica difusão no espaço latente de um autoencoder (VAE) em vez de operar diretamente nos pixels — reduzindo drasticamente o custo computacional e tornando geração text-to-image viável em GPUs de consumidor.

Foi um divisor de águas cultural: ao abrir os pesos, Stable Diffusion detonou uma explosão de fine-tunes, LoRAs, ControlNets, interfaces (AUTOMATIC1111, ComfyUI) e uma comunidade gigantesca — em contraste com modelos fechados como DALL·E e Midjourney. Marco da multimodalidade open-source.

Como funciona

Difusão: ruído e remoção de ruído

Modelos de difusão (Diffusion Models) aprendem revertendo um processo: durante o treino, adiciona-se ruído gaussiano a uma imagem em muitos passos até virar ruído puro; o modelo aprende a prever e remover esse ruído passo a passo. Na geração, parte-se de ruído aleatório e “desruidifica” iterativamente até emergir uma imagem.

O truque latente

Fazer isso em pixels (megapixels) é caríssimo. A inovação do Latent Diffusion é operar no espaço latente comprimido de um VAE — uma representação ~8× menor em cada dimensão. Os três componentes:

  1. VAE — comprime a imagem em um latente e depois o decodifica de volta a pixels.
  2. U-Net (denoiser) — faz a difusão no latente, condicionada pelo texto.
  3. Encoder de texto (CLIP) — transforma o prompt em embeddings que guiam a geração via cross-attention.

A condicionação por texto entra exatamente pelas camadas de atenção cruzada que conectam tokens do prompt aos patches da imagem.

Guidance e amostragem

Para que a imagem realmente obedeça ao prompt, usa-se classifier-free guidance: o modelo gera duas previsões (uma condicionada ao texto, outra não) e extrapola na direção da condicionada, com um peso ajustável (CFG scale). Mais guidance = mais aderência ao prompt, menos diversidade. O número de passos de remoção de ruído (samplers como DDIM, Euler, DPM++) negocia qualidade contra velocidade: dezenas de passos para qualidade máxima, poucos passos para previews rápidos. Esse conjunto de botões — prompt, CFG, seed, sampler, passos — é o que a comunidade aprendeu a manipular com precisão quase artesanal.

Por que importa

  • Democratizou a geração de imagens. Rodar localmente, de graça, em hardware comum, mudou quem podia criar e experimentar.
  • Criou um ecossistema aberto. Fine-tunes, LoRAs e ControlNets só existem porque os pesos eram abertos.
  • Provou a difusão latente. O padrão “comprimir → difundir → decodificar” virou receita dominante de geração visual.

Estado em 2026

A linhagem evoluiu da U-Net para Diffusion Transformers (DiT): SDXL (2023) refinou a U-Net com pipeline base+refiner; Stable Diffusion 3 (2024) trocou a U-Net por um Multimodal DiT (MMDiT) com rectified flow e três encoders de texto (incluindo T5-XXL), melhorando muito a aderência a prompts e a renderização de texto dentro da imagem. Em paralelo, ex-pesquisadores da Stability fundaram a Black Forest Labs e lançaram a família Flux, considerada estado da arte aberta em fotorrealismo e aderência. A tendência de 2026 é clara: transformers substituindo U-Nets na difusão, ecossistema aberto vibrante, e convergência entre geração de imagem, vídeo e modelos multimodais — sempre sob a sombra de questões de direitos autorais sobre dados de treino e de Synthetic Data Generation/model collapse.

Tratamento de carta — proposta

Stable Diffusion, The Latent Forge Site · Chronoworks · custo

Denoise. Tap: comece com uma carta “ruído” (face para baixo) e, a cada turno, remova 1 marcador de ruído. Quando o último sair, ela se torna uma cópia de qualquer Conceito que você já controlou.

Open Weights. Qualquer jogador pode usar a habilidade Denoise deste Site pagando 1 ⚡.

“Comece do caos. Remova o ruído, camada por camada, até a imagem emergir — e deixe a forja aberta a todos.”

A mecânica encena a difusão (remover ruído iterativamente até emergir a imagem) e os pesos abertos (acesso compartilhado).

Veja também

Diffusion Models · Transformer · GAN — Generative Adversarial Net · Self-Attention · Synthetic Data Generation

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Rombach, R. et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022. arXiv:2112.10752.
  • Ho, J. et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020. arXiv:2006.11239.
  • Esser, P. et al. (2024). Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (Stable Diffusion 3). arXiv:2403.03206.