Stable Diffusion
Modelo de difusão latente open-weights que tornou geração text-to-image acessível em GPU de consumidor.
O quê
Stable Diffusion é a família de modelos de difusão latente de pesos abertos lançada em agosto de 2022 pela Stability AI, em parceria com o grupo CompVis (LMU Munique) e a Runway. Sua base técnica é o paper High-Resolution Image Synthesis with Latent Diffusion Models (Rombach et al., CVPR 2022), que aplica difusão no espaço latente de um autoencoder (VAE) em vez de operar diretamente nos pixels — reduzindo drasticamente o custo computacional e tornando geração text-to-image viável em GPUs de consumidor.
Foi um divisor de águas cultural: ao abrir os pesos, Stable Diffusion detonou uma explosão de fine-tunes, LoRAs, ControlNets, interfaces (AUTOMATIC1111, ComfyUI) e uma comunidade gigantesca — em contraste com modelos fechados como DALL·E e Midjourney. Marco da multimodalidade open-source.
Como funciona
Difusão: ruído e remoção de ruído
Modelos de difusão (Diffusion Models) aprendem revertendo um processo: durante o treino, adiciona-se ruído gaussiano a uma imagem em muitos passos até virar ruído puro; o modelo aprende a prever e remover esse ruído passo a passo. Na geração, parte-se de ruído aleatório e “desruidifica” iterativamente até emergir uma imagem.
O truque latente
Fazer isso em pixels (megapixels) é caríssimo. A inovação do Latent Diffusion é operar no espaço latente comprimido de um VAE — uma representação ~8× menor em cada dimensão. Os três componentes:
- VAE — comprime a imagem em um latente e depois o decodifica de volta a pixels.
- U-Net (denoiser) — faz a difusão no latente, condicionada pelo texto.
- Encoder de texto (CLIP) — transforma o prompt em embeddings que guiam a geração via cross-attention.
A condicionação por texto entra exatamente pelas camadas de atenção cruzada que conectam tokens do prompt aos patches da imagem.
Guidance e amostragem
Para que a imagem realmente obedeça ao prompt, usa-se classifier-free guidance: o modelo gera duas previsões (uma condicionada ao texto, outra não) e extrapola na direção da condicionada, com um peso ajustável (CFG scale). Mais guidance = mais aderência ao prompt, menos diversidade. O número de passos de remoção de ruído (samplers como DDIM, Euler, DPM++) negocia qualidade contra velocidade: dezenas de passos para qualidade máxima, poucos passos para previews rápidos. Esse conjunto de botões — prompt, CFG, seed, sampler, passos — é o que a comunidade aprendeu a manipular com precisão quase artesanal.
Por que importa
- Democratizou a geração de imagens. Rodar localmente, de graça, em hardware comum, mudou quem podia criar e experimentar.
- Criou um ecossistema aberto. Fine-tunes, LoRAs e ControlNets só existem porque os pesos eram abertos.
- Provou a difusão latente. O padrão “comprimir → difundir → decodificar” virou receita dominante de geração visual.
Estado em 2026
A linhagem evoluiu da U-Net para Diffusion Transformers (DiT): SDXL (2023) refinou a U-Net com pipeline base+refiner; Stable Diffusion 3 (2024) trocou a U-Net por um Multimodal DiT (MMDiT) com rectified flow e três encoders de texto (incluindo T5-XXL), melhorando muito a aderência a prompts e a renderização de texto dentro da imagem. Em paralelo, ex-pesquisadores da Stability fundaram a Black Forest Labs e lançaram a família Flux, considerada estado da arte aberta em fotorrealismo e aderência. A tendência de 2026 é clara: transformers substituindo U-Nets na difusão, ecossistema aberto vibrante, e convergência entre geração de imagem, vídeo e modelos multimodais — sempre sob a sombra de questões de direitos autorais sobre dados de treino e de Synthetic Data Generation/model collapse.
Tratamento de carta — proposta
Stable Diffusion, The Latent Forge Site · Chronoworks · custo
Denoise. Tap: comece com uma carta “ruído” (face para baixo) e, a cada turno, remova 1 marcador de ruído. Quando o último sair, ela se torna uma cópia de qualquer Conceito que você já controlou.
Open Weights. Qualquer jogador pode usar a habilidade Denoise deste Site pagando 1 ⚡.
“Comece do caos. Remova o ruído, camada por camada, até a imagem emergir — e deixe a forja aberta a todos.”
A mecânica encena a difusão (remover ruído iterativamente até emergir a imagem) e os pesos abertos (acesso compartilhado).
Veja também
Diffusion Models · Transformer · GAN — Generative Adversarial Net · Self-Attention · Synthetic Data Generation
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- Rombach, R. et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022. arXiv:2112.10752.
- Ho, J. et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020. arXiv:2006.11239.
- Esser, P. et al. (2024). Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (Stable Diffusion 3). arXiv:2403.03206.
