Modelos de difusão: como a IA gera imagens destruindo-as com ruído

Entenda o mecanismo por trás de Stable Diffusion, DALL-E 2 e Midjourney, do ruído puro à imagem final.

Por Marcos Guimarães11 out 2026
Modelos de difusão: como a IA gera imagens destruindo-as com ruído

Todo modelo de difusão treina em duas etapas que rodam em sentidos opostos.

No processo direto, chamado de forward, o sistema pega uma imagem real e adiciona ruído gaussiano em muitas etapas pequenas até sobrar apenas estática, indistinguível de um sinal aleatório.

No processo reverso, uma rede neural aprende a dar um único passo na direção contrária: recebe uma versão ruidosa e devolve uma versão um pouco menos embaralhada.

O artigo DDPM (Denoising Diffusion Probabilistic Models), assinado por Jonathan Ho, Ajay Jain e Pieter Abbeel e publicado em 2020, formalizou essa receita.

Ele virou a base de quase tudo que veio depois.

Gerar uma imagem nova é rodar o processo reverso a partir de ruído puro.

O modelo nunca viu aquela imagem específica.

Ele apenas absorveu a estatística de como o ruído se acumula e se desfaz sobre o conjunto de treino, e usa isso para decidir qual pixel ajustar em cada passo. ## Por que a difusão venceu as GANs Antes de 2020, a geração de imagens era dominada pelas GANs, as redes adversárias generativas.

O problema das GANs é estrutural: dois modelos competem entre si, um gerando e outro julgando, e o treino fica instável.

O gerador costuma colapsar em poucos resultados repetidos, fenômeno conhecido como mode collapse.

A difusão troca essa disputa por um objetivo simples e estável: prever o ruído que foi adicionado.

O treino é mais demorado e a geração custa mais, porque exige dezenas ou centenas de passos.

Em troca, o modelo entrega diversidade maior e não desanda no meio do caminho.

Foi esse equilíbrio que empurrou a difusão para o centro da IA generativa de imagem. ## O passo que tornou tudo viável: o espaço latente Rodar difusão direto nos pixels de uma imagem em alta resolução é caro demais.

A saída veio com a difusão latente, descrita no artigo de Robin Rombach e equipe em 2022.

A ideia é comprimir a imagem em um espaço latente reduzido com um autoencoder.

O ruído é aplicado lá, em dimensões menores, e um decodificador reconstrói a imagem final.

O Stable Diffusion, lançado em 2022 pela Stability AI, adota essa arquitetura e por isso consegue rodar em GPUs de consumidor, não só em clusters de pesquisa.

Esse detalhe de engenharia é o que explica a explosão de modelos abertos de geração de imagem a partir daquele ano. ## O que comanda a geração: o texto Quando você digita um prompt, um encoder de texto transforma a frase em um vetor.

Modelos como o CLIP fazem esse trabalho.

Esse vetor é injetado na rede em cada passo, por meio de um mecanismo de atenção, e funciona como um mapa: indica para onde o ruído deve caminhar.

Um ajuste chamado classifier-free guidance controla o quanto o modelo obedece ao prompt.

Aumentar esse valor deixa a imagem mais fiel ao texto, mas reduz a variedade dos resultados.

É o parâmetro que muita gente mexe sem saber o nome. ## Além da imagem A mesma matemática serve para outros dados além de pixels.

Pesquisadores adaptaram modelos de difusão para geração de áudio, de vídeo, de estruturas de proteínas e para o desenho de moléculas candidatas a medicamentos.

A lógica é idêntica: aprender a reverter ruído sobre um tipo de dado, não apenas sobre imagens. ## Os limites que ainda existem Gerar uma imagem com difusão exige muitos passos, o que pesa no tempo de resposta e no custo de computação.

Modelos de destilação, que comprimem o processo em poucos passos, surgiram justamente para atacar esse gargalo.

O treinamento consome muita GPU, o que restringe quem consegue criar um modelo do zero.

Há também a questão do viés.

O modelo aprende com um conjunto de dados e reproduz os padrões que encontra ali, inclusive estereótipos.

E os direitos autorais sobre imagens usadas no treino seguem em disputa judicial em vários países, sem resposta fechada até agora. ## Perguntas que aparecem sempre **Difusão é a mesma coisa que GAN?** Não.

A GAN treina dois modelos competindo entre si.

A difusão treina um único modelo para remover ruído, etapa por etapa. **Por que a imagem gerada às vezes sai com detalhes estranhos, como dedos tortos?** Porque o modelo reconstrói estatística visual, não lógica.

Ele aprendeu a distribuição de formas nos dados e segue essa distribuição, sem entender o que é uma mão de verdade. **Preciso de GPU para usar um modelo de difusão?** Não necessariamente.

Versões latentes e destiladas rodam em hardware mais modesto.

Treinar do zero, sim, exige muito poder de processamento.