Modelos de difusão: como a IA gera imagens destruindo-as com ruído
Entenda o mecanismo por trás de Stable Diffusion, DALL-E 2 e Midjourney, do ruído puro à imagem final.
Todo modelo de difusão treina em duas etapas que rodam em sentidos opostos.
No processo direto, chamado de forward, o sistema pega uma imagem real e adiciona ruído gaussiano em muitas etapas pequenas até sobrar apenas estática, indistinguível de um sinal aleatório.
No processo reverso, uma rede neural aprende a dar um único passo na direção contrária: recebe uma versão ruidosa e devolve uma versão um pouco menos embaralhada.
O artigo DDPM (Denoising Diffusion Probabilistic Models), assinado por Jonathan Ho, Ajay Jain e Pieter Abbeel e publicado em 2020, formalizou essa receita.
Ele virou a base de quase tudo que veio depois.
Gerar uma imagem nova é rodar o processo reverso a partir de ruído puro.
O modelo nunca viu aquela imagem específica.
Ele apenas absorveu a estatística de como o ruído se acumula e se desfaz sobre o conjunto de treino, e usa isso para decidir qual pixel ajustar em cada passo. ## Por que a difusão venceu as GANs Antes de 2020, a geração de imagens era dominada pelas GANs, as redes adversárias generativas.
O problema das GANs é estrutural: dois modelos competem entre si, um gerando e outro julgando, e o treino fica instável.
O gerador costuma colapsar em poucos resultados repetidos, fenômeno conhecido como mode collapse.
A difusão troca essa disputa por um objetivo simples e estável: prever o ruído que foi adicionado.
O treino é mais demorado e a geração custa mais, porque exige dezenas ou centenas de passos.
Em troca, o modelo entrega diversidade maior e não desanda no meio do caminho.
Foi esse equilíbrio que empurrou a difusão para o centro da IA generativa de imagem. ## O passo que tornou tudo viável: o espaço latente Rodar difusão direto nos pixels de uma imagem em alta resolução é caro demais.
A saída veio com a difusão latente, descrita no artigo de Robin Rombach e equipe em 2022.
A ideia é comprimir a imagem em um espaço latente reduzido com um autoencoder.
O ruído é aplicado lá, em dimensões menores, e um decodificador reconstrói a imagem final.
O Stable Diffusion, lançado em 2022 pela Stability AI, adota essa arquitetura e por isso consegue rodar em GPUs de consumidor, não só em clusters de pesquisa.
Esse detalhe de engenharia é o que explica a explosão de modelos abertos de geração de imagem a partir daquele ano. ## O que comanda a geração: o texto Quando você digita um prompt, um encoder de texto transforma a frase em um vetor.
Modelos como o CLIP fazem esse trabalho.
Esse vetor é injetado na rede em cada passo, por meio de um mecanismo de atenção, e funciona como um mapa: indica para onde o ruído deve caminhar.
Um ajuste chamado classifier-free guidance controla o quanto o modelo obedece ao prompt.
Aumentar esse valor deixa a imagem mais fiel ao texto, mas reduz a variedade dos resultados.
É o parâmetro que muita gente mexe sem saber o nome. ## Além da imagem A mesma matemática serve para outros dados além de pixels.
Pesquisadores adaptaram modelos de difusão para geração de áudio, de vídeo, de estruturas de proteínas e para o desenho de moléculas candidatas a medicamentos.
A lógica é idêntica: aprender a reverter ruído sobre um tipo de dado, não apenas sobre imagens. ## Os limites que ainda existem Gerar uma imagem com difusão exige muitos passos, o que pesa no tempo de resposta e no custo de computação.
Modelos de destilação, que comprimem o processo em poucos passos, surgiram justamente para atacar esse gargalo.
O treinamento consome muita GPU, o que restringe quem consegue criar um modelo do zero.
Há também a questão do viés.
O modelo aprende com um conjunto de dados e reproduz os padrões que encontra ali, inclusive estereótipos.
E os direitos autorais sobre imagens usadas no treino seguem em disputa judicial em vários países, sem resposta fechada até agora. ## Perguntas que aparecem sempre **Difusão é a mesma coisa que GAN?** Não.
A GAN treina dois modelos competindo entre si.
A difusão treina um único modelo para remover ruído, etapa por etapa. **Por que a imagem gerada às vezes sai com detalhes estranhos, como dedos tortos?** Porque o modelo reconstrói estatística visual, não lógica.
Ele aprendeu a distribuição de formas nos dados e segue essa distribuição, sem entender o que é uma mão de verdade. **Preciso de GPU para usar um modelo de difusão?** Não necessariamente.
Versões latentes e destiladas rodam em hardware mais modesto.
Treinar do zero, sim, exige muito poder de processamento.
