D-OPCD: método destila experiência de agentes em pesos de difusão

Novo método de destilação transforma prompts aprimorados por agentes em conhecimento permanente dentro do modelo de difusão.

Por Marcos Guimarães8 out 2026
D-OPCD: método destila experiência de agentes em pesos de difusão

O que aconteceu

Pesquisadores publicaram no arXiv o artigo "Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation", identificado como arXiv:2610.07250v1 e submetido em 5 de outubro de 2026. O trabalho propõe o D-OPCD, sigla para Diffusion On-Policy Context Distillation, uma técnica que trata o prompt melhorado por um agente como contexto privilegiado e destila o conhecimento do agente para dentro dos pesos do modelo de difusão.

Os testes usaram um agente Text-to-Image equipado com o Auto Skill Evolver (ASE), componente também proposto no artigo. Com o D-OPCD, a pontuação média de geração direta subiu de 60,52 para 65,09 em quatro benchmarks. Em uma segunda rodada do ASE sobre o gerador atualizado, houve ganho adicional de 1,83 ponto sobre um harness sem skills.

O conjunto de ganhos vem sendo chamado pelos autores de coevolução contínua entre harness e modelo.

Contexto

Modelos de difusão alimentam boa parte dos geradores de imagem usados hoje. A prática comum para melhorar resultados envolve envolver o modelo em um harness agêntico, uma camada externa que usa memória, skills, orquestração de fluxo, verificação de resultado e refinamento iterativo para construir e revisar prompts até obter imagens melhores.

Esses ganhos, no entanto, ficam externos ao modelo. Eles só se manifestam enquanto o harness completo está rodando. Quando o usuário entrega apenas a consulta original, sem toda a parafernália do agente ao redor, o modelo volta ao seu desempenho de base.

O D-OPCD ataca exatamente esse ponto. A técnica destila o conhecimento codificado no harness agêntico para dentro dos pesos do modelo de difusão, de modo que ele retenha parte do benefício do agente mesmo quando condicionado apenas à consulta original.

Por que importa

A proposta muda a economia de sistemas de geração de imagem. Hoje, o desempenho extra depende de um harness completo rodando a cada chamada, com custo de inferência, latência e complexidade operacional. Se o conhecimento do harness vira peso do modelo, o usuário recebe parte do ganho sem precisar carregar toda a estrutura do agente.

O número concreto é a subida de 60,52 para 65,09 na pontuação média de geração direta em quatro benchmarks. A diferença de 4,57 ponto representa o quanto do trabalho do agente ficou absorvido pelo próprio gerador.

Há também um efeito sobre o harness. Com o conhecimento absorvido nos pesos, o agente pode descartar skills que já saturaram o gerador e voltar a evoluir. É isso que a segunda rodada do ASE demonstra: o gerador atualizado serve de base para uma nova rodada de evolução de skills, com ganho de 1,83 ponto sobre um harness sem skills.

Impacto

O artigo aponta para sistemas em que harness e modelo melhoram um ao outro em ciclo contínuo. Na prática, isso significa que pipelines de geração de imagem podem separar duas fases: uma de evolução de skills do agente, com todos os custos associados, e outra de destilação para os pesos, que congela parte do ganho em formato mais barato de rodar.

A abordagem também reposiciona o papel do harness agêntico. Em vez de ser uma camada fixa que só encarece a inferência, ele passa a ser uma fonte de dados que alimenta a evolução do próprio modelo. O harness vira uma etapa de treinamento, não um acessório permanente.

Para quem opera produtos de geração de imagem, o caminho sugere uma alternativa a simplesmente aumentar o tamanho do modelo. Parte do ganho de qualidade pode vir da destilação de experiência agêntica acumulada, reaproveitando trabalho já feito na camada externa.

O que muda

O texto do artigo define o D-OPCD como uma destilação on-policy, ou seja, o conhecimento destilado vem da própria trajetória do agente, não de um conjunto congelado de exemplos. O prompt melhorado pelo agente funciona como contexto privilegiado durante o processo, e o objetivo é que o modelo aprenda a reproduzir parte desse refinamento sozinho.

O Auto Skill Evolver, por sua vez, é o mecanismo que dá ao agente a capacidade de evoluir skills ao longo do tempo. O ciclo descrito envolve o ASE evoluindo habilidades, o D-OPCD transferindo o resultado para os pesos do gerador e, em seguida, o ASE voltando a operar sobre um gerador mais forte, o que permite descartar skills saturadas e explorar novas.

A sigla D-OPCD passa a nomear uma família de técnicas que trata o harness como fonte de treinamento, e não apenas como infraestrutura de inferência.

O que vem agora

O artigo foi submetido ao arXiv em 5 de outubro de 2026 e está disponível sob o identificador arXiv:2610.07250v1 na categoria cs.AI, seção de Inteligência Artificial. Não foram divulgados nomes dos autores, instituição responsável, código, dados de treinamento ou prazos para publicação em conferência no material consultado.

Os próprios autores descrevem o resultado como uma direção, não como um ponto final: sistemas de text-to-image nos quais harness e modelo seguem se melhorando mutuamente por coevolução contínua.

Fontes

  • arXiv cs.AI: "Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation", arXiv:2610.07250v1, submetido em 5 de outubro de 2026. https://arxiv.org/abs/2610.07250