C-DPPO: novo método de post-training promete +3.0 pontos em agentes de código

Framework fidelity-aware elimina erros de token e chamadas espúrias que distorcem o treinamento de agentes de código

Por Marcos Guimarães7 set 2026
C-DPPO: novo método de post-training promete +3.0 pontos em agentes de código

O que aconteceu

O paper Train What You Deploy: Token-Faithful Post-Training of a Production Coding foi submetido ao arXiv em 4 de setembro de 2026, sob o identificador arXiv:2609.04678v1, na área de Inteligência Artificial (cs.AI). O trabalho propõe o C-DPPO, sigla em inglês para Certified Divergence Proximal Policy Optimization, um algoritmo de post-training voltado a agentes de código e de terminal usados em produção.

Os números centrais do estudo vêm dos experimentos com dois modelos pareados, Baize5B e Baize10B, avaliados no benchmark TMax-100 com protocolos idênticos de treino e teste. O C-DPPO entregou um ganho consistente de +3.0 pontos de desempenho sobre o DPPO padrão nas duas escalas de modelo. Auditorias de certificado validaram a confiabilidade e a cobertura operacional completa do pipeline de treinamento certificado.

Contexto

O problema que o paper ataca é conhecido de quem treina agentes de código: os pipelines existentes de post-training sofrem erros severos de fidelidade de token e de controle. Há duas fontes principais de distorção. A primeira é o uso de ambientes de treinamento simplificados que não correspondem aos ambientes reais de produção. A segunda é a reconstrução offline de tokens a partir de logs de agentes, que distorce os prompts originais e confunde chamadas do modelo de política com operações de modelos de fundo.

Ou seja, o modelo é treinado em uma situação e implantado em outra. O título do trabalho resume a tese: treine o que você vai implantar.

Por que importa

A equipe propôs um framework de acoplamento de treinamento consciente de fidelidade (fidelity-aware) com três mecanismos. O framework retém a amostragem do lado do treinador sobre os prompts originais, elimina chamadas espúrias de modelo por meio de um protocolo de treinamento negociado e restringe o cálculo da loss a intervalos de tokens verificáveis, com garantias de falha fechadas.

Sobre o DPPO padrão, o C-DPPO adiciona limites de certificação TV (Total Variation) bilaterais e ajustados, regras adaptativas de K, garantias de sequência conscientes de orçamento e mascaramento de política robusto a erros. Para empresas que operam agentes de código em produção, isso significa treinamento com garantias formais sobre o comportamento do modelo, e não apenas métricas médias de benchmark.

Impacto

O ganho de +3.0 pontos do C-DPPO sobre o DPPO foi consistente nas duas escalas testadas, Baize5B e Baize10B, o que sugere que o método não depende do tamanho do modelo. As auditorias de certificado, segundo o paper, confirmaram cobertura operacional completa, indicando que os limites de certificação funcionaram em todo o pipeline.

O framework fidelity-aware também ataca um custo silencioso: chamadas espúrias de modelo durante o treinamento, que desperdiçam computação e contaminam os gradientes. O protocolo de treinamento negociado elimina essas chamadas.

O que muda

Para times de engenharia de ML, a mensagem prática é que a reconstrução offline de tokens a partir de logs de agentes, prática comum, introduz dois vieses documentados: distorção dos prompts originais e confluência entre chamadas da política e operações de modelos de fundo. O C-DPPO propõe substituir essa abordagem por amostragem do lado do treinador sobre os prompts originais, mantendo o mesmo ambiente de produção.

O que vem agora

O paper está disponível no arXiv desde 4 de setembro de 2026, com PDF e versão HTML experimental. Ainda não há informações no material sobre adoção em produção por terceiros, liberação de código ou comparações com outros métodos além do DPPO. A próxima etapa natural é a reprodução independente dos resultados no TMax-100 e a verificação se os ganhos de +3.0 pontos se mantêm em outros benchmarks e famílias de modelos além de Baize5B e Baize10B.