CompPO usa computação interna do Transformer para melhorar RL de LLMs
Framework CCT apresentado no arXiv em agosto de 2026 traz ganhos em precisão e estabilidade no treinamento por reforço.
O que aconteceu
Um estudo submetido ao arXiv em 21 de agosto de 2026, sob o identificador 2608.21501, apresenta o Computation-Conditioned Credit Transport (CCT), um framework para credit assignment em aprendizado por reforço de grandes modelos de linguagem (LLM RL). O trabalho, classificado em Computer Science > Artificial Intelligence, foi anunciado na plataforma em 25 de agosto.
O algoritmo concreto, chamado CompPO, mapeia a concentração de atenção nativa do Transformer em um gate de retenção por token. Esse gate é usado no bootstrapping de um passo e em um trace de vantagem generalizada dependente do caminho, o Comp-GAE. O método também co-desenha um crítico alinhado ao transporte (TAC), que reutiliza os estados ocultos e as informações de roteamento do ator, sem exigir um segundo Transformer de mesma escala.
Nos experimentos com o modelo Qwen3-4B, em cinco sementes (seeds), o CompPO atingiu 61,4% de acurácia final em dados fora da amostra, com intervalo de confiança de 95% entre 60,8 e 62,0. O GRPO ajustado chegou a 53,8% (IC 95% 52,9-54,7), uma diferença de 7,6 pontos percentuais. Comparações adicionais mostram que nem o Comp-GAE com crítico padrão (55,2%) nem o TAC com gate fixo (56,4%) alcançam o modelo completo, cuja interação adicionou 2,4 pontos (IC 95% 1,9-2,9). Os controles de embaralhamento e posição confirmam alinhamento específico da trajetória. Em termos de estabilidade, o CompPO se mostrou estável em 10 das 12 execuções no grid de PPO, contra 3 de 12 na linha de base. Na avaliação congelada (frozen), o ganho sobre o GRPO foi de 4,3 pontos no Qwen3-4B e de 3,9 pontos no Llama-3.1-8B-Instruct, medidos em greedy pass@1 macro.
Contexto
O credit assignment em RL de LLMs pode ser decomposto em três objetos: evidência sobre sucesso, operador de transporte e geometria de atualização. O operador de transporte converte a evidência em vantagens em nível de token, e a geometria transforma essas vantagens em mudanças de política. O trabalho observa que a evidência, a amostragem e a geometria melhoraram recentemente, mas o operador de transporte costuma ser agnóstico à arquitetura. O GAE de desconto fixo aplica um kernel geométrico estacionário ao longo do tempo do token. Métodos relativos a grupo, como o GRPO, transmitem uma estatística de resultado para toda a resposta. Nenhum dos dois representa o cálculo específico da trajetória feito pela política Transformer.
O CompPO propõe um gate de retenção por token, limitado, derivado da concentração de atenção nativa. Um gate constante recupera o GAE de coeficiente fixo, o que mostra que o método é uma generalização. O TAC reutiliza as representações internas do ator, evitando o custo de um crítico separado do mesmo porte.
Por que importa
Treinar LLMs com RL é caro e sensível a hiperparâmetros. O CompPO ataca duas dores: a qualidade do sinal de crédito e a estabilidade do treino. A vantagem de usar a computação interna do modelo para calibrar o transporte de valor pode reduzir o desperdício de dados e a necessidade de intervenção manual em grids de hiperparâmetros. Para equipes que rodam modelos abertos como Qwen e Llama, o método oferece um caminho para melhorar o desempenho em tarefas de raciocínio sem trocar o algoritmo de política PPO.
Os ganhos em estabilidade são relevantes na prática. O material relata que o CompPO foi estável em 10 de 12 execuções no grid de PPO, contra 3 de 12 na linha de base. Isso significa menos tentativas para obter um resultado confiável.
Impacto
No curto prazo, o framework tende a ser reproduzido e comparado por outros grupos de pesquisa em RL. No médio prazo, a combinação de gate baseado em atenção e crítico reutilizando estados ocultos pode influenciar bibliotecas de treino, como TRL e frameworks de PPO em código aberto. O fato de não exigir um segundo Transformer em escala completa é um atrativo econômico. Para empresas que pagam por GPU em horas, poupar um modelo crítico inteiro pode reduzir o custo por execução.
Os resultados no Llama-3.1-8B-Instruct, um modelo menor, sugerem que a técnica não é exclusiva de uma família. A diferença de 3,9 pontos na avaliação congelada indica que o benefício se mantém fora do conjunto de treino.
O que muda
Na prática, o operador de transporte deixa de ser um componente fixo e passa a ser condicionado pelo comportamento da política. Uma equipe que adote o CompPO precisará expor estados ocultos do ator para calcular o gate e alimentar o crítico. Isso altera a implementação, mas não a função de recompensa nem o objetivo PPO. O resumo afirma que a recompensa da tarefa e o objetivo de política com clipping permanecem inalterados.
O gate constante recupera o GAE padrão, o que facilita a integração gradual. Quem já tem um pipeline de PPO pode testar o CompPO mantendo a infraestrutura atual.
O que vem agora
O artigo foi anunciado em 25 de agosto de 2026 e ainda não passou por revisão formal por pares. Espera-se que a comunidade submeta avaliações independentes em modelos maiores, como versões de 14B ou 32B, e em tarefas diversas. Também é provável que os autores divulguem código e pesos dos gates para reprodução, embora o resumo não detalhe disponibilidade. O próximo passo natural é verificar se a interação entre gate e crítico se sustenta em treinos com milhões de passos.
Fontes
- arXiv: Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning (https://arxiv.org/abs/2608.21501)
