CompPO usa computação interna do Transformer para melhorar RL de LLMs

Framework CCT apresentado no arXiv em agosto de 2026 traz ganhos em precisão e estabilidade no treinamento por reforço.

Por Marcos Guimarães25 ago 2026
CompPO usa computação interna do Transformer para melhorar RL de LLMs

O que aconteceu

Um estudo submetido ao arXiv em 21 de agosto de 2026, sob o identificador 2608.21501, apresenta o Computation-Conditioned Credit Transport (CCT), um framework para credit assignment em aprendizado por reforço de grandes modelos de linguagem (LLM RL). O trabalho, classificado em Computer Science > Artificial Intelligence, foi anunciado na plataforma em 25 de agosto.

O algoritmo concreto, chamado CompPO, mapeia a concentração de atenção nativa do Transformer em um gate de retenção por token. Esse gate é usado no bootstrapping de um passo e em um trace de vantagem generalizada dependente do caminho, o Comp-GAE. O método também co-desenha um crítico alinhado ao transporte (TAC), que reutiliza os estados ocultos e as informações de roteamento do ator, sem exigir um segundo Transformer de mesma escala.

Nos experimentos com o modelo Qwen3-4B, em cinco sementes (seeds), o CompPO atingiu 61,4% de acurácia final em dados fora da amostra, com intervalo de confiança de 95% entre 60,8 e 62,0. O GRPO ajustado chegou a 53,8% (IC 95% 52,9-54,7), uma diferença de 7,6 pontos percentuais. Comparações adicionais mostram que nem o Comp-GAE com crítico padrão (55,2%) nem o TAC com gate fixo (56,4%) alcançam o modelo completo, cuja interação adicionou 2,4 pontos (IC 95% 1,9-2,9). Os controles de embaralhamento e posição confirmam alinhamento específico da trajetória. Em termos de estabilidade, o CompPO se mostrou estável em 10 das 12 execuções no grid de PPO, contra 3 de 12 na linha de base. Na avaliação congelada (frozen), o ganho sobre o GRPO foi de 4,3 pontos no Qwen3-4B e de 3,9 pontos no Llama-3.1-8B-Instruct, medidos em greedy pass@1 macro.

Contexto

O credit assignment em RL de LLMs pode ser decomposto em três objetos: evidência sobre sucesso, operador de transporte e geometria de atualização. O operador de transporte converte a evidência em vantagens em nível de token, e a geometria transforma essas vantagens em mudanças de política. O trabalho observa que a evidência, a amostragem e a geometria melhoraram recentemente, mas o operador de transporte costuma ser agnóstico à arquitetura. O GAE de desconto fixo aplica um kernel geométrico estacionário ao longo do tempo do token. Métodos relativos a grupo, como o GRPO, transmitem uma estatística de resultado para toda a resposta. Nenhum dos dois representa o cálculo específico da trajetória feito pela política Transformer.

O CompPO propõe um gate de retenção por token, limitado, derivado da concentração de atenção nativa. Um gate constante recupera o GAE de coeficiente fixo, o que mostra que o método é uma generalização. O TAC reutiliza as representações internas do ator, evitando o custo de um crítico separado do mesmo porte.

Por que importa

Treinar LLMs com RL é caro e sensível a hiperparâmetros. O CompPO ataca duas dores: a qualidade do sinal de crédito e a estabilidade do treino. A vantagem de usar a computação interna do modelo para calibrar o transporte de valor pode reduzir o desperdício de dados e a necessidade de intervenção manual em grids de hiperparâmetros. Para equipes que rodam modelos abertos como Qwen e Llama, o método oferece um caminho para melhorar o desempenho em tarefas de raciocínio sem trocar o algoritmo de política PPO.

Os ganhos em estabilidade são relevantes na prática. O material relata que o CompPO foi estável em 10 de 12 execuções no grid de PPO, contra 3 de 12 na linha de base. Isso significa menos tentativas para obter um resultado confiável.

Impacto

No curto prazo, o framework tende a ser reproduzido e comparado por outros grupos de pesquisa em RL. No médio prazo, a combinação de gate baseado em atenção e crítico reutilizando estados ocultos pode influenciar bibliotecas de treino, como TRL e frameworks de PPO em código aberto. O fato de não exigir um segundo Transformer em escala completa é um atrativo econômico. Para empresas que pagam por GPU em horas, poupar um modelo crítico inteiro pode reduzir o custo por execução.

Os resultados no Llama-3.1-8B-Instruct, um modelo menor, sugerem que a técnica não é exclusiva de uma família. A diferença de 3,9 pontos na avaliação congelada indica que o benefício se mantém fora do conjunto de treino.

O que muda

Na prática, o operador de transporte deixa de ser um componente fixo e passa a ser condicionado pelo comportamento da política. Uma equipe que adote o CompPO precisará expor estados ocultos do ator para calcular o gate e alimentar o crítico. Isso altera a implementação, mas não a função de recompensa nem o objetivo PPO. O resumo afirma que a recompensa da tarefa e o objetivo de política com clipping permanecem inalterados.

O gate constante recupera o GAE padrão, o que facilita a integração gradual. Quem já tem um pipeline de PPO pode testar o CompPO mantendo a infraestrutura atual.

O que vem agora

O artigo foi anunciado em 25 de agosto de 2026 e ainda não passou por revisão formal por pares. Espera-se que a comunidade submeta avaliações independentes em modelos maiores, como versões de 14B ou 32B, e em tarefas diversas. Também é provável que os autores divulguem código e pesos dos gates para reprodução, embora o resumo não detalhe disponibilidade. O próximo passo natural é verificar se a interação entre gate e crítico se sustenta em treinos com milhões de passos.

Fontes

  • arXiv: Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning (https://arxiv.org/abs/2608.21501)