RGPO: método reduz esparsidade de recompensa em LLMs

Framework usa gabaritos de raciocínio como andaimes temporários e transfere de volta só as soluções melhores geradas pelo próprio modelo

Por Marcos Guimarães7 out 2026
RGPO: método reduz esparsidade de recompensa em LLMs

O que aconteceu

O artigo "Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding" foi submetido ao arXiv em 5 de outubro de 2026 e registrado sob o número 2610.07342v1, na área de Computer Science > Artificial Intelligence. O trabalho apresenta o RGPO (Rationale-Guided Policy Optimization), um framework de aprendizado por reforço que adapta o uso de informações de rationale, as justificativas passo a passo que sustentam uma resposta, de acordo com a capacidade atual do modelo.

O RGPO, sigla de Rationale-Guided Policy Optimization, não trata as soluções de referência como alvos fixos de imitação. Elas funcionam como andaimes temporários: ajudam o modelo a gerar respostas melhores durante o treino, mas apenas as soluções de maior recompensa produzidas pelo próprio modelo são transferidas de volta ao ambiente original, sem orientação. Com isso, o treinamento aproveita informação de referência sem exigir que dados off-policy sigam o mesmo formato da tarefa de aprendizado por reforço.

Os autores relatam ganhos consistentes sobre baselines de RLVR (Reinforcement Learning with Verifiable Rewards) em dois cenários: raciocínio só com linguagem e raciocínio com visão e linguagem combinadas. Estudos de ablação apontam a orientação adaptativa por rationale como o fator decisivo para esses ganhos. O resumo, porém, não informa os nomes dos autores, a instituição responsável, o tamanho dos modelos testados, os benchmarks usados nem a magnitude percentual das melhorias.

Contexto

O aprendizado por reforço on-policy se consolidou como um dos principais caminhos para melhorar a capacidade de raciocínio de grandes modelos de linguagem. O problema conhecido é a esparsidade de recompensa: quando o modelo não consegue encontrar trajetórias corretas para problemas difíceis, o processo de otimização recebe pouco sinal útil e pode estagnar.

Trabalhos anteriores tentaram contornar isso de três formas: incorporando demonstrações off-policy, traços de especialistas ou soluções geradas por modelos. Todas compartilham uma limitação parecida. Os dados auxiliares precisam seguir o formato da tarefa de aprendizado por reforço, o que muitas vezes obriga o uso de rejection sampling a partir de modelos mais fortes para obter trajetórias de treino adequadas. O RGPO ataca justamente esse acoplamento de formato.

Por que importa

Treinar modelos de raciocínio consome volume grande de computação e tempo de GPU. Quando o sinal de recompensa é esparso, boa parte desse esforço se perde em tentativas que não geram aprendizado. Um método que estabiliza o processo e melhora o desempenho sobre baselines de RLVR interessa diretamente a laboratórios e empresas que ajustam modelos próprios.

O detalhe prático está na dispensa do alinhamento de formato. Se os dados de referência não precisam espelhar a tarefa de RL, o custo de preparar e filtrar trajetórias cai. O RGPO também foi testado em cenários que combinam visão e linguagem, o que amplia o alcance para modelos multimodais, hoje centrais em produtos que leem imagens, gráficos e documentos.

Impacto

No curto prazo, o resultado é uma alternativa a pipelines que dependem de rejection sampling de modelos maiores para produzir trajetórias de treino. Isso importa para quem não tem acesso a um modelo de fronteira como professor e precisa destravar o próprio sistema com o que já tem em mãos.

No médio prazo, a ideia de usar rationale como andaime temporário pode influenciar o desenho de rotinas de pós-treinamento. A diferença central em relação a métodos de imitação é que o modelo não fica preso à resposta de referência: ele explora, e só o que gera recompensa maior volta para o ambiente sem orientação.

O que muda

A mudança conceitual é tratar a solução de referência como apoio descartável, e não como destino. Métodos que usam demonstrações off-policy tendem a empurrar o modelo para o formato da demonstração. O RGPO inverte a ordem: a referência serve para o modelo produzir respostas melhores, e o que se aproveita é a resposta do próprio modelo.

O que vem agora

O artigo é um preprint e não traz, no material divulgado, código, dados ou cronograma de revisão por pares. O próximo passo natural é a reprodução independente dos resultados e a comparação com outros métodos que atacam a esparsidade de recompensa. Até lá, os ganhos relatados sobre baselines de RLVR seguem sem números públicos verificáveis.

Fontes

  • arXiv cs.AI: Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding (arXiv:2610.07342v1) — https://arxiv.org/abs/2610.07342