Recompensa esparsa trava RL em matemática visual; estudo testa 11 métodos
Pesquisa do arXiv compara prior injection e revela que slice de avaliação inverte ranking
O que aconteceu
Pesquisadores treinaram 11 métodos de RL sob condições idênticas para investigar a fome de gradiente em problemas visuais de matemática. No pool de 20.830 questões, o modelo Qwen2-VL-2B acerta apenas 3,6% dos rollouts, e entre 85% e 97% dos grupos de rollout do algoritmo GRPO são inteiramente errados, contribuindo com gradiente zero. O estudo, intitulado "Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning" (arXiv:2608.21811), foi submetido em 22 de agosto de 2026.
Cada método injeta um tipo diferente de prior: texto (dicas de solução de referência), distribuição (destilação on-policy de um professor de 7B) e valor (um crítico pré-treinado com perda MSE ou perda categórica HL-Gauss). Os resultados mostram que o prior ajuda exatamente quando chega à política. Os seis braços cujo prior efetivamente alcança a política separam-se sem sobreposição dos cinco restantes, tanto na métrica in-domain quanto na transferência entre domínios via DynaMath.
Contexto
O problema central é a escassez de recompensa. Quando quase todos os rollouts falham, o gradiente some e o treino estagna. A GRPO, variante de RL usada no Qwen2-VL-2B, depende de grupos de rollout para estimar vantagens; sem acertos, o sinal é nulo. O estudo compara três famílias de prior, mas o achado mais disruptivo não está nos métodos, e sim na avaliação.
Um slice do pool in-domain, usado há muito tempo como checagem de distribuição geral, anti-correlaciona com transferência genuína entre domínios, com Spearman rho de -0,74 (n = 11 braços, p = 0,011). Em contraste, o slice mais difícil do in-domain prediz bem a transferência, com rho de +0,89 (p < 0,001). Os autores atribuem a inversão a um subconjunto de múltipla escolha próximo do acaso, que recompensa modelos que não mudaram. Lendo através desse slice, o melhor método em cross-domain parecia mediano, e o pior parecia o campeão.
Por que importa
A descoberta tem consequência prática imediata: a escolha da métrica de avaliação pode reverter o ranking de métodos. Um pesquisador que usa só o slice de múltipla escolha para escolher seu modelo pode descartar o melhor e adotar o pior. O estudo mostra que o slice difícil é um proxy confiável para transferência, enquanto o slice fácil engana.
Além disso, o estudo isola o mecanismo dos ganhos. As dicas guiam a exploração, e não a loss auxiliar do UFT. Entre os métodos, trocar a perda MSE do crítico por HL-Gauss vale +14,4 pontos in-domain. Isso significa que a arquitetura do crítico é mais relevante que a quantidade de dados de prior.
Impacto
No curto prazo, grupos que trabalham com RL em matemática visual precisam rever seus protocolos de avaliação. O slice de múltipla escolha, por ser perto do acaso, recompensa modelos que não mudaram, o que explica a anti-correlação. No médio prazo, a adoção de HL-Gauss como perda padrão para críticos pode acelerar treinos, dado o ganho de 14,4 pontos.
O estudo também impacta quem usa destilação de professores. O braço com professor de 7B foi bem, mas apenas quando o prior é entregue sem cap ou gate. Quatro braços falharam por ter o prior restrito ou perdido em um crítico mal parametrizado. Isso sugere que a engenharia da entrega do prior é tão importante quanto a escolha do método.
O que muda
Na prática, a comunidade de RL deve desconfiar de métricas in-domain que não espelham a dificuldade real. A inversão rho = -0,74 é um alerta de overfitting à métrica. O slice difícil, com rho = +0,89, deve ser preferido como proxy de generalização.
O artigo também reforça o papel da exploração guiada por dicas. A loss auxiliar do UFT, usada em trabalhos anteriores, não é o motor dos ganhos; as dicas de referência são. Isso muda prioridades de pesquisa futura.
O que vem agora
O estudo não anuncia próximos passos formais, mas sinaliza direções: testar múltiplos slices de dificuldade antes de declarar vencedores, e usar HL-Gauss em críticos de valor. Os autores disponibilizam o paper no arXiv (arXiv:2608.21811), com código e dados esperados via repositórios associados. Grupos que treinam modelos maiores, como Qwen2-VL-7B, podem validar se os resultados escalam.
Fontes
- [arXiv cs.AI] Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning — https://arxiv.org/abs/2608.21811
