Estratégias de Evolução superam RL em cobertura de soluções de LLMs
Pesquisa no arXiv propõe trocar RL por ES no pós-treinamento para aumentar diversidade de respostas
O que aconteceu
Pesquisadores apresentaram no arXiv um artigo que compara duas abordagens de pós-treinamento para Grandes Modelos de Linguagem (LLMs): Reinforcement Learning (RL), o método padrão atual, e Evolution Strategies (ES), uma técnica populacional sem gradientes. Os resultados mostram que ES alcança consistentemente pass@k superior ao RL, além de produzir uma distribuição de saída mais ampla, com maior cobertura de soluções (arXiv:2608.12679, submetido em 13 de agosto de 2026). Essa cobertura mais ampla permite melhores desempenhos em benchmarks matemáticos convencionais.
Contexto
LLMs são cada vez mais usados em domínios de descoberta, como matemática e ciência, onde a abordagem típica envolve apresentar o problema ao modelo e usar sua resposta como solução. O método pass@k permite que o modelo explore o espaço de soluções, gerando múltiplos candidatos. No entanto, o RL, ao recompensar apenas saídas de alta pontuação, estreita a distribuição de saída do modelo, causando colapso na cobertura de soluções — um problema crítico para tarefas que exigem diversidade de respostas. As ES, por outro lado, otimizam diretamente no espaço de pesos por meio de perturbações aleatórias, sem depender de sinais de recompensa para guiar o ajuste, o que preserva a diversidade.
Por que importa
A descoberta tem implicações práticas para pesquisadores e empresas que desenvolvem LLMs para descoberta científica. Atualmente, o RL é o padrão ouro em pós-treinamento, mas sua limitação em cobertura de soluções pode restringir o potencial de IA em áreas onde múltiplas respostas plausíveis são necessárias. O estudo sugere que ES pode ser uma base melhor para problemas de descoberta e outros domínios onde a diversidade de soluções é crítica. Para o cenário brasileiro, onde a pesquisa em IA aplicada à ciência cresce — como em laboratórios de universidades públicas —, a adoção de ES poderia democratizar técnicas de pós-treinamento mais eficazes.
Impacto
No curto prazo, o uso de ES pode melhorar a qualidade de modelos em benchmarks de matemática e ciência, com impacto em aplicações de pesquisa automatizada e análise de dados. No médio prazo, a técnica pode se tornar uma alternativa viável ao RL em pipelines de treinamento comercial, reduzindo custos computacionais ao evitar a otimização por recompensa. Porém, a adoção exige validação em escala industrial e integração com infraestrutura existente.
O que vem agora
Os próximos passos incluem a reprodução dos resultados em outros benchmarks e a exploração de ES em combinação com RL, como um híbrido. A comunidade de IA deve observar se a técnica ganhará tração em frameworks de código aberto, como Hugging Face, e se novas versões do estudo trarão dados mais robustos. Até lá, o artigo serve como um alerta: o RL não é a única — nem a melhor — opção para pós-treinamento quando a diversidade de soluções é essencial.
