RLMOpt: otimização adaptativa de prompts com modelos recursivos
Método supera a baseline GEPA em nove de onze comparações e gera prompts de 27% a 79% do tamanho.
O que aconteceu
O paper "RLMOpt: Adaptive Prompt Optimization via Recursive Language Models" (arXiv:2608.10471) foi submetido em 11 de agosto de 2026 ao arXiv, na área Computer Science > Artificial Intelligence. O método propõe que a política de busca — quais candidatos explorar, quanto orçamento de avaliação alocar e quando parar — seja definida por um modelo de linguagem recursivo (RLM). O agente opera em um ambiente baseado em ferramentas: inspeciona informações da tarefa, analisa falhas, gera candidatos, aloca o orçamento de avaliação e decide a interrupção. Um harness determinístico complementa o agente aplicando pontuação objetiva, seleção baseada em Pareto e restrições de regressão (arXiv, 2026).
A avaliação cobriu quatro benchmarks: extração de informação clínica estruturada (Chia), perguntas e respostas multi-hop (HotpotQA), seguimento de instruções verificável (IFBench-2025) e agentes de chamada de ferramentas em múltiplos turnos (BFCL). Na comparação pareada com uma única seed, o RLMOpt obteve o melhor score retido em todos os quatro benchmarks e liderou a média das tarefas, com 0,610 contra 0,589 do GEPA. Com a repetição dos benchmarks em diferentes seeds, foram 11 comparações pareadas, com vitória do RLMOpt em 9 casos. Em nenhuma das 11 execuções o método produziu um prompt com desempenho inferior ao da seed inicial; o GEPA ficou abaixo do ponto de partida duas vezes. O método também foi mais eficiente, alcançando os resultados com menos rollouts de busca e prompts de 27% a 79% do tamanho dos gerados pelo GEPA.
Contexto
Otimizadores de prompt automatizam a busca por prompts que melhoram o desempenho de modelos de linguagem. Nos métodos existentes, o procedimento de otimização é predefinido: o algoritmo decide quais candidatos explorar e como a busca avança, enquanto o modelo de linguagem apenas gera ou refina propostas. O RLMOpt desloca essa responsabilidade: a política de busca passa a ser dirigida pelo próprio modelo de linguagem recursivo, com o harness determinístico responsável por aplicar as regras objetivas.
Por que importa
Para equipes que usam LLMs em produção, o prompt é uma variável de custo e de desempenho. O paper relata que o RLMOpt atingiu os resultados com menos rollouts e gerou prompts de 27% a 79% do tamanho dos produzidos pelo GEPA. Em operações que pagam por token — situação comum também entre empresas brasileiras que usam APIs de modelos de linguagem —, prompts menores reduzem o custo por requisição. Além disso, o fato de o método não ter produzido nenhum prompt pior que a seed em 11 execuções indica controle de regressão, um requisito para pipelines que precisam de um desempenho mínimo garantido.
Impacto
O resultado central do paper é que os ganhos de otimização são determinados principalmente pelo headroom disponível no prompt inicial, e não pelo orçamento de busca. Isso reposiciona a discussão sobre eficiência: otimizar bem depende de alcançar o headroom disponível de forma confiável e com o mínimo de busca. Para a comunidade de pesquisa, isso sugere que ampliar o orçamento de busca não compensa necessariamente — a estratégia de alocação e de parada pode importar mais que o volume de tentativas.
O que muda
No curto prazo, o RLMOpt entra como alternativa a otimizadores como o GEPA, com um desenho em que o modelo de linguagem define o rumo da busca e o harness determinístico reduz os riscos. No médio prazo, a combinação de política adaptativa com restrições de regressão pode influenciar ferramentas de otimização de prompts em aplicações reais, sobretudo em tarefas com avaliação objetiva, como extração de informação e agentes que chamam ferramentas.
O que vem agora
O artigo não detalha próximos passos. Por ser um preprint, o trabalho segue para avaliação da comunidade científica; a disponibilização de código e a validação em outros conjuntos de dados dependerão dos autores.
Fontes
- arXiv (cs.AI) — "RLMOpt: Adaptive Prompt Optimization via Recursive Language Models" (arXiv:2608.10471): https://arxiv.org/abs/2608.10471
