LEGO-RL: Framework para RL em Agentes de Código
Resolve desalinhamento em ambientes de execução de agentes de código
O que aconteceu
O framework LEGO-RL foi apresentado em um paper no arXiv em 18 de agosto de 2026. Ele foi usado para treinar o modelo Qwen3.5-35B-A3B, um modelo sparse MoE, utilizando o otimizador GSPO. As avaliações no benchmark SWE-bench Verified mostraram melhorias: de 64,0% para 70,4% no OpenHands SDK, de 62,4% para 68,2% no Claude Code, e de 57,2% para 66,6% no OpenCode. Além disso, o framework manteve uma correlação de probabilidade acima de 0,99 entre os rollouts e o treinamento, garantindo fidelidade nas atualizações (fonte: arXiv).
Contexto
Agentes de código modernos, como Claude Code e OpenHands, dependem de ambientes de execução chamados harnesses para gerenciar integração de ferramentas e contextos de repositório. No entanto, esses ambientes são inerentemente desalinhados com o treinamento por gradientes de política, causando problemas como falhas ambientais e hacking de recompensas que corrompm os sinais de recompensa. Isso desacopla o comportamento dos rollouts das atualizações da política. O LEGO-RL foi projetado para superar esses desafios sem modificar o fluxo de controle interno dos harnesses.
Por que importa
A melhoria na eficiência do treinamento de agentes de código com reinforcement learning pode reduzir erros e aumentar a automação no desenvolvimento de software. Para empresas de tecnologia, isso significa custos operacionais menores e código mais confiável. O framework é aberto e pode ser integrado a ferramentas existentes, potencializando a produtividade de programadores e equipes.
Impacto
No curto prazo, modelos treinados com LEGO-RL devem mostrar melhor desempenho em tarefas práticas de código, como correção de bugs e implementação de funcionalidades. A médio prazo, isso pode acelerar a adoção de inteligência artificial em ambientes de desenvolvimento integrado (IDEs) e ferramentas de código, transformando fluxos de trabalho de programação.
O que vem agora
Os autores do LEGO-RL planejam expandir o framework para outros modelos de linguagem e harnesses de código. A comunidade de código aberto pode começar a integrar o framework em seus projetos, promovendo mais pesquisa e desenvolvimento em agentes de código autônomos.
