NP-Bench: planejador zera conflitos entre agentes de código
Benchmark NP-Bench mede coordenação entre LLMs que programam ao mesmo tempo e mostra que escalonar o trabalho vale mais que reagir ao erro
O que aconteceu
Uma equipe de pesquisa publicou em 5 de outubro de 2026 o artigo arXiv:2610.07261v1, intitulado "Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner". O trabalho ataca um problema específico: equipes que rodam vários agentes de programação baseados em LLM ao mesmo tempo sobre o mesmo código.
Os autores construíram o planejador dentro do Nerveplane e o avaliaram com o NP-Bench, um benchmark de três braços ancorado no ambiente (sem coordenação, detecção reativa e planejamento proativo) que verifica a integração a partir de um merge real do Git. A avaliação roda tanto em simulação determinística quanto com agentes ao vivo.
O planejador eleva a integração limpa de 1/9 para 9/9 cenários e reduz conflitos de merge de 13 para 0, com a diferença crescendo conforme sobe o número de agentes. Em uma mudança de contrato que quebra a integração ao vivo, o planejador recupera um resultado que as duas baselines erram em todas as seeds: a taxa de integração limpa sobe de 0 (sem coordenação e com detecção reativa) para 1,0 em um modelo de fronteira e 0,6 em um modelo pequeno, enquanto os agentes respeitam os escopos atribuídos (0/5 de vazamento).
Contexto
O artigo descreve o cenário de colisão: dois agentes reescrevem a mesma função, um codifica contra um contrato que um colega acabou de mudar, e a integração falha depois que o trabalho está pronto. Ferramentas de coordenação comuns reagem ao problema, vigiando um conflito para só então emitir um aviso. Na velocidade dos agentes, o aviso chega depois da edição desperdiçada.
A proposta inverte a lógica. O sistema pega o escopo declarado de cada item de trabalho, particiona o trabalho em escopos disjuntos e ordena os merges ao longo do grafo produtor para consumidor, tudo de antemão. O NP-Bench existe justamente para medir esse tipo de coordenação, porque a avaliação agente por agente não captura a falha de time: cada agente passa nos próprios testes enquanto o resultado mesclado quebra.
Por que importa
Um pipeline que mede qualidade agente por agente pode reportar sucesso enquanto o produto final está quebrado. Esse é o ponto central do paper, e é o que torna a verificação por merge real, e não por teste individual, uma peça separada de avaliação.
O dado mais relevante para quem escolhe ferramentas: o ganho não encolheu conforme os modelos ficaram mais fortes. Os testes cobriram dois níveis de capacidade e dois fornecedores. O benefício vem de como o trabalho é alocado, não do raciocínio do modelo, segundo os autores.
Impacto
A memória entre sessões derruba a taxa de erro repetido de 1,00 para 0,00 tanto em modelos fortes quanto fracos. É um efeito separado do escalonamento e vale para o mesmo time de agentes rodando várias tarefas ao longo do tempo.
O paper também relata um resultado negativo. Roteamento de fatos para os agentes não resgata a acurácia em contexto longo nas escalas de ajuste de janela. O valor desse roteamento está em custo e capacidade, não em atenção. Quem esperava resolver estouro de contexto apenas distribuindo informação entre agentes precisa rever a conta.
O que muda
A coordenação deixa de ser um alarme disparado depois do estrago e passa a ser uma etapa de planejamento anterior à execução. Para times que já rodam múltiplos agentes em um mesmo repositório, isso desloca o custo de retrabalho de merge para a fase de definição de escopo, que é onde o paper mostra o ganho maior conforme o número de agentes sobe.
O que vem agora
O material não informa datas de disponibilização comercial, licenciamento nem planos de publicação do Nerveplane ou do NP-Bench. Os autores também não indicam se o benchmark será aberto para uso de terceiros. O que está declarado é o conjunto de resultados: integração limpa de 1/9 para 9/9, conflitos de 13 para 0, taxa de integração limpa de 0 para 1,0 em modelo de fronteira e 0,6 em modelo pequeno, e vazamento de escopo de 0/5.
Fontes
- arXiv cs.AI: "Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner" (arXiv:2610.07261v1, submetido em 5 de outubro de 2026) — https://arxiv.org/abs/2610.07261
