Harness altera resultados de agentes de codificação com o mesmo modelo
Pesquisa compara duas configurações do mesmo harness e mostra ganho sob contexto apertado
O que aconteceu
O grupo de pesquisa por trás do artigo comparou duas configurações do mesmo harness em três benchmarks de codificação: SWE-bench Verified, SWE-bench Pro e FeatureBench. Na configuração de controle, o harness fornecia a conversa completa em ordem temporal. Na configuração de tratamento, o harness mantinha o mesmo registro, mas encurtava mecanicamente resultados de ferramentas mais antigas conforme o contexto enchia e respondia a trabalho repetido ou travado.
Na comparação de janela apertada do SWE-bench Verified, com 169 tarefas, uma janela de 20.480 tokens e um limite fixo de 480 segundos por tentativa, o tratamento elevou a média de F2PF por tarefa de 28% para 49% e subiu as soluções completas de 43 para 72. O mesmo tratamento congelado, sem reajuste específico por modelo, também elevou os dois endpoints na mesma coorte para três modelos adicionais com designs diferentes. Esse resultado indica que o ganho não é exclusivo de um único modelo.
Nas comparações de janela larga com o modelo Qwen3.6, os resultados observados ficaram próximos entre controle e tratamento no SWE-bench Verified e no SWE-bench Pro. Já no FeatureBench, a média de F2PF por tarefa continuou maior sob o tratamento. Na coorte Verified de janela larga, o tratamento também serviu menos tokens de prompt por turno, o que pode reduzir custos de inferência.
Contexto
Agentes de codificação combinam um modelo de linguagem com um harness, que decide o que o modelo vê, quais ferramentas ele pode usar e como o trabalho continua. Essa arquitetura ficou mais comum com o avanço de modelos como o Qwen, usado nas comparações de janela larga do estudo. A avaliação tradicional costuma atribuir o desempenho ao modelo, como se o harness fosse neutro. O paper contesta essa premissa ao mostrar que mudanças na camada de ferramentas alteram o que pesos fixos conseguem realizar. O arXiv, repositório onde o artigo foi depositado em 26 de agosto de 2026, recebeu o texto na categoria Computer Science > Artificial Intelligence.
Por que importa
Para equipes que adotam agentes de codificação, o resultado muda o modo de comparar soluções. Avaliar apenas o modelo, sem considerar o harness, pode superestimar ou subestimar um produto. O estudo mostra que o mesmo modelo, com o mesmo harness, produz resultados diferentes apenas pela forma como o contexto é gerenciado. Isso tem impacto direto em benchmarks públicos, onde competidores comparam números sem reportar a configuração do harness.
Em custo, o tratamento serviu menos tokens de prompt por turno na coorte Verified de janela larga. Para empresas que rodam agentes em escala, isso pode significar gasto menor de API e latência reduzida, além de melhor aproveitamento de janelas de contexto limitadas.
Impacto
No curto prazo, times de engenharia devem tratar o harness como parte do solver testado, não como detalhe de infraestrutura. A prática de citar o modelo apenas ("modelo X resolveu Y tarefas") perde validade. Publicações de benchmarks precisarão reportar também a configuração do harness, como janela de contexto, política de resumo e tempo máximo por tentativa.
O ganho de 28% para 49% de F2PF na janela apertada mostra que, sob pressão de contexto, a forma de gerenciar o histórico de ferramentas é decisiva. Soluções que truncam registros antigos de forma mecânica tendem a superar as que mantêm tudo em ordem temporal. Isso favorece implementações que priorizam espaço para novas informações.
O que muda
A principal mudança é metodológica: avaliações de agentes de codificação devem tratar modelo e harness juntos como o solver testado. O estudo demonstra isso com o mesmo harness em duas configurações, mantendo a tarefa fixa. Para provedores de API, o papel do harness se torna um diferencial competitivo, além de arquitetura do modelo.
Para o ecossistema Qwen, os resultados de janela larga próximos entre controle e tratamento em Verified e Pro indicam que, com contexto abundante, a gestão de histórico importa menos. Já o FeatureBench manteve vantagem para o tratamento, sugerindo que benchmarks com características específicas ainda reagem a essa variável.
O que vem agora
O artigo está disponível no arXiv sob o identificador 2608.26218, com versão v1 depositada em 26 de agosto de 2026. Não há data publicada para revisão por pares nem para liberação de código. O próximo passo natural é testar variações do harness em mais modelos e benchmarks, incluindo janelas intermediárias entre 20.480 tokens e as configurações largas usadas no Qwen3.6.
Também cabe investigar por que o tratamento ajudou mais sob contexto apertado. Entender o mecanismo exato pode levar a políticas de resumo mais inteligentes, que preservem informações críticas sem inflar o contexto.
Fontes
- arXiv cs.AI: Same Model, Different Harness: Different Coding-Agent Results (arXiv:2608.26218v1) - https://arxiv.org/abs/2608.26218
