DreamBench-SWE: benchmark revela limites da memória em agentes de software
Estudo do arXiv avaliou quatro configurações de memória em tarefas multi-sessão; nenhuma passou de 54% de acerto.
O que aconteceu
O DreamBench-SWE, um benchmark de higiene de memória para agentes de software, foi submetido ao arXiv em 21 de agosto de 2026, no preprint arXiv:2608.20664. O estudo, assinado por pesquisadores da área de inteligência artificial (cs.AI), apresenta duas rodadas de avaliação: o conjunto original v2.0.5 e uma auditoria sucessora pré-registrada (v2.1), desenhada depois do primeiro estudo e congelada antes da inspeção dos resultados.
A auditoria sucessora completou 360 de 360 unidades de trabalho e 720 de 720 células S3, em quatro condições. No conjunto original, o contraste primário entre a abordagem DF-híbrida e a B5 foi nulo (95 de 180 contra 89 de 180; p agrupado = ,518, p de Holm = 1), o que os autores classificam como não evidência de equivalência. As condições C9 e C10 mantiveram limitações de espaço livre B0.
Já na rodada sucessora, os resultados foram claros. Sem memória externa, o agente passou em 21 das 180 tarefas (taxa de 0,1167, ou 11,67%). Com memória de eventos verbatim determinística, foram 82 de 180 (0,4556, 45,56%). A sonda de referência tipada mais bruta acertou 83 de 180 (0,4611, 46,11%). A única configuração que se destacou foi uma instância fixada do Mem0, serviço de memória hospedado, que alcançou 97 de 180 (0,5389, 53,89%).
Contexto
O DreamBench-SWE nasce de uma preocupação prática: agentes de software que trabalham em múltiplas sessões precisam lembrar de informações que não podem ser inferidas apenas pelo código ou pela conversa atual. O benchmark foi criado para medir essa memória de forma automatizada, usando oráculos ocultos executáveis que pontuam se a tarefa posterior foi resolvida a partir de evidências de sessões anteriores.
O estudo original v2.0.5 já havia apontado problemas no contraste principal. A comparação entre a abordagem DF-híbrida e a baseline B5 não mostrou diferença estatística, e as condições C9 e C10 ficaram presas ao espaço de cabeça da baseline B0. Esses achados motivaram a auditoria v2.1, registrada antes da análise dos resultados.
Na auditoria, três comparações contra a condição sem memória rejeitaram a hipótese nula após correção de Holm. Mas o sistema de seis slots da Família A, que foi registrado no protocolo, manteve slots não disponíveis, com p = 1. Tanto os contrastes de mecanismo quanto a comparação secundária entre armazenamento literal e verbatim não foram confirmatórios.
Por que importa
Para equipes que desenvolvem agentes de IA para automação de código, o resultado é um alerta. Mesmo a melhor configuração testada, o Mem0, deixou de resolver 46% das tarefas. Isso significa que a memória externa, como é implementada hoje, não é uma solução confiável para problemas que exigem lembrar detalhes de sessões anteriores.
A diferença entre 11,67% e 53,89% parece grande, mas o estudo não estabelece que o Mem0 seja superior a outras abordagens de memória. A comparação entre armazenamento literal e memória verbatim não rejeitou a hipótese nula, ou seja, não há prova de que um mecanismo seja melhor que o outro. Para o mercado brasileiro, que cresce em adoção de agentes de código assistidos por IA, o benchmark serve como uma régua realista: não basta plugar um serviço de memória e esperar que ele resolva tudo.
Impacto
O DreamBench-SWE, benchmark de higiene de memória, já se mostra um instrumento discriminativo para comparar perfis de agentes. A auditoria v2.1 caracteriza uma configuração exata do Mem0 (armazenamento literal, fixada e hospedada), mas não comprova um mecanismo externo geral, nem superioridade entre as condições com memória, nem equivalência entre elas.
Em termos práticos, pesquisadores e empresas que precisam escolher entre memória interna, verbatim, ou serviços hospedados vão encontrar pouca orientação definitiva fora da configuração específica testada. O estudo aponta que a memória verbatim determinística e a sonda de referência tiveram desempenho quase idêntico (45,56% e 46,11%), sugerindo que o formato de registro faz pouca diferença quando o conteúdo é processado da mesma forma.
O que muda
A publicação deixa duas lições. Primeira: benchmarks multi-sessão como o DreamBench-SWE são necessários para medir memória de agentes, e o método de oráculos executáveis funciona. Segunda: a indústria de agentes de software ainda precisa de avanços em como armazenar, recuperar e aplicar memória entre sessões, porque nenhuma técnica testada ultrapassou a barreira dos 60% de acerto.
Os autores mantêm os achados e artefatos originais da versão v2.0.5 inalterados. Isso significa que quem já usa o benchmark pode continuar comparando resultados sem preocupação de mudanças nos dados.
O que vem agora
O próximo passo esperado é o desenvolvimento de novas configurações de memória que consigam transformar as 47 tarefas que o Mem0 falhou em acertos. Também fica em aberto a validação de outros serviços externos de memória, como alternativas ao Mem0, em rodadas futuras. Os autores não anunciaram prazos para uma nova versão do benchmark.
Para a comunidade acadêmica, o protocolo pré-registrado do v2.1 serve de modelo para auditorias independentes em benchmarks de agentes. A expectativa é que novos estudos usem o DreamBench-SWE para testar hipóteses específicas de mecanismos de memória, algo que esta rodada não conseguiu estabelecer.
