Weighted Memory Tree: nova memória eleva acurácia de agentes de IA

Sistema hierárquico organiza tarefas, subtarefas e ações e decide o que manter no prompt

Por Marcos Guimarães24 ago 2026
Weighted Memory Tree: nova memória eleva acurácia de agentes de IA

O que aconteceu

Pesquisadores submeteram ao arXiv, em 21 de agosto de 2026, o paper "Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents" (arXiv:2608.20631). O trabalho apresenta o Weighted Memory Tree (WMT), um sistema de memória hierárquica que organiza a execução de agentes de IA em tarefas, subtarefas e ações, atribuindo a cada memória um escore dinâmico de retenção. O WMT usa atualizações baseadas em eventos e decaimento baseado em seleção para revisar esses escores.

Na avaliação com o benchmark GAIA-Text, o WMT foi testado sobre três modelos de linguagem: Qwen3-8B, Gemma 4 E4B e Llama-3.1-8B. Em comparação com a memória linear, o WMT melhorou a acurácia média em 9,97 pontos percentuais e reduziu o uso de tokens de prompt em 32,8%. Os ganhos consistentes entre os três modelos foram medidos sobre o GAIA-Text, segundo o resumo do estudo. Com o WMT, a acurácia média sobe 9,97 pontos percentuais e o consumo de tokens cai 32,8% em relação à memória linear.

Contexto

Agentes baseados em LLMs (large language models) executam tarefas de múltiplas etapas que exigem planejamento, uso de ferramentas e acesso a informações externas. Conforme a execução avança, o histórico cresce, aumentando o custo de inferência e expondo o raciocínio a dados desatualizados, irrelevantes ou enganosos, o que pode degradar a qualidade da resposta. Os métodos de memória existentes organizam ou comprimem esses históricos, mas oferecem poucos mecanismos para decidir quais memórias devem continuar ativas.

Por que importa

Na prática, o WMT mostra que o problema central da memória de agentes não é armazenar mais informação, e sim decidir qual informação permanece ativa. Para equipes que desenvolvem agentes de IA, a redução de 32,8% no uso de tokens de prompt pode se traduzir em queda direta de custo de inferência, além de ganho médio de acurácia de quase 10 pontos percentuais em tarefas de múltiplas etapas. O sistema também limita a persistência e a propagação de informações não confiáveis, como mostraram os experimentos de memory-poisoning.

Impacto

O WMT preserva informação útil, dobra trajetórias concluídas, suprime conteúdo de baixa utilidade e mantém acesso ao contexto dobrado. Esse mecanismo de seleção permite que um agente execute tarefas longas sem carregar todo o histórico no prompt, atacando diretamente o aumento de custo de inferência. O estudo conclui que a eficácia da memória de longo horizonte depende menos de guardar mais dados e mais de escolher o que permanece ativo.

O que muda

Com o WMT, o desenho de sistemas de memória para agentes passa a priorizar seleção e esquecimento, em vez de apenas organização e compressão. A redução de 32,8% no consumo de tokens de prompt e o ganho de 9,97 pontos percentuais em acurácia, medidos no GAIA-Text, indicam que a memória seletiva pode ser mais barata e mais precisa que a abordagem linear. Os autores do paper argumentam que decisões sobre quais memórias manter são mais relevantes do que o volume armazenado.

O que vem agora

O material não traz cronograma ou próximos passos anunciados. O paper está disponível no arXiv (2608.20631), e a validação inicial ocorreu em um único benchmark, GAIA-Text. Novos testes em outros conjuntos de dados e arquiteturas devem definir a utilidade prática do WMT, e não há informação sobre disponibilização de código pelos autores.