RAG não melhora recomendações de investimento, estudo no arXiv mostra

Experimento fatorial 2x2 revela que motor de cálculo de imposto reduziu economia de impostos em 55 pontos percentuais.

Por Marcos Guimarães26 ago 2026
RAG não melhora recomendações de investimento, estudo no arXiv mostra

O que aconteceu

O estudo intitulado 'Retrieval-augmented generation vs. deterministic tax computation in multi-agent financial advisory: A 2x2 factorial experiment' foi submetido ao arXiv em 24 de agosto de 2026 e anunciado como novo em 26 de agosto de 2026. Os pesquisadores introduziram um motor de cálculo de ganho de capital customizado e uma loja de vetores alimentada por RAG com relatórios de consultoria de mercado para contextualizar um sistema multiagente de recomendações de negociação. A qualidade das recomendações foi medida pelo ganho de capital relativo incorrido durante a liquidação da carteira. Uma ANOVA de medidas repetidas 2x2 revelou um efeito principal significativo do motor de otimização tributária (F(1,29) = 9,17, p = 0,005, η²p = 0,240). Ativar o motor reduziu as economias de impostos em aproximadamente 55 pontos percentuais em comparação às condições sem o motor. O efeito principal do RAG não foi significativo (p = 0,841), nem foi a interação entre RAG e motor (p = 0,553).

Contexto

O *tax-loss harvesting* demonstra benefícios consistentes para o crescimento de longo prazo de carteiras, mas sua implementação eficiente envolve considerações complexas específicas às posições da carteira e ao indivíduo proprietário. Para abordar esse desafio, os autores propuseram duas abordagens de fornecimento de contexto para agentes baseados em LLM: uma engine de cálculo determinística e um sistema de geração aumentada por recuperação (RAG). O experimento foi estruturado como um fatorial 2x2, combinando as presença ou ausência de cada componente. A condição com RAG apenas obteve a maior média descritiva de economia de impostos (47,7%), seguida pela condição de referência (30,6%). Isso sugere que o conhecimento financeiro internalizado pelo modelo de linguagem pré-treinado pode ser suficiente para recomendações competentes de *tax-loss harvesting* sem ferramentas explícitas.

Por que importa

O experimento demonstra que aumentar agentes de LLM com motores de cálculo específicos do domínio não garante melhor desempenho e pode introduzir sinais de otimização conflitantes. A redução de 55 pontos percentuais nas economias de impostos ao ativar o motor de cálculo determinístico indica que a integração de ferramentas especializadas pode interferir negativamente no desempenho do sistema multiagente. Esse achado é particularmente relevante para aplicações de consultoria financeira automatizada, onde a precisão tributária é crucial para o valor entregue ao cliente.

Impacto

As condições sem o motor de cálculo determinístico — incluindo a condição de referência e a condição com RAG apenas — superaram a condição com o motor ativado. A condição de referência obteve 30,6% de economia de impostos, enquanto a condição com RAG apenas atingiu 47,7%. Esses resultados indicam que a presença de um motor de cálculo determinístico pode interferir na capacidade do modelo de linguagem de gerar recomendações otimizadas, especialmente quando os sinais de otimização entre o motor e o modelo entram em conflito.

O que muda

Os resultados sugerem que a arquitetura de sistemas multiagentes para consultoria financeira deve reconsiderar a integração automática de ferramentas de cálculo especializadas. A autonomia do modelo de linguagem em utilizar seu próprio conhecimento internalizado pode, em alguns casos, superar a adição de componentes computacionais explícitos. Isso desafia a noção de que mais ferramentas sempre melhoram o desempenho em sistemas baseados em LLM.

O que vem agora

O estudo foi publicado no arXiv em 26 de agosto de 2026, após submissão em 24 de agosto de 2026. Futuras pesquisas podem explorar estratégias de integração mais sofisticadas entre LLMs e motores de cálculo, bem como avaliar o impacto de diferentes tipos de relatórios de mercado no desempenho do RAG. A replicação do experimento com diferentes portfólios e perfis fiscais também pode ampliar a compreensão dos limites da abordagem proposta.