SchemaRouter corta 90% do custo de contexto em RAG agêntico
Camada leve de roteamento por schema mantém acurácia e garante proveniência em sistemas de IA agêntica
O SchemaRouter é uma camada de roteamento leve apresentada em um papel científico submetido ao arXiv em 3 de julho de 2026, com identificador arXiv:2608.21375. O sistema representa ferramentas, endpoints, parâmetros, campos de resposta, conceitos de domínio, unidades, proveniência e políticas de licença como um grafo de schema. Dada uma consulta, o SchemaRouter emite um plano executável que especifica quais ferramentas chamar e quais campos recuperar, usando um LLM pequeno para extrair intenção, conceitos e restrições de fonte, enquanto a seleção de campos ocorre de forma determinística sobre o grafo, por projeção de grupo de intenção e correspondência conceito-campo com uma camada de aliases. A camada SchemaRouter foi avaliada em um benchmark de ciência de materiais com 110 consultas, alcançando acurácia de resposta de 0,71, empatando com o método fetch-everything dentro de intervalos de confiança sobrepostos e superando o prompt-all, que registrou 0,66.
O que aconteceu
O estudo reporta que o SchemaRouter usa 227 tokens de contexto recuperado, contra 2.066 tokens do método fetch-everything, uma redução de cerca de 89%. Em latência ponta a ponta, o SchemaRouter é 2,7 vezes mais rápido que o prompt-all. Além disso, obteve a melhor taxa de ferramenta exata, com 0,93, e validade de parâmetros perfeita, de 1,0. Um achado adicional do paper foi o de que minimizar o número de campos selecionados é contraproducente: essa estratégia reduziu a acurácia para 0,56, com economia de tokens insignificante, enquanto uma projeção que preserva o recall restaurou a acurácia máxima. A abordagem SchemaRouter, descrita no arXiv:2608.21375, também fundamenta informações de proveniência e licença em 62% das respostas, enquanto as linhas de base registraram aproximadamente 0%.
Contexto
Sistemas de RAG agêntico heterogêneo, que orquestram APIs externas, bancos de dados internos, vetores e grafo stores, enfrentam dois problemas recorrentes: expor todas as descrições de ferramentas a um agente LLM aumenta o tamanho do payload, o uso de tokens e a latência, fenômeno chamado over-fetching; e selecionar ferramentas apenas por similaridade vetorial causa under-fetching, quando campos necessários para responder à consulta são omitidos. O SchemaRouter ataca ambos os problemas ao representar a estrutura de ferramentas como um grafo, permitindo seleção determinística de campos. A evolução, segundo o paper, está em substituir a seleção por similaridade vetorial por uma seleção baseada em estrutura de conhecimento, o que melhora a escalabilidade independente do tamanho do schema.
Por que importa
Para empresas que rodam agentes de IA com múltiplas fontes de dados, o custo de tokens é um dos principais gargalos. O SchemaRouter mostra uma redução de 89% no uso de contexto, o que se traduz em economia direta em chamadas de API e menor latência, algo crítico em aplicações interativas. A proveniência é outro fator: fundamentar as respostas em campos específicos permite auditar de onde veio cada informação. Isso importa para setores regulados, como finanças e saúde, onde rastreabilidade é exigência. A descoberta de que minimizar campos não é o melhor caminho também orienta engenheiros a priorizarem recall em vez de cortar campos, evitando um trade-off falso entre custo e acurácia.
Impacto
Em curto prazo, o SchemaRouter oferece um caminho prático para reduzir custos em pipelines existentes de agente RAG sem perda de qualidade, com números publicados. O uso de 227 tokens contra 2.066 pode viabilizar consultas que antes eram inviáveis em orçamentos de tokens. A latência 2,7 vezes menor permite respostas mais rápidas em chatbots e assistentes. Em médio prazo, a abordagem por schema graph pode influenciar o design de middleware de orquestração de ferramentas, especialmente em plataformas que gerenciam dezenas de APIs. A validação em ciência de materiais, no entanto, limita a generalização imediata: outros domínios podem exigir adaptações no alias layer e na construção do grafo.
O que muda
A mudança central é conceitual: em vez de listar todas as ferramentas para o LLM ou confiar apenas em similaridade de vetores, o SchemaRouter propõe que o roteamento seja feito sobre uma representação estruturada e determinística dos campos. Isso altera o papel do LLM, que deixa de escolher ferramentas e passa a extrair intenção e conceitos, enquanto a seleção de campos é resolvida por regras sobre o grafo. A descoberta sobre minimização de campos alerta que otimizações aparentemente lógicas, como reduzir o número de campos, podem ter efeito oposto. A camada SchemaRouter, portanto, reposiciona o trade-off entre eficiência e acurácia, mostrando que é possível manter ambas com a projeção certa.
O que vem agora
O paper, ainda em versão preprint no arXiv, não apresenta datas para disponibilização de código ou benchmarks públicos. A comunidade de pesquisa deve acompanhar se os autores liberarão o SchemaRouter como ferramenta de código aberto, o que facilitaria a reprodução dos resultados em outros domínios além de ciência de materiais. Estudos de extensão devem testar a abordagem com grafos de ferramentas maiores e consultas mais complexas, e avaliar o comportamento em cenários com mudanças dinâmicas de schema.
FONTES
- [arXiv cs.AI | RESEARCH | PRIMARY] SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG — arXiv:2608.21375v1, submetido em 3 jul 2026. Disponível em: https://arxiv.org/abs/2608.21375
