Mosaic cria política por consulta para GraphRAG e ganha 9,96 pontos

Framework sem treinamento converte cada pergunta em política própria e chega a 76,97 de acerto no Medical

Por Marcos Guimarães12 set 2026
Mosaic cria política por consulta para GraphRAG e ganha 9,96 pontos

O que aconteceu

O Mosaic, framework de Graph Retrieval-Augmented Generation (GraphRAG) publicado no arXiv em 10 de setembro de 2026, formula a recuperação em grafos como um problema de controle por consulta. O artigo, identificado como arXiv:2609.11065v1, descreve um analisador baseado em LLM que converte os requisitos de evidência de cada pergunta em uma política limitada de seleção de sementes, travessia do grafo, critério de parada e seleção de evidências.

A proposta central é simples de enunciar. O grafo do corpus, os índices, as funções de pontuação, o procedimento de grounding e o gerador de respostas continuam compartilhados entre todas as consultas. O que muda a cada pergunta é apenas a política de exploração. O Mosaic é apresentado como um framework sem treinamento, ou seja, não exige ajuste fino de modelos por tarefa.

No benchmark GraphRAG-Bench, o Mosaic alcança Answer Correctness ponderada por consulta de 76,97 no domínio Medical e 64,33 no Novel. Os números representam ganhos de 5,13 e 4,43 pontos sobre os melhores resultados gerais relatados anteriormente. No Medical, o sistema chega a 95,1 de Evidence Recall e 86,1 de Context Relevancy.

Contexto

Sistemas de GraphRAG existem justamente para conectar evidências espalhadas por um corpus estruturado em grafo. O problema apontado pelos autores é que a maioria desses sistemas usa procedimentos de exploração largamente compartilhados entre consultas, independentemente do tipo de pergunta recebida.

Essa uniformidade cria um descasamento estrutural. Fatos diretos tendem a precisar de vizinhanças locais compactas. Perguntas comparativas exigem cobertura equilibrada de múltiplos alvos. Questões mediadas podem demandar caminhos mais profundos, passando por conectores pouco relacionados entre si. Uma política única de varredura dificilmente atende os três casos com a mesma eficiência.

Um dos experimentos do artigo ataca exatamente esse ponto. Em comparações controladas, com grafo e gerador idênticos, nenhuma política fixa se mostrou consistentemente melhor. Nem as versões estreita, média ou ampla. O Mosaic superou em 9,96 pontos a política fixa canônica mais forte do conjunto avaliado.

Por que importa

O ganho de qualidade vem acompanhado de economia. Em relação à configuração Fixed Wide, o Mosaic avalia 81,9% menos caminhos no grafo e mantém 47,2% menos itens de evidência. Menos travessia significa menos tempo de recuperação e menos contexto despejado no gerador de respostas, o que reduz custo computacional e o risco de diluir a informação relevante em meio a ruído.

Para quem constrói sistemas de perguntas e respostas sobre bases documentais grandes, a mensagem prática é que a política de exploração pode ser tratada como camada separada, sem reescrever o restante do pipeline. O Mosaic foi projetado como framework sem treinamento, o que dispensa a etapa de ajuste específico por benchmark.

Impacto

Os resultados em Medical são o destaque quantitativo. Answer Correctness de 76,97, Evidence Recall de 95,1 e Context Relevancy de 86,1 formam um conjunto que indica bom desempenho tanto em achar a evidência quanto em manter o contexto limpo. No Novel, domínio em que o material disponível é menos estruturado, o Mosaic marca 64,33 de acerto ponderado, avanço de 4,43 pontos sobre o melhor resultado geral anterior.

O artigo também relata experimentos de transferência em HotpotQA, MuSiQue e 2WikiMultiHopQA. A interface de política do Mosaic pôde ser aplicada nesses benchmarks sem treinamento de retriever específico para cada conjunto. O Mosaic, framework do arXiv:2609.11065v1, portanto, não ficou restrito ao cenário em que foi originalmente medido.

O que muda

O desenho do Mosaic separa o que é fixo do que é variável. O grafo do corpus permanece compartilhado. Os índices permanecem compartilhados. As funções de pontuação, o grounding e o gerador de respostas permanecem compartilhados. A variação por consulta fica restrita à política, delimitada por um conjunto de decisões sobre sementes, travessia, parada e seleção final de evidências.

Essa separação é o que permite levar a mesma interface para benchmarks distintos. Em vez de treinar um retriever novo para cada base, o sistema reaproveita a infraestrutura de recuperação e troca apenas o controlador. O Mosaic faz essa troca a cada consulta.

O que vem agora

O artigo está disponível no arXiv em PDF e em versão HTML experimental, com data de submissão em 10 de setembro de 2026. A página do trabalho reúne ainda ferramentas de citação e de exploração bibliográfica, como o Bib Explorer, Connected Papers, Litmaps e scite, além de integrações listadas pelo arXivLabs, entre elas alphaXiv, Hugging Face e ScienceCast.

Os autores não detalham no resumo um cronograma de disponibilização de código. O caminho natural de acompanhamento é observar se a política por consulta do Mosaic será replicada em outros pipelines de GraphRAG e se o ganho de 9,96 pontos sobre a melhor política fixa se sustenta em bases fora do GraphRAG-Bench.

Fontes