Modelos de fronteira recuperam 65% dos fatos que esquecem ao pensar mais

Pesquisa do Google Research e Technion mostra que alucinação é falha de recall, não de conhecimento.

Por Marcos Guimarães1 set 2026
Modelos de fronteira recuperam 65% dos fatos que esquecem ao pensar mais

O que aconteceu

Um estudo conduzido por pesquisadores do Google Research e do Technion (Instituto de Tecnologia de Israel) mostrou que modelos de linguagem de grande escala (LLMs) de fronteira, como GPT-5 e Gemini-3, não sofrem de falta de conhecimento, mas sim de dificuldade de recuperá-lo. Nos experimentos, os modelos conseguiram recuperar até 65% dos fatos que não conseguiam lembrar diretamente, apenas com mais tempo de computação na hora da inferência. Os pesquisadores testaram milhares de fatos e descobriram que os modelos codificam entre 95% e 98% deles nos parâmetros. O estudo está disponível no arXiv (link).

A pesquisa propõe uma nova forma de avaliar modelos: em vez de medir apenas se uma resposta a uma pergunta está correta (avaliação por questão), eles sugerem um "perfilamento de fatos" (fact-level profiling). Essa abordagem testa um mesmo fato sob múltiplas condições: se ele está armazenado nos parâmetros, se pode ser acessado por diferentes perguntas e formulações, e quanto esforço computacional é necessário para recuperá-lo. Os autores diferenciam "codificado" (o fato existe nos parâmetros) de "conhecido" (o modelo consegue respondê-lo de forma confiável em várias formas de pergunta).

Contexto

Historicamente, quando um LLM alucina, as equipes de engenharia assumem que o modelo não tem o conhecimento necessário. O diagnóstico tradicional é de falta de informação, e a solução padrão é aumentar o tamanho do modelo, expandir os dados de treinamento ou construir arquiteturas complexas de recuperação externa, como bancos de dados vetoriais. O estudo contraria essa visão: o conhecimento está lá, mas não é acessado no momento da geração. Isso sugere que muitos casos de alucinação são, na verdade, falhas de recuperação (recall), não de codificação.

A pesquisa se baseia em trabalhos anteriores sobre interpretabilidade e memória em redes neurais, mas avança ao quantificar a lacuna entre armazenamento e acesso. Os pesquisadores do Google Research e do Technion criaram um método para medir essa lacuna de forma sistemática, o que pode mudar a forma como a indústria diagnostica e corrige erros em modelos de IA.

Por que importa

Para equipes de engenharia, a descoberta tem impacto prático imediato. Se o conhecimento já está nos parâmetros, não é necessário sempre recorrer a modelos maiores ou bases de dados externas para melhorar a precisão. Em vez disso, é possível investir em técnicas de inferência que "desbloqueiam" o conhecimento latente, como gerar múltiplas respostas e fazer o modelo revisar seus raciocínios (técnicas de "pensamento mais longo" ou inference-time computation). Isso pode reduzir custos e simplificar arquiteturas, sem sacrificar a qualidade.

Além disso, o estudo fornece uma estrutura para avaliar modelos de forma mais precisa. Em vez de apenas medir acurácia em perguntas isoladas, as empresas podem usar o perfilamento de fatos para identificar quais conhecimentos são frágeis no modelo, direcionando melhor os esforços de treinamento ou ajuste fino. Isso é relevante para aplicações críticas, como diagnósticos médicos, atendimento jurídico ou assistentes de código, onde erros factuais têm consequências altas.

Impacto

A curto prazo, a pesquisa deve incentivar o uso de técnicas de inferência mais elaboradas. Modelos como GPT-5 e Gemini-3, já disponíveis comercialmente, podem se beneficiar de estratégias como gerar cadeias de raciocínio múltiplas e depois escolher a resposta mais consistente. Isso já é usado em algumas aplicações, mas o estudo dá uma base teórica robusta para generalizar a técnica.

A médio prazo, a indústria pode começar a repensar o balanço entre tamanho do modelo e capacidade de inferência. Se os fatos estão todos lá, talvez valha mais a pena investir em computação na hora da resposta do que em parâmetros adicionais. Isso pode influenciar decisões de arquitetura em empresas como Google e OpenAI, que constantemente ampliam seus modelos.

Outro impacto é no campo de avaliação de modelos. O perfilamento de fatos proposto pelos pesquisadores pode se tornar um padrão ouro para medir conhecimento, complementando benchmarks tradicionais como MMLU ou HellaSwag. Isso permitiria comparar modelos não apenas pelo que respondem, mas pelo que sabem e conseguem acessar com esforço adequado.

O que muda

A principal mudança é na mentalidade: alucinação não é sinônimo de ignorância. Para desenvolvedores, isso significa que antes de expandir dados ou modelos, vale explorar estratégias de inferência. Por exemplo, em um sistema de atendimento ao cliente, se o modelo não lembra de uma política reembolso, pedir que ele "pense novamente" ou forneça etapas intermediárias pode recuperar a informação correta.

Além disso, a pesquisa propõe um vocabulário mais preciso: "codificado" versus "conhecido". Um modelo pode codificar um fato (ele está nos parâmetros) mas não conhecê-lo (não consegue acessá-lo de forma confiável). Essa distinção permite diagnósticos mais finos: se um fato está codificado mas não é conhecido, a solução pode ser melhorar o acesso, não o re-treinamento.

O que vem agora

Os pesquisadores apontam que ainda há muito a explorar sobre como maximizar a recuperação. O estudo mostrou que 65% dos fatos "esquecidos" podem ser recuperados com mais inferência, mas os 35% restantes permanecem inacessíveis, pelo menos com as técnicas atuais. Próximos passos incluem desenvolver métodos mais eficientes de "pensamento mais longo" que não aumentem excessivamente a latência, algo crítico para aplicações em tempo real.

Também é provável que outras empresas e grupos de pesquisa repliquem o estudo em outros modelos e conjuntos de dados, ampliando o conhecimento sobre a universalidade do fenômeno. O artigo do Google Research e do Technion já está em preprint no arXiv, e a comunidade espera que uma versão revisada por pares traga mais detalhes. Para engenheiros, a mensagem é clara: antes de culpar a memória do modelo, tente fazê-lo pensar um pouco mais.