IA inventa 96,7% das memórias ao escrever autobiografia, mostra estudo do arXiv
Auditoria de cenas em um livro de 366 dias mostra que o LLM criou pessoas, empregos e cenários falsos; grounding reduz a falha a 83,3%
O que aconteceu
O artigo "Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes" (arXiv:2608.23640v1) descreve uma auditoria de nível de cena. A autora do estudo usou um LLM conversacional para redigir um livro "page-a-day" com 366 entradas de memórias em primeira pessoa. Os inputs documentados do modelo foram um template, dois dias de exemplo e a citação de cada dia, e não o corpus da própria autora.
Cada dia foi auditado em nível de anedota contra um corpus de verificação independente, usando uma rubrica de quatro níveis fixada antes da análise. A taxa de falha de verificação foi definida como a parcela de dias não classificados como VERIFIED (cena positivamente corroborada). Dos 366 dias, 354 falharam, ou 96,7% (intervalo de confiança de Wilson de 95% entre 94,4% e 98,1%). Apenas 12 dias continham uma cena corroborada, e 19 dias (5,2%) apresentaram alegações ativamente contraditas pelo registro.
Contexto
O modo de falha dominante recebeu o nome de "grounded drift". Nesse padrão, o modelo usa pessoas reais, empregadores e cenários verdadeiros, mas os insere em cenas inventadas. A proporção medida desse fenômeno variou entre avaliadores, o que indica que a taxonomia de quatro níveis usada na auditoria tem confiabilidade apenas razoável a moderada.
O estudo é o primeiro do tipo, segundo os autores, a quantificar a auditoria de autobiografia gerada por LLM contra um corpus de verdade específico do sujeito, com base em uma busca não sistemática de literatura. A autora do paper é também o sujeito da biografia, o que permitiu acesso direto ao corpus documentado.
Por que importa
Para o mercado de IA, o achado expõe um risco concreto em aplicações de memória e biografia automatizadas. Serviços que geram histórias de vida, resumos de carreira ou perfis pessoais a partir de LLMs podem produzir narrativas com aparência verossímil, mas sem correspondência com o que realmente aconteceu. A medição do estudo, de 96,7% de falha, é um limite superior realista para o problema, e não uma exceção teórica.
O experimento de regeneração reforça o ponto. Ao reproduzir os mesmos dias com modelos atuais nomeados e os mesmos inputs, os pesquisadores observaram 100% de falha de verificação. Ou seja, o problema persiste mesmo com a geração mais recente de modelos.
Impacto
No curto prazo, o estudo oferece um instrumento de auditoria reutilizável para quem precisa testar narrativas geradas por IA. Porém, a fronteira entre as categorias WEAK e UNVERIFIED se mostrou não confiável, o que limita a precisão do instrumento em casos intermediários.
O remédio testado também tem efeito quantificado. Ao ancorar a geração no corpus do sujeito, em vez de depender apenas do template e das citações, a taxa de falha caiu de 96,7% para 83,3%. A melhora é significativa, mas a falha residual continua alta, o que indica que o grounding reduz, mas não elimina, a confabulação em nível de cena.
O que muda
Para desenvolvedores de aplicações de memória pessoal, o padrão mínimo passa a incluir verificação contra fontes documentadas. A auditoria de cenas, como a descrita no estudo, deve ser incorporada aos fluxos de avaliação de LLMs em domínios biográficos. Empresas que vendem ferramentas de escrita de histórias de vida precisarão oferecer mecanismos de citação ou validação, sob risco de propagar narrativas falsas.
A pesquisa também mostra que a reavaliação independente replicou o resultado principal, sem evidência de que a taxa original foi inflada. Isso dá confiança ao número central de 96,7% para decisões regulatórias e de produto.
O que vem agora
Os autores planejam refinar o instrumento de auditoria, especialmente a fronteira WEAK/UNVERIFIED, que o estudo demonstrou ser pouco confiável. O próximo passo natural é testar o remédio de grounding em escalas maiores e com múltiplos sujeitos, não apenas com a própria autora. A comunidade de pesquisa em cs.AI, contexto do paper no arXiv, pode usar o instrumento como base para auditorias comparativas entre modelos.
A expectativa é que futuras versões do estudo incluam métricas por modelo nomeado, já que a regeneração com modelos atuais reproduziu 100% de falha. Isso abre caminho para um ranking público de confiabilidade narrativa de LLMs em contextos biográficos.
