Auditoria: só 6,5% da literatura de IA neuro-simbólica é reproduzível

Auditoria em seis etapas analisou 5.497 registros e encontrou falhas graves na disponibilização de artefatos.

Por Marcos Guimarães28 ago 2026
Auditoria: só 6,5% da literatura de IA neuro-simbólica é reproduzível

O que aconteceu

Um artigo submetido ao arXiv em 26 de agosto de 2026 apresenta a primeira aplicação de um framework de auditoria em seis etapas para mensurar a reprodutibilidade de uma área da ciência da computação. O alvo foi o subdomínio da inteligência artificial neuro-simbólica, conhecido pela sigla NSAI, que combina redes neurais com raciocínio simbólico. O autor, Brandon Colelough, descreve no preprint arXiv:2608.26236 como o processo de auditoria, que levou vários anos, recuperou 5.497 registros na primeira etapa e removeu 3.018 duplicatas, restando 2.479 registros únicos.

Na triagem por título e resumo, a etapa dois identificou 1.365 registros que se declaravam como NSAI. Após a leitura completa, 61 foram descartados por estarem fora do tema, não serem pesquisa com avaliação quantitativa ou por texto integral inacessível. Restaram 1.304 estudos elegíveis. A terceira etapa procurou um artefato de código público e verificável para cada um deles. Para 849 estudos, nenhum código foi encontrado. Assim, 455 entraram no inventário de artefatos, onde as etapas quatro e cinco foram reexecutadas de forma limitada.

No total, 85 estudos foram total ou parcialmente reproduzidos. Esse número representa 6,52% do corpus elegível e 18,68% das tentativas de reexecução. As barreiras foram claras: 321 tentativas de reexecução foram bloqueadas por falta de artefatos que não eram código, como dados, ambiente ou instruções. Outras 42 foram impedidas por repositórios de código ausentes ou inutilizáveis. Esses números quantificam um déficit de reprodutibilidade que persiste mesmo quando o artigo traz a declaração nominal de que o código está disponível.

Contexto

A crise de reprodutibilidade não é nova na inteligência artificial. Estudos anteriores já apontaram que muitos artigos com código disponível não podem ser executados sem intervenção manual. A novidade desta auditoria é a abrangência sistemática: ela não avalia um único artigo, mas uma literatura inteira. O framework em seis etapas foi desenhado para ser genérico em ciência da computação e poderia ser aplicado a outros subdomínios. A escolha da NSAI é relevante porque essa área frequentemente combina componentes heterogêneos, como redes neurais e sistemas lógicos, o que torna a reprodutibilidade ainda mais desafiadora.

O histórico da área mostra que muitos autores publicam código em repositórios temporários, sem versionamento ou arquivamento permanente. O estudo demonstra que a simples presença de um link de código não garante que o experimento seja reproduzível. A falta de artefatos não-code, como dados processados, configurações de ambiente e hiperparâmetros, bloqueou mais de 70% das reexecuções tentadas.

Por que importa

Para pesquisadores, os 6,5% de reprodutibilidade significam que a maioria dos resultados publicados em NSAI não pode ser verificada de forma independente. Isso compromete a confiança em conclusões científicas e dificulta a construção de trabalhos sobre resultados anteriores. Para a indústria, que cada vez mais adota técnicas de IA neuro-simbólica, usar achados não reproduzíveis pode levar a falhas em aplicações reais. Os números também expõem um problema de incentivos: os autores que declaram ter código disponível muitas vezes não fornecem artefatos suficientes para que outros executem os experimentos.

Os 849 estudos que não tinham código verificável representam 65% do corpus elegível. Isso não significa que sejam fraudulentos, mas que a ciência perde a capacidade de confirmar suas afirmações. A auditoria mostra que o problema não é apenas de vontade individual, mas de falta de política editorial clara.

Impacto

A curto prazo, a publicação serve como um alerta para revistas e conferências de IA. Os autores argumentam que artigos empíricos de NSAI deveriam ser obrigados, no momento da submissão, a fornecer pacotes completos de artefatos, com versionamento e arquivamento permanente. Se essa prática for adotada, o custo de produção de cada artigo aumenta, mas a confiabilidade da área melhora.

Em médio prazo, é provável que veículos de publicação exijam não apenas código, mas também dados, ambientes e instruções de execução. O framework de auditoria pode se tornar uma ferramenta para avaliar o cumprimento dessas novas regras. A reexecução limitada de etapas quatro e cinco mostrou que, mesmo quando o código existe, erros de versão e falta de dependências documentadas são comuns.

O que muda

O estudo propõe uma mudança concreta na forma como trabalhos de NSAI são publicados: a submissão deve vir acompanhada de um pacote de artefatos completo, versionado e arquivado permanentemente. Isso não é apenas uma recomendação acadêmica. Se adotada por conferências importantes, como as da área de IA, a regra altera o fluxo de trabalho de milhares de pesquisadores. A auditoria também demonstra que a expressão "código disponível" deixou de ser suficiente.

Para o leitor comum dessa literatura, a mudança significa que futuros artigos serão mais fáceis de validar. Para os próprios autores, implica planejar a reprodutibilidade desde o início do projeto, não como uma etapa final.

O que vem agora

O próximo passo natural é a aplicação do framework em outras áreas da ciência da computação. Os autores não indicam um cronograma, mas afirmam que o framework é generalizável. Também é esperado que revistas científicas comecem a discutir políticas de artefatos obrigatórios, seguindo o modelo já adotado em algumas áreas da biologia computacional. A comunidade de NSAI, por sua vez, pode usar os números desta auditoria como base para criar repositórios comunitários de artefatos verificados. Até que isso ocorra, os leitores devem tratar os resultados publicados com ceticismo até que a reprodução seja demonstrada.