DECAF: novo método separa evidência, contradição e fragilidade em respostas de IA
Pesquisadores criam decomposição que explica o que a magnitude de perturbação realmente significa em modelos de visão.
O que aconteceu
Pesquisadores submeteram ao arXiv o artigo "Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses" (arXiv:2608.12935), em 13 de agosto de 2026. O trabalho introduz o DECAF (Decomposition of Evidence, Contradiction, And Fragility), uma técnica que separa a resposta de um modelo a entradas alteradas em três componentes: evidência (E), contradição (C) e fragilidade (F). A decomposição preserva exatamente a magnitude total, com a equação Abs = E + C + F, e é única sob axiomas relativos ao ponto final.
O método rastreia como o contraste entre pares de entradas se desenvolve conforme elas são progressivamente reveladas, usando o contraste final para interpretar a trajetória. Em um audit com 72 modelos na ImageNet-9, o maior componente do DECAF concordou com um comportamento medido independentemente em 96,4% dos casos, contra 35,0% quando se usa apenas a magnitude.
Contexto
Métodos de perturbação explicam decisões de modelos medindo mudanças nas previsões quando as entradas são alteradas. O problema: a magnitude da resposta indica apenas o quanto o modelo reage, não o que essa reação significa. A mesma magnitude pode apoiar a diferença factual-contrafactual final, opor-se a ela, ou surgir fortemente ao longo do caminho de perturbação e desaparecer no ponto final. O DECAF foi criado para resolver essa ambiguidade.
Por que importa
Para quem desenvolve e audita sistemas de IA, saber se uma resposta é evidência real, contradição ou fragilidade muda completamente a interpretação. Uma resposta grande pode ser enganosa se for apenas fragilidade — ou seja, o modelo reage fortemente no meio do caminho, mas o efeito some no final. O DECAF permite distinguir esses casos, o que é crítico para explicabilidade, robustez e segurança.
Impacto
Os resultados mostram ganhos práticos. Mudar apenas o caminho de revelação aumentou a resposta total em quase 80%, mas a evidência quase não mudou enquanto a fragilidade cresceu mais de 4 vezes. Isso indica que a fragilidade é sensível ao caminho, enquanto a evidência é estável. Em benchmarks como FunnyBirds e ImageNet-1k, trajetórias curtas do DECAF superaram baselines de atribuição de propósito geral. Em um modelo DINOv2 de escala 1B, uma trajetória curta igualou um baseline forte baseado em gradiente com 4,75x menos tempo de parede e 2,36x menos pico de memória.
O que muda
O DECAF oferece uma nova métrica para avaliar explicações de modelos, indo além da magnitude. Ele permite que pesquisadores e engenheiros identifiquem quando uma resposta é confiável (evidência), quando é contraditória (contradição) e quando é frágil (fragilidade). Isso pode melhorar a auditoria de modelos, a detecção de vieses e a construção de sistemas mais robustos.
O que vem agora
O artigo está disponível no arXiv e não há anúncio de código público até o momento. Os autores devem divulgar detalhes adicionais, possivelmente incluindo implementações e experimentos em outras modalidades. A comunidade de IA explicável deve acompanhar os próximos passos para validar o método em cenários mais amplos.
