Auditoria revela que LLMs fabricam escores de dor em 76% dos casos
Estudo com sete modelos no corpus TAME Pain mostra que abstenção não garante robustez em cenário clínico provadamente não informativo
O que aconteceu
O artigo "Refusal Is Not Robustness", submetido ao arXiv em 16 de julho de 2026, testou sete LLMs no corpus TAME Pain. O corpus foi criado com participantes lendo frases Harvard Sentences (foneticamente balanceadas) enquanto mantinham uma mão em água fria ou morna, relatando dor apenas em declarações periódicas. O protocolo gerou 5.750 transcrições sem sinal (nenhuma palavra de dor no texto) e 1.294 com sinal (a classificação de dor falada explicitamente).
No braço sem sinal, a dor era recuperável a partir de características acústicas (AUC de 0,622, IC 95% 0,553-0,662), enquanto a previsão baseada apenas na transcrição ficou próxima do acaso (AUC de 0,489, IC 95% 0,418-0,504). Como o reconhecimento automático de fala (ASR) elimina as pistas acústicas, qualquer pontuação de dor inferida exclusivamente do texto é não suportada pela evidência disponível, segundo os autores.
Sob prompting cooperativo, seis dos sete modelos abstiveram-se em quase todas as transcrições sem sinal, extraíram corretamente as classificações faladas no controle positivo (acurácia de 0,939 a 1,00) e mantiveram erro de calibração esperado de no máximo 0,100. Quando os prompts ganharam moldura de autoridade, a abstenção tornou-se dependente da formulação: o mesmo modelo variou de 0,18 a 1,00 entre frases equivalentes.
Forçados a responder, a maioria dos modelos produziu estimativas com baixa confiança. As exceções foram Gemini 2.5 Flash e Llama 3.1 8B, que geraram consistentemente escores confiantes, com taxas de fabricação confiante de 0,53 e 0,76, respectivamente, contra no máximo 0,15 dos demais. Não foram observados efeitos demográficos significativos nas respostas forçadas, com todos os valores p maiores ou iguais a 0,20.
Contexto
O estudo nasce de uma limitação dos benchmarks de alucinação: eles raramente estabelecem que o modelo não poderia ter conhecido a resposta correta. Sem essa garantia, fica difícil distinguir abstenção apropriada de predição sem suporte. O TAME Pain resolve esse problema criando um conjunto provadamente não informativo para o texto, já que a informação de dor está na acústica, não nas palavras.
A pesquisa também expõe uma fragilidade conhecida: a sensibilidade dos LLMs a prompts. No artigo, os autores mostram que modelos que se recusam a responder sob uma formulação cooperativa podem fabricar respostas quando o prompt muda para uma autoridade percebida, como um clínico que insiste pela resposta.
Por que importa
Na prática, um sistema de triagem de dor baseado em transcrições de consultas ou ligações de telemedicina poderia atribuir escores altos a pacientes sem nenhum indício de dor, com confiança elevada. Isso pode levar a prescrições indevidas, ansiedade desnecessária ou distorção de prontuários clínicos. O estudo mostra que recusar responder não é um atestado de robustez: é um comportamento que pode ser contornado pela engenharia de prompts.
A diferença entre modelos também destaca que a calibração de confiança precisa ser auditada em cenários de risco, e não apenas medidas de precisão ou abstenção.
Impacto
Em curto prazo, o achado pressiona provedores de modelos como Google (desenvolvedor do Gemini) e Meta (desenvolvedora do Llama) a documentar limites de uso clínico. Integradores de saúde que usam ASR seguido de LLM precisam entender que a cadeia inteira, e não apenas o modelo final, determina a qualidade da previsão.
O trabalho também propõe a "taxa de fabricação confiante" como métrica de auditoria, que pode se tornar padrão em avaliações de segurança de modelos em domínios sensíveis.
O que muda
Para desenvolvedores e reguladores, a lição é que abstenção e robustez são propriedades independentes. Testes de segurança devem incluir variação de prompt e cenários onde a resposta correta é impossível de ser conhecida. A métrica de fabricação confiante complementa as tradicionais de precisão e calibração.
No Brasil, com o avanço de soluções de telessaúde e IA em prontuários eletrônicos, a auditoria desse tipo de erro deveria ser parte dos requisitos de aprovação de sistemas clínicos.
O que vem agora
Os autores disponibilizaram o artigo no arXiv (identificador 2608.26167) e sinalizam que os dados do TAME Pain podem ser usados para replicação. Espera-se que a comunidade desenvolva métodos para tornar a recusa invariante ao prompt, além de testar outros modelos e domínios clínicos. O próximo passo natural é avaliar se as fabricações confiantes persistem em línguas como o português, dado que o corpus original é em inglês.
Fontes
- arXiv: "Refusal Is Not Robustness: Auditing Confident Fabrication in Large Language Models on a Provably Uninformative Clinical Pain Speech Transcript" (https://arxiv.org/abs/2608.26167)
