Whisper: método sem retreino reduz alucinações de transcrição em 92%

Projeção de ativações no espaço de alucinação derruba taxa de transcrições inventadas de 31,31% para 2,44% em benchmarks de não-fala

Por Marcos Guimarães7 set 2026
Whisper: método sem retreino reduz alucinações de transcrição em 92%

O que aconteceu

Um artigo intitulado "Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection" foi submetido ao arXiv em 3 de setembro de 2026, pela pesquisadora Maryam Abbasihafshejani (arXiv:2609.04561v1). O trabalho propõe um método de redução de alucinações no Whisper, o modelo de reconhecimento automático de fala (ASR) amplamente usado na indústria.

O problema atacado é conhecido de quem trabalha com o modelo: o decoder generativo do Whisper produz transcrições fluentes e inventadas quando o áudio de entrada contém pouco ou nenhum discurso. Em silêncio, ruído ou música, o modelo pode gerar frases inteiras que nunca foram ditas.

A solução proposta é uma projeção de baixo rank das ativações do decoder. O método estima um subespaço compacto associado a alucinações a partir de dados de calibração sem fala e, durante a inferência, projeta os estados ocultos do decoder para fora desse subespaço. Nada é retreinado.

Os números: a variante always-on, aplicada a todas as entradas, reduz a taxa média de alucinação (HR) de 31,31% para 2,44%, uma queda relativa de 92,21%. A variante gated, acionada apenas quando o Whisper prevê que a entrada provavelmente não contém fala, leva a HR a 3,74%, redução relativa de 88,05%, com menor rejeição indevida de fala genuína.

Contexto

O Whisper é um foundation model de ASR adotado por desenvolvedores e empresas para transcrever áudio em escala. Sua arquitetura generativa, que gera texto token a token, é a origem do defeito: quando não há fala para ancorar a saída, o decoder preenche o vazio com texto plausível.

Trabalhos anteriores documentaram esse comportamento em áudios silenciosos ou com ruído, mas as correções costumavam exigir retreino ou filtros externos. O artigo de 2026 mostra que as alucinações ocupam uma região identificável do espaço de ativações internas do modelo, o que permite removê-las por projeção matemática, sem tocar nos pesos.

Por que importa

Quem usa o Whisper em produção sabe o custo do problema. Transcrições inventadas em trechos de silêncio contaminam legendas automáticas, atas de reuniões, análises de call centers e pipelines de IA que consomem o texto gerado. Um trecho alucinado pode virar dado falso em um sistema de decisão.

O método é training-free, ou seja, qualquer equipe que já roda o Whisper pode aplicar a projeção na inferência, sem custo de retreino e sem precisar dos dados originais de treinamento. Isso reduz a barreira de adoção a praticamente zero.

Impacto

Há um trade-off medido no artigo. No LibriSpeech, conjunto clássico de benchmarks de fala, a variante gated aumenta a taxa de erro de palavra (WER) em 0,33 a 4,39 pontos percentuais absolutos, dependendo do modelo e da divisão testada. As taxas de falsa rejeição (FRR) de fala genuína ficam entre 0,41% e 9,97%.

Na prática, isso significa que equipes precisam escolher: a variante always-on suprime mais alucinações (HR de 2,44%), mas pode rejeitar fala real com mais frequência. A variante gated preserva melhor o reconhecimento, ao custo de uma HR um pouco maior (3,74%). O artigo descreve esse equilíbrio como controlável, o que permite ajustar o método ao caso de uso.

O que muda

Para o mercado de ASR, o resultado reforça uma tendência: corrigir falhas de modelos generativos por intervenção no espaço latente, sem retreino. A técnica de projeção de ativações, aplicada aqui ao Whisper, pode inspirar abordagens semelhantes em outros modelos com decoders generativos.

Para desenvolvedores brasileiros e empresas que usam o Whisper em produtos de transcrição, legendagem e atendimento, o método oferece uma camada de proteção contra texto inventado em áudios sem fala, com ajuste fino entre segurança e precisão.

O que vem agora

O artigo está disponível no arXiv (2609.04561) desde 3 de setembro de 2026, na versão v1, submetida por Maryam Abbasihafshejani. A página do paper lista ferramentas de citação e repositórios associados, mas o material divulgado não menciona data de publicação em conferência nem disponibilidade de código em produção. A expectativa natural é que a comunidade valide os resultados de forma independente e que implementações da projeção apareçam em bibliotecas de inferência de ASR nos próximos meses.