InnerExpert usa sinais de MoE para detectar alucinações em LLMs
Pesquisa do arXiv introduz técnica que aproveita sinais internos de arquiteturas Mixture-of-Experts para localizar erros por token.
O que aconteceu
Pesquisadores introduziram o InnerExpert, uma técnica para detecção de alucinações em LLMs que se aproveita de sinais únicos gerados por arquiteturas Mixture-of-Experts (MoE). O método combina dados do roteador (como entropia e desacordo entre experts) com sinais padrões de transformer para criar vetores de características por token. Esses vetores são classificados por um detector leve treinado em rótulos gerados por um pipeline LLM-as-a-judge (arXiv, 2026).
Em testes, o InnerExpert superou métodos existentes em cinco datasets diferentes e duas arquiteturas MoE. O desempenho máximo alcançado foi de 0,91 de AUROC para detecção no nível da resposta completa e de 0,76 para detecção a nível de token. O processo requer apenas uma única passagem (forward pass) pelo modelo.
Contexto
O problema das alucinações — conteúdo plausível, mas falso gerado por LLMs — é um dos maiores obstáculos para sua adoção confiável. A maioria das soluções de detecção existente opera após a geração completa de uma resposta ou frase. Porém, para corrigir ou sinalizar erros específicos, é necessário identificar exatamente em qual token a alucinação começou.
Arquiteturas MoE, como as usadas em alguns modelos de última geração, oferecem uma oportunidade inexplorada. Ao ativar apenas um subconjunto de 'experts' (redes feedforward distintas) por camada, elas geram sinais internos de roteamento. Esses sinais — a entropia do roteador, o grau de concordância entre os experts ativos e padrões de uso — não existem em arquiteturas densas tradicionais e nunca foram explorados para detecção de erros.
Por que importa
A detecção a nível de token transforma a gestão de alucinações de um problema geral em uma questão localizada. Em vez de rejeitar uma resposta inteira ou apenas marcar uma frase, sistemas podem apontar a palavra ou trecho exato em que a confiança do modelo caiu. Isso abre caminho para intervenções granulares: uma edição automática, uma solicitação de verificação ou uma chamada a uma ferramenta externa.
Para empresas que integram LLMs em produtos críticos — como assistentes de saúde, jurídicos ou financeiros — isso significa uma camada adicional de segurança e auditoria. O método do InnerExpert é promissor porque opera de forma eficiente (uma única passagem) e não depende de anotação manual, pois usa outro LLM como juiz para treinar o detector.
Impacto
No curto prazo, a pesquisa valida que o próprio 'esqueleto' da arquitetura MoE já contém informações valiosas para avaliação de qualidade. Isso pode acelerar a implementação de sistemas de detecção em modelos já treinados que usam MoE, sem necessidade de retreinamento pesado.
No médio prazo, pode-se esperar a integração de módulos de detecção como o InnerExpert diretamente nas pipelines de inferência. Isso elevaria o padrão de confiabilidade dos LLMs, tornando seus erros não apenas detectáveis, mas também rastreáveis e, potencialmente, corrigíveis em tempo real.
O que muda
O principal deslocamento é técnico e conceitual: a detecção de alucinações deixa de ser exclusivamente uma análise externa da saída e passa a extrair señais diretamente da dinâmica interna do modelo. A arquitetura MoE, frequentemente escolhida por sua eficiência computacional, revela-se agora uma ferramenta útil para garantia de qualidade. A abordagem por token também desloca o foco de uma validação binária (certo/errado) para uma análise de graus de confiança ao longo da sequência gerada.
O que vem agora
Os próximos passos envolvem testes com uma gama mais ampla de modelos MoE comerciais e de código aberto, além de integração em fluxos de trabalho práticos. A comunidade de pesquisa certamente explorará adaptações do InnerExpert para outras arquiteturas e cenários, como detecção de alucinações em códigos gerados ou em informações fáticas. A eficiência do método (uma única passagem) é um forte argumento para sua adoção em ambientes de produção onde a latência é crítica.
