Estudo aponta falha em destilação multi-professor por correção

Pesquisa mostra redistribuição de decisões e perda de funcionalidade de rótulos em experimento controlado

Por Marcos Guimarães11 set 2026
Estudo aponta falha em destilação multi-professor por correção

O que aconteceu

O artigo 'Decision Shifts, Lost Label Functionality, and an Inconclusive Grounding Audit in Correctness-Gated Multi-Teacher Distillation' (arXiv:2609.09702v1) foi submetido em 9 de setembro de 2026 e descreve um experimento fixo com oito braços que compartilham 4.330 fontes, um modelo aluno de 63,9 milhões de parâmetros, 12.990 linhas de otimização, 406 atualizações, entradas de evidência e um decodificador. Sete dos oito braços usam professores e um único conjunto fixo de três respostas. Três sementes foram avaliadas sobre 267 exemplos mantidos fora do treino.

O experimento de destilação multi-professor com filtro de correção comparou o braço ponderado por correção com a destilação sem filtro. Em relação à destilação sem filtro, o braço ponderado por correção apresentou diferença de acurácia de +0,1660, com intervalo observado de 95% entre [0,0670, 0,2455]. O macro-F1 de cinco rótulos variou +0,1323 ([0,0916, 0,1731]) e a taxa condicional de ações inseguras definida pela tarefa caiu -0,4979 ([-0,5926, -0,3686]).

Contexto

A destilação multi-professor é uma técnica em que vários modelos professores treinam um modelo aluno menor. A ideia central é aproveitar o conhecimento agregado de diferentes fontes para reduzir custo computacional sem perder desempenho. A variação estudada aqui adiciona um filtro de correção: o sistema dá mais peso às respostas que considera corretas, na tentativa de evitar que o aluno aprenda padrões ruins.

O estudo mostra que correção de decisão e fundamentação de justificativa são objetivos distintos. O braço ponderado melhorou métricas de acurácia, mas esse avanço não significa comportamento uniformemente melhor. O Source-label SFT, outro braço do experimento, teve o maior macro-F1 médio, de 0,586.

Por que importa

O resultado mais crítico do estudo envolve perda de funcionalidade de rótulos. O braço ponderado por correção teve recall zero na categoria Refuted em todas as sementes. Além disso, duas sementes atribuíram NotEnoughInfo a todos os 167 exemplos de alegação, ou seja, o modelo deixou de classificar qualquer exemplo como refutado ou suportado nesses casos.

O filtro de correção, portanto, redistribuiu as decisões do modelo em vez de melhorá-las de forma geral. Essa redistribuição pode ser perigosa em aplicações de verificação de fatos e moderação, nas quais a distinção entre informação refutada e insuficiente é o próprio propósito do sistema.

Impacto

O experimento também submeteu o braço ponderado a uma auditoria humana de fundamentação, ajustada por disponibilidade em uma semente de referência. Os resultados foram 0/20 para saídas ponderadas e 1/20 para saídas sem filtro em positivos sustentados por evidência. Já os positivos contendo material não sustentado somaram 20/20 no braço ponderado e 19/20 no braço sem filtro.

Os autores do estudo afirmam que a auditoria não permite estimar um efeito comum de fundamentação por fonte. As amostras não eram pareadas, a sobreposição de fontes não foi serializada e o ajuste ocorreu depois da sumarização automática, mas antes da anotação. Por isso, a auditoria é inconclusiva sobre melhora ou dano no nível do sistema.

O filtro rígido (hard filtering) já alcançava 0,660 de acurácia, 0,530 de macro-F1 e taxa condicional de ações inseguras de 0,135. O braço ponderado implementado não demonstrou ganho incremental de decisão em relação a esse filtro rígido.

O que muda

A análise de falha em matriz fixa revela um cenário de redistribuição de decisões acompanhada de perda de função de rótulos. Esse tipo de resultado desafia a premissa de que ponderar por correção necessariamente produz um aluno mais confiável.

Para equipes que trabalham com destilação de modelos, a conclusão prática é que ganhos em acurácia podem esconder perdas de cobertura em categorias específicas. Uma métrica agregada como a acurácia não captura o colapso de recall em uma classe inteira. O macro-F1, que pondera classes igualmente, também pode mascarar esse tipo de falha quando combinado com outras classes bem comportadas.

O que vem agora

O estudo de destilação multi-professor com filtro de correção sobre o modelo aluno de 63,9 milhões de parâmetros termina sem estabelecer ganho de fundamentação. O texto indica que a auditoria humana disponível não é suficiente para estimar o efeito e que novos experimentos com amostras pareadas e serialização de sobreposição de fontes seriam necessários para isolar o efeito de fundamentação por fonte comum.

A pesquisa foi submetida à categoria Computer Science > Artificial Intelligence do arXiv em 9 de setembro de 2026. O artigo está disponível com PDF e versão HTML experimental na página do arXiv.

Fontes

  • arXiv cs.AI: 'Decision Shifts, Lost Label Functionality, and an Inconclusive Grounding Audit in Correctness-Gated Multi-Teacher Distillation' (arXiv:2609.09702v1) https://arxiv.org/abs/2609.09702