NovGauge: benchmark expõe falhas de LLMs ao julgar novidade de papers

Novo benchmark testa 18 modelos em revisão por pares e mostra que a maioria cita evidências que não sustentam o próprio argumento

Por Marcos Guimarães12 set 2026
NovGauge: benchmark expõe falhas de LLMs ao julgar novidade de papers

O que aconteceu

Pesquisadores publicaram no arXiv, em 10 de setembro de 2026, o paper NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment (arXiv:2609.11234v1). O NovGauge é um benchmark ancorado em julgamento humano que avalia a capacidade de modelos de linguagem de julgar a novidade de artigos científicos, uma tarefa cada vez mais comum na revisão por pares de grandes conferências de IA.

O conjunto de dados reúne 619 pares de papers e 50 conjuntos com múltiplos artigos. As instâncias foram retiradas de duas fontes especializadas: alegações de sobreposição feitas por revisores da ICLR, conferência de referência em aprendizado de máquina, e cocitações em artigos de survey. Cada instância recebeu rótulo independente em três dimensões: tarefa, problema e método. Essas dimensões capturam, respectivamente, os objetivos de aplicação, os desafios técnicos e as abordagens de solução de cada trabalho.

A novidade do NovGauge está na forma de avaliar. O benchmark propõe um pipeline de diagnóstico em cascata que verifica três camadas separadas: correção por dimensão, ancoragem da evidência e suporte lógico. Benchmarks anteriores mediam novidade como uma nota única e holística, o que impedia identificar qual dimensão o modelo errou ou se a evidência apresentada era fiel ao que o artigo realmente diz.

Os números da avaliação de 18 LLMs são o ponto central do trabalho. As taxas de alucinação variaram de 0% a 39% entre as dimensões. Entre os julgamentos corretos e não alucinados, mais de 70% citaram evidências que falham em sustentar logicamente a razão declarada. O melhor modelo testado, o GPT-5.5, alcançou de 43% a 72% de Verified F1 por dimensão. A maioria dos modelos reteve menos da metade do F1 bruto após a verificação de fidelidade.

Contexto

Large language models passaram a ser usados em revisão por pares em conferências importantes de IA, seja para triagem inicial, seja para apoiar revisores humanos. A novidade sempre foi o ponto fraco reconhecido dessa aplicação. Um modelo consegue resumir bem um artigo, apontar limitações metodológicas e sugerir melhorias de escrita, mas julgar se uma contribuição é de fato nova exige comparar o trabalho com o estado da arte de forma precisa e justificar a conclusão com evidência verificável.

O problema é que os benchmarks existentes tratavam novidade como uma nota única. Essa abordagem holística escondia a origem do erro. Um modelo podia receber pontuação razoável mesmo errando sistematicamente a dimensão de método, por exemplo, ou acertando a conclusão por acidente, com uma justificativa que não se sustentava.

O NovGauge ataca exatamente essa lacuna ao separar tarefa, problema e método, e ao condicionar a correção à fidelidade da evidência. A escolha das fontes também é relevante: alegações de sobreposição de revisores da ICLR são casos reais em que humanos identificaram conflito de novidade, e cocitações em surveys indicam trabalhos que a comunidade acadêmica trata como relacionados.

Por que importa

A avaliação de novidade é uma das tarefas mais difíceis de automatizar porque não basta classificar texto. É preciso comparar contribuições, entender o que já foi feito e explicar por que o novo trabalho se diferencia. O NovGauge mostra que os modelos atuais não entregam esse nível de rigor.

O dado mais duro é o das evidências infundadas. Mais de 70% dos julgamentos corretos e não alucinados citaram evidências que não sustentam logicamente a razão apresentada. Na prática, isso significa que um modelo pode dizer que um paper é original e apontar um trecho que, lido com atenção, não comprova a afirmação. Para um revisor humano que usa o LLM como apoio, esse tipo de erro é difícil de detectar sem checar a fonte original.

O GPT-5.5, melhor modelo do teste, chegou a 43% a 72% de Verified F1 conforme a dimensão. O número é bom em termos relativos e insuficiente em termos absolutos para uma decisão de revisão. A maioria dos 18 LLMs avaliados perdeu mais da metade do F1 bruto quando a fidelidade da evidência entrou na conta.

Impacto

Para conferências que já usam LLMs na triagem de submissões, como a própria ICLR, o resultado sugere cautela. Um modelo com taxa de alucinação de até 39% em certas dimensões pode rejeitar ou destacar papers por razões que não existem no texto. O custo recai sobre autores, que recebem avaliações enviesadas, e sobre os organizadores, que precisam lidar com contestação.

Para as empresas que desenvolvem os modelos, o NovGauge se torna uma métrica adicional de avaliação. Verified F1 mede algo diferente do F1 tradicional: não basta acertar o rótulo, é preciso citar a evidência certa e apresentar um raciocínio que se sustente. Ferramentas de revisão acadêmica e de análise de literatura tendem a ser cobradas por esse padrão.

No Brasil, grupos de pesquisa que usam LLMs para triagem de artigos e revisões sistemáticas também são afetados. A adoção de assistentes de leitura em laboratórios e programas de pós-graduação precisa considerar que a justificativa dada pelo modelo pode não corresponder ao conteúdo real do paper.

O que muda

A mudança principal é metodológica. O NovGauge desloca a avaliação de novidade de uma nota única para três dimensões rotuladas de forma independente, com verificação em cascata de correção, ancoragem de evidência e suporte lógico. Benchmarks futuros de tarefas científicas podem seguir esse desenho, condicionando a pontuação à fidelidade da justificativa.

O benchmark também oferece um diagnóstico acionável. Em vez de saber apenas que um modelo errou, é possível identificar se ele confundiu a dimensão de problema com a de método, ou se acertou a conclusão por acidente. Isso orienta o desenvolvimento de modelos e de estratégias de verificação.

O que vem agora

O paper foi submetido em 10 de setembro de 2026 e está disponível no arXiv sob o identificador 2609.11234v1. O material não detalha cronograma de revisão por pares, liberação pública do conjunto de dados nem quais modelos específicos compõem os 18 avaliados além do GPT-5.5. A expectativa natural é que o benchmark passe a ser usado como referência por grupos que trabalham com revisão automatizada e por conferências que adotam LLMs em seus fluxos de avaliação.

Fontes

  • arXiv cs.AI: NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment (https://arxiv.org/abs/2609.11234)