NovGauge: benchmark expõe falhas de LLMs ao julgar novidade de papers
O NovGauge, novo benchmark publicado no arXiv, avalia como 18 LLMs julgam a novidade de papers científicos em três dimensões. As taxas de alucinação chegam a 39% e mais de 70% das justificativas corretas citam evidências que não sustentam o argumento.
