Benchmark expõe lacuna de crédito parcial em provas com nota convexa

Estudo com 632 itens do exame nacional do Vietnã mostra que acurácia tradicional superestima modelos.

Por Marcos Guimarães20 ago 2026
Benchmark expõe lacuna de crédito parcial em provas com nota convexa

O que aconteceu

Um estudo submetido ao arXiv em 18 de agosto de 2026 apresenta o THPT-Ladder, um benchmark com 632 itens extraídos de 21 provas oficiais do Exame Nacional de Conclusão do Ensino Médio do Vietnã, cobrindo 11 disciplinas. A avaliação usa exatamente a rubrica do Ministério da Educação vietnamita, que adotou na reforma de 2025 um esquema de pontuação convexo na Parte II: cada questão traz quatro afirmações de verdadeiro/falso, e a nota é definida em saltos de 0, 0,10, 0,25, 0,50 e 1,00 ponto. Quem identifica três afirmações corretamente recebe 0,50 ponto, não os 0,75 que uma métrica proporcional daria. Como a Parte II vale 4,00 dos 10,00 pontos do exame, relatar apenas acurácia infla o resultado ao recompensar conhecimento parcial que o Estado penaliza explicitamente (arXiv:2608.18336).

Contexto

A maioria dos benchmarks de LLMs em exames humanos pontua cada resposta como certa ou errada e resume tudo em acurácia. Essa abordagem assume que conhecimento parcial vale crédito proporcional — uma premissa que falha quando a prova usa um esquema de pontuação não aditivo. A reforma de 2025 do exame vietnamita é um exemplo concreto desse custo. O ministério publica as notas de mais de um milhão de candidatos, o que permitiu aos pesquisadores posicionar os modelos diretamente na coorte humana.

Por que importa

A diferença não é marginal. Entre oito modelos avaliados, a rubrica oficial paga de 0,020 a 0,159 ponto a menos por questão da Parte II do que o crédito proporcional. No exame de História de 2025, o Qwen3.5-27B perdeu 0,042 ponto — o suficiente para cair do 90º para o 77º percentil entre 481.293 candidatos. A acurácia não prevê essa penalidade: no nível de acurácia do Claude Sonnet 5, diferentes distribuições de erro geram de 0,869 a 0,932 ponto por questão. Ou seja, benchmarks padrão podem relatar uma competência que a instituição não certificaria.

Impacto

No curto prazo, o estudo expõe uma limitação prática: a nota oficial depende de como as afirmações corretas estão agrupadas, não apenas de quantas estão corretas. No médio prazo, benchmarks com rubricas oficiais, como o THPT-Ladder, devem se tornar referência para medir modelos em avaliações com regras não aditivas. No Brasil, a discussão serve de alerta para quem compara modelos por percentual de acertos em provas com correção não linear, como a TRI do Enem.

O que vem agora

O artigo apresenta o THPT-Ladder como uma forma de colocar modelos na mesma coorte dos candidatos humanos, já que o ministério divulga as notas reais. Espera-se que o benchmark seja usado para avaliar novos modelos e que a métrica de crédito parcial ganhe mais atenção em pesquisas de avaliação de LLMs. A lição imediata: acurácia não é nota.

Fontes