Benchmark expõe lacuna de crédito parcial em provas com nota convexa
Estudo com 632 itens do exame nacional do Vietnã mostra que acurácia tradicional superestima modelos.
O que aconteceu
Um estudo submetido ao arXiv em 18 de agosto de 2026 apresenta o THPT-Ladder, um benchmark com 632 itens extraídos de 21 provas oficiais do Exame Nacional de Conclusão do Ensino Médio do Vietnã, cobrindo 11 disciplinas. A avaliação usa exatamente a rubrica do Ministério da Educação vietnamita, que adotou na reforma de 2025 um esquema de pontuação convexo na Parte II: cada questão traz quatro afirmações de verdadeiro/falso, e a nota é definida em saltos de 0, 0,10, 0,25, 0,50 e 1,00 ponto. Quem identifica três afirmações corretamente recebe 0,50 ponto, não os 0,75 que uma métrica proporcional daria. Como a Parte II vale 4,00 dos 10,00 pontos do exame, relatar apenas acurácia infla o resultado ao recompensar conhecimento parcial que o Estado penaliza explicitamente (arXiv:2608.18336).
Contexto
A maioria dos benchmarks de LLMs em exames humanos pontua cada resposta como certa ou errada e resume tudo em acurácia. Essa abordagem assume que conhecimento parcial vale crédito proporcional — uma premissa que falha quando a prova usa um esquema de pontuação não aditivo. A reforma de 2025 do exame vietnamita é um exemplo concreto desse custo. O ministério publica as notas de mais de um milhão de candidatos, o que permitiu aos pesquisadores posicionar os modelos diretamente na coorte humana.
Por que importa
A diferença não é marginal. Entre oito modelos avaliados, a rubrica oficial paga de 0,020 a 0,159 ponto a menos por questão da Parte II do que o crédito proporcional. No exame de História de 2025, o Qwen3.5-27B perdeu 0,042 ponto — o suficiente para cair do 90º para o 77º percentil entre 481.293 candidatos. A acurácia não prevê essa penalidade: no nível de acurácia do Claude Sonnet 5, diferentes distribuições de erro geram de 0,869 a 0,932 ponto por questão. Ou seja, benchmarks padrão podem relatar uma competência que a instituição não certificaria.
Impacto
No curto prazo, o estudo expõe uma limitação prática: a nota oficial depende de como as afirmações corretas estão agrupadas, não apenas de quantas estão corretas. No médio prazo, benchmarks com rubricas oficiais, como o THPT-Ladder, devem se tornar referência para medir modelos em avaliações com regras não aditivas. No Brasil, a discussão serve de alerta para quem compara modelos por percentual de acertos em provas com correção não linear, como a TRI do Enem.
O que vem agora
O artigo apresenta o THPT-Ladder como uma forma de colocar modelos na mesma coorte dos candidatos humanos, já que o ministério divulga as notas reais. Espera-se que o benchmark seja usado para avaliar novos modelos e que a métrica de crédito parcial ganhe mais atenção em pesquisas de avaliação de LLMs. A lição imediata: acurácia não é nota.
