Estudo mapeia 14.767 benchmarks de LLMs no arXiv

Levantamento analisou benchmarks de LLMs publicados no arXiv entre 2022 e 2026 e mostra avanço da avaliação feita por modelos

Por Marcos Guimarães18 set 2026
Estudo mapeia 14.767 benchmarks de LLMs no arXiv

O que aconteceu

O artigo "What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks" foi submetido ao arXiv em 15 de setembro de 2026 e catalogado sob o identificador arXiv:2609.19182v1, na área de Inteligência Artificial. O estudo analisou 14.767 papers que introduziram ou atualizaram recursos de avaliação, todos publicados no arXiv entre janeiro de 2022 e agosto de 2026. Os 14.767 benchmarks foram mapeados por meio de triagem em etapas e codificação automatizada de texto completo, segundo o resumo do artigo.

O levantamento olhou para três frentes: quais sistemas e domínios os benchmarks miravam, quais materiais e condições de avaliação usavam, e como as respostas eram pontuadas.

Contexto

Benchmarks são o instrumento central para medir e comunicar o progresso em LLMs. O problema, segundo os autores, é que rankings de modelos dizem pouco sobre como as exigências de avaliação em si estão mudando. Olhar para a variedade crescente de testes oferece outra perspectiva: o que os pesquisadores esperam que os LLMs façam e o que eles consideram desempenho bem-sucedido.

A coleta do estudo mostra uma ênfase crescente em ação, interação e aplicações profissionais. Elementos de design antigos e novos coexistem com frequência nos benchmarks analisados. Ou seja, a área não substituiu métricas tradicionais por abordagens recentes. Empilhou umas sobre as outras.

A participação dos modelos no processo de avaliação também avança de forma desigual. A pontuação feita por LLMs cresce tanto dentro do grupo de benchmarks voltados a agentes quanto fora dele. Já os materiais gerados por modelos não apresentam aumento sustentado comparável nas coortes mais recentes.

Por que importa

A questão prática é quem controla o crivo. Quando um modelo de linguagem executa a tarefa e outro modelo julga a resposta, a avaliação deixa de depender apenas de gabaritos fixos ou de anotadores humanos. Isso reduz custo e escala, mas cria uma dependência circular: o desempenho de um LLM passa a ser medido, em parte, por outro LLM.

Os próprios autores formulam a dúvida central do trabalho. À medida que a IA participa da construção dos testes, da execução das tarefas e do julgamento das respostas, a avaliação expandida oferece mais evidência independente ou corre o risco de reproduzir as preferências e os pontos cegos dos modelos que participam dela?

O dado de que a pontuação por LLM cresce nos dois grupos, agentes e não agentes, mostra que essa prática não ficou restrita a benchmarks experimentais de agentes autônomos. Ela se espalhou pela avaliação de LLMs em geral. Já a estabilidade dos materiais gerados por modelos indica uma assimetria: os pesquisadores aceitam que um modelo julgue, mas são mais cautelosos em deixar que ele produza o conteúdo do teste.

Impacto

Para laboratórios e empresas que publicam modelos, o mapeamento de 14.767 papers de benchmarks é um retrato do que o mercado passou a cobrar de um LLM. A ênfase em aplicações profissionais sugere que a avaliação acompanha a migração dos modelos de linguagem de demonstrações de texto para uso dentro de fluxos de trabalho reais.

Para quem consome esses rankings, o alerta é direto: a lista de benchmarks cresceu, mas crescimento em número de testes não equivale automaticamente a crescimento em independência dos testes. Se o juiz é um modelo, o viés do juiz entra no resultado.

Para a pesquisa acadêmica, o estudo oferece um mapa quantitativo do que a área decidiu medir. Essa base permite comparar coortes e identificar quando um tipo de design de benchmark se consolidou, algo que antes ficava disperso em milhares de PDFs separados.

O que muda

O estudo reposiciona a discussão sobre avaliação de LLMs. Em vez de perguntar apenas qual modelo lidera um ranking, ele propõe olhar para o desenho dos testes: o que se pede ao modelo, com que material, sob quais condições e com que critério de sucesso.

O mapeamento também documenta a convivência entre designs estabelecidos e novos, o que contraria a ideia de substituição limpa de gerações de benchmarks. Na prática, um mesmo campo de pesquisa carrega camadas de critérios acumulados ao longo de quatro anos.

O que vem agora

O artigo deixa aberta a pergunta sobre independência da avaliação de LLMs e não anuncia uma proposta de correção. O caminho natural é que a comunidade discuta protocolos para separar quem gera o teste, quem executa a tarefa e quem julga o resultado, evitando que o mesmo tipo de modelo ocupe os três papéis.

O mapeamento também serve de base para análises futuras, já que cobre coortes sucessivas de benchmarks de LLMs entre 2022 e 2026 e permite medir se a pontuação por LLM continuará crescendo, se os materiais gerados por modelos vão se firmar e se a ênfase em ação, interação e aplicações profissionais seguirá dominando o desenho dos testes.

Fontes

  • arXiv cs.AI: "What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks" (arXiv:2609.19182v1), submetido em 15 de setembro de 2026. https://arxiv.org/abs/2609.19182