IBBench-Light: benchmark mede IA em diretivas externas

Benchmark do arXiv cria 144 pares por modelo e mostra que trocar o EOS leva o Phi de 0/144 a 62/144

Por Marcos Guimarães15 set 2026
IBBench-Light: benchmark mede IA em diretivas externas

O que aconteceu

O arXiv publicou em 12 de setembro de 2026 o paper "IBBench-Light: A Paired Evaluation of Task-Conditioned Responses to External Directives", identificado como arXiv:2609.13725v1 na área de Inteligência Artificial (arXiv). O IBBench-Light é um benchmark que mede o que um modelo de linguagem faz quando recebe um mesmo registro externo com duas instruções possíveis: aplicar um procedimento descrito ali ou apenas ler o texto.

O desenho é pareado. Doze bases semânticas geram 144 pares casados por modelo. Quatro modelos de instrução quantizados produziram 1.152 respostas greedy arquivadas, segundo o resumo do artigo. A métrica central se chama Paired exact-contract accuracy (PECA) e exige que os dois membros do par cumpram seus contratos de saída. Não basta acertar um lado.

Os números do Qwen mostram a diferença. O Qwen acerta 132 prompts de execução e 109 de processamento, mas fecha somente 97 pares completos. A média marginal esconde 35 pares que ficam pelo caminho quando os dois lados são cobrados juntos.

Os autores também ampliaram a auditoria. Somaram 1.722 gerações de CPU registradas para testar controles sem diretiva, doze bases semânticas adicionais, mudanças de redação dentro da mesma base e o critério de parada da geração.

Contexto

Benchmarks de LLM costumam reportar médias por tarefa. O IBBench-Light propõe outra leitura: o mesmo documento, dois pedidos, dois contratos. É uma forma de medir se o modelo distingue "faça isto" de "leia isto" sem confundir as duas coisas.

A escolha de modelos quantizados de instrução pesa porque são versões comprimidas, comuns em inferência local e em produção com custo controlado. Já a decodificação greedy, que sempre escolhe o token mais provável, elimina o acaso da amostragem e torna o resultado reprodutível.

O ponto mais chamativo vem da repetição fixada do Phi. Quando os pesquisadores mudaram o conjunto de tokens de fim de sequência (EOS), o sucesso exato pareado saiu de 0/144 para 62/144. O Phi, modelo testado nessa rodada fixada, mudou de resultado sem mudar de pesos. O que mudou foi a política de parada.

Por que importa

Se um modelo não sabe onde parar, o contrato de saída quebra. Isso afeta quem usa LLM para executar procedimentos vindos de documentos externos: extração de dados, agentes que seguem instruções de um arquivo, pipelines que dependem de formato exato.

O contraste entre 132 acertos de execução, 109 de processamento e 97 pares completos é o argumento do artigo. A média por tarefa do Qwen pareceria boa. A contagem pareada mostra que parte das respostas só funciona em um dos dois pedidos, o que na prática significa comportamento inconsistente do mesmo documento conforme a pergunta.

O caso do Phi reforça outro ponto: a política de parada entra no resultado final. Um benchmark que ignora o conjunto de EOS pode estar medindo o critério de parada, não a capacidade do modelo.

Impacto

Para equipes que escolhem modelos, o IBBench-Light sugere três números a olhar juntos: acerto em execução, acerto em processamento e total de pares completos. Decidir com base apenas no primeiro leva a erro.

A auditoria de exposição literal ao alvo e de normalização de maiúsculas e minúsculas aponta para um problema conhecido: parte do acerto pode vir de vazamento do alvo ou de regra de comparação frouxa. Os autores dizem ter auditado os dois pontos antes de fechar as conclusões.

Há ainda a comparação limitada com o IHEval, feita com o mesmo checkpoint do SmolLM2 e o mesmo orçamento de saída, preservando os papéis de instrução e o scorer já publicados. O SmolLM2, modelo usado nesse recorte, serve como controle de comparabilidade.

O que muda

A leitura de benchmarks muda de eixo. Em vez de uma tabela de médias, o IBBench-Light entrega pares e pede que margem de tarefa e contagem pareada sejam lidas lado a lado com a política de parada.

Para quem publica avaliação, a mensagem é testar o EOS e a normalização antes de anunciar número. Para quem consome, é desconfiar de placar sem detalhe de decodificação.

O que vem agora

O artigo está no arXiv desde 12 de setembro de 2026, com primeira visualização registrada em 15 de setembro de 2026. O resumo indica que as gerações ficam registradas, o que permite reproduzir o teste de EOS no Phi e as 1.722 gerações de CPU.

Fontes

  • arXiv cs.AI, "IBBench-Light: A Paired Evaluation of Task-Conditioned Responses to External Directives", arXiv:2609.13725v1, 12 set 2026. https://arxiv.org/abs/2609.13725