IBBench-Light: benchmark mede IA em diretivas externas
O IBBench-Light, novo benchmark publicado no arXiv, cobra acerto nos dois lados de um mesmo registro externo e mostra que o Qwen fecha 97 pares completos apesar de 132 acertos de execução. Trocar o conjunto de EOS levou o Phi de 0/144 para 62/144.
