Limitar o juiz de IA supera voto majoritário em pipelines
Em GSM8K e HotpotQA, subordinar o juiz a uma regra baseada em evidências melhorou a resposta final
O que aconteceu
Pesquisadores testaram um juiz baseado em LLM, um DeepSeek-R1-7B sem restrições, sobre pools congelados de candidatos gerados por quatro políticas GRPO. O ganho sobre a votação majoritária por resposta foi marginal: +1,0 ponto percentual em 500 questões do GSM8K e +0,34 de exact match (EM) em 300 questões do HotpotQA. Em um split de confirmação de 30 questões, o juiz ficou 10 pontos abaixo da votação majoritária: destruiu acurácia enquanto atribuía pontuações confiantes (arXiv:2608.07813).
Contexto
LLM judges são cada vez mais usados para avaliar e selecionar respostas geradas por modelos em pipelines de raciocínio. A prática comum é tentar calibrar o modelo julgador; a pesquisa sugere que o problema é estrutural. A solução proposta é o EL-DGR (Evidence-Locked Derive-Gate-Repair), uma regra adaptativa não compensatória que só permite ao juiz sobrepor um consenso apoiado por evidências quando existe um certificado extrativo de evidência. Reparos são admitidos apenas quando nenhuma alternativa está certificada e o próprio reparo está.
Por que importa
O achado muda o foco de quem opera sistemas de IA em produção: tentar tornar o juiz mais acurado pode render menos do que limitar seu raio de decisão. Para equipes de engenharia no Brasil que montam pipelines com modelos como DeepSeek, a regra de seleção é uma alavanca barata, pois não exige novo treinamento nem mais orçamento de inferência.
Impacto
Com o EL-DGR, o mesmo juiz alcançou 58,2% no GSM8K, contra 56,8% do juiz livre, 55,8% da votação majoritária e 55,4% do primeiro candidato GRPO. No HotpotQA, foram 17,33 de EM e 25,46 de F1, contra 15,67/23,49 do juiz, 15,33/23,19 da maioria e 15,33/22,97 do primeiro candidato. A melhora sobre o primeiro candidato foi de +2,8 pontos percentuais (McNemar p=0,0026) e +2,00 de EM (p=0,070, marginal). A auditoria de decisões mostrou que o EL-DGR reverteu o consenso em apenas 8 das 30 questões piloto e nunca converteu um consenso correto em resposta incorreta.
O que muda
O paper também reporta o que não funcionou. A decomposição em sete canais usada como recompensa de treinamento em nível de passo foi nula, e ablações de channel-drop mostraram que nenhum canal é individualmente necessário (p=1,0 em todos os testes). Isso reforça a conclusão dos autores: o problema não é a acurácia do juiz, e sim a admissibilidade do seu poder de decisão.
O que vem agora
A recomendação prática do estudo é direta: limitar o raio de impacto do juiz em vez de tentar deixá-lo mais preciso. O EL-DGR precisa ser validado em outros domínios e em cenários de produção, incluindo aplicações em português. O artigo foi submetido ao arXiv em 7 de agosto de 2026.
Fontes
arXiv — When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines (arXiv:2608.07813)
https://arxiv.org/abs/2608.07813
