Policy as Code vence CAR-bench com harness de coroutine
Paper usou código Python executável no lugar de regras de prompt, cortou chamadas de modelo e serviu 78% dos tokens de entrada via cache
O que aconteceu
O paper arXiv:2609.29251v1, submetido em 24 de setembro de 2026 na categoria de Inteligência Artificial do arXiv, apresenta um harness de coroutine-bridge para o CAR-bench. A proposta central é simples de enunciar e incomum na prática: a única ação que o modelo pode emitir é um programa Python que bloqueia e retoma no lugar, no meio das trocas de ferramentas do avaliador.
Isso separa a invocação do modelo das idas e voltas de ferramentas. No split público de teste, o agente passa a usar uma mediana de duas chamadas de modelo contra sete turnos de agente por tarefa. Uma tarefa multi-turno completa é resolvida com mediana de 1,8 segundo de latência de modelo no gpt-oss-120b rodando na Cerebras.
Na avaliação oculta oficial, o harness venceu a Track 2 com 60,0% de Pass^3, 4,5 vezes o baseline dos organizadores do CAR-bench. O trabalho também registrou o menor custo estimado e a latência mediana mais rápida, de 3,14 segundos, entre todas as entradas que superaram aquele baseline.
Os tokens de cache são outro número do paper. O prompt congelado da submissão serviu 78% dos tokens de entrada a partir de cache, chegando a 86,6% na cauda quente. No corpus de três semanas de desenvolvimento, o índice ficou em 73%, porque edições no prompt redefiniam o cache repetidamente.
Contexto
O CAR-bench foi desenhado para medir se agentes que usam ferramentas continuam confiáveis sob incerteza do mundo real. A escolha de arquitetura do benchmark é o ponto de partida do problema: cada ferramenta roda dentro do próprio avaliador, então cada troca de resultado de ferramenta é um round-trip separado do agente.
Um agente convencional de próxima ação consegue agrupar chamadas paralelas de ferramentas. O gargalo aparece nas cadeias de chamadas dependentes. Nesse caso, o custo é de uma chamada de modelo por rodada de resultados, o que multiplica latência e gasto conforme a tarefa se alonga.
O harness de coroutine-bridge ataca exatamente esse ponto. Ao transformar a ação do modelo em código executável, o programa emitido pode pausar e continuar sem exigir uma nova ida ao modelo a cada resultado intermediário.
Por que importa
Como a superfície de ação é código executável, as políticas determinísticas do CAR-bench são codificadas diretamente como lógica na camada de ferramentas, e não como regras em prompt. A consequência prática é a conformidade aplicada a custo de raciocínio zero.
Há também um efeito de stack no gasto. Um único prompt estático, com o estado específico de cada tarefa anexado na cauda, permanece byte a byte idêntico entre chamadas e entre tarefas. Essa combinação com o desenho de poucas chamadas comprime o compute de entrada nominal a uma fração pequena.
O paper reporta ainda que a definição congelada da submissão foi a mesma usada no resultado oficial, sem ajuste posterior.
Impacto
O teste de generalização veio na trilha Open. O mesmo harness, sem alterações, reproduziu 60,0% de Pass^3 com o GPT-5.5, empatando com agentes de modelos de fronteira. Isso indica que o ganho não estava preso ao gpt-oss-120b da Cerebras nem a um ajuste específico de modelo.
Para equipes que constroem agentes com ferramentas, o dado mais relevante é a razão entre chamadas de modelo e turnos de agente: duas contra sete no split público. Menos chamadas significam menos latência acumulada e menos custo por tarefa, dois gargalos conhecidos em produção de agentes multi-turno.
O que muda
A mudança de método é deslocar a política de conformidade do prompt para o código. Em vez de instruir o modelo a seguir regras em linguagem natural, o harness faz as regras viverem na camada de ferramentas, onde são aplicadas de forma determinística.
O uso de cache deixa de ser um detalhe de infraestrutura e passa a integrar o desenho. Editar o prompt durante o desenvolvimento derruba o aproveitamento, como mostram os 73% do corpus de três semanas contra os 78% da submissão congelada.
O que vem agora
O paper não anuncia cronograma de produto, código aberto nem próxima submissão ao CAR-bench. Os resultados divulgados se limitam ao split público de teste, à avaliação oculta oficial da Track 2 e à reprodução na trilha Open com o GPT-5.5. Nenhum prazo adicional foi informado no material.
FONTES
- arXiv cs.AI, Policy as Code: A Coroutine-Bridge Harness for Fast-Reasoning Reliability on CAR-bench (arXiv:2609.29251v1) https://arxiv.org/abs/2609.29251
