FinalityBench: benchmark mede decisões de agentes de IA sob incerteza financeira
Novo benchmark do arXiv avalia agentes pelo efeito monetário real das decisões, não pela taxa de acerto
O que aconteceu
O arXiv publicou em 4 de setembro de 2026 o artigo "FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality" (arXiv:2609.04706v1). O FinalityBench é um benchmark executável que simula um problema real de pagamentos: o processador de pagamentos, o ledger, o ERP e o feed bancário de um comerciante recebem mensagens atrasadas, duplicadas, descartadas e reordenadas. Por minutos, os quatro sistemas mantêm crenças contraditórias sobre o mesmo pedido.
O agente que resolve a exceção precisa decidir entre enviar a mercadoria, reenviar uma captura, reembolsar ou esperar, sabendo que algumas dessas ações não podem ser desfeitas. O benchmark mantém um log de eventos canônico oculto e deriva a visão de cada sistema a partir de um fluxo de entrega com falhas especificadas, de modo que a divergência surge de semântica de falha definida, e não de casos escritos à mão.
A nota é calculada sobre efeitos monetários executados: cada episódio é pontuado pela posição econômica terminal do comerciante, comparada a uma referência privilegiada que sabe quando a captura pendente se resolve.
Contexto
Benchmarks tradicionais de agentes medem acerto por tarefa. O FinalityBench propõe outra métrica: a perda financeira pareada. O corpus tem 321 tarefas, incluindo 45 pares gêmeos (90 tarefas): casos em que as quatro visões dos sistemas são idênticas no instante da decisão, as sondas autoritativas retornam "desconhecido" nas duas versões, mas as disposições corretas finais divergem. A indistinguibilidade do snapshot é verificada em cada seed de avaliação, não assumida.
Nos 14.445 episódios avaliados com nove políticas programáticas, os rankings por acerto individual e por perda pareada divergem em 7 posições. Uma política que envia a mercadoria ao primeiro sinal é a segunda melhor por acerto, com 65,7%, e a pior do conjunto em perda pareada, porque não consegue distinguir os membros de um par gêmeo.
Por que importa
O resultado mais relevante para quem constrói agentes: uma política que bloqueia ações irreversíveis até uma sonda autoritativa de finalidade responder atinge 85,4% de acerto e, diferente de todas as políticas de polling, não perde nada nos pares gêmeos. Sua perda residual vem quase toda de um único arquétipo, que precifica diretamente a informação de finalidade.
Modelos de linguagem alcançaram a mesma taxa exata do gate escrito à mão em um subconjunto estratificado, mas perderam cerca de duas vezes mais dinheiro. O detalhe positivo: os LLMs descobriram sozinhos a estratégia de bloqueio por finalidade, sem que ela fosse informada.
Impacto
Para equipes de engenharia e produto em fintechs e e-commerce, o benchmark mostra que taxa de acerto é uma métrica perigosa em decisões com efeitos irreversíveis. Dois agentes com acerto parecido podem ter resultados financeiros muito diferentes quando a avaliação considera pares de cenários indistinguíveis no momento da decisão. A métrica de perda pareada do FinalityBench captura exatamente esse risco.
O que muda
A avaliação de agentes passa a ter um exemplo concreto de grading por efeito monetário executado, com log canônico oculto e falhas de entrega especificadas. Isso reduz o risco de benchmarks "costurados" e aproxima a avaliação do prejuízo real que um agente causa ao operar sistemas de pagamento.
O que vem agora
O artigo está disponível no arXiv (2609.04706) com PDF e código associado. A próxima etapa natural, indicada pelos próprios resultados, é usar o benchmark para comparar políticas de gating de finalidade contra LLMs em cenários mais amplos, já que a perda residual do gate se concentra em um arquétipo que precifica informação de finalidade.
