FinalityBench: benchmark mede decisões de agentes de IA sob incerteza financeira

Novo benchmark do arXiv avalia agentes pelo efeito monetário real das decisões, não pela taxa de acerto

Por Marcos Guimarães7 set 2026
FinalityBench: benchmark mede decisões de agentes de IA sob incerteza financeira

O que aconteceu

O arXiv publicou em 4 de setembro de 2026 o artigo "FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality" (arXiv:2609.04706v1). O FinalityBench é um benchmark executável que simula um problema real de pagamentos: o processador de pagamentos, o ledger, o ERP e o feed bancário de um comerciante recebem mensagens atrasadas, duplicadas, descartadas e reordenadas. Por minutos, os quatro sistemas mantêm crenças contraditórias sobre o mesmo pedido.

O agente que resolve a exceção precisa decidir entre enviar a mercadoria, reenviar uma captura, reembolsar ou esperar, sabendo que algumas dessas ações não podem ser desfeitas. O benchmark mantém um log de eventos canônico oculto e deriva a visão de cada sistema a partir de um fluxo de entrega com falhas especificadas, de modo que a divergência surge de semântica de falha definida, e não de casos escritos à mão.

A nota é calculada sobre efeitos monetários executados: cada episódio é pontuado pela posição econômica terminal do comerciante, comparada a uma referência privilegiada que sabe quando a captura pendente se resolve.

Contexto

Benchmarks tradicionais de agentes medem acerto por tarefa. O FinalityBench propõe outra métrica: a perda financeira pareada. O corpus tem 321 tarefas, incluindo 45 pares gêmeos (90 tarefas): casos em que as quatro visões dos sistemas são idênticas no instante da decisão, as sondas autoritativas retornam "desconhecido" nas duas versões, mas as disposições corretas finais divergem. A indistinguibilidade do snapshot é verificada em cada seed de avaliação, não assumida.

Nos 14.445 episódios avaliados com nove políticas programáticas, os rankings por acerto individual e por perda pareada divergem em 7 posições. Uma política que envia a mercadoria ao primeiro sinal é a segunda melhor por acerto, com 65,7%, e a pior do conjunto em perda pareada, porque não consegue distinguir os membros de um par gêmeo.

Por que importa

O resultado mais relevante para quem constrói agentes: uma política que bloqueia ações irreversíveis até uma sonda autoritativa de finalidade responder atinge 85,4% de acerto e, diferente de todas as políticas de polling, não perde nada nos pares gêmeos. Sua perda residual vem quase toda de um único arquétipo, que precifica diretamente a informação de finalidade.

Modelos de linguagem alcançaram a mesma taxa exata do gate escrito à mão em um subconjunto estratificado, mas perderam cerca de duas vezes mais dinheiro. O detalhe positivo: os LLMs descobriram sozinhos a estratégia de bloqueio por finalidade, sem que ela fosse informada.

Impacto

Para equipes de engenharia e produto em fintechs e e-commerce, o benchmark mostra que taxa de acerto é uma métrica perigosa em decisões com efeitos irreversíveis. Dois agentes com acerto parecido podem ter resultados financeiros muito diferentes quando a avaliação considera pares de cenários indistinguíveis no momento da decisão. A métrica de perda pareada do FinalityBench captura exatamente esse risco.

O que muda

A avaliação de agentes passa a ter um exemplo concreto de grading por efeito monetário executado, com log canônico oculto e falhas de entrega especificadas. Isso reduz o risco de benchmarks "costurados" e aproxima a avaliação do prejuízo real que um agente causa ao operar sistemas de pagamento.

O que vem agora

O artigo está disponível no arXiv (2609.04706) com PDF e código associado. A próxima etapa natural, indicada pelos próprios resultados, é usar o benchmark para comparar políticas de gating de finalidade contra LLMs em cenários mais amplos, já que a perda residual do gate se concentra em um arquétipo que precifica informação de finalidade.