FinalityBench: benchmark mede decisões de agentes de IA sob incerteza financeira

FinalityBench: benchmark mede decisões de agentes de IA sob incerteza financeira

FinalityBench, novo benchmark publicado no arXiv, avalia agentes de IA pelo prejuízo monetário real em decisões financeiras irreversíveis sob dados atrasados e contraditórios. Uma política de bloqueio por finalidade atinge 85,4%, enquanto LLMs acertam na mesma taxa mas perdem o dobro do dinheiro.

Por Redação Mapa Paper7 set
SQL-Zero: método treina agente Text-to-SQL sem dados anotados

SQL-Zero: método treina agente Text-to-SQL sem dados anotados

Método SQL-Zero treina agentes Text-to-SQL sem nenhum dado anotado por humanos, usando self-play entre dois LLMs e execução contra o banco como única verdade. Ganhos de 6,6 pontos em 3B e 7,3 pontos em 7B no benchmark BIRD.

Por Redação Mapa Paper7 set