SemPlan: Benchmark mede acerto de LLMs em consultas a dados empresariais e aponta limites
Novo benchmark com 1.800 casos em inglês e português avalia quatro arquiteturas e mostra que estruturas complexas não garantem respostas corretas
O que aconteceu
Pesquisadores publicaram o SemPlan, um benchmark determinístico e bilíngue (inglês e português brasileiro) para avaliar a capacidade de LLMs de transformar consultas vagas em dados empresariais em ações executáveis e governadas. O conjunto de dados contém 1.800 casos, sendo 1.200 formando um subconjunto de avaliação científica. Foram comparadas quatro arquiteturas sob a mesma configuração de modelo: geração direta de SQL (A1), um agente de ferramentas com limites (A2), geração de solicitação semântica estruturada seguida de planejamento determinístico (A3), e uma variante com esclarecimento e estado (A4). A análise, baseada em 4.800 registros primários, revelou uma taxa de acerto absoluta baixa: 22,25% para A1, 22,58% para A2, 25,67% para A3 e 24,25% para A4 (arXiv, 12/ago/2026).
Contexto
Interfaces naturais para dados empresariais enfrentam um dilema central: transformar pedidos subespecificados em comportamentos executáveis e governados, ao mesmo tempo em que controlam consultas inválidas, falhas de política, custos e não determinismo. Até agora, faltava um benchmark focado nesse design arquitetônico específico, que pudesse comparar abordagens de forma controlada. O SemPlan foi criado para preencher essa lacuna, testando se adicionar camadas de estrutura e planejamento melhora os resultados frente a abordagens mais simples, como a geração direta de SQL.
Por que importa
O resultado tem implicações diretas para empresas que buscam implementar assistentes de dados ou agentes de IA. O estudo mostra que não existe uma arquitetura universal vencedora. A abordagem com maior acerto (A3) também envolve mais complexidade. Por outro lado, a geração direta de SQL (A1), apesar de menos acertada, apresentou a maior taxa de conformidade com políticas e a menor taxa de respostas inseguras ou inválidas. Para gestores de TI, isso significa que a escolha da arquitetura não deve ser apenas sobre acurácia, mas um equilíbrio entre precisão, segurança, custo de API e controle de erros.
Impacto
No curto prazo, o estudo desacelera o hype ao demonstrar que, mesmo com configurações idênticas, a taxa de acerto das LLMs para consultas complexas e governadas permanece baixa (abaixo de 26%). Empresas precisarão investir em revisão humana, validação de dados e governança rígida, independentemente da arquitetura escolhida. A médio prazo, o benchmark pode direcionar o desenvolvimento de modelos focados em tarefas de planejamento semântico e em português, já que o conjunto de dados é bilíngue e os resultados incluem especificamente o contexto do mercado brasileiro.
O que muda
Os resultados indicam que restrições estruturais adicionais alteram os modos de falha e a eficiência, mas não melhoram monotonamente a correção. A arquitetura A4, que incorpora esclarecimento interativo, apresentou o menor custo médio de API e a menor taxa de falsa recusa, sugerindo que sistemas que sabem quando "não sei responder" podem ser mais eficientes em termos de recursos. A repetibilidade das respostas corretas, testada em um subconjunto de 150 casos, foi alta (entre 92% e 98,67%), mostrando que o problema não é aleatoriedade, mas capacidade de resolução.
O que vem agora
A pesquisa abre caminho para benchmarkings mais específicos que incluam turnos múltiplos, consistência de estado e integração com políticas reais de empresas. O código e os dados do SemPlan devem servir de base para trabalhos futuros focados em resolver a ambiguidade e melhorar a precisão em ambientes de dados empresariais, onde o custo de um erro pode ser alto. A próxima fronteira não é apenas acertar mais, mas fazer isso de forma segura, econômica e previsível.
