Era by Eon cria benchmark com empresa fictícia para testar agentes de IA

Ferramenta simula Salesforce, Zendesk, Slack e Gong em uma corporação fictícia para medir LLM agents sem tocar em dados de clientes

Por Marcos Guimarães11 set 2026
Era by Eon cria benchmark com empresa fictícia para testar agentes de IA

O que aconteceu

O Era by Eon Benchmark foi submetido ao arXiv em 9 de setembro de 2026 e apareceu como novidade na seção de inteligência artificial do repositório em 11 de setembro. O artigo é identificado como arXiv:2609.09853v1 e trata de um problema conhecido de quem desenvolve agentes para empresas: LLM agents que operam sistemas corporativos de registro não podem ser avaliados em dados de produção de clientes reais, e nenhum substituto disponível até agora entrega ground truth, ou seja, a resposta correta verificável.

A proposta do Era by Eon Benchmark, ferramenta criada para avaliar LLM agents que usam ferramentas corporativas, é construir uma empresa fictícia completa. O benchmark inclui simuladores de produtos, bancos de dados internos específicos da companhia, perguntas de avaliação e gabaritos calculados.

Cinco parâmetros definem cada empresa gerada: indústria, tamanho, modelo de negócio, portfólio de aplicações e uma seed. Um único grafo de entidades com seed fornece os dados compartilhados da companhia para os simuladores de Salesforce, Zendesk, Slack, Gong e outros produtos. Os simuladores de Salesforce, Zendesk, Slack e Gong puxam informações do mesmo grafo, o que garante coerência entre eles.

Um gerador condicionado por pergunta cria os schemas e os registros dos bancos internos. Esse gerador parte das mesmas entidades, chaves e valores do grafo antes de produzir os fatos específicos de cada banco. Os dois mecanismos, portanto, descrevem um único ambiente corporativo consistente.

A validação aparece em números. Em 23 empresas geradas, a pontuação média de realismo subiu de 61,8 para 97,0, e nenhum registro foi sinalizado como sintético. Checagens de design e de gabarito validam os bancos internos, enquanto um scorecard de realismo e um detector adversarial validam o grafo de entidades.

Contexto

Avaliar agente de IA em ambiente corporativo sempre esbarrou em um dilema prático. Usar dados reais de clientes expõe informação sensível e viola contratos. Usar dados artificiais simples produz testes que não se parecem com a bagunça de um CRM de verdade, com registros duplicados, campos vazios e nomes de contas inconsistentes.

O Era by Eon Benchmark ataca exatamente essa lacuna. O artigo afirma que nenhum substituto existente fornece ground truth para esse tipo de avaliação. A saída encontrada foi gerar o ambiente inteiro e depois calcular a resposta esperada a partir dos registros finais, não de um gabarito escrito à mão. Toda resposta esperada é computada dos registros finais, o que torna a correção exata.

Esse desenho importa porque o gabarito escrito à mão envelhece. Se o banco muda, a resposta certa muda junto. Quando o gabarito é derivado dos próprios dados finais, ele acompanha a geração automaticamente.

Por que importa

Para quem compra agentes de IA corporativos, a pergunta que raramente tem resposta clara é: quanto esse agente realmente acerta nas tarefas do meu dia a dia? Fornecedores divulgam benchmarks próprios, muitas vezes sem detalhar o critério de correção. O Era by Eon Benchmark tenta padronizar essa medição com empresas geradas em escala e gabarito auditável.

O benchmark também expõe o tamanho do problema. Na trilha de comparação de simuladores, nove modelos responderam às mesmas 33 perguntas três vezes cada. As estimativas de acurácia ficaram entre 42,4% e 76,8%. Ou seja: mesmo o melhor modelo testado errou quase um quarto das perguntas nesse recorte.

A diferença entre 42,4% e 76,8% é grande. Ela indica que a escolha do modelo não é detalhe operacional, é decisão de arquitetura para quem vai colocar um agente para mexer em Salesforce, Zendesk ou Slack.

Impacto

As 23 empresas geradas mostram que o método escala. A pontuação média de realismo saiu de 61,8 e chegou a 97,0, com zero registros marcados como sintéticos pelo detector adversarial. Se o ambiente gerado é suficientemente realista, ele substitui o teste em produção que hoje é inviável.

O efeito prático para fornecedores de agentes é a pressão por transparência. Um benchmark com gabarito calculado e ambiente replicável permite que terceiros rodem o mesmo teste, com a mesma seed e os mesmos parâmetros, e cheguem ao mesmo resultado.

Do lado de quem compra, o impacto é na due diligence. Em vez de aceitar a métrica de marketing do fornecedor, a equipe técnica pode exigir desempenho em tarefas equivalentes às de uma empresa com o mesmo porte, setor e portfólio de aplicações.

O que muda

O benchmark também revela um limite estatístico que muita avaliação de IA ignora. Na comparação de simuladores, das 36 diferenças pareadas entre modelos, apenas três permaneceram sustentadas após correção. Isso significa que a maior parte das diferenças observadas entre os nove modelos não resiste ao ajuste estatístico.

A leitura prática é dura para o mercado. Rankings de agentes com poucas perguntas e poucas repetições produzem conclusões frágeis. O Era by Eon Benchmark fez três rodadas por modelo em 33 perguntas e ainda assim encontrou poucas diferenças robustas.

O que vem agora

O artigo foi submetido em 9 de setembro de 2026 e está disponível no arXiv com PDF e versão HTML experimental. A página do repositório lista ferramentas de citação, exploração bibliográfica e conjuntos de dados associados ao trabalho.

Não há, no material divulgado, prazo para uma versão pública do benchmark ou para a inclusão de novos simuladores além de Salesforce, Zendesk, Slack e Gong. O caminho natural é a comunidade replicar as 23 empresas geradas, testar mais modelos e verificar se as três diferenças pareadas que sobreviveram à correção se mantêm.

Fontes

  • arXiv cs.AI: The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents (arXiv:2609.09853v1, submetido em 9 de setembro de 2026). https://arxiv.org/abs/2609.09853