IA gera empresas fictícias consistentes em 66 sistemas
Sistema monta empresa completa, de clientes a chamadas gravadas, e mede o realismo sem comparar com base real
O que aconteceu
O artigo "Generating a Consistent Enterprise: Synthesis and Reference-Free Evaluation of Multi-System Business Data" foi submetido ao arXiv em 10 de setembro de 2026, sob o identificador arXiv:2609.11286v1, na área de Inteligência Artificial (cs.AI). Um gerador de dados sintéticos que funciona sem nenhum conjunto de dados real, nem na entrada nem na saída, é a proposta central do estudo.
A operação é direta. O usuário informa uma indústria, um porte de empresa, um modelo de negócio, um conjunto de aplicações corporativas e uma semente aleatória. O sistema devolve uma empresa fictícia completa: força de trabalho, base de clientes, negócios de vendas, tickets de suporte, chamadas gravadas, mensagens de chat e documentos.
O detalhe técnico mais concreto é o grafo de entidades único, projetado nos formatos nativos de 66 produtos de negócio. O mesmo cliente aparece no CRM, no sistema de suporte e no sistema de chamadas sob uma única identidade. É isso que evita o problema clássico das bases sintéticas, em que cada arquivo conta uma história diferente.
Contexto
Dados relacionais sintéticos costumam ser produzidos por um modelo treinado em um conjunto real, e a qualidade é medida como distância até esse conjunto. O trabalho inverte as duas pontas do processo. Sem base real de referência, o realismo passa a ser construído a partir de estatísticas citadas na literatura e verificado por medição sem referência.
A avaliação usa três instrumentos. O primeiro é um scorecard de cinco eixos com 28 checagens estatísticas. O segundo é um detector adversarial que caça marcas típicas de geração sintética. O terceiro é um conjunto de testes de solidez, entre eles um classificador comparado a uma cópia embaralhada dos dados de forma independente.
Como esses instrumentos já existiam antes do ajuste fino do gerador, o progresso foi medido com régua fixa, sem trocar o critério no meio do caminho. Ao longo de 23 empresas geradas, o realismo médio subiu de 60,3 para 99,1. A empresa mais fraca do lote saiu de 41,1 para 94,9. O detector adversarial, que no início sinalizava 55,2% de todos os registros, agora não sinaliza nenhum.
Os números se mantêm em uma semente que nunca foi usada durante o desenvolvimento, o que separa o resultado de um ajuste cego ao conjunto de teste.
Um segundo gerador, também descrito no artigo, monta bancos de dados relacionais a partir de uma lista de perguntas de negócio. Ele força linhas qualificadas para cada pergunta respondível, adiciona erros próximos controlados e calcula rótulos exatos a partir das tabelas finalizadas.
Por que importa
Empresas que precisam testar sistemas com dados realistas esbarram em dois limites: privacidade e disponibilidade. Bases reais carregam informação sensível, e nem sempre podem circular entre times de engenharia, fornecedores e ambientes de teste. Uma empresa fictícia completa, gerada sob especificação, contorna boa parte desse atrito.
A consistência entre os 66 produtos é o ponto que muda o jogo na prática. Sem ela, um modelo de IA treinado ou avaliado com esses dados aprende a lidar com cadastros que não batem entre sistemas, algo que quase nunca acontece em uma operação real. Com o grafo único de entidades, o mesmo cliente no CRM e no sistema de chamadas é literalmente o mesmo cliente.
O segundo gerador ataca outro problema conhecido. Ao forçar linhas qualificadas para cada pergunta respondível e adicionar erros próximos controlados, ele cria casos em que a resposta certa existe, mas a quase-certa também aparece. É exatamente esse tipo de armadilha que separa uma avaliação útil de um teste fácil demais.
Impacto
O serviço roda hoje de forma hospedada, em console.era.eon.io. Uma empresa construída ali a partir de uma especificação é servida por seus simuladores via MCP e REST, os dois protocolos que ferramentas de IA e sistemas corporativos usam para se conectar a fontes externas.
Na prática, isso significa que um agente de IA pode conversar com o CRM, o service desk e o sistema de telefonia de uma empresa que não existe, sem que ninguém precise mascarar dados de clientes reais. Os simuladores também foram publicados como imagens de contêiner, o que permite rodar tudo offline, dentro da infraestrutura de quem for usar.
Para fornecedores de software corporativo, o caminho de menor resistência deixa de ser montar bases de demonstração à mão e passa a ser gerar uma empresa inteira a partir de parâmetros. Para times de avaliação de modelos, surge um substituto mensurável para o dado real, com nota de realismo e detector adversarial embutidos.
O que muda
A mudança de método é o que sustenta o resultado. Medir dados sintéticos pela distância até uma base real sempre amarrou a qualidade do gerador à qualidade e à disponibilidade dessa base. A medição sem referência rompe esse vínculo e permite avaliar um gerador que não tem contraparte real alguma.
O segundo ponto é a régua fixa. Como o scorecard de 28 checagens, o detector e os testes de solidez foram definidos antes do ajuste fino, a evolução de 60,3 para 99,1 em realismo médio não pode ser explicada por um critério que amoleceu no meio do processo.
O que vem agora
O gerador já está disponível como serviço hospedado e como imagens de contêiner para uso offline. O próximo passo natural é a adoção por times que hoje dependem de bases mascaradas ou de dados de demonstração limitados, além da reprodução independente dos números relatados, incluindo o desempenho em sementes nunca vistas.
Fontes
- arXiv cs.AI: Generating a Consistent Enterprise: Synthesis and Reference-Free Evaluation of Multi-System Business Data (arXiv:2609.11286v1) - https://arxiv.org/abs/2609.11286
