DiG-bench: benchmark de IA para descoberta em jogos
Conjunto de jogos do arXiv avalia capacidade de modelos de IA de formular generalizações por experimentação
O que aconteceu
O DiG-bench foi lançado em 12 de agosto de 2026 no arXiv (arXiv:2608.12593). O benchmark é composto por 70 jogos independentes, cada um codificado como uma string curta com regras de transformação únicas que precisam ser descobertas por interação e experimentação. Os níveis de cada jogo apresentam desafios para testar se as regras foram descobertas, com condições de vitória também desconhecidas. Os jogos são organizados em sete níveis de dificuldade: o mais baixo é resolvido rotineiramente por vários modelos, enquanto o mais alto desafia os melhores modelos em harnesses agentic. Todos os 70 jogos foram resolvidos por pelo menos um humano na primeira tentativa. Um subconjunto de 21 jogos é público; o restante é mantido privado para avaliação segura.
Contexto
A descoberta — formular generalizações novas — é parte central do processo científico, mas há uma lacuna nos benchmarks atuais de IA: poucos testam diretamente a capacidade de descobrir novos conhecimentos por experimentação em ambientes controlados onde o objetivo é desconhecido. O DiG-bench surge para preencher essa lacuna, oferecendo um ambiente controlado com regras ocultas.
Por que importa
Para o mercado de IA, benchmarks como o DiG-bench são essenciais para medir progresso em capacidades além de tarefas específicas. A descoberta de regras é fundamental para agentes autônomos, pesquisa científica automatizada e sistemas que precisam se adaptar a novos ambientes. No Brasil, o avanço de modelos de IA depende de avaliações robustas que indiquem limitações reais.
Impacto
O DiG-bench pode se tornar referência para avaliar agentes de IA em tarefas de descoberta. A divisão entre jogos públicos e privados evita overfitting e permite avaliação justa. A dificuldade escalonada em sete níveis permite medir progresso incremental. A curto prazo, espera-se que pesquisadores testem seus modelos e publiquem resultados; a médio prazo, o benchmark pode influenciar o design de agentes mais capazes de generalizar.
O que vem agora
Os pesquisadores disponibilizaram 21 jogos publicamente; os demais permanecem privados para avaliação segura. A comunidade de IA pode começar a testar os jogos públicos e submeter resultados. Não há informações detalhadas sobre atualizações futuras, mas a expectativa é que o benchmark seja usado em competições e pesquisas.
