CADWorld: benchmark testa agentes de IA em CAD no FreeCAD
Benchmark CADWorld reúne 200 tarefas de engenharia mecânica e julga agentes pelos arquivos salvos, não pela aparência da tela
O que aconteceu
O CADWorld, benchmark para uso de computador em horizonte longo, foi publicado no arXiv em 14 de setembro de 2026, com identificação arXiv:2609.16251 (arXiv cs.AI). O CADWorld roda dentro do FreeCAD, software de CAD open source, e reúne 200 tarefas distribuídas em 11 categorias de fluxo de trabalho de engenharia mecânica. Entre elas estão sketching, modelagem de peças, montagem, CAM, FEM, medição, processamento de malha e desenho técnico.
A forma de avaliação é o ponto central. Os agentes operam por capturas de tela e ações de interface gráfica, mas o sucesso não é medido pelo que aparece no monitor. Cada tarefa tem checagens executáveis próprias, aplicadas sobre os artefatos salvos do FreeCAD e sobre saídas auxiliares. Essas checagens cobrem propriedades geométricas, estrutura paramétrica, restrições, estado de manufatura e resultados de simulação.
Sete agentes atuais foram rodados no benchmark completo. O desempenho do agente mais forte do grupo chegou a 17,5% de sucesso. A referência especialista registrada pelos autores é de 87,0% de aprovação. A página do projeto está em https://cad-world.github.io
Contexto
Agentes de computer use vêm sendo testados em ambientes de desktop realistas com frequência crescente. O problema apontado pelos autores é de cobertura: os benchmarks existentes cobrem pouco os fluxos de trabalho profissionais cujo resultado é um artefato persistente e estruturado, e não uma sequência de cliques correta.
O CAD mecânico é um caso especialmente exigente. O agente precisa manipular geometria e restrições ao longo de muitas interações e, ao final, entregar um projeto nativo cujas dimensões, estrutura de construção e estado de engenharia a jusante continuem válidos. Um erro de restrição no começo do desenho contamina tudo o que vem depois.
O material descreve um padrão de falha que separa os agentes por faixa de competência. Os mais fracos costumam falhar antes mesmo de produzir um artefato válido. Os mais fortes vão além disso e falham em requisitos estruturais, geométricos e de processo construtivo, ou seja, entregam algo que existe, mas que não passa na verificação de engenharia.
Por que importa
O CADWorld mede uma coisa que os benchmarks de interface não mediam: a validade do produto final. A diferença prática é grande para quem projeta, fabrica ou compra automação de engenharia. Um agente que acerta a tela e erra a restrição gera retrabalho, não economia.
Os números ajudam a dimensionar o gap. Um acerto de 17,5% em 200 tarefas equivale a cerca de 35 tarefas concluídas com verificação aprovada. A referência especialista de 87,0% aponta para o patamar que o fluxo profissional exige. A conclusão declarada pelos autores é direta: existe uma distância entre competência geral em GUI e execução confiável de fluxos de engenharia persistentes e verificáveis.
Isso desloca a pergunta que empresas fazem ao contratar agentes de IA. Não basta saber se o agente navega no software. A pergunta passa a ser se o arquivo que ele salva sobrevive a uma inspeção técnica.
Impacto
No curto prazo, o CADWorld vira uma régua para quem desenvolve agentes de computer use. Um resultado de 17,5% mostra que a categoria ainda não está pronta para assumir etapas de CAD sem revisão humana. No médio prazo, o benchmark cria um alvo mensurável: cada ponto de sucesso conquistado nas 11 categorias indica que o agente passou a produzir artefato válido onde antes falhava.
A cobertura escolhida pesa nesse cálculo. Categorias como CAM e FEM não verificam apenas forma. Elas checam estado de manufatura e resultados de simulação, o que aproxima o teste do que a indústria realmente exige de um projeto mecânico antes de mandá-lo para produção.
O que muda
A mudança de método é o legado imediato do CADWorld. A avaliação sai da captura de tela e entra no arquivo. O critério de aprovação é uma checagem executável sobre o artefato salvo no FreeCAD, aplicada tarefa por tarefa, cobrindo geometria, parâmetros, restrições, manufatura e simulação.
Esse desenho também explica por que os agentes mais avançados travam em requisitos estruturais. Passar a barreira inicial de produzir algo válido resolve só a primeira parte do problema. A segunda parte é manter consistência construtiva ao longo de um horizonte longo de interação.
O que vem agora
O projeto do CADWorld, com as 200 tarefas e as checagens executáveis, está acessível em https://cad-world.github.io. O material não informa cronograma de versões futuras nem a lista nominal dos sete agentes avaliados. O que está declarado é o conjunto completo de tarefas em 11 categorias de CAD mecânico e a comparação entre o melhor agente, com 17,5% de sucesso, e a referência especialista, com 87,0%.
Fontes
- arXiv cs.AI: CADWorld: Computer-Use Benchmark for Long-Horizon Computer-Aided Design (https://arxiv.org/abs/2609.16251)
- Página do projeto CADWorld (https://cad-world.github.io)
