Benchmark revela: IA resolve geometria olímpica, mas falha ao desenhar diagramas
Pesquisadores lançam conjunto de 954 problemas de olimpíada para medir raciocínio diagramático em modelos como GPT e Claude.
O que aconteceu
Pesquisadores lançaram o benchmark "Solving Is Not Drawing", um conjunto de dados open-source com 954 problemas de geometria olímpica, incluindo um subconjunto difícil de 297 problemas. Cada problema vem com solução e um diagrama de alta fidelidade criado por humanos em código Asymptote renderizável. O objetivo é medir o que os autores chamam de "raciocínio diagramático" — a capacidade de construir a figura geométrica correta, não apenas chegar à resposta numérica (arXiv:2608.18111, submetido em 23 de junho de 2026).
Ao avaliar modelos de fundação atuais, os pesquisadores encontraram uma taxa média de compilação de apenas 36,14% para os diagramas gerados. Ou seja, menos de 4 em cada 10 figuras produzidas pelos modelos conseguem ser renderizadas sem erros.
Contexto
Modelos como GPT e Claude já demonstram proficiência notável em matemática de nível olímpico, e a resolução de problemas de geometria tornou-se um proxy padrão para avaliar raciocínio matemático. No entanto, resolver um problema e desenhar a figura da qual ele depende são habilidades distintas. O progresso em geometria muitas vezes depende de um diagrama fiel, com construções auxiliares e incidências corretas. Benchmarks existentes, como MathVista e MathVerse, medem se os modelos chegam à resposta certa, mas nenhum isolava a habilidade de construir o diagrama em si.
Por que importa
Essa lacuna tem implicações práticas. Se um sistema de IA é usado para auxiliar no ensino de matemática ou na geração de materiais didáticos, ele precisa não apenas resolver o problema, mas também produzir figuras precisas que ajudem na compreensão. A incapacidade de desenhar diagramas corretos pode limitar a aplicação desses modelos em áreas como educação, publicação científica e engenharia assistida por computador.
Impacto
O benchmark revela que forte raciocínio matemático não implica a capacidade de construir diagramas geométricos precisos. Isso sugere que os modelos atuais tratam a resolução de problemas e a geração de figuras como tarefas desconexas, sem integrar o conhecimento geométrico necessário para a visualização. A curto prazo, isso pode levar a respostas corretas acompanhadas de ilustrações erradas ou incompletas, minando a confiança em sistemas automatizados. A médio prazo, o benchmark pode impulsionar o desenvolvimento de modelos que combinem raciocínio simbólico com geração visual coerente.
O que muda
Pesquisadores e desenvolvedores agora têm uma ferramenta para avaliar e comparar especificamente a habilidade de desenhar diagramas. O conjunto de dados, disponível no Hugging Face, inclui métricas baseadas em texto, código, imagem, VLM e restrições, permitindo uma análise multifacetada. Isso pode levar a novas abordagens de treinamento que incorporem a geração de diagramas como parte do processo de resolução de problemas.
O que vem agora
Os autores disponibilizaram o benchmark e o dataset publicamente em https://huggingface.co/datasets/max98765/hard_geometry_problems_with_diagrams A comunidade de IA pode usar esses dados para desenvolver modelos mais robustos, que não apenas resolvam, mas também visualizem problemas geométricos. Espera-se que próximas iterações de modelos de fundação incorporem essa capacidade, reduzindo a lacuna entre resolver e desenhar.
