SCAFFOLD: dataset brasileiro-alcance global ensina IA a ler diagramas científicos
Novo dataset público, criado a partir de 3.058 artigos do arXiv, combina figuras, perguntas e raciocínio passo a passo.
O que aconteceu
O SCAFFOLD (Structured Computer science And Figure FOrmats for LLM Learning from Diagrams) é um novo dataset público apresentado no arXiv em 20 de agosto de 2026 (arXiv:2609.00018v1). Ele foi criado pela equipe do pesquisador Ranjir Raut, que também o disponibilizou no GitHub (github.com/theranjitraut/scaffold). O dataset combina imagens de figuras de artigos de ciência da computação com legendas, contexto, perguntas, respostas e etapas de raciocínio, no formato (image, caption, context, question-answer, chain-of-thought).
O SCAFFOLD-157K, a versão grande do dataset, contém 157.387 pares de pergunta e resposta, distribuídos por 29.887 figuras oriundas de 3.058 artigos. A versão média, chamada SCAFFOLD-37K, tem 36.797 pares, e a versão pequena, SCAFFOLD-12K, possui 12.000 pares. Os pesquisadores usaram a versão SCAFFOLD-12K para realizar experimentos iniciais com o modelo Qwen2.5-VL-3B-Instruct.
Contexto
Artigos de ciência da computação dependem fortemente de diagramas, como desenhos de arquiteturas de sistemas, fluxogramas e esquemas de pipelines. Essas figuras frequentemente carregam mais informação do que o texto ao redor, mas não existia um dataset público que associasse esse tipo específico de figura a legendas, contexto, perguntas, respostas e raciocínio passo a passo. Sem esse material, os modelos de visão e linguagem (VLMs) não conseguem ser treinados adequadamente para interpretar essas representações visuais.
O SCAFFOLD preenche essa lacuna. O dataset foi preparado usando técnicas de detecção de layout e análise de PDF, com uma etapa de geração de perguntas assistida por inteligência artificial. O processo envolve extrair as figuras dos arquivos PDF dos artigos, identificar as regiões de interesse e gerar perguntas que exigem compreensão do diagrama em conjunto com a legenda e o contexto do texto.
Por que importa
A criação do SCAFFOLD tem impacto direto no treinamento de modelos de visão e linguagem. Os VLMs atuais, como o Qwen2.5-VL-3B-Instruct, muitas vezes falham em interpretar diagramas técnicos complexos porque não recebem dados estruturados que ensinem a relação entre a imagem e o texto. O SCAFFOLD-157K, com seus 157.387 pares, oferece um volume de dados inédito para esse tipo de tarefa.
Além disso, o dataset é público e gratuito, o que permite que qualquer grupo de pesquisa ou empresa de tecnologia, no Brasil e no mundo, utilize os dados para treinar seus próprios modelos. Isso pode acelerar o desenvolvimento de sistemas de leitura automática de artigos científicos, uma necessidade crescente em áreas como revisão de literatura, meta-análise e automação de pesquisa.
Impacto
No curto prazo, o SCAFFOLD-12K já serviu como base para experimentos com o Qwen2.5-VL-3B-Instruct, demonstrando que o dataset é funcional para o treinamento de modelos de menor porte. Os autores não divulgaram os resultados numéricos dos experimentos no resumo, mas a existência de três versões de tamanhos diferentes permite que pesquisadores com recursos limitados comecem com o SCAFFOLD-12K e depois escalem para o SCAFFOLD-157K.
O impacto de médio prazo pode ser a criação de modelos especializados em compreensão de diagramas de ciência da computação. Isso beneficiaria desde ferramentas de busca acadêmica até assistentes de pesquisa que precisam interpretar arquiteturas de redes neurais ou fluxos de dados. O dataset também pode ser usado como benchmark, já que permite comparar o desempenho de diferentes VLMs na tarefa de perguntas e respostas sobre diagramas.
O que vem agora
A equipe do SCAFFOLD disponibilizou o código e os dados no GitHub. O próximo passo esperado é a publicação do paper completo, que deve detalhar a metodologia de geração das perguntas e os resultados dos experimentos de linha de base. A comunidade de pesquisa também pode contribuir com melhorias no dataset, como a inclusão de mais figuras de outras áreas da ciência ou o refinamento das cadeias de raciocínio.
O SCAFFOLD-157K, que representa o maior conjunto de dados do tipo, deve atrair a atenção de grandes laboratórios de IA. Empresas como Google, OpenAI e Meta, que já investem em modelos multimodais, podem usar o dataset para avaliar e treinar seus sistemas. No Brasil, grupos de pesquisa em processamento de linguagem natural e visão computacional podem incorporar o dataset em projetos de mestrado e doutorado, dada a facilidade de acesso.
O SCAFFOLD também tem potencial para inspirar iniciativas semelhantes em outras disciplinas. A metodologia de extração de figuras, geração de perguntas e raciocínio passo a passo pode ser replicada para artigos de medicina, física ou engenharia, criando uma família de datasets científicos. Isso ampliaria a capacidade dos modelos de IA de ler e entender a literatura especializada global.
