Benchmark e Concurso ICDAR 2026 Criam Roteiro para IA Multimodal em Ciência

Iniciativa do ICDAR propõe caminho para que modelos compreendam gráficos e tabelas de pesquisas.

Por Marcos Guimarães17 ago 2026
Benchmark e Concurso ICDAR 2026 Criam Roteiro para IA Multimodal em Ciência

O que aconteceu

Pesquisadores apresentaram o benchmark ALD/E-ImageMiner e anunciaram o Concurso ICDAR 2026 sobre Extração de Informação de Figuras Científicas de Deposição/Etching em Camada Atômica (ALD/E). O conjunto de dados, descrito em artigo no arXiv (14/ago/2026), contém 1.951 figuras extraídas de 205 publicações. Cada figura foi anotada por especialistas para tarefas como classificação, extração de tabelas, sumarização e resposta a perguntas visuais.

Além de apresentar o benchmark, os autores articulam uma perspectiva de futuro. O objetivo de longo prazo definido é o de "compreensão conceitual científica a partir de imagens". O documento propõe direções como expandir para mais domínios e tipos de figura, permitir síntese entre documentos e avaliar a capacidade dos modelos de raciocinar sobre hipóteses, incertezas e fundamentação em evidências.

Contexto

Figuras e tabelas em artigos científicos concentram evidências experimentais essenciais. Contudo, tanto bibliotecas digitais quanto sistemas de IA multimodal ainda têm grande dificuldade para recuperá-las e interpretá-las com profundidade. O campo de Visão Computacional e Processamento de Linguagem Natural vem buscando avançar além da simples descrição visual para um entendimento qualificado do conteúdo.

O benchmark ALD/E-ImageMiner surge para preencher essa lacuna em um domínio específico e complexo. Ao anotar dados para múltiplas tarefas, ele permite treinar e avaliar modelos em diferentes aspectos do raciocínio científico, desde a leitura visual e quantitativa até o julgamento baseado em evidências.

Por que importa

Essa iniciativa é um passo concreto para desenvolver IAs que possam realmente "ler" e sintetizar a literatura científica, um trabalho hoje impossível em escala para humanos. Para pesquisadores e empresas de tech, isso significa potencial para ferramentas de revisão bibliográfica automatizada, descoberta de padrões em grandes acervos e assistentes de pesquisa que compreendam o conteúdo visual.

O foco em "verificabilidade" é crucial. Uma IA que compreende figuras científicas precisa não apenas gerar texto, mas justificá-lo com base em dados visuais específicos, reduzindo alucinações em contextos de alta precisão.

Impacto

No curto prazo, o benchmark serve como campo de teste padronizado para pesquisadores de IA do mundo todo, impulsionando a competitividade e o avanço no domínio. O concurso ICDAR 2026 deve acelerar soluções práticas para extração de dados de figuras complexas.

No médio prazo, modelos treinados com dados como os do ALD/E-ImageMiner poderão integrar fluxos de trabalho em bibliotecas digitais e plataformas de pesquisa, melhorando a indexação, busca e reuso de conhecimento. A agenda de "síntese cross-document" aponta para a capacidade futura de conectar achados visuais de papers diferentes automaticamente.

O que muda

A proposta muda o foco de benchmarks genéricos de "captioning" para tarefas específicas de raciocínio científico. Ao usar a taxonomia de Bloom para guar o design de perguntas, o trabalho insiste que a IA deve operar em níveis cognitivos mais altos, como análise e avaliação, e não apenas recordação.

Isso estabelece um novo patamar de complexidade para sistemas multimodais, desafiando-os a demonstrar um "compreensão conceitual" e não apenas reconhecimento de padrões.

O que vem agora

O próximo passo imediato é a realização do Concurso ICDAR 2026, que reunirá equipes para disputar a resolução das tarefas propostas no benchmark. Os resultados fornecerão uma avaliação objetiva do estado da arte.

No horizonte, os pesquisadores visam expandir o trabalho para novos domínios além do ALD/E, incluir mais tipos de figuras e desenvolver capacidades de raciocínio contrafactual e de avaliação de incerteza nos modelos.