Modelos de IA falham em usar imagens em exames médicos poloneses

Benchmark em polonês mostra que VLMs dependem do texto e ficam abaixo de humanos na maioria dos casos

Por Marcos Guimarães14 ago 2026
Modelos de IA falham em usar imagens em exames médicos poloneses

O que aconteceu

Um estudo submetido ao arXiv em 13 de agosto de 2026 introduz o primeiro benchmark de VQA (Visual Question Answering) médico em polonês, construído a partir de questões da certificação polonesa para médicos e dentistas. O conjunto inclui perguntas com imagens de diversas especialidades e um grupo de controle apenas com texto. Os pesquisadores avaliaram modelos de linguagem vision-language voltados ao polonês, modelos open-weight de propósito geral e modelos comerciais.

O resultado principal: a tarefa segue difícil — o melhor modelo alcançou 79,0% de acurácia no conjunto completo de VQA, e apenas o GPT-5.6 superou a referência humana aproximada no subconjunto com respostas candidatas. Todos os outros modelos tiveram desempenho inferior ao humano.

Para medir o grounding visual, os autores compararam entradas completas com configurações omitindo a imagem, a pergunta ou ambos, categorizando as questões por importância da imagem. Os modelos extraem mais informação útil do texto da pergunta do que da imagem, e têm desempenho pior em questões dominadas por imagem. Mesmo sem imagem ou pergunta, eles conseguem acurácia acima do acaso apenas com as alternativas de resposta (arXiv:2608.12928).

Contexto

O estudo responde a uma lacuna: benchmarks de VQA médico existem em inglês e outras línguas, mas faltam avaliações em idiomas de menor difusão como o polonês. Os exames de certificação poloneses são um campo realista, com imagens diagnósticas e perguntas de múltipla escolha — o que aproxima o teste de situações clínicas concretas. A criação de um benchmark nesse domínio permite medir não só se os modelos acertam, mas se realmente usam a informação visual.

A comparação entre entradas completas e omitidas revela um padrão conhecido: muitos VLMs tendem a dar mais peso ao texto, especialmente em perguntas com alternativas. Isso já foi observado em outros benchmarks, mas aqui fica evidente no contexto médico, onde a imagem muitas vezes é o dado central.

Por que importa

Para o Brasil, o resultado serve de alerta: modelos que prometem auxiliar diagnósticos por imagem podem estar ignorando pistas visuais e dependendo de padrões textuais. Em medicina, isso é arriscado — uma imagem pode conter a informação decisiva, e o modelo pode acertar por vias indiretas, como probabilidade de resposta ou vieses das alternativas. O estudo mostra que o desempenho aparente pode enganar.

Para desenvolvedores, a mensagem é clara: é preciso avaliar o verdadeiro grounding visual, não só a acurácia final. A metodologia de ablação (remover imagem, pergunta ou ambos) ajuda a identificar se o modelo está aprendendo a olhar ou apenas a chutar com base no texto.

Impacto

No curto prazo, o benchmark polonês é uma referência para testar VLMs em idiomas não-ingleses e em domínio médico especializado. Empresas que vendem IA para saúde precisam demonstrar que seus modelos usam imagens de forma robusta, não apenas que acertam em média.

No médio prazo, a tendência é que benchmarks semelhantes surjam em outras línguas, incluindo português. A baixa performance dos modelos em questões dominadas por imagem sugere que a arquitetura e o treinamento precisam evoluir para forçar o uso efetivo de evidência visual.

O que muda

Para hospitais e clínicas que testam IA assistiva, o estudo reforça a necessidade de validações locais e de testes que isolem o papel da imagem. Ferramentas de apoio à decisão médica não devem ser adotadas apenas por acurácia média — é preciso verificar se elas realmente interpretam exames de imagem ou se estão "vazando" informação do texto.

O que vem agora

Os pesquisadores devem disponibilizar o benchmark e os dados associados (o paper menciona ferramentas de código e dados). Espera-se que outros grupos adaptem a metodologia para português e outras línguas. Também é provável que modelos futuros sejam avaliados nesse teste, com foco em melhorar o grounding visual.

Enquanto isso, o recado é direto: a inteligência artificial em medicina ainda está longe de substituir o olhar humano — e, em muitos casos, nem sequer aprendeu a olhar.