FedPref: IA Federada Melhora Extração de Laudos Radiológicos
Novo protocolo permite hospitais pequenos colaborarem sem trocar dados sensíveis de pacientes
O que aconteceu
O FedPref foi apresentado em artigo publicado no arXiv em 17 de agosto de 2026 (arXiv:2608.16971v1). O método combina aprendizado federado e aprendizado por preferência para extrair dados estruturados de laudos de radiologia — documentos que descrevem achados e localizações em texto livre, mas que precisam ser convertidos para esquemas fixos para permitir busca e análise automatizada.
Em testes conduzidos com seis hospitais simulados com volumes diferentes de dados e prevalência de doenças, o FedPref melhorou o F1 médio entre clientes em 2,49 pontos e o F1 do pior hospital em 9,10 pontos, comparado ao treinamento isolado de cada site (arXiv:2608.16971v1). Os maiores ganhos ocorreram nos hospitais com menos dados. No conjunto de teste com 400 laudos validados manualmente, o método atingiu 68,68 de F1, enquanto o treinamento centralizado com dados agrupados chegou a 71,67.
Contexto
Hospitais menores produzem poucos laudos anotados. Grandes centros de pesquisa concentram a maior parte dos dados. E agrupar essas informações em um único repositório esbarra em regulamentações de privacidade e na própria resistência institucional.
O FedPref propõe uma arquitetura diferente. Modelos de linguagem públicos e congelados geram alternativas de extração em formato JSON. Anotações locais ranqueiam essas opções. E os hospitais treinam em conjunto adaptadores compactos do Qwen3-8B, compartilhando apenas atualizações de pesos — nunca os dados brutos ou anotações. Um pool heterogêneo de modelos professores fornece contraste entre diferentes abordagens, evitando que amostras repetidas de um único modelo colapsem o aprendizado.
Por que importa
A desigualdade de dados é o gargalo central da IA em saúde. Se um hospital não tem volume suficiente para treinar um modelo, ele fica para trás. O FedPref endereça isso ao permitir que instituições com dados mínimos se beneficiem da experiência de outras sem abrir mão da privacidade.
No Brasil, onde a rede de saúde é fragmentada entre hospitais públicos grandes, unidades menores e clínicas privadas de diferentes portes, esse tipo de abordagem federada pode ser especialmente relevante. Um hospital municipal com poucos laudos poderia se beneficiar do conhecimento acumulado em hospitais universitários sem precisar enviar dados para fora.
Impacto
O dado mais significativo do estudo é o ganho de 9,10 pontos no site com menos dados. Ele confirma que o método protege exatamente quem mais precisa de ajuda. A diferença para o treinamento centralizado (2,66 pontos no F1 médio) existe, mas o FedPref não exige movimentação de dados.
Em curto prazo, o método pode ser aplicado a outras áreas da medicina com laudos em texto livre: patologia, oncologia, cardiologia. Em médio prazo, pode influenciar regulamentações ao demonstrar que colaboração em IA clínica não depende necessariamente de pooling de dados.
O que muda
A equação entre privacidade e performance em IA médica ganha uma terceira via. Antes, instituições escolhiam entre manter dados isolados ou compartilhar riscos regulatórios. Agora existe uma opção intermediária que preserva soberania sobre os dados.
O uso de adaptadores compactos do Qwen3-8B também reduz o custo computacional por instituição, o que torna a abordagem mais acessível para hospitais com infraestrutura limitada.
O que vem agora
A prova de conceito foi feita com dados simulados. O próximo passo é validar com dados reais de múltiplas instituições. Outra questão aberta é a eficácia do método com laudos em idiomas diferentes do inglês. A pesquisa ainda não passou por revisão por pares formal — o artigo está disponível no arXiv como preprint.
