LLMs erram ao atualizar julgamento clínico, diz estudo no arXiv
Modelos reagiram mais à piora do que à melhora de evidência respiratória, e o prompting não corrigiu o viés
O que aconteceu
Um estudo publicado no arXiv em 2 de outubro de 2026 (arXiv:2610.02684) avaliou se grandes modelos de linguagem (LLMs) revisam o próprio julgamento clínico conforme novas evidências sobre o paciente aparecem. A avaliação usou trajetórias pareadas de terapia intensiva extraídas de prontuários eletrônicos de saúde. O resultado central: ao condicionar a resposta a um julgamento anterior, os modelos mais frequentemente aumentaram do que reduziram o erro de predição quando as estimativas mudavam. O padrão se repetiu em um segundo endpoint clínico.
Os autores identificaram dois modos de falha. No primeiro, com a avaliação prévia fixada, os modelos responderam com mais força a evidências respiratórias de piora do que a evidências equivalentes de melhora. A assimetria se manteve após normalização de headroom nos níveis moderado e forte de evidência. No segundo, com a evidência atual fixada, elevar o risco prévio de 10% para 90% deslocou as estimativas em 26,2 pontos percentuais, o que demonstra influência causal da crença anterior do modelo.
Tentar corrigir o comportamento por prompting não restaurou uma atualização confiável. Os pesquisadores propuseram então o Evidence-Validated Longitudinal Update (EVLU), método que identificou menos revisões e mais confiáveis, expondo um trade-off entre confiabilidade e cobertura.
Contexto
LLMs são cada vez mais explorados para raciocínio clínico, mas o artigo aponta que não estava claro se eles revisam julgamentos de forma adequada quando a evidência evolui. A maioria das avaliações mede acurácia em um único ponto no tempo, com um conjunto fixo de dados do paciente. O trabalho adota outra abordagem: usa trajetórias longitudinais de UTI, com dados que chegam em sequência, e intervenções controladas para isolar o efeito do julgamento anterior.
O estudo sustenta que a atualização longitudinal de crença é uma dimensão distinta de confiabilidade de LLMs, separada da acurácia isolada. O abstract não informa quais modelos foram testados, quais instituições assinam o trabalho nem o tamanho exato da amostra de trajetórias usada.
Por que importa
Na terapia intensiva, a condição do paciente muda a cada hora. Se o modelo se ancora no julgamento que ele mesmo emitiu antes, o ajuste de conduta tende a acompanhar a estimativa antiga em vez dos dados novos. O erro de 26,2 pontos percentuais, medido em um intervalo de risco prévio de 10% a 90%, mostra o tamanho dessa ancoragem.
A assimetria entre piora e melhora tem consequência prática. Um sistema que reage com mais força ao agravamento do quadro do que à recuperação pode gerar escalada de alertas e de intervenção sem base equivalente nos dados. E o fato de o prompting não corrigir o comportamento indica que ajustes simples de instrução, aplicados na camada de conversa, não resolvem o problema.
Impacto
O achado desloca o foco de avaliação de modelos clínicos. Além de medir se a predição está certa em um instante, passa a ser necessário medir se ela se corrige bem ao longo do tempo. Para hospitais e empresas que testam LLMs em triagem, monitoramento e apoio à decisão, isso significa que uma boa pontuação em benchmark estático não garante bom desempenho em uso contínuo.
O EVLU introduz um trade-off explícito. O método produz menos revisões, e mais confiáveis, o que implica deixar de revisar parte dos casos. Quem adotar essa lógica precisa decidir quanto de cobertura está disposto a perder para reduzir o volume de mudanças erradas.
O que muda
A atualização longitudinal passa a ser tratada como critério próprio de confiabilidade, e não como detalhe do raciocínio clínico. Modelos com bom desempenho em perguntas isoladas podem falhar quando precisam rever uma conclusão anterior à luz de evidência nova. A pesquisa também mostra que o viés não vem apenas dos dados, mas da própria estimativa que o modelo emitiu antes, o que torna a ordem das informações um fator de risco mensurável.
O que vem agora
O artigo é um preprint no arXiv, submetido em 2 de outubro de 2026, e o material disponível não informa se ele foi aceito em conferência ou revista com revisão por pares, nem prazos para publicação final. Também não foram divulgados os nomes dos modelos avaliados nem os autores do estudo.
Fontes
- Large language models exhibit unreliable updating of clinical judgment as patient evidence evolves, arXiv:2610.02684v1 (https://arxiv.org/abs/2610.02684)
