Solver determinístico melhora matemática de LLM clínico em 7 pontos
Estudo testa executor local que roda Python gerado pelo próprio modelo para eliminar erros de aritmética em calculadoras médicas
O que aconteceu
O pesquisador Felipe Ocampo Osorio publicou em 9 de setembro de 2026 o artigo "Towards a Deterministic Math Solver for Clinical Language Models" no arXiv (arXiv:2609.10728v1). O trabalho parte de um problema conhecido: LLMs são pouco confiáveis em aritmética, e em calculadoras clínicas um erro numérico altera a conduta médica. A resposta padrão do setor é transformar cada calculadora em uma função validada, uma por uma.
A proposta testada é diferente. O modelo não faz a conta. Ele escreve Python específico para cada caso, e um executor local restrito roda esse código como solver determinístico. A tarefa do modelo se reduz a decidir como usar a ferramenta. O artigo chama essa abordagem de interface Program-Solve.
A avaliação usou o MedCalc-Bench Verified, com 1.100 casos e 55 calculadoras. O desempenho foi comparado com a aritmética direta do modelo e com uma biblioteca de 22 calculadoras escrita à mão. Os modelos testados foram o Qwen2.5-7B e o Qwen2.5-32B-AWQ, ambos de pesos abertos. Antes dos testes, os autores auditaram as fórmulas do benchmark contra diretrizes clínicas atuais e sinalizaram 16 das 55 com preocupações de versão, uso ou coeficiente.
Contexto
Modelos de linguagem são bons em linguagem, não em números. Erros de aritmética são um problema antigo e persistente, e a comunidade tentou várias soluções. A mais tradicional é engessar cada fórmula em código validado, o que garante exatidão mas exige trabalho manual e não escala. A segunda é deixar o modelo calcular sozinho, o que rende resultados irregulares.
A interface Program-Solve fica no meio do caminho. O modelo continua lendo a nota clínica inteira e identificando variáveis, mas delega a conta para um executor determinístico. Com fórmulas e variáveis corretas fornecidas, e com as duas rotas lendo o prontuário completo, o resultado muda conforme o tamanho do modelo.
A biblioteca escrita à mão serve como referência de teto. Ela é exata nos 440 casos que suporta, mas se abstém em todo o resto, o que dá apenas 40,0% de cobertura geral. Isso mostra o custo da abordagem tradicional: precisão absoluta onde existe, silêncio onde não existe.
Por que importa
Em ambiente clínico, o erro aritmético não é detalhe. Calculadoras médicas definem dose, filtração renal, escores de risco e condutas. Um dígito errado pode significar uma prescrição equivocada. O estudo mostra que o ganho de delegar a conta a um solver é real, mas condicionado ao tamanho do modelo.
No Qwen2.5-7B, entregar a conta ao solver não trouxe vantagem confiável: 75,31% contra 72,02%, um ganho pareado de 3,29 pontos com intervalo de 95% de [-3,49, 10,38], que cruza o zero. No Qwen2.5-32B-AWQ, o ganho aparece com clareza: 90,53% contra 83,47%, uma diferença de 7,05 pontos com intervalo de [0,47, 14,60], longe do zero.
O resultado do Qwen2.5-32B-AWQ mostra que o mesmo executor ajuda modelos maiores mais do que modelos pequenos, mesmo com acesso igual a fórmulas, variáveis e notas. A interface Program-Solve, portanto, não é solução universal. É um componente que rende conforme a capacidade do modelo que a opera.
Impacto
Para hospitais e desenvolvedores de software clínico, o recado é duplo. Primeiro: adicionar um executor determinístico pode elevar a acurácia de modelos de pesos abertos de grande porte, como o Qwen2.5-32B-AWQ, para perto de 90% em benchmarks de calculadoras. Segundo: esse executor não substitui fórmulas verificadas nem extração confiável de variáveis.
A auditoria das fórmulas do MedCalc-Bench Verified reforça esse segundo ponto. Os autores sinalizaram 16 das 55 calculadoras com problemas de versão, uso ou coeficiente. Ou seja, parte do próprio benchmark carrega fórmulas desatualizadas, o que contamina qualquer avaliação que dependa delas.
A biblioteca escrita à mão, exata nos 440 casos que cobre, expõe o dilema de custo. Manter tudo em código validado garante exatidão, mas deixa 60% dos casos descobertos. O solver gerado pelo modelo cobre mais terreno, com menos garantia individual por caso.
O que muda
A contribuição central do artigo é metodológica. Ele separa duas responsabilidades que costumam andar juntas: decidir qual cálculo fazer e executá-lo. Ao empurrar a execução para um executor Python restrito, o modelo fica com a parte que faz melhor, que é interpretar a nota clínica e escolher o caminho.
Isso muda como pesquisadores devem medir avanço em LLM clínico. Comparar números brutos de acurácia sem isolar fórmula, variável e execução pode esconder onde está o gargalo. No experimento, as duas rotas leram a nota inteira e receberam as mesmas fórmulas e variáveis, o que isola a variável executor.
O estudo também mostra que o tamanho do modelo pesa. O Qwen2.5-7B não converteu a delegação em vantagem estatística. O Qwen2.5-32B-AWQ converteu. Para quem constrói produto clínico com pesos abertos, a escolha do modelo deixa de ser só questão de custo e vira questão de arquitetura.
O que vem agora
O artigo não anuncia cronograma de produto nem publicação em conferência. O texto foi submetido ao arXiv em 9 de setembro de 2026 e está disponível para leitura e PDF. O próximo passo natural da linha de pesquisa é atacar os dois gargalos apontados: verificação de fórmulas e extração confiável de variáveis, que os autores classificam como insubstituíveis em qualquer rota.
Também fica em aberto o comportamento em modelos maiores que o Qwen2.5-32B-AWQ e em arquiteturas fechadas, que não foram testadas. Enquanto isso, a interface Program-Solve se firma como uma peça possível, não como solução completa, para tornar calculadoras clínicas baseadas em LLM mais seguras.
Fontes
- arXiv cs.AI: Towards a Deterministic Math Solver for Clinical Language Models (arXiv:2609.10728v1) - https://arxiv.org/abs/2609.10728
