Solver determinístico melhora matemática de LLM clínico em 7 pontos

Estudo testa executor local que roda Python gerado pelo próprio modelo para eliminar erros de aritmética em calculadoras médicas

Por Marcos Guimarães12 set 2026
Solver determinístico melhora matemática de LLM clínico em 7 pontos

O que aconteceu

O pesquisador Felipe Ocampo Osorio publicou em 9 de setembro de 2026 o artigo "Towards a Deterministic Math Solver for Clinical Language Models" no arXiv (arXiv:2609.10728v1). O trabalho parte de um problema conhecido: LLMs são pouco confiáveis em aritmética, e em calculadoras clínicas um erro numérico altera a conduta médica. A resposta padrão do setor é transformar cada calculadora em uma função validada, uma por uma.

A proposta testada é diferente. O modelo não faz a conta. Ele escreve Python específico para cada caso, e um executor local restrito roda esse código como solver determinístico. A tarefa do modelo se reduz a decidir como usar a ferramenta. O artigo chama essa abordagem de interface Program-Solve.

A avaliação usou o MedCalc-Bench Verified, com 1.100 casos e 55 calculadoras. O desempenho foi comparado com a aritmética direta do modelo e com uma biblioteca de 22 calculadoras escrita à mão. Os modelos testados foram o Qwen2.5-7B e o Qwen2.5-32B-AWQ, ambos de pesos abertos. Antes dos testes, os autores auditaram as fórmulas do benchmark contra diretrizes clínicas atuais e sinalizaram 16 das 55 com preocupações de versão, uso ou coeficiente.

Contexto

Modelos de linguagem são bons em linguagem, não em números. Erros de aritmética são um problema antigo e persistente, e a comunidade tentou várias soluções. A mais tradicional é engessar cada fórmula em código validado, o que garante exatidão mas exige trabalho manual e não escala. A segunda é deixar o modelo calcular sozinho, o que rende resultados irregulares.

A interface Program-Solve fica no meio do caminho. O modelo continua lendo a nota clínica inteira e identificando variáveis, mas delega a conta para um executor determinístico. Com fórmulas e variáveis corretas fornecidas, e com as duas rotas lendo o prontuário completo, o resultado muda conforme o tamanho do modelo.

A biblioteca escrita à mão serve como referência de teto. Ela é exata nos 440 casos que suporta, mas se abstém em todo o resto, o que dá apenas 40,0% de cobertura geral. Isso mostra o custo da abordagem tradicional: precisão absoluta onde existe, silêncio onde não existe.

Por que importa

Em ambiente clínico, o erro aritmético não é detalhe. Calculadoras médicas definem dose, filtração renal, escores de risco e condutas. Um dígito errado pode significar uma prescrição equivocada. O estudo mostra que o ganho de delegar a conta a um solver é real, mas condicionado ao tamanho do modelo.

No Qwen2.5-7B, entregar a conta ao solver não trouxe vantagem confiável: 75,31% contra 72,02%, um ganho pareado de 3,29 pontos com intervalo de 95% de [-3,49, 10,38], que cruza o zero. No Qwen2.5-32B-AWQ, o ganho aparece com clareza: 90,53% contra 83,47%, uma diferença de 7,05 pontos com intervalo de [0,47, 14,60], longe do zero.

O resultado do Qwen2.5-32B-AWQ mostra que o mesmo executor ajuda modelos maiores mais do que modelos pequenos, mesmo com acesso igual a fórmulas, variáveis e notas. A interface Program-Solve, portanto, não é solução universal. É um componente que rende conforme a capacidade do modelo que a opera.

Impacto

Para hospitais e desenvolvedores de software clínico, o recado é duplo. Primeiro: adicionar um executor determinístico pode elevar a acurácia de modelos de pesos abertos de grande porte, como o Qwen2.5-32B-AWQ, para perto de 90% em benchmarks de calculadoras. Segundo: esse executor não substitui fórmulas verificadas nem extração confiável de variáveis.

A auditoria das fórmulas do MedCalc-Bench Verified reforça esse segundo ponto. Os autores sinalizaram 16 das 55 calculadoras com problemas de versão, uso ou coeficiente. Ou seja, parte do próprio benchmark carrega fórmulas desatualizadas, o que contamina qualquer avaliação que dependa delas.

A biblioteca escrita à mão, exata nos 440 casos que cobre, expõe o dilema de custo. Manter tudo em código validado garante exatidão, mas deixa 60% dos casos descobertos. O solver gerado pelo modelo cobre mais terreno, com menos garantia individual por caso.

O que muda

A contribuição central do artigo é metodológica. Ele separa duas responsabilidades que costumam andar juntas: decidir qual cálculo fazer e executá-lo. Ao empurrar a execução para um executor Python restrito, o modelo fica com a parte que faz melhor, que é interpretar a nota clínica e escolher o caminho.

Isso muda como pesquisadores devem medir avanço em LLM clínico. Comparar números brutos de acurácia sem isolar fórmula, variável e execução pode esconder onde está o gargalo. No experimento, as duas rotas leram a nota inteira e receberam as mesmas fórmulas e variáveis, o que isola a variável executor.

O estudo também mostra que o tamanho do modelo pesa. O Qwen2.5-7B não converteu a delegação em vantagem estatística. O Qwen2.5-32B-AWQ converteu. Para quem constrói produto clínico com pesos abertos, a escolha do modelo deixa de ser só questão de custo e vira questão de arquitetura.

O que vem agora

O artigo não anuncia cronograma de produto nem publicação em conferência. O texto foi submetido ao arXiv em 9 de setembro de 2026 e está disponível para leitura e PDF. O próximo passo natural da linha de pesquisa é atacar os dois gargalos apontados: verificação de fórmulas e extração confiável de variáveis, que os autores classificam como insubstituíveis em qualquer rota.

Também fica em aberto o comportamento em modelos maiores que o Qwen2.5-32B-AWQ e em arquiteturas fechadas, que não foram testadas. Enquanto isso, a interface Program-Solve se firma como uma peça possível, não como solução completa, para tornar calculadoras clínicas baseadas em LLM mais seguras.

Fontes