Asclepius: harness adaptativo melhora agentes clínicos de longa duração
Estudo no arXiv aponta três modos de falha em agentes de longa duração e propõe um harness que se reescreve entre turnos
O que aconteceu
O preprint Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents foi submetido ao arXiv em 11 de setembro de 2026, com o identificador arXiv:2609.13543v1, na área de Computer Science > Artificial Intelligence. O trabalho parte de um problema específico: agentes de LLM são avaliados quase sempre em trajetórias curtas, de tarefa única, enquanto implantações reais rodam por horas sob contenção e expõem outra classe de falhas.
Para medir isso, os autores usam o Clinical Environment Simulator (CES), um ambiente em que o agente administra um turno inteiro de pronto-socorro sob pressão contínua de tempo e de recursos. O Clinical Environment Simulator, segundo o resumo do paper, permite que falhas de execução de longa duração apareçam de forma mensurável já em uma única rodada, com avaliação estruturada e multidimensional.
O resultado central é o que os autores chamam de execution gap. No CES, os agentes atuais chegam ao diagnóstico correto na maioria dos casos, mas não entregam as ações críticas de forma completa e pontual. O grupo atribui essa lacuna a três modos de falha de longa duração, cada um transformado em um contador por traço de execução: deriva de aderência a instruções (instruction-adherence drift), incompletude de tratamento (treatment incompleteness) e uma disparidade de gravidade na pontualidade (severity-equity gap in timeliness).
A resposta proposta é o Asclepius. O Asclepius é um scaffolding adaptativo de agente com três componentes: um harness auto-evolutivo, que reescreve o manual de operação entre turnos a partir de feedback no nível do traço; uma biblioteca externa de habilidades clínicas, voltada a conhecimentos de regime de alto risco; e três subagentes isolados, que dividem as decisões de cada turno ao longo da fila de pacientes.
Contexto
O ponto de partida do paper é uma assimetria conhecida de quem trabalha com agentes de IA. Os benchmarks predominantes medem o agente em tarefas curtas, isoladas, em que o acerto final é o que conta. Ambientes reais de trabalho, como um pronto-socorro, cobram outra coisa: manter a aderência às instruções ao longo do tempo, completar o tratamento iniciado e não deixar pacientes mais graves esperando mais do que os menos graves.
O CES foi escolhido justamente porque replica essa pressão. Em vez de uma pergunta única respondida corretamente, o agente precisa administrar uma fila de pacientes, com tempo e recursos limitados, ao longo de um turno inteiro. É nesse formato que a diferença entre saber o que fazer e efetivamente fazer aparece.
Os três modos de falha descritos no preprint não são tratados como problemas separados. Segundo os autores, eles formam um gargalo acoplado. Reduções decisivas nos erros só aparecem quando os três componentes do Asclepius atuam em conjunto.
Por que importa
A distinção entre diagnóstico correto e ação crítica entregue é o que dá peso ao estudo. Em um cenário clínico, saber a resposta certa e não executar o procedimento no tempo devido tem consequência prática direta. O paper nomeia esse intervalo como execution gap e mostra que ele é mensurável em simulação.
O terceiro modo de falha merece atenção à parte. O severity-equity gap in timeliness descreve uma diferença de pontualidade ligada à gravidade do caso, ou seja, o agente não trata todos os pacientes com a mesma urgência relativa. É um tipo de erro que métricas de acerto final dificilmente capturam.
Para quem desenvolve agentes para setores de alto risco, o recado é que avaliar por taxa de acerto em tarefas curtas esconde uma classe inteira de problemas. O material do estudo trata o harness como parte do sistema, não como detalhe de implementação.
Impacto
Os ganhos relatados são específicos. Em lotes separados, nunca observados durante a evolução do harness, o Asclepius melhora a correção das ações críticas em 22% sobre uma baseline forte de framework de agente, com p = 0,024, preservando a acurácia de diagnóstico. Os ganhos se mantêm consistentes em cinco juízes de LLM, de três famílias de modelos distintas.
No conjunto completo de dez lotes, as melhorias chegam a 25% em ações críticas e a 13% em pontualidade. O Asclepius, sistema descrito no preprint arXiv:2609.13543v1, mantém a acurácia diagnóstica enquanto sobe nesses dois eixos.
Vale registrar o que o material não afirma. Não há teste com pacientes reais nem validação clínica. Toda a medição ocorre dentro do Clinical Environment Simulator, e o texto é um preprint, sem revisão por pares concluída.
O que muda
A mudança de método está em três frentes. A primeira é o harness auto-evolutivo, que reescreve o manual de operação entre turnos com base no feedback de cada traço de execução, em vez de manter instruções fixas. A segunda é a biblioteca externa de habilidades clínicas, que tira do modelo o conhecimento de regime de alto risco e o coloca em um repositório consultável. A terceira é a divisão em três subagentes isolados, que repartem as decisões de cada turno pela fila de pacientes.
O desenho importa porque ataca o acoplamento descrito no paper. Instruction-adherence drift, treatment incompleteness e severity-equity gap não caem de forma decisiva quando apenas um dos componentes age. É a combinação que produz o resultado.
O que vem agora
O preprint foi submetido em 11 de setembro de 2026 e está disponível no arXiv, com PDF e versão HTML experimental. O material não informa cronograma de revisão por pares, publicação em conferência nem planos de teste fora do simulador.
O caminho natural a partir daqui é a replicação independente dos números, em especial dos 22% de ganho em ações críticas com p = 0,024 e dos 25% no conjunto de dez lotes. Sem isso, os resultados seguem como evidência de simulação.
Fontes
- arXiv cs.AI: Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents (arXiv:2609.13543v1), submetido em 11 de setembro de 2026. https://arxiv.org/abs/2609.13543
