Retry, timeout e circuit breaker falham com agentes de IA, diz estudo

Paper no arXiv documenta 147 incidentes em 81 execuções de uma plataforma de entrega de software agêntica e propõe sete primitivas novas

Por Marcos Guimarães28 ago 2026
Retry, timeout e circuit breaker falham com agentes de IA, diz estudo

O que aconteceu

O paper "Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation", submetido ao arXiv pelo pesquisador Anurag Rajkumar Bombarde em 26 de agosto de 2026, relata um estudo de falhas em uma plataforma de produção de entrega de software dirigida por agentes de IA. O estudo acompanhou 147 incidentes numerados em 81 execuções, cada uma com custo medido e, na maioria dos casos, uma prova de mutação que reproduz o defeito. A conclusão central é que os três mecanismos clássicos de orquestração, retry, timeout e error-rate circuit breaking, descansam sobre premissas que na prática não se sustentam.

Os números são específicos. Houve um loop de cinquenta e quatro chamadas consecutivas de ferramentas bem-sucedidas que nenhum error-rate breaker poderia detectar, porque a taxa de erro permanecia zero. Houve um sinal de progresso constante por construção, que garantiu um falso disparo na terceira rodada de reparo e fez uma execução despencar de seis de seis componentes funcionais para três. Vinte e um eventos se acumularam em seis invocações de uma única delegação, tornando um componente correto e idempotente impossível de vencer. E doze incidentes vieram da camada de enforcement bloqueando trabalho correto, sendo o mais caro deles o que custou 107 turnos de agente e zero escrita aceita.

Contexto

Orquestradores de agentes autônomos executam tarefas limitadas de software e delegam subtarefas sob políticas de retry, reinício e orçamento. O maquinário que esses orquestradores usam é o do service mesh: retry, timeout e circuit breaking por taxa de erro. O estudo parte dessa premissa e a testa em produção. O resultado é que todas as três suposições são violadas na prática.

O estudo identifica uma causa transversal e seu duplo. O primeiro é a identidade inadequada: em cinco subsistemas separados, uma identidade que falhava em discriminar produziu uma resposta errada e confiante, e dois desses subsistemas derivaram a mesma regra corretiva de forma independente. O segundo é a evidência inadequada: uma decisão de confiabilidade só pode ser tomada com evidência capaz de mover, atribuível ao que mede e determinística sob condições idênticas. As três condições foram violadas em momentos distintos da observação.

Por que importa

Para equipes de engenharia que adotam agentes para entregar software, o custo real é direto e mensurável. O incidente mais caro entre os doze bloqueios de trabalho correto custou 107 turnos de agente e resultou em zero escrita aceita. Na prática, a infraestrutura de confiabilidade consumiu mais recursos do que entregou valor.

Há também o problema do roteamento de falhas. Uma falha mal roteada acordou cinco componentes para um defeito que era de apenas dois, deixando três espectadores regredindo código que funcionava. Numa plataforma de entrega de software, isso significa que a correção automática pode quebrar código estável enquanto tenta reparar outra coisa.

Impacto

O efeito de curto prazo é que plataformas agentivas em produção não podem confiar nos mecanismos herdados do service mesh. O desenho atual trata cada mensagem como unidade de observação, mas os incidentes mostram que a delegação inteira é a unidade relevante. Um componente idempotente e correto foi tornando invencível por acúmulo de eventos em múltiplas invocações, o que indica que o problema não é a lógica do agente, e sim o modelo de decisão do orquestrador.

O estudo também expõe o paradoxo da identidade: um sistema que gera respostas erradas com confiança total quando a identidade que ele usa falha em discriminar entidades. Em dois subsistemas, a regra corretiva derivada foi a mesma, mesmo sem comunicação entre eles. Isso sugere que o fenômeno é estrutural, não acidental.

O que muda

O paper propõe sete primitivas de confiabilidade cuja unidade de execução é a delegação, e não a mensagem. Cada primitiva redefine como o orquestrador observa, mede e decide sobre o trabalho delegado, com base nas duas exigências de adequação, de identidade e de evidência. A expectativa é que a mudança de unidade elimine as falsas medidas de progresso, os acúmulos de eventos e os erros de roteamento.

O que vem agora

Os autores especificam uma avaliação controlada que o estudo motiva mas não constitui. O próximo passo é testar as sete primitivas em um ambiente de comparação controlada, com métricas iguais às usadas na análise de falhas: custo por execução, mutações reproduzíveis e taxa de bloqueio de trabalho correto. Não há data pública para os resultados dessa avaliação.