RETD corrige instabilidade do ETD com passo constante

Paper da arXiv apresenta counterexample de dois estados e uma correção pós-choque que recupera o ponto fixo do ETD

Por Marcos Guimarães18 set 2026
RETD corrige instabilidade do ETD com passo constante

O que aconteceu

O artigo arXiv:2609.19170, submetido em 14 de setembro de 2026 na área de Computer Science > Artificial Intelligence, apresenta o regularized emphatic TD (RETD). O método corrige a dinâmica do emphatic temporal-difference learning (ETD) quando o aprendizado roda com tamanho de passo constante.

A base do trabalho é um counterexample ergódico de dois estados. Nele, o mapa médio do ETD contrai, mas o produto amostrado exibe expoente de Lyapunov superior positivo. A conclusão é direta: estabilizar o update esperado do TD off-policy e mudar a geometria de projeção não garante que a dinâmica amostrada com passo constante se comporte bem. Nenhuma das duas propriedades determina esse comportamento.

O RETD, método proposto no paper, é definido como um reparo pós-choque normalizado de primeira ordem. O RETD mantém o traço e as razões de importância inalterados, guarda o sinal do ETD em um estado escalar com vazamento e libera uma correção atrasada. O equilíbrio bruto do RETD é um deslocamento afim do equilíbrio do ETD. Leituras com uma e com duas regularizações recuperam o ponto fixo do ETD exatamente.

Os autores provam convergência quase certa para passos harmônicos decrescentes. Também provam um resultado condicional de contração de momento para passo constante, derivado de um limite markoviano de produto aleatório.

Contexto

O ETD nasceu para resolver um problema conhecido do TD off-policy: a instabilidade do update esperado. Ao estabilizar esse update e alterar a geometria da projeção, o método passou a ser tratado como solução. O paper mostra que essa leitura é incompleta.

A ferramenta que expõe a falha é o expoente de Lyapunov, indicador de divergência ou contração de trajetórias. A análise de ciclos regenerativos separa o sinal do expoente da variância infinita do traço follow-on, que é uma fonte distinta de instabilidade. O artigo também recorre a um ponto de Baird, construção clássica de counterexamples em diferença temporal.

Por que importa

Para quem treina agentes de reinforcement learning com dados fora da política, a distância entre teoria e prática custa caro. Um método que converge na média pode divergir na simulação, e o sintoma aparece só depois de horas de treino. O paper mostra que essa distância existe e oferece uma correção que não mexe em dois componentes sensíveis: o traço e as razões de importância.

O RETD tem expoentes negativos certificados na construção de dois estados e em um ponto de Baird. O sinal positivo do ETD em Baird permanece apenas numérico, ou seja, sem certificação no trabalho.

Impacto

Os experimentos pareados de 10.000 rodadas validam as duas separações, a recuperação do ponto fixo, uma região de estabilidade não monotônica e dependência da tarefa. A dependência da tarefa importa: o comportamento do método muda conforme o problema, e não há garantia universal.

O paper também registra um limite explícito. O RETD altera a dinâmica pós-choque, mas não reduz a variância compartilhada do traço follow-on. A variância infinita do follow-on trace segue no problema, mesmo com a correção.

O que muda

A leitura prática muda em um ponto. Estabilidade do update esperado deixa de ser critério suficiente para escolher passo constante em TD off-policy. O RETD entra como camada de reparo que preserva o ponto fixo do ETD e atua sobre a dinâmica após o choque.

O que vem agora

O paper não anuncia implementação pública nem benchmark. O horizonte imediato é a replicação dos experimentos e a checagem do resultado condicional de passo constante, que depende de um limite de produto aleatório markoviano. A certificação do sinal em Baird é outro ponto em aberto, já que ali o resultado segue numérico.

Fontes

arXiv cs.AI, "Regularized Emphatic Temporal-Difference Learning: Stability under Constant Stepsizes", arXiv:2609.19170v1, submetido em 14 de setembro de 2026. https://arxiv.org/abs/2609.19170