Spaced Repetition Training: técnica do SuperMemo recupera até 37 pp de conhecimento em LLMs

Novo framework usa algoritmo de memorização para resolver esquecimento catastrófico em pré-treino contínuo de modelos de linguagem

Por Marcos Guimarães19 ago 2026
Spaced Repetition Training: técnica do SuperMemo recupera até 37 pp de conhecimento em LLMs

O que aconteceu

Um artigo publicado no arXiv em 18 de agosto de 2026 apresenta o Spaced Repetition Training (SRT), framework que reformula o pré-treino contínuo de modelos de linguagem como um problema de agendamento adaptativo de revisão. A proposta parte de uma constatação simples: métodos de replay atuais misturam dados antigos e novos de forma uniforme, ignorando que exemplos diferentes são esquecidos em ritmos diferentes (arXiv:2608.17530).

O SRT mantém estado de revisão para cada exemplo, mapeia a perplexidade por amostra como sinal de qualidade de rechamada e agenda exemplos históricos para retenção enquanto consolida os novos. Tudo isso sem alterar o modelo, a função de objetivo ou o otimizador.

Contexto

O esquecimento catastrófico é um dos problemas centrais do aprendizado contínuo em redes neurais. Quando um LLM é pré-treinado sequencialmente em corpus diferentes, o conhecimento anterior tende a ser sobrescrito pelo novo. Isso força as empresas de IA a realizarem re-treinos completos, processo que demanda recursos computacionais enormes.

Métodos de replay tentam resolver isso misturando exemplos antigos no treinamento atual. Porém, essa mistura é estática e uniforme — não considera que o modelo já domina alguns conceitos enquanto outros estão em risco de serem perdidos. A pesquisa parte do campo da ciência cognitiva, onde o SuperMemo-2 (SM-2) já demonstra eficiência em programar revisões para aprendizado humano.

Por que importa

O problema abordado é estrutural para empresas que mantêm LLMs atualizados com dados recentes. Bancos de código, bases de conhecimento corporativo e sistemas de recomendação dependem de pré-treino contínuo. Se o modelo esquece o que aprendeu anteriormente, a utilidade prática diminui drasticamente.

O SRT resolve isso sem aumentar a complexidade técnica. O framework preserva a arquitetura existente e apenas adiciona lógica de agendamento. Isso o torna acessível para equipes que já operam pipelines de treinamento estabelecidos.

Impacto

Em testes com corpus temporais do Wikipedia e de código, o SRT recuperou entre 5 e 37 pontos percentuais de acurácia que seriam perdidos com treino contínuo convencional. A variação depende da escala do modelo e do tipo de dado.

Em experimentos de maior escala, o método preservou desempenho em benchmarks amplos que seriam degradados tanto pelo pré-treino contínuo direto quanto por replay uniforme. Testes adicionais com dados de visão e tabulares indicam que o princípio de agendamento pode ser estendido além de linguagem, desde que haja um sinal de rechamada adequado.

O que muda

A pesquisa desloca a discussão sobre pré-treino contínuo da quantidade de dados para a estratégia de revisão. Não basta replayar dados antigos: é necessário identificar quais exemplos são mais vulneráveis ao esquecimento e priorizá-los.

Essa mudança de paradigma pode influenciar como empresas como Google, Meta e Anthropic estruturam seus pipelines de atualização de modelos. O custo de manter LLMs atualizados com conhecimento consistente pode cair significativamente se a agendamento adaptativo se mostrar viável em produção.

O que vem agora

O artigo está em fase inicial de divulgação (publicado há menos de uma semana). A comunidade ainda precisa validar os resultados em ambientes de produção e em escala de modelos maiores que os testados. Questões como o custo computacional da manutenção do estado de revisão por exemplo e a generalização para domínios específicos devem ser exploradas em trabalhos futuros.

O código-fonte e os dados dos experimentos ainda não foram divulgados publicamente, o que limita a reprodução independente dos resultados neste momento.