TISD: método força ramificação do professor no treino de LLMs

Novo algoritmo de self-distillation deixa o professor escolher o desvio e devolve ao aluno a geração do resto da trajetória

Por Marcos Guimarães28 set 2026
TISD: método força ramificação do professor no treino de LLMs

O que aconteceu

O artigo TISD: On-Policy Self-Distillation with Trajectory Intervention foi submetido em 25 de setembro de 2026 e publicado como arXiv:2609.30878v1, na categoria Computer Science > Artificial Intelligence. O TISD, sigla de Trajectory-Intervention Self-Distillation, é descrito pelos autores como um algoritmo branch-regenerate-distill: ele força uma ação de ramificação escolhida pelo professor, devolve a geração do sufixo ao aluno e destila a trajetória inteira sob o professor condicionado ao contexto privilegiado.

Antes de propor o método, os pesquisadores montaram um diagnóstico com intervenções controladas de tokens. A constatação central é que um token preferido pelo professor no ponto de maior discordância entre ele e o aluno melhora o sucesso da continuação do aluno, mas tem valor corretivo local limitado. Esse achado é o que sustenta a tese do paper: a discordância entre professor e aluno serve melhor para propor um ramo de trajetória do que para apontar um reparo local suficiente.

Contexto

O trabalho parte de uma limitação do on-policy self-distillation (OPSD). Essa abordagem fornece alvos densos do professor, mas só os avalia ao longo de rollouts amostrados pelo próprio aluno. Quando o professor privilegiado prefere uma ação alternativa em um prefixo já visitado, o OPSD consegue dar um alvo para a decisão de ramificação, porém não supervisiona os contextos sucessores induzidos por essa ação, a menos que o aluno a amostre por conta própria.

O efeito prático é um gargalo de coleta de dados em tempo de treino. Contextos que o professor consideraria promissores ficam fora do sinal de aprendizado simplesmente porque o aluno nunca passou por eles. O TISD ataca exatamente esse ponto: ao forçar o ramo indicado pelo professor e devolver o sufixo ao aluno, o algoritmo expõe esses contextos sucessores sem depender de amostragem espontânea.

Por que importa

O gargalo descrito no paper é de custo. Cada trajetória que o aluno não explora é uma região em que o professor tem informação e o treino não usa. Para quem treina modelos de raciocínio e de código, isso significa mais passos e mais tempo de computação para o mesmo ganho, ou ganho menor com o mesmo orçamento.

O TISD mexe nessa equação sem alterar a arquitetura do modelo. A intervenção acontece no processo de geração de dados de treino, não no desenho da rede. Isso torna o método compatível com o pipeline de self-distillation já usado e explica por que os autores tratam a proposta como um algoritmo simples, de três etapas, em vez de um novo arcabouço de treinamento.

Impacto

Nos modelos de código avaliados, o TISD melhora a média de Avg@4 em 1,2 ponto percentual sobre o SDPO. Nos domínios de ciência, a média de Avg@128 sobe 0,8 ponto sob orçamento de passos iguais e 0,3 ponto sob orçamento de tempo igual.

A diferença entre os dois orçamentos é o dado mais revelador do paper. O ganho cai de 0,8 para 0,3 ponto quando a comparação passa a ser por tempo, e não por número de passos. Isso indica que parte da vantagem vem de trabalho adicional de geração, o que coloca a eficiência computacional no centro da avaliação do método.

O que muda

O paper reposiciona o desacordo entre professor e aluno. Na leitura tradicional, esse desacordo aponta onde o aluno errou e precisa de correção pontual. O diagnóstico com intervenções de tokens mostra que esse uso rende pouco. O valor está em usar o desacordo como sinal de ramificação, criando uma alternativa de trajetória que o aluno passa a percorrer e cujos desdobramentos o professor pode então supervisionar.

O TISD, algoritmo de Trajectory-Intervention Self-Distillation, formaliza essa troca em três movimentos: forçar o ramo do professor, devolver o sufixo ao aluno e destilar a trajetória completa. O resultado relatado é que a ramificação guiada pelo professor expõe contextos sucessores úteis para a self-distillation.

O que vem agora

O material disponível não informa lista de autores, instituições nem repositório de código associado ao arXiv:2609.30878v1. Também não há indicação de submissão a conferência ou de prazo para publicação dos experimentos em outro veículo. O paper está acessível na íntegra no arXiv, com PDF e versão HTML experimental.

Fontes

  • arXiv cs.AI: TISD: On-Policy Self-Distillation with Trajectory Intervention (arXiv:2609.30878v1) — https://arxiv.org/abs/2609.30878