Seg-OPD: destilação por segmentos melhora raciocínio de LLMs

Técnica de destilação por segmentos treina o aluno a revisar passos intermediários e supera baselines em matemática e programação competitiva

Por Marcos Guimarães5 out 2026
Seg-OPD: destilação por segmentos melhora raciocínio de LLMs

O que aconteceu

Um novo método para treinar modelos de linguagem na correção do próprio raciocínio foi publicado no arXiv. O artigo "Learning to Revise Reasoning with Segment-wise On-Policy Distillation" foi submetido em 2 de outubro de 2026 e entrou na listagem de novos trabalhos da categoria Computer Science > Artificial Intelligence do repositório.

Os autores propõem o Segment-wise On-Policy Distillation, chamado de Seg-OPD. O método seleciona segmentos do raciocínio produzido pelo modelo aluno com base em uma métrica de incerteza e pede que o modelo professor reescreva esses trechos, gerando o que o paper chama de redrafts. O treinamento ensina o aluno a preferir os redrafts do professor aos seus próprios segmentos pareados, sem abandonar a supervisão densa token a token que caracteriza a destilação on-policy tradicional.

Nos experimentos, alunos treinados com Seg-OPD atingiram taxas de sucesso de revisão mais altas que os baselines comparados. O ganho médio relativo em acurácia de raciocínio foi de 5,22% em modelos e tarefas variados (arXiv, outubro de 2026). O código está disponível em um link anonimizado: anonymous.4open.science/r/Seg-OPD.

Contexto

A destilação on-policy (OPD) é uma técnica estabelecida para melhorar o raciocínio de LLMs. Nela, o aluno é treinado sobre seus próprios rollouts e recebe supervisão token a token do professor, camada por camada de tokens gerados.

O problema apontado no artigo é que essa supervisão não oferece um passo alternativo coerente. Em vez de mostrar como o trecho poderia ser reescrito para melhorar o que vem depois, ela apenas reforça a distribuição de tokens do professor no caminho que o aluno já escolheu.

Há um segundo problema. Quando o aluno produz um prefixo de raciocínio degenerado, a supervisão do professor permanece condicionada a esse prefixo e pode reforçar padrões ruins de raciocínio. Por meio de intervenções controladas, os autores verificaram que substituir segmentos do aluno por redrafts do professor melhora a acurácia do raciocínio subsequente. Foi desse achado que nasceu a proposta de transformar os redrafts em supervisão explícita.

Por que importa

Destilação é o caminho padrão para levar capacidade de raciocínio de modelos grandes para modelos menores, mais rápidos e mais baratos de servir. A supervisão token a token é granular, mas não ensina o modelo a se recuperar de um erro no meio de uma cadeia longa de passos.

Esse modo de falha é caro em tarefas de múltiplas etapas. Em matemática e programação competitiva, um passo errado contamina tudo o que vem depois, e o modelo raramente volta atrás para corrigir. O Seg-OPD muda o alvo do treinamento: além de imitar tokens, o aluno aprende a preferir a versão corrigida do próprio trecho.

Os ganhos aparecem justamente nessas duas frentes. O paper relata experimentos em raciocínio matemático e programação competitiva, com melhora média relativa de 5,22% em acurácia entre modelos e tarefas diversos, além de taxas de sucesso de revisão superiores às dos baselines de estado da arte.

Impacto

Para equipes que treinam modelos menores a partir de modelos maiores, o Seg-OPD adiciona um sinal de correção ao objetivo de treinamento, sem descartar a supervisão token a token já usada na OPD. Isso significa que o método pode ser acoplado a pipelines de destilação existentes em vez de exigir uma arquitetura nova.

O abstract não informa o tamanho dos modelos testados nem a acurácia absoluta alcançada, apenas o ganho relativo. Também não detalha a métrica de incerteza usada para escolher os segmentos, além de descrevê-la como um critério de seleção. Esses pontos ficam em aberto até a publicação da versão completa e da revisão por pares.

O pacote de código aponta para um repositório anonimizado, o que indica submissão a conferência com revisão dupla-cega. A reprodutibilidade dos resultados, portanto, ainda depende da liberação do código com autoria identificada.

O que vem agora

O artigo é um preprint e não passou por revisão por pares. O próximo passo natural é a avaliação por revisores, que devem cobrar detalhes sobre a métrica de incerteza, o custo computacional de gerar redrafts com o professor e a comparação em tarefas além de matemática e programação competitiva.

Os autores disponibilizaram o código em link anônimo, sem data de liberação definitiva divulgada. Até lá, o resultado que o setor pode citar é o número reportado no abstract: 5,22% de melhora média relativa em acurácia de raciocínio (arXiv, outubro de 2026).

FONTES

  • [arXiv cs.AI | RESEARCH | score 95 | PRIMÁRIA] Learning to Revise Reasoning with Segment-wise On-Policy Distillation (https://arxiv.org/abs/2610.02703)