Depth Control Protocol questiona métrica de profundidade em LLMs recursivos
Depth Control Protocol separa três fatores que a truncagem de profundidade mistura em um único número
O que aconteceu
O artigo "Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models" foi submetido ao arXiv em 17 de setembro de 2026 e está registrado como arXiv:2609.19934v1, na área de Computer Science, subcategoria Artificial Intelligence. A submissão aparece como tipo "new" no serviço de anúncios do repositório.
O texto propõe o Depth Control Protocol, ou DCP, uma suíte de diagnóstico para verificar se modelos de linguagem com recorrência de profundidade usam de fato a profundidade que aplicam na inferência. O Depth Control Protocol, o DCP, foi desenhado para separar três grandezas que hoje são medidas de uma só vez.
O problema apontado pelo artigo é de medição. Modelos recorrentes em profundidade aplicam repetidamente um pequeno conjunto de camadas, o que desacopla o cálculo por token da contagem de parâmetros distintos. Tanto a literatura de recorrência quanto a de poda de camadas usam a mesma avaliação para saber se o modelo aproveita essa profundidade: truncar a profundidade no momento da inferência, plotar a qualidade contra a fração de profundidade retida e ler a inclinação da curva resultante. O método é barato e não exige treinamento. Segundo o artigo, também é enganoso.
A truncagem de profundidade altera três propriedades do modelo ao mesmo tempo. Ela reduz o número de aplicações de bloco, diminui o volume de computação distinta executada e empurra a cabeça de leitura para um fluxo residual fora da distribuição em que foi treinada. A inclinação observada na curva mistura os três fatores, mas a leitura convencional atribui o efeito apenas ao segundo deles, o volume de computação distinta.
Contexto
A crítica do artigo é sobre um atalho metodológico consolidado. Como a truncagem de profundidade é gratuita e não exige retreinar nada, virou a régua compartilhada por dois campos que estudam arquiteturas diferentes. O resultado é que um único escalar extraído de uma intervenção complexa passou a responder por uma pergunta importante: este modelo está realmente aproveitando a profundidade que tem?
O DCP responde com cinco componentes. Três são controles positivos, cada um isolando um dos fatores enquanto varia os outros. Um quarto é um controle negativo, que aplica intervenções idênticas a transformers densos para garantir que o efeito observado não é artefato do próprio protocolo de medição. O quinto é uma intervenção de treinamento controlada, usada para verificar causalidade.
O controle central, descrito no artigo como o mais decisivo, roda o orçamento completo de aplicações de bloco executando apenas uma única iteração distinta. Esse controle só é estritamente realizável em arquiteturas com compartilhamento de pesos ao longo da profundidade. Em uma rede densa, repetir uma camada produz um modelo completamente diferente, e não o mesmo modelo em uma configuração alternativa. É essa assimetria que dá ao DCP seu poder de discriminação.
Por que importa
Para quem treina modelos recorrentes em profundidade, a métrica antiga podia inflar ou esconder ganhos reais. Se a inclinação da curva é lida como prova de que a profundidade é útil, um modelo pode parecer mais eficiente do que é, ou mais dependente da profundidade do que realmente depende. O volume de computação distinta executada é apenas um dos três fatores medidos, e o artigo sustenta que é o único que a convenção enxerga.
O caso dos transformers densos também importa. O controle negativo do Depth Control Protocol existe justamente para checar se o efeito medido é característica do modelo ou do instrumento. Sem esse teste, resultados de arquiteturas distintas ficam difíceis de comparar.
Impacto
Uma consequência direta é a revisão de comparações já publicadas entre modelos recorrentes e modelos densos. Se a truncagem de profundidade confunde três fatores, rankings baseados nessa curva precisam ser relidos com o DCP em mãos. O impacto maior recai sobre decisões de arquitetura: quanto de profundidade recorrente vale a pena, e em que ponto o retorno adicional deixa de compensar.
O DCP também dá à área um vocabulário separado. Número de aplicações de bloco, volume de computação distinta e posição da cabeça de leitura no fluxo residual passam a ser medidas distintas, cada uma com seu próprio controle. Isso permite testar hipóteses específicas em vez de discutir um único número agregado.
O que muda
A pergunta deixa de ser apenas "o modelo piora quando corto a profundidade" e passa a ser "qual dos três fatores explica a piora". O controle que executa o orçamento completo de aplicações com uma só iteração distinta é o que torna essa distinção operacional, e ele depende de compartilhamento de pesos ao longo da profundidade.
O que vem agora
O artigo foi submetido em 17 de setembro de 2026 sob o identificador arXiv:2609.19934v1 e está disponível na categoria Computer Science, subcategoria Artificial Intelligence. Os próximos passos naturais são a replicação do protocolo por outros grupos e a reavaliação de resultados anteriores de recorrência e de poda de camadas com a separação proposta pelo Depth Control Protocol.
Fontes
- arXiv cs.AI: Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models (https://arxiv.org/abs/2609.19934)
