Estudo mapeia sensibilidade de camadas em modelos MoE do Qwen
Análise mostra quais camadas de arquiteturas Mixture-of-Experts podem ser comprimidas sem perda.
O que aconteceu
Uma equipe de pesquisa publicou em 25 de junho de 2026 no arXiv (arXiv:2608.13565) um estudo intitulado "Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking". O trabalho foca no modelo Qwen3.6-35B-A3B, que possui 40 camadas MoE, 256 experts por camada e roteamento top-8. O benchmark utilizado foi o XLCoST, focado em tradução de código entre línguas.
Os pesquisadores conduziram um teste em três fases (100, 300 e 500 prompts) em três servidores com GPUs H100. O método principal foi o "expert masking" baseado em magnitude, onde experts de menor magnitude são desativados. O achado central é que a sensibilidade é fortemente dependente da profundidade: as camadas iniciais (0-9) e intermediárias (10-29) são muito frágeis ao mascaramento, enquanto as camadas tardias (30-39), especialmente as muito tardias (35-39), toleram a desativação agressiva de experts de baixa magnitude.
Em um teste com 300 prompts, uma política uniforme de mascaramento de 30% em todas as camadas manteve apenas 150 de 300 saídas classificadas como "Boas/Similares". Por outro lado, políticas focadas nas camadas tardias mantiveram 249 a 255 saídas, mascarando entre 640 e 1.145 experts. Em uma validação final com 500 prompts, a política mais restrita (apenas camadas 35-39 com 50% de mascaramento) foi a mais eficiente, mantendo 419 de 500 saídas "Boas/Similares" enquanto desligava apenas 640 dos 10.240 experts totais.
O estudo também testou reduzir a largura do roteamento top-k de 8 para 6 experts por token. Isso resultou em uma grande redução no tempo de processamento (wall-clock) em um teste com 100 prompts, sem perda de qualidade, embora ainda não se componha bem com o mascaramento agressivo de experts.
Contexto
Arquiteturas Mixture-of-Experts (MoE) são uma forma de escalar modelos de linguagem (LLMs) mantendo a eficiência computacional, ativando apenas um subconjunto de seus parâmetros para cada entrada. O modelo Qwen analisado é um exemplo destas arquiteturas complexas. Apesar de sua adoção crescente, a importância relativa de cada camada MoE, especialmente para fins de compressão e otimização, ainda não estava bem caracterizada na literatura. Este estudo preenche essa lacuna com uma análise empírica.
Por que importa
A principal implicação prática é para a compressão e otimização de LLMs. Saber quais camadas e experts são dispensáveis permite criar modelos menores, mais rápidos e que consomem menos energia, sem sacrificar a qualidade da resposta. Para empresas e desenvolvedores, isso significa redução de custos operacionais com hardware (menos GPUs necessárias) e possibilidade de rodar modelos em ambientes com mais restrições.
Impacto
No curto prazo, os resultados fornecem um "mapa" empírico para aplicar técnicas de "weight surgery" (cirurgia de pesos) ou pontuação de experts baseada em ativação. No médio prazo, pode guiar estratégias de treinamento para recuperação de desempenho após a compressão. O método abre um caminho concreto para tornar modelos MoE enormes mais acessíveis e eficientes, o que pode acelerar sua adoção em produção em diversas empresas.
O que muda
A principal mudança é a compreensão de que nem todas as camadas de um modelo MoE são igualmente importantes. Isso desafia uma abordagem uniforme de otimização e direciona esforços para políticas de compressão inteligentes e localizadas, focadas especificamente nas camadas tardias, onde há maior folga para redução de parâmetros.
O que vem agora
Os autores estabelecem uma base para próximos passos: (1) o desenvolvimento de técnicas de "weight surgery" física, onde os pesos dos experts mascarados seriam removidos do modelo; (2) a criação de métodos de pontuação de experts baseados em seus padrões de ativação; e (3) a investigação de técnicas de treinamento para recuperar o desempenho perdido após a compressão agressiva.
