Degradação desigual em modelos de linguagem ternários
Pesquisa submetida ao arXiv mostra que a conversão ternária não substitui um modelo geral, mas é útil para tarefas específicas.
O que aconteceu
Um estudo submetido ao arXiv em 28 de agosto de 2026 converteu o modelo Qwen3.5-0.8B, de 752 milhões de parâmetros, em pesos ternários, restritos aos valores -1, 0 e +1. O trabalho, identificado como arXiv:2608.28809, usou 72,4 milhões de tokens de treinamento com quantização consciente (quantisation-aware training, QAT) para gerar o modelo Cloe. A avaliação cobriu 29 benchmarks, diagnósticos de representação e fine-tuning.
O Qwen3.5-0.8B, modelo original da série Qwen, serviu de professor em precisão total. Sobre o Cloe, modelo ternário resultante, o estudo encontrou um padrão de degradação não uniforme. Um probe linear recuperou 43,76% das respostas do MMLU a partir das representações do professor, mas apenas 26,19% a partir do Cloe, número próximo ao acaso. Isso indica perda de informação factual especializada.
Ainda assim, o Cloe manteve performance mensurável em dez tarefas, com média de 77,1% da performance do professor. Em fine-tuning, o Cloe chegou a 89,8% no SST-2, o que corresponde a 95,6% do professor equivalente, e alcançou 79,4% de retenção no XSum.
Contexto
Os modelos de linguagem ternários restringem os pesos a três valores, aproximando-se do limite teórico de log2 3, cerca de 1,585 bit por peso. No caso do Qwen3.5-0.8B, com 752 milhões de parâmetros, isso representa um caminho para inferência com menos recursos computacionais e implantação em ambientes com restrições.
A pergunta prática do estudo não era apenas se os pesos poderiam ser quantizados, mas quais capacidades sobreviveriam e se o modelo continuaria útil para adaptação. A resposta observada foi estratificada: algumas habilidades resistem melhor do que outras. O modelo Cloe, derivado do Qwen3.5-0.8B, ilustra essa diferença ao reter tarefas de classificação e sumarização, mas perder boa parte do conhecimento factual medido pelo MMLU.
Por que importa
A conversão ternária não serve como substituto geral e imediato de um modelo em precisão total. Para aplicações que dependem de fatos especializados, como respostas a perguntas de múltiplas disciplinas, o Cloe fica próximo do acaso. No MMLU, o probe linear recuperou 26,19% das respostas, contra 43,76% do professor.
Por outro lado, para tarefas específicas, o Cloe mostrou ser um substrato compacto útil. O fine-tuning elevou o modelo a 89,8% no SST-2, um benchmark de análise de sentimento, e a 79,4% de retenção da performance do professor no XSum, usado para sumarização. Isso indica que quem precisa de modelos pequenos para tarefas delimitadas pode se beneficiar, enquanto quem precisa de um modelo geral deve manter a versão em precisão total.
Impacto
Um dos achados mais relevantes é metodológico. A avaliação padrão por letra de resposta falhou no MMLU: o Cloe emitiu a letra A em 98,6% das perguntas. O estudo precisou usar pontuação por continuação de texto (continuation scoring) para obter métricas confiáveis. Sem essa correção, qualquer leitura da performance do modelo seria enganosa.
No curto prazo, a lição é que benchmarks de múltipla escolha podem mascarar o colapso de um modelo ternário quando o formato de saída é artificialmente restrito. No médio prazo, o resultado de 77,1% de performance média em dez tarefas, com 95,6% da performance do professor equivalente no SST-2 após fine-tuning, sugere que modelos ternários podem ser viáveis em pipelines de tarefa única.
O que muda
Para engenheiros e pesquisadores, o estudo muda a forma de avaliar quantização extrema. Antes de declarar que um modelo ternário funciona ou não, é preciso verificar qual capacidade está sendo medida e como a saída é pontuada. A conversão do Qwen3.5-0.8B no Cloe mostra que a degradação é seletiva e que conhecimento factual é mais vulnerável do que habilidades estruturais.
A conclusão do artigo é objetiva: a conversão ternária é inadequada como substituto direto de uso geral, mas permanece valiosa como base compacta para modelos específicos de tarefa.
O que vem agora
O estudo atribui a degradação a uma combinação de perda de informação causada pela quantização e recuperação incompleta devido ao orçamento limitado de QAT, de 72,4 milhões de tokens. Uma linha natural de avanço é testar orçamentos maiores de QAT ou técnicas de recuperação de conhecimento após a quantização.
O artigo arXiv:2608.28809 foi submetido em 28 de agosto de 2026 e está disponível na seção de Inteligência Artificial da plataforma. Como se trata de uma submissão recente, ainda não há detalhes públicos sobre versões revisadas ou código de reprodução.
Fontes
- arXiv cs.AI: Capability-Stratified Degradation in Ternary Language Models (https://arxiv.org/abs/2608.28809)
