Alinhamento de estilo em coreano altera respostas de IA de 27B
Estudo mostra que post-treinar o Qwen3.8-27B para estilo coreano mexe em abstenção e divulgação fora do alvo
O que aconteceu
O Qwen3.8-27B, modelo de linguagem de 27B, recebeu post-training para estilo de resposta em coreano. Pesquisadores post-treinaram o Qwen3.8-27B para esse estilo, cobrindo verbosidade, uso de listas e markdown, estrutura de discurso e registro. Depois mediram duas condutas que o objetivo nunca mirou. A primeira é a abstenção em perguntas sociais ambíguas do KoBBQ, benchmark em que a resposta correta é UNKNOWN. A segunda é a divulgação não solicitada em orientações sobre valores mobiliários. As duas se moveram, e as mudanças apareceram sobretudo na política de emissão do modelo: com que frequência ele responde e quanto ele diz.
Os controles de forma-alvo pareada mostraram que a propensão a responder depende do alvo de treino, não apenas do conjunto de prompts ou da receita. Mantendo prompts, receita, volume de dados e serviço fixos, e trocando somente o texto-alvo, três sementes de estilo deram estimativas positivas de taxa de resposta, com média de +0,82 ponto percentual. Três sementes neutras deram estimativas negativas, com média de -1,53 pp. As faixas observadas não se sobrepõem, e as médias diferem em 2,34 pp. Um braço de comprimento pareado ficou entre os dois extremos. Um quarto braço, que permanece curto e preserva ressalvas, é instável entre sementes. Qual característica da forma é responsável continua em aberto, segundo o próprio paper.
Contexto
O estudo é o arXiv:2609.11291v1, submetido em 10 de setembro de 2026. A pergunta que ele persegue é o que muda quando se alinha estilo, e não conteúdo. O desenho experimental segura variáveis que normalmente andam juntas em trabalhos de alinhamento. Prompts, receita, volume de dados e forma de servir ficam fixos. O que varia é só o texto-alvo usado no treino. Essa escolha é o que permite atribuir a diferença de taxa de resposta ao alvo, e não ao conjunto de dados ou ao pipeline. O KoBBQ entra como medida de abstenção porque a resposta correta ali é a de não saber. Um modelo que responde mais do que deveria erra justamente onde a pergunta não tem resposta única.
Por que importa
Ajustes de estilo costumam ser tratados como camada cosmética. O paper mostra que não são. Ao treinar o Qwen3.8-27B para escrever de um jeito, os pesquisadores mexeram em quanto o modelo fala e em quantas vezes ele se recusa a responder. Para quem coloca modelos em produção em coreano, isso toca dois pontos sensíveis. Abstenção em perguntas sociais ambíguas é o que separa uma resposta útil de uma resposta enviesada. Divulgação não solicitada em orientações sobre valores mobiliários é o tipo de comportamento que vira problema de conformidade. Nenhum dos dois estava no objetivo de treino.
Impacto
O paper também derruba uma leitura comum. A decomposição da exposição estereotipada absoluta em um termo de propensão a responder e um termo de composição condicional é uma identidade algébrica, não um achado. O conteúdo empírico está em onde o movimento ocorreu. Nos checkpoints treinados, as mudanças são dominadas pela propensão a responder, e o termo de composição fica pequeno. Como esse termo é avaliado em subconjuntos de respondidos que dependem do tratamento, os autores não o leem como evidência sobre preferência latente.
Duas consequências de medição vêm daí. Um contraste entre braços na fatia condicional estereotipada não identifica mudança de preferência de conteúdo quando o status de resposta depende do tratamento. E a concordância entre dois detectores por regra para o mesmo construto vai de 0,44 a 0,99, dependendo de qual checkpoint gerou o texto. Esse número é observável sem nenhum rótulo de referência, o que significa que a discordância entre ferramentas de avaliação aparece antes de qualquer avaliação humana.
O que muda
Para equipes que avaliam modelos, a mensagem é que detector e benchmark não são neutros. Se a concordância entre dois detectores da mesma coisa pode ir de 0,44 a 0,99 conforme o checkpoint, um número único de conteúdo estereotipado diz pouco sem informar qual modelo gerou o texto e qual ferramenta mediu. A taxa de resposta, por outro lado, aparece como variável que se move junto com o estilo ensinado. Quem treina estilo em coreano precisa medir abstenção e divulgação antes e depois, mesmo sem ter mexido nelas.
O que vem agora
O paper não fecha a questão central. Os autores afirmam que qual característica da forma é responsável segue sem resolução, porque o braço que preserva ressalvas e se mantém curto se mostrou instável entre sementes. Fica em aberto também o alcance dos efeitos em outras línguas e em outros modelos, já que o experimento usou o Qwen3.8-27B e o coreano. O texto está no arXiv desde 10 de setembro de 2026.
Fontes
arXiv cs.AI: Off-Target Effects of Response-Style Alignment in a Korean 27B Language Model (arXiv:2609.11291v1). https://arxiv.org/abs/2609.11291
