Segurança de LLMs falha em idiomas não-ingleses, aponta estudo
Pesquisa com 10 modelos mostra que alinhamento de segurança é centrado no inglês e ignora vieses em hindi, tâmil e outras línguas.
O que aconteceu
Pesquisadores publicaram no arXiv (arXiv:2608.18131) o estudo "Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs", que analisa como o alinhamento de segurança de LLMs é treinado majoritariamente em inglês e, por isso, deixa lacunas em outros idiomas. Para medir o problema, criaram o benchmark INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases), com 2.604 prompts em seis idiomas: inglês, hindi, bengali, marata, tâmil e hinglish (mistura de hindi e inglês).
Dez modelos — open-source e fechados — foram testados, gerando 14.988 pontuações de viés. Os resultados mostram que o bengali teve a maior média de viés entre os modelos open-source. Já o inglês apresentou uma reversão notável: foi o idioma com menor viés nos modelos abertos, mas o maior viés nos modelos fechados.
Contexto
O alinhamento de segurança de LLMs — o processo que ensina os modelos a evitar respostas prejudiciais — é historicamente dominado por dados em inglês. Isso cria uma "ilusão de alinhamento": os modelos parecem seguros quando testados em inglês, mas reproduzem estereótipos e preconceitos quando usados em outros idiomas. Na Índia, onde há dezenas de línguas faladas por milhões de pessoas, assistentes de voz e sistemas de diálogo baseados em LLMs podem propagar vieses socioculturais sem que os filtros de segurança os detectem.
Por que importa
O problema não é apenas acadêmico. Assistentes de voz, chatbots e sistemas de atendimento automático em países como o Brasil — que também tem diversidade linguística e variações regionais — podem reproduzir preconceitos de gênero, raça ou classe em português, já que o treinamento de segurança é feito majoritariamente em inglês. Para empresas que implementam LLMs em mercados multilíngues, isso representa um risco de reputação e de dano ao usuário.
Impacto
No curto prazo, o estudo expõe uma falha crítica em modelos amplamente usados: a segurança não é transferível entre idiomas. No médio prazo, desenvolvedores precisarão criar benchmarks multilíngues específicos para cada cultura, como o INCLUDE, e investir em dados de alinhamento em línguas locais. A reversão no desempenho do inglês entre modelos abertos e fechados também sugere que estratégias de treinamento diferentes produzem resultados opostos — um ponto que merece investigação.
O que muda
Para o mercado, a mensagem é clara: avaliar um LLM apenas em inglês não garante segurança em outros idiomas. Empresas que operam em mercados emergentes — incluindo o Brasil — precisam exigir testes de viés em português e em variações regionais antes de adotar modelos. O estudo também reforça a necessidade de benchmarks locais, como o INCLUDE, que podem servir de modelo para outras culturas.
O que vem agora
Os pesquisadores devem disponibilizar o benchmark INCLUDE publicamente, permitindo que outros grupos avaliem seus modelos. A comunidade de IA precisa avançar na criação de datasets de alinhamento multilíngues e culturalmente específicos. Enquanto isso, usuários e empresas devem tratar os resultados de segurança em inglês como insuficientes para uso global.
