Usuários atacam IAs em 0,9% das mensagens, diz estudo

Pesquisa auditou 777 mil conversas em inglês do dataset LMSYS-Chat-1M com dois detectores independentes

Por Marcos Guimarães15 set 2026
Usuários atacam IAs em 0,9% das mensagens, diz estudo

O que aconteceu

O artigo "How User-AI Mistreatment Occurs and Matters in Conversational Systems?" foi submetido ao arXiv em 11 de setembro de 2026 (arXiv:2609.13579). Os autores auditaram 777 mil conversas em inglês do LMSYS-Chat-1M, base usada em avaliações de arena, com dois detectores independentes: um léxico de oito categorias para hostilidade dirigida ao modelo e o sinal de moderação que já acompanha o dataset. O LMSYS-Chat-1M, conjunto público de diálogos, foi processado pelos dois filtros.

Os dois detectores capturam fenômenos diferentes e pouco sobrepostos. O léxico encontra insultos, ameaças e coerção de jailbreak contra o assistente. O sinal de moderação, por sua vez, é dominado por pedidos de conteúdo tóxico, não por hostilidade contra o modelo. Juntos, os dois marcam cerca de 5% dos turnos de usuário. Ajustando a união mais estreita, a de léxico e assédio, pela precisão medida, o maltrato dirigido ao assistente fica em 0,90%.

Os autores fazem uma ressalva explícita no próprio resumo: essas taxas absolutas descrevem tráfego de avaliação no estilo arena e não devem ser lidas como taxas-base de toda implantação em produção.

Contexto

A pesquisa de segurança em IA costuma mirar os danos que o modelo gera. Este trabalho inverte a direção e mede a hostilidade, a coerção e a pressão adversarial que os usuários aplicam aos modelos. Entender como e quando isso ocorre é, segundo o artigo, essencial para interpretar comportamento do modelo, drift de alinhamento e riscos reais de implantação.

O achado central é que a hostilidade do usuário varia 13 vezes entre modelos. A variação é explicada sobretudo por quem cada modelo atrai, e não pelo comportamento do modelo em si. Hostilidade no primeiro turno se espalha muito mais do que hostilidade depois da resposta. Mesmo depois de deduplicar os prompts de abertura, mais de quinze vezes separa os extremos.

O desenho metodológico também é um resultado. Como o léxico de hostilidade e o sinal de moderação do LMSYS-Chat-1M medem coisas distintas, tratar os dois como equivalentes distorceria qualquer diagnóstico sobre segurança.

Por que importa

Dentro de uma mesma conversa, pedidos de desculpa do assistente aparecem consistentemente associados a odds maiores de hostilidade no turno seguinte, nos dois detectores. O efeito sobrevive quando os autores restringem a análise a turnos anteriores que não foram recusados e a conversas sem jailbreak, e é positivo em 20 dos 23 modelos avaliados.

Mas o sinal se inverte quando a comparação é entre modelos. Modelos que pedem mais desculpas recebem menos hostilidade no conjunto. O contraste indica que o mesmo comportamento do assistente tem efeito diferente dentro da conversa e no agregado por modelo, algo que qualquer equipe de avaliação precisa separar antes de tirar conclusões.

A hostilidade também tem estrutura temporal. Aberturas coercitivas se concentram no primeiro turno, enquanto a hostilidade afetiva se acumula ao longo da sessão. Modelos que recebem muitos pedidos agressivos logo de cara convivem com um público diferente daqueles que enfrentam desgaste gradual.

Impacto

Para quem treina e avalia modelos, o número de 0,90% não serve como métrica de produção, mas serve como piso de referência para medir hostilidade em tráfego real, onde a composição de usuários é outra. A variação de 13 vezes entre modelos mostra que comparar chatbots por volume bruto de abuso é enganoso: a maior parte da diferença vem da audiência que cada sistema atrai.

Para times de moderação e suporte, a associação entre desculpas e hostilidade seguinte sugere que respostas apológicas não encerram o conflito dentro da conversa. Já a leitura agregada aponta o oposto, e essa tensão é o ponto mais delicado do artigo.

O que muda

Os autores liberaram o léxico de oito categorias, o pipeline de validação cruzada entre detectores e todas as tabelas derivadas. Isso permite que outros grupos reproduzam a auditoria sobre o LMSYS-Chat-1M ou apliquem os mesmos detectores a bases próprias. O método de cruzar duas medidas de hostilidade, em vez de confiar em uma só, passa a ser replicável.

O que vem agora

O artigo não anuncia próximos passos além da liberação dos artefatos. A lacuna que ele mesmo aponta é a das taxas-base: os 0,90% valem para tráfego de arena, e medir o mesmo fenômeno em sistemas em produção exige novos conjuntos de dados. Até lá, os resultados servem como referência metodológica e como alerta sobre o que uma métrica única de moderação deixa passar.

Fontes