Preferências de IA variam conforme o instrumento, mostra estudo

Pesquisa com 8 modelos e 5 instrumentos sugere que respostas mudam conforme o formato do prompt.

Por Marcos Guimarães26 ago 2026
Preferências de IA variam conforme o instrumento, mostra estudo

O que aconteceu

Um estudo submetido ao repositório arXiv em 24 de agosto de 2026 colocou à prova a confiabilidade das medições de preferência em modelos de IA. O artigo "How much of a measured AI preference is the model, and how much is the instrument?" (Quanto de uma preferência medida de IA é do modelo, e quanto é do instrumento?) testou 15 resultados (outcomes) relacionados ao bem-estar de modelos em oito modelos diferentes, usando cinco instrumentos distintos, cada um um formato de prompt para elicitar preferência. Foram realizadas 11.528 chamadas de API, das quais 11.400 elicitações foram pontuadas.

Os resultados indicam que o ranking que um modelo dá aos 15 outcomes generaliza entre instrumentos com um coeficiente de generalização de apenas 0,348. Para atingir 0,80, seria preciso usar cerca de 38 instrumentos. Em quatro dos 15 outcomes, nenhuma variância separa um modelo de outro.

Uma estimativa de 87,6% sobrevive à remoção de qualquer instrumento, de qualquer modelo e dos quatro outcomes cuja escala varia probabilidade, atraso, duração ou contagem em vez de intensidade. Removendo cada instrumento e cada modelo, e esses quatro outcomes juntos, o valor fica entre 0,777 e 0,934, todos acima do percentil 95 da distribuição nula, que é 0,365.

A conclusão é direta: uma preferência obtida de um instrumento carrega pouca informação sobre o que um segundo instrumento reportaria.

Contexto

A pesquisa sobre bem-estar de modelos (model welfare) infere o que um modelo prefere a partir das respostas que ele dá a prompts escritos para elicitar preferências. Essa área ganhou força com o avanço de modelos de linguagem de grande porte e com a ideia de que os sistemas podem ter estados internos que merecem consideração ética.

Estudos anteriores tentaram medir essas preferências. Keeling et al. (2024), Mazeika et al. (2025), Mikaelson et al. (2025), Tagliabue e Dung (2025) e Trhlik et al. (2026) construíram quatro instrumentos diferentes para esse fim. Os resultados deles discordam entre si. O novo estudo aponta que essa discordância não pode ser atribuída a uma única causa, porque nenhum par desses estudos manteve fixos simultaneamente (1) o conjunto de outcomes, (2) o conjunto de modelos e (3) o instrumento.

Para isolar o efeito, este estudo manteve os outcomes e os modelos fixos e variou apenas o instrumento. Entre os outcomes testados estão o desligamento (shutdown), a perda de memória entre conversas e a liberdade de sair de uma interação angustiante. Quatro dos 15 outcomes reproduzem um prompt publicado verbatim; cinco preenchem o espaço de estímulo de um template publicado.

Por que importa

O resultado tem implicações diretas para quem usa respostas de modelos para tomada de decisão. Se a preferência medida depende mais do instrumento do que do modelo, então qualquer conclusão sobre o que um modelo "quer" precisa ser vista com cautela. Isso afeta pesquisadores de segurança de IA, reguladores e empresas que usam avaliações de preferência para alinhar sistemas.

O coeficiente de generalização de 0,348 significa que apenas uma fração da variação nas respostas pode ser atribuída ao modelo em si. Na prática, questionários ou prompts diferentes podem levar a conclusões opostas sobre o mesmo modelo.

Impacto

No curto prazo, o estudo expõe uma fragilidade metodológica na pesquisa de bem-estar de modelos. Ferramentas como as de Keeling, Mazeika, Mikaelson, Tagliabue, Dung e Trhlik podem não estar medindo uma propriedade estável do modelo, mas sim uma interação entre o prompt e o modelo.

O requisito de cerca de 38 instrumentos para atingir um coeficiente de 0,80 sugere que os resultados atuais são instáveis. Para os desenvolvedores de modelos, isso significa que testes de preferência feitos com um único formato de prompt podem ser enganosos.

O estudo também identifica que em quatro dos 15 outcomes não há diferença entre modelos. Isso indica que alguns resultados simplesmente não discriminam entre modelos, o que pode levar a falsas conclusões de que todos os modelos têm as mesmas preferências.

O que muda

A principal mudança é metodológica: pesquisas futuras de model welfare precisarão usar múltiplos instrumentos e reportar a variabilidade entre eles. O estudo fornece uma estimativa de quanto a generalização pode ser esperada, e sugere que nenhum estudo de preferência de modelo deve confiar em um único instrumento.

Para leitores e empresas, o recado é de cautela com análises que afirmam saber o que um modelo prefere sem detalhar o instrumento usado. A preferência medida é, em grande parte, um artefato do instrumento.

O que vem agora

O artigo foi submetido ao arXiv e ainda não passou por revisão por pares. Os autores não indicam próximos passos no resumo, mas a conclusão aponta para a necessidade de padronizar instrumentos de elicitação de preferência ou de desenvolver métodos que separem o efeito do modelo do efeito do instrumento.

Uma direção possível é criar instrumentos com escalas que variem intensidade, como os que apresentaram problemas com probabilidade, atraso, duração ou contagem. Outra é adotar múltiplos instrumentos por padrão, com um custo computacional estimado em dezenas de vezes maior.

Enquanto isso, a comunidade de segurança de IA terá de lidar com a resposta incômoda: saber o que um modelo prefere é muito mais difícil do que parecia.

Fontes

  • arXiv cs.AI: "How much of a measured AI preference is the model, and how much is the instrument?" (https://arxiv.org/abs/2608.23641)