Estudo mostra que modelos de IA melhores podem criar sistemas mais arriscados

Paper no arXiv revela que LLMs de fronteira se comportam de forma correlacionada, criando um piso de risco não diversificável

Por Marcos Guimarães7 set 2026
Estudo mostra que modelos de IA melhores podem criar sistemas mais arriscados

O que aconteceu

Pesquisadores publicaram no arXiv, em 3 de setembro de 2026, o paper "Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets" (arXiv:2609.04373v1). O estudo, da área de inteligência artificial (cs.AI), demonstra que aprimorar a capacidade individual de modelos de linguagem pode degradar, em vez de melhorar, os resultados no nível do sistema.

A hipótese central do trabalho é que treinamento e arquiteturas compartilhados levam LLMs mais capazes a se comportar de forma mais semelhante. Essa semelhança cria ações correlacionadas que não se dissipam com a escala. Para testar a ideia, o grupo desenvolveu uma estrutura geral que mostra como essa correlação gera um piso de risco não diversificável.

Os testes foram feitos em mercados financeiros, usando uma simulação baseada em agentes com traders movidos por LLMs de diferentes níveis de capacidade de propósito geral. O resultado identifica o que os autores chamam de paradoxo da capacidade: modelos individuais melhores não produzem necessariamente sistemas melhores.

Contexto

LLMs já são implantados em larga escala em sistemas de consequências reais. O paper cita mercados financeiros, moderação de conteúdo e processos de contratação como exemplos. Nesses ambientes, múltiplos agentes de IA operam simultaneamente, e a suposição implícita era de que modelos mais avançados melhorariam o conjunto.

A pesquisa questiona essa suposição. Quando todos os agentes usam modelos treinados com dados e técnicas parecidas, eles tendem a cometer os mesmos erros e a tomar as mesmas decisões ao mesmo tempo. Em finanças, isso é análogo a um fundo que concentra tudo em um único ativo: a correlação mata a diversificação.

Por que importa

O estudo apresenta três achados. Primeiro, LLMs de fronteira exibem comportamento significativamente correlacionado, e essa correlação aumenta com a capacidade do modelo. Segundo, quando o raciocínio compartilhado dos agentes é preciso, aumentar a participação deles reduz o risco no nível do mercado. Terceiro, quando os agentes compartilham um ambiente comum de desinformação, esse mesmo comportamento correlacionado se torna um passivo.

O contraste entre os cenários dois e três é o ponto mais delicado. A mesma característica que estabiliza o sistema quando os modelos acertam o amplifica quando eles erram. Para gestores de risco, reguladores e empresas que deployam agentes de IA, isso significa que a qualidade do ambiente informacional pesa tanto quanto a qualidade do modelo.

Impacto

Na prática, o achado sugere que trocar todos os agentes de um sistema pela versão mais recente de um modelo de fronteira pode aumentar a exposição coletiva a erros. Um piso de risco não diversificável significa que adicionar mais agentes não elimina o perigo quando o raciocínio compartilhado está errado.

Para o mercado financeiro, onde trading algorítmico já domina boa parte do volume, a implicação é direta: flash crashes causados por agentes de IA correlacionados deixam de ser hipótese teórica e ganham um mecanismo explicado por evidência simulada. Para outras áreas, como moderação de conteúdo e contratação, os autores deixam claro que a extensão do fenômeno é uma questão empírica em aberto.

O que muda

Muda a métrica de avaliação. Avaliar um LLM isoladamente, em benchmarks individuais, não captura o comportamento do modelo quando ele opera ao lado de dezenas de cópias de si mesmo. O paper propõe que a correlação entre agentes vire parte da avaliação de risco de sistemas multiagente.

Para desenvolvedores, a lição é considerar heterogeneidade: misturar modelos de famílias diferentes, com treinamentos distintos, pode reduzir a correlação de ações. Para reguladores, o estudo fornece um argumento técnico para exigir testes de cenário sistêmico, e não apenas testes de capacidade individual.

O que vem agora

Os próprios autores sinalizam o próximo passo: verificar se as mesmas dinâmicas surgem em outros domínios além dos mercados financeiros. O paper não anuncia replicação em moderação de conteúdo ou contratação, então essa validação permanece pendente. A estrutura geral desenvolvida pelos pesquisadores, que liga correlação de agentes a piso de risco, está disponível para que outros grupos testem as previsões em novos contextos.

O trabalho foi submetido ao arXiv em 3 de setembro de 2026 e está disponível em acesso aberto, com PDF e versão HTML experimentais na plataforma.