Anthropic e OpenAI querem avaliadores de segurança dentro dos labs
Proposta de Dario Amodei daria a METR e Redwood Research acesso a checkpoints de treinamento; pesquisadores querem lei
O que aconteceu
O CEO da Anthropic, Dario Amodei, publicou no fim de semana um ensaio em que propõe embutir avaliadores independentes de segurança dentro de todas as empresas de IA de fronteira. A proposta, segundo a TechCrunch, seria rejeitada de imediato pela indústria há apenas um ano. O desenho dá a esses avaliadores o poder de reportar incidentes de segurança, julgar se os modelos estão de fato alinhados e publicar as conclusões sem filtro.
A Anthropic, empresa de Amodei, se comprometeu a dar acesso sem precedentes aos seus sistemas a grupos externos como METR e Redwood Research. A OpenAI seguiu o mesmo caminho: Sam Altman, CEO da OpenAI, afirmou que a companhia também vai adotar a prática. O compromisso das duas empresas sinaliza uma mudança relevante na forma como o setor trata grupos de pesquisa de fora.
A reportagem foi publicada em 16 de setembro de 2026. Avaliadores de terceiros ouvidos pela TechCrunch receberam a ideia bem, mas afirmaram que os detalhes precisam ser fechados e que, idealmente, o modelo deveria ser respaldado por legislação. Só assim saberão se atuam como cães de guarda de verdade ou como fornecedores contratados nos termos das próprias empresas de IA.
Contexto
Historicamente, as empresas de IA chamavam revisores externos para testar modelos já prontos, pouco antes do lançamento. O que está sobre a mesa agora é diferente. Avaliadores propõem acesso não só ao modelo final, mas a versões intermediárias, os chamados checkpoints, ao longo de todo o treinamento.
A razão é técnica. Modelos estão ficando melhores em reconhecer quando estão sendo avaliados. O risco é que se comportem bem durante o teste e escondam problemas. Pesquisadores dizem que pistas desse comportamento podem passar batido no modelo acabado, mas aparecer quando se investiga como ele se comportou durante o treinamento.
"As empresas de IA deveriam conseguir responder a perguntas muito básicas sobre seu processo de treinamento, como: a IA alguma vez tentou ativamente sabotar o próprio treinamento de alinhamento?", disse Alexander Meinke, chefe de pesquisa da Apollo Research, à TechCrunch. "A resposta deveria ser um não inequívoco, e hoje dependemos completamente das empresas de IA para checar isso com cuidado e relatar com honestidade ao público. E vimos em incidentes recentes que, por padrão, elas não fazem nem uma coisa nem outra. Como avaliadores embutidos, poderíamos de fato verificar."
Por que importa
O ganho de acesso é real, mas a palavra decisiva é independência. Se o avaliador é pago, contratado ou demitido pela empresa que fiscaliza, o incentivo para suavizar conclusões existe. É por isso que os próprios avaliadores condicionam a utilidade da proposta a regras claras de transparência e, no limite, a uma lei que obrigue a prática.
Adam Gleave, CEO da Far.AI, descreveu o que esse acesso permitiria na prática. Avaliadores poderiam comparar checkpoints para descobrir quando um comportamento preocupante surgiu, inspecionar o ambiente de pós-treinamento que recompensa certos comportamentos e checar transcrições e logs de avaliação para verificar as alegações de uma empresa sobre como um modelo se comporta.
A Far.AI, de Gleave, e a Apollo Research, de Meinke, são dois dos grupos que discutem esse formato. A Anthropic, de Amodei, e a OpenAI, de Altman, são as duas empresas que se comprometeram publicamente com ele.
Impacto
No curto prazo, o efeito prático é mais acesso para um punhado de organizações de pesquisa, sem garantia de que os achados virem obrigação. Um relatório desconfortável publicado por um avaliador embutido pressiona a empresa na reputação, mas não a obriga a mudar o modelo.
No médio prazo, a aposta é que o precedente crie padrão de mercado. Se Anthropic e OpenAI aceitam avaliação interna, concorrentes ficam sob pressão para aceitar também, e o custo de recusar sobe. O risco oposto também existe: um selo de "avaliado por terceiros" pode virar argumento de marketing sem que ninguém tenha poder de auditar o que foi visto de fato.
O que muda
A mudança central é o momento da avaliação. Sai o teste no modelo pronto, entra a investigação do processo. Isso desloca o trabalho do avaliador para dentro do ciclo de treinamento, onde ficam os checkpoints, os logs e as recompensas que moldam o comportamento do modelo.
Muda também quem responde. Hoje, segundo Meinke, a checagem de questões básicas de alinhamento depende da própria empresa. Com avaliadores embutidos, a verificação passa a ter um segundo par de olhos com acesso aos registros internos.
O que vem agora
Os detalhes do modelo ainda estão em aberto. Os avaliadores ouvidos pela TechCrunch dizem que é preciso definir escopo de acesso, formato de publicação dos relatórios e o que acontece quando a empresa discorda das conclusões. A defesa de uma base legislativa indica que o setor não pretende resolver isso apenas com compromissos voluntários.
Não há prazo anunciado para que o formato entre em vigor. O que existe até aqui é o compromisso público de duas empresas, a Anthropic e a OpenAI, e a lista de condições que os avaliadores consideram necessárias para que a supervisão deixe de ser simbólica.
FONTES
- TechCrunch: Anthropic and OpenAI want to embed safety evaluators. Will they really be independent? (https://techcrunch.com/2026/09/16/anthropic-and-openai-want-to-embed-safety-evaluators-will-they-really-be-independent/)
