Microsoft: Copilot raramente reproduz artigos do NYT em ação de direitos autorais
Empresa usa dados da descoberta processual para rebater acusações do The New York Times, do CIR e de autores
O que aconteceu
A Microsoft divulgou números de uma análise feita na ação de direitos autorais movida por editores de notícias e autores de livros para sustentar que o Copilot, seu assistente de IA, raramente reproduz trechos de obras protegidas. A empresa forneceu 8,2 milhões de logs de conversas do Copilot a um perito contratado pelas editoras de notícias. Segundo a Microsoft, esses registros foram escolhidos porque "atingiam palavras-chave que implicavam uso dos sites das editoras de notícias", ou seja, eram os mais propensos a conter material protegido.
Os 8,2 milhões de logs de conversas do Copilot, fornecidos pela Microsoft no âmbito da descoberta processual, foram analisados por um perito. A análise encontrou 59.545 logs com pelo menos 16 palavras em comum com conteúdo de notícias usado para fundamentar o modelo. Isso representa menos de 1% do total de conversas. Em outra frente, um perito que trabalha para o Center for Investigative Reporting (CIR) localizou 51 casos de "sobreposição substancial" com conteúdos do CIR no mesmo conjunto de dados. No processo movido por autores de livros, o perito encontrou apenas 24 respostas do Copilot com pelo menos 30 palavras correspondentes entre os 8,2 milhões de chats. Dos 212 livros avaliados, apenas 10 tiveram qualquer correspondência.
Contexto
A disputa começou quando o The New York Times, o CIR e a entidade Authors Guild, em ações separadas, acusaram a Microsoft e a OpenAI de usar obras protegidas para treinar seus modelos de IA sem autorização. Os autores afirmam que os produtos de IA competem com as publicações originais e prejudicam seus negócios.
A Microsoft argumenta que os números reforçam sua tese de que o uso de material protegido no treinamento de IA deve ser considerado uso justo (fair use). A empresa reconhece que sistemas como o Copilot dependem de material protegido por direitos autorais, mas afirma que os sistemas resultantes têm finalidade transformadora e são usados para fins "significativamente diferentes" do original. Na visão da companhia, o fato de o modelo às vezes reproduzir seções de texto "dificilmente prejudica o propósito transformador do treinamento de LLM".
Por que importa
A resposta do The New York Times foi dura. "Os documentos e testemunhos descobertos durante a descoberta processual levam a uma única conclusão: a Microsoft e a OpenAI roubaram do The New York Times para fazer produtos comerciais que substituem seu jornalismo, ameaçam seu negócio e prejudicam sua indústria", disse Ian Crosby, advogado principal do Times na ação. "Esperamos que a Microsoft e a OpenAI sejam responsabilizadas por seu roubo."
O caso pode definir até onde as empresas de IA podem usar conteúdo editorial para treinar seus modelos sem pagar licença. Os números defensivos da Microsoft mostram que a reprodução literal é rara, mas o Times argumenta que o problema central é o uso das obras para criar um produto concorrente, e não a cópia exata.
Impacto
Se a corte aceitar o argumento da Microsoft, outras empresas de IA podem evitar acordos de licenciamento e seguir com treinamento em larga escala sobre material protegido. Se os editores vencerem, o custo do treinamento pode subir, e mais acordos comerciais devem ser firmados, como os que a OpenAI já fechou com diversas publicações. O desfecho também afeta autores de livros, que exigem compensação pelo uso de suas obras.
O CIR e a entidade Authors Guild não responderam imediatamente aos pedidos de comentário.
O que muda
A divulgação dos números não encerra a disputa. Ela apenas dá material novo para os juízes avaliarem o mérito do uso justo. A Microsoft aposta em dados quantitativos para mostrar baixa incidência de reprodução. O Times contra-ataca com a tese de que a substituição econômica, e não a cópia literal, é o centro da violação.
O que vem agora
A ação segue na Justiça dos Estados Unidos. O The New York Times deve continuar apresentando documentos e testemunhas para reforçar a acusação. A Microsoft e a OpenAI, por sua vez, devem insistir na defesa de uso justo. Novas decisões e audiências são esperadas nos próximos meses, mas nenhuma data foi divulgada.
