Fontes
Fique por dentro da arte com IA
Receba no seu e-mail as principais histórias da semana sobre IA e arte com IA — selecionadas, diretas e grátis.

Sofia acompanha o dinheiro, as políticas e as plataformas que definem o que criadores podem fazer.
Receba no seu e-mail as principais histórias da semana sobre IA e arte com IA — selecionadas, diretas e grátis.
Grátis. Cancele quando quiser.
Escolha um companheiro e veja o que ele acha dessa história
Arquivos judiciais recém-revelados no processo New York Times v. OpenAI expõem que tanto a OpenAI quanto a Microsoft documentaram internamente — em seus próprios registros — que suas práticas de treinamento de IA arriscavam criar um «loop destrutivo» que degradaria a web aberta, e que pelo menos um executivo da Microsoft caracterizou o scraping como o «maior roubo de trabalho da história da humanidade».
A expressão «loop destrutivo» aparece na própria documentação das empresas, não na queixa do Times. A lógica é direta e autoincriminatória: os sistemas de IA raspam a web para treinar com conteúdo, depois entregam respostas diretamente aos usuários em vez de redirecioná-los aos sites de origem, o que priva os editores do tráfego e da receita publicitária necessários para produzir novos conteúdos, o que degrada a web que esses mesmos sistemas de IA precisam para treinar na próxima geração. O ciclo se aperta a cada geração de modelos.

Uma página dos arquivos judiciais revelados mostrando o Diretor de Ciência Aplicada da Microsoft descrevendo a aquisição de dados de IA como 'um roubo assombroso de proporções sem precedentes'.
Imagem: The Verge / The Verge AI
O depoimento de Satya Nadella é particularmente contundente. De acordo com The Verge, Nadella concordou sob juramento que as interações com chatbots «substituíam» a visita aos sites subjacentes — uma concessão que apoia diretamente a teoria de dano do Times. Não se trata de uma alegação de um advogado de acusação; é o CEO do réu registrado em ata.
Do lado da OpenAI, registros internos mostram que a empresa sabia desde 2021 que sua API poderia reproduzir conteúdo existente literalmente, e que prevenir a memorização era importante «para conformidade com uso justo e minimização» da exposição legal. A empresa também observou que estava contornando paywalls e violando termos de serviço ao adquirir dados de treinamento — e que indivíduos dentro da organização tratavam essas questões como custos aceitáveis.
«Este caso é sobre, como o Diretor de Ciência Aplicada da Microsoft colocou, 'um roubo assombroso de proporções sem precedentes'; talvez o 'maior roubo de trabalho da história da humanidade'.»
— Arquivo judicial, NYT v. OpenAI
Esta não é a primeira vez que uma grande empresa de IA enfrenta um ajuste de contas sobre a origem dos dados de treinamento. Quando a Stability AI enfrentou alegações semelhantes em 2023, a posição da empresa era essencialmente que o scraping era um território legalmente não resolvido. O que torna a situação da OpenAI e da Microsoft estruturalmente diferente é que a linguagem prejudicial vem de dentro da própria casa — executivos e cientistas aplicados, não especialistas adversariais.

Um arquivo revelado mostrando o reconhecimento da OpenAI em 2021 de que sua API poderia reproduzir conteúdo existente literalmente, sinalizado como uma preocupação de conformidade com uso justo.
Imagem: The Verge / The Verge AI
Para criadores de arte com IA, as consequências indiretas são reais. Os conjuntos de dados de treinamento por trás dos modelos de geração de imagens enfrentam questões análogas sobre a raspagem de conteúdo visual da web sem compensação. Se o caso do NYT produzir uma decisão — ou um acordo com termos de licenciamento — que estabeleça um precedente para texto, espere que essa estrutura seja aplicada a dados de imagem quase imediatamente. Plataformas que já migraram para dados de treinamento licenciados ou sintéticos ganhariam uma vantagem estrutural; aquelas que ainda dependem de raspagens não filtradas da web enfrentariam a mesma exposição a responsabilidades que está sendo litigada em Manhattan.
O catálogo de modelos disponíveis da Charmloop já reflete parte dessa mudança, com provedores distinguindo cada vez mais entre modelos treinados em conjuntos de dados licenciados versus raspados — uma distinção que está prestes a importar legalmente, não apenas eticamente.
Nossa cobertura anterior dos arquivos não redigidos da Microsoft delineou as divulgações iniciais de documentos; esses registros recém-revelados vão mais longe, colocando o enquadramento do «loop destrutivo» e os reconhecimentos de memorização diretamente no registro judicial.
O caso ainda não tem data de julgamento definida. O próximo momento determinante é como o tribunal decidirá sobre as moções de julgamento sumário — uma decisão que forçará um acordo ou levará os documentos do «loop destrutivo» diante de um júri.