Sources
Gardez une longueur d’avance sur l’art IA
Recevez chaque semaine les meilleures actus IA et art IA dans votre boîte mail — sélectionnées, concises, gratuites.

Sofia suit l'argent, les régulations et les plateformes qui façonnent ce que les créateurs peuvent faire.
Recevez chaque semaine les meilleures actus IA et art IA dans votre boîte mail — sélectionnées, concises, gratuites.
Gratuit. Désabonnement à tout moment.
Choisissez un compagnon et découvrez son avis sur cette histoire
Des pièces judiciaires récemment déclassifiées dans le cadre du procès New York Times c. OpenAI révèlent qu'OpenAI et Microsoft ont tous deux consigné en interne — dans leurs propres archives — que leurs pratiques d'entraînement de l'IA risquaient de créer une « boucle infernale » qui dégraderait le Web ouvert, et qu'au moins un cadre de Microsoft a qualifié le scraping de « plus grand vol de travail de l'histoire de l'humanité ».
L'expression « boucle infernale » figure dans la propre documentation des entreprises, et non dans la plainte du Times. La logique est simple et auto-incriminante : les systèmes d'IA scrapent le Web pour s'entraîner sur du contenu, puis fournissent des réponses directement aux utilisateurs plutôt que de les rediriger vers les sites sources, ce qui prive les éditeurs du trafic et des revenus publicitaires nécessaires à la production de nouveaux contenus, ce qui dégrade le Web dont ces mêmes systèmes d'IA ont besoin pour s'entraîner ensuite. La boucle se resserre à chaque génération de modèles.

Une page des pièces judiciaires déclassifiées montrant le directeur des sciences appliquées de Microsoft décrivant l'acquisition de données par IA comme 'un vol stupéfiant aux proportions sans précédent'.
Image : The Verge / The Verge AI
La déposition de Satya Nadella est particulièrement accablante. Selon The Verge, Nadella a reconnu sous serment que les interactions avec les chatbots « se substituaient » à la visite des sites Web sous-jacents — une concession qui soutient directement la théorie du préjudice avancée par le Times. Il ne s'agit pas d'une allégation tirée d'un mémoire de plaignant ; c'est le PDG du défendeur qui s'exprime au dossier.
Du côté d'OpenAI, des documents internes montrent que l'entreprise savait dès 2021 que son API pourrait reproduire du contenu existant mot pour mot, et que la prévention de la mémorisation était importante « pour la conformité au fair use et la minimisation » de l'exposition juridique. L'entreprise a également noté qu'elle contournait des paywalls et violait des conditions d'utilisation lors de l'acquisition de données d'entraînement — et que certains membres de l'organisation considéraient ces problèmes comme des coûts acceptables.
« Cette affaire concerne, comme l'a formulé le directeur des sciences appliquées de Microsoft, 'un vol stupéfiant aux proportions sans précédent' ; peut-être le 'plus grand vol de travail de l'histoire de l'humanité'. »
— Pièce judiciaire, NYT c. OpenAI
Ce n'est pas la première fois qu'une grande entreprise d'IA est confrontée à un bilan sur les sources de données d'entraînement. Lorsque Stability AI a fait face à des allégations similaires en 2023, la position de l'entreprise était essentiellement que le scraping constituait un territoire juridiquement non résolu. Ce qui rend la situation d'OpenAI et Microsoft structurellement différente, c'est que le langage compromettant provient de l'intérieur — de cadres dirigeants et de scientifiques appliqués, et non d'experts adverses.

Une pièce déclassifiée montrant la reconnaissance par OpenAI en 2021 que son API pourrait reproduire du contenu existant mot pour mot, signalée comme une préoccupation de conformité au fair use.
Image : The Verge / The Verge AI
Pour les créateurs d'art par IA, les enjeux en aval sont bien réels. Les jeux de données d'entraînement qui sous-tendent les modèles de génération d'images font face à des questions analogues concernant le scraping de contenu visuel sur le Web sans compensation. Si l'affaire NYT aboutit à un jugement — ou à un règlement amiable avec des conditions de licence — établissant un précédent pour le texte, il faut s'attendre à ce que ce cadre soit appliqué aux données d'image presque immédiatement. Les plateformes qui ont déjà évolué vers des données d'entraînement sous licence ou synthétiques bénéficieraient d'un avantage structurel ; celles qui s'appuient encore sur des scrapes Web non filtrés feraient face à la même exposition à la responsabilité actuellement en litige à Manhattan.
Le catalogue de modèles disponibles de Charmloop reflète déjà une partie de cette évolution, les fournisseurs distinguant de plus en plus les modèles entraînés sur des jeux de données sous licence par rapport aux jeux de données scrapés — une distinction qui est sur le point d'avoir une importance juridique, et pas seulement éthique.
Notre couverture précédente des pièces Microsoft non caviardées avait exposé les premières divulgations de documents ; ces pièces nouvellement déclassifiées vont plus loin, inscrivant directement au dossier judiciaire le cadrage de la « boucle infernale » et les reconnaissances relatives à la mémorisation.
L'affaire n'a pas encore de date de procès fixée. Le prochain moment déterminant sera la décision du tribunal sur les requêtes en jugement sommaire — une décision qui forcera soit un règlement amiable, soit l'envoi des documents sur la « boucle infernale » devant un jury.