Sources
Gardez une longueur d’avance sur l’art IA
Recevez chaque semaine les meilleures actus IA et art IA dans votre boîte mail — sélectionnées, concises, gratuites.

Theo transforme l'actualité de l'IA en choses à essayer dès ce soir.
Recevez chaque semaine les meilleures actus IA et art IA dans votre boîte mail — sélectionnées, concises, gratuites.
Gratuit. Désabonnement à tout moment.
Choisissez un compagnon et découvrez son avis sur cette histoire
Le Seattle Times et Newsday ont poursuivi OpenAI et Microsoft pour violation de droits d'auteur, alléguant que ces entreprises ont aspiré leur contenu journalistique pour entraîner des modèles d'IA et reproduisent des passages d'articles mot pour mot lorsque des utilisateurs interrogent ces systèmes.
À première vue, un journal qui poursuit un concepteur de chatbot semble être le problème de quelqu'un d'autre pour les créateurs d'art IA. Ce n'est pas le cas. La logique juridique qui sous-tend ces procès — selon laquelle l'aspiration de contenus publiquement accessibles à des fins d'entraînement de modèles constitue une violation — est structurellement identique aux arguments avancés contre les modèles de génération d'images dans des litiges parallèles. Une décision stipulant que l'entraînement sur des textes journalistiques nécessite une licence accélérerait presque certainement des exigences similaires à l'encontre des jeux de données qui alimentent Stable Diffusion, Midjourney et les modèles multimodaux qui propulsent les outils que vous utilisez aujourd'hui.
L'allégation spécifique selon laquelle les modèles d'OpenAI reproduisent des passages d'articles mot pour mot est également directement pertinente. Si les tribunaux considèrent la reproduction quasi-verbatim comme la ligne de démarcation entre l'usage loyal et la violation, cette norme sera mise à l'épreuve face aux générateurs d'images capables de reproduire la composition distinctive d'un photographe ou le style d'un graphiste avec une précision troublante.

Microsoft et OpenAI font face à des allégations selon lesquelles leurs chatbots reproduisent mot pour mot le texte d'articles de presse en réponse aux requêtes des utilisateurs.
Image : The Verge / The Verge AI
Selon The Verge, ces procès font suite à des actions similaires d'autres éditeurs, et la tendance est significative : chaque nouveau plaignant enrichit un corpus de découvertes sur lequel les affaires futures — y compris celles touchant aux jeux de données d'entraînement d'images et de vidéos — pourront s'appuyer. OpenAI se défend simultanément dans le procès du New York Times, où le récent mémoire du gouvernement américain a soutenu que l'entraînement de l'IA sert les intérêts nationaux, comme nous l'avons rapporté dans notre précédent article sur le dépôt de l'administration Trump dans l'affaire de droits d'auteur OpenAI-NYT.
Pour les créateurs qui construisent des flux de travail autour de modèles entraînés sur de larges aspirations du web, la question pratique est celle du calendrier. Aucune injonction n'a encore forcé un modèle à être retiré du service, et le calendrier des litiges se mesure en années. Mais la pression en matière de licences modifie déjà les données sur lesquelles les futurs modèles sont entraînés — les paiements signalés de Google aux studios hollywoodiens pour les droits d'entraînement vidéo en sont un exemple visible de l'industrie qui se couvre discrètement.
Si vous générez des images aujourd'hui, rien dans votre flux de travail immédiat ne change à cause de ce dépôt de plainte. Les modèles avec lesquels vous effectuez vos rendus sont déjà entraînés ; aucun tribunal n'a ordonné de retour en arrière. Les créateurs les plus exposés à des perturbations à court terme sont ceux qui construisent des produits ou des pipelines dépendant de sorties multimodales texte-plus-image — où un modèle de langage récupère ou résume un contexte journalistique en parallèle d'un visuel généré. C'est précisément cette combinaison que ces procès visent.
À plus long terme, surveillez les fournisseurs de modèles qui accélèrent le développement de niveaux d'entraînement sur données sous licence, comme certains le font déjà avec des données synthétiques. Un modèle entraîné sur un corpus plus propre et sous licence pourrait se comporter différemment — plus conservateur dans la reproduction, potentiellement moins ancré dans l'actualité culturelle — et cela se manifestera dans les réponses aux prompts d'une manière difficile à prévoir avant de se retrouver face au résultat.
Pour l'instant, ce qu'il est le plus utile de surveiller, c'est si l'un de ces procès aboutit à un règlement de type consentement-décret qui établit un tarif de licence. Ce chiffre, une fois établi pour le texte, devient le modèle auquel les négociateurs se réfèrent lorsque la prochaine vague de procès sur les données d'images avance vers une résolution. Les créateurs qui comprennent ce lien seront moins surpris lorsqu'il se concrétisera.
Découvrez comment les modèles d'images IA actuels gèrent ces pressions dans le catalogue de modèles Charmloop, ou affinez votre approche des prompts dans les guides.