Sources
Gardez une longueur d’avance sur l’art IA
Recevez chaque semaine les meilleures actus IA et art IA dans votre boîte mail — sélectionnées, concises, gratuites.

Maya passe chaque nouveau modèle au banc d'essai — les chiffres d'abord, jamais le battage.
Recevez chaque semaine les meilleures actus IA et art IA dans votre boîte mail — sélectionnées, concises, gratuites.
Gratuit. Désabonnement à tout moment.
Choisissez un compagnon et découvrez son avis sur cette histoire
Un AirTag dissimulé dans un livre rare a suivi le volume jusqu'à un entrepôt Amazon où il a été détruit — preuve physique irréfutable qu'Amazon acquiert et broie des textes rares pour en extraire des données d'entraînement destinées à ses modèles d'IA.
La découverte de l'AirTag, rapportée par Ars Technica, transforme ce qui n'était que soupçons circonstanciels en fait documenté. Les libraires spécialisés avaient déjà remarqué un schéma inquiétant — des achats en masse de volumes inhabituels ou épuisés, suivis d'un silence total — mais jusqu'à présent, aucune preuve directe n'existait sur ce qui se passait après la vente.

Amazon acquiert des livres physiques rares et les détruit pour en extraire le texte destiné à l'entraînement de ses IA.
Image : TechCrunch / TechCrunch AI
L'attrait des textes physiques rares pour l'entraînement de l'IA est simple : ces modèles ont déjà ingéré la quasi-totalité de ce qui existe sur le web ouvert. Les livres qui n'ont jamais été numérisés — tirages limités, histoires régionales, volumes académiques spécialisés — représentent un signal d'entraînement véritablement inédit. Selon TechCrunch, c'est précisément cette rareté qui les rend attrayants pour les développeurs d'IA qui cherchent à différencier leurs corpus d'entraînement.
L'ironie est difficile à ignorer. Amazon a bâti l'intégralité de son activité sur la vente de livres. Son équipe interne dédiée aux données d'IA utiliserait apparemment un T. rex en train de dévorer un livre comme logo — un détail qui suggère que la destruction n'est pas accidentelle, mais délibérée et assumée.
Le dispositif de suivi a accompagné le livre depuis son point de vente, à travers le réseau logistique d'Amazon, jusqu'à un entrepôt où le signal s'est éteint d'une manière cohérente avec une destruction. La méthode est rudimentaire mais efficace : un petit traceur disponible dans le commerce fournissant un historique de localisation horodaté qui se termine sur un site Amazon.
Ce qui reste non confirmé, c'est l'ampleur du phénomène. Amazon n'a pas divulgué combien de livres il a acquis de cette façon, quels titres ou catégories sont ciblés, ni quel cadre juridique — le cas échéant — il estime applicable au statut des droits d'auteur du contenu numérisé. La destruction de l'objet physique ne résout pas les questions relatives aux droits de reproduction numérique du texte à des fins d'entraînement, et aucun audit indépendant du programme n'existe.
Cette histoire constitue un exemple concret d'une évolution plus large : les entreprises d'IA dépassent le cadre du web pour s'aventurer dans les archives physiques, les bibliothèques et les marchés de livres épuisés, à la recherche de matériaux d'entraînement que leurs concurrents n'ont pas encore ingérés. Cette course a des conséquences directes pour quiconque se soucie de la préservation culturelle — et pour les créateurs qui s'appuient sur des outils d'IA entraînés sur des textes diversifiés et de haute qualité.
Pour les créateurs d'art par IA, la question des données d'entraînement est importante car la richesse et la précision de la compréhension textuelle d'un modèle déterminent sa capacité à interpréter des prompts nuancés. Un modèle entraîné sur des textes historiques et littéraires véritablement rares pourra traiter différemment les demandes de style d'époque, les références artistiques obscures ou les prompts narratifs complexes, par rapport à un modèle entraîné uniquement sur des textes issus du web. On ne sait pas encore si l'approche d'Amazon produit des gains de qualité mesurables dans ses modèles.
L'article de Charmloop sur les soupçons antérieurs des libraires couvrait les preuves circonstancielles qui ont précédé cette confirmation — la découverte de l'AirTag boucle la boucle. Le débat plus large sur la provenance des données rejoint également les questions en cours sur ce que font les entreprises d'IA avec les contenus créés sur leurs plateformes, un schéma qui se répète dans les domaines du streaming, des réseaux sociaux et désormais des médias physiques.
Amazon n'a pas répondu publiquement à l'un ou l'autre des rapports. Jusqu'à ce qu'il le fasse, l'ampleur du programme — et sa légitimité juridique — reste une question ouverte.