Quellen
Bleib bei KI-Kunst vorn
Erhalte die Top-Storys der Woche zu KI und KI-Kunst direkt in dein Postfach — kuratiert, kompakt, kostenlos.

Maya testet jedes neue Modell im Benchmark — Zahlen zuerst, Hype nie.
Erhalte die Top-Storys der Woche zu KI und KI-Kunst direkt in dein Postfach — kuratiert, kompakt, kostenlos.
Kostenlos. Jederzeit abbestellbar.
Wähle einen Companion und erfahre seine Meinung zu dieser Story
Ein in einem seltenen Buch versteckter AirTag verfolgte den Band bis zu einer Amazon-Einrichtung, wo er vernichtet wurde — ein handfester physischer Beweis dafür, dass Amazon seltene Texte erwirbt und schreddert, um Trainingsdaten für seine KI-Modelle zu gewinnen.
Der AirTag-Fund, berichtet von Ars Technica, verwandelt einen bislang auf Indizien gestützten Verdacht in dokumentierte Tatsache. Antiquarische Buchhändler hatten bereits ein beunruhigendes Muster bemerkt — Massenkäufe ungewöhnlicher oder vergriffener Bände, gefolgt von Stille — doch bis jetzt gab es keinen direkten Beweis dafür, was nach dem Verkauf geschah.

Amazon hat seltene physische Bücher erworben und vernichtet, um Text für KI-Trainingsdaten zu extrahieren.
Der Reiz physischer seltener Texte für das KI-Training liegt auf der Hand: Diese Modelle haben bereits den Großteil dessen verarbeitet, was im offenen Web existiert. Bücher, die nie digitalisiert wurden — limitierte Auflagen, Regionalgeschichten, akademische Fachbände — stellen ein genuines neues Trainingssignal dar. Laut TechCrunch ist genau diese Knappheit es, die sie für KI-Entwickler attraktiv macht, die im Wettlauf darum sind, ihre Trainingskorpora zu differenzieren.
Die Ironie ist kaum zu übersehen. Amazon hat sein gesamtes Geschäft mit dem Verkauf von Büchern aufgebaut. Sein internes KI-Datenteam verwendet offenbar einen T. rex, der ein Buch frisst, als Logo — ein Detail, das darauf hindeutet, dass die Vernichtung nicht beiläufig, sondern bewusst und mit eigenem Branding versehen ist.
Das Tracking-Gerät verfolgte das Buch vom Verkaufsort durch Amazons Logistiknetzwerk bis zu einer Einrichtung, wo das Signal auf eine mit Vernichtung vereinbare Weise erlosch. Die Methode ist simpel, aber wirkungsvoll: Ein kleiner, handelsüblicher Tracker liefert eine zeitgestempelte Standortspur, die an einem Amazon-Standort endet.
Was unbestätigt bleibt, ist das Ausmaß. Amazon hat nicht offengelegt, wie viele Bücher es auf diese Weise erworben hat, welche Titel oder Kategorien gezielt werden oder welchen rechtlichen Rahmen — falls überhaupt einen — es für den Urheberrechtsstatus der gescannten Inhalte als gegeben betrachtet. Die Vernichtung des physischen Objekts löst keine Fragen über das Recht auf digitale Reproduktion des Textes für Trainingszwecke, und es existiert kein unabhängiges Audit des Programms.
Diese Geschichte ist ein konkreter Datenpunkt in einem umfassenderen Wandel: KI-Unternehmen gehen über das Web hinaus und dringen in physische Archive, Bibliotheken und Märkte für vergriffene Bücher vor, um Trainingsmaterial zu finden, das Konkurrenten noch nicht verarbeitet haben. Dieses Wettrennen hat direkte Konsequenzen für alle, denen kulturelle Bewahrung am Herzen liegt — und für Kreative, die auf KI-Tools angewiesen sind, die mit vielfältigen, hochwertigen Texten trainiert wurden.
Für KI-Kunstschaffende ist die Frage nach den Trainingsdaten relevant, weil der Reichtum und die Spezifität des Textverständnisses eines Modells bestimmen, wie gut es nuancierte Prompts interpretiert. Ein Modell, das mit genuinen seltenen historischen und literarischen Materialien trainiert wurde, könnte Anfragen nach stilistisch periodengerechten Darstellungen, obskuren Kunstreferenzen oder komplexen narrativen Prompts anders verarbeiten als eines, das ausschließlich auf Web-Texten trainiert wurde. Ob Amazons Ansatz tatsächlich messbare Qualitätsverbesserungen in seinen Modellen erzeugt, ist noch nicht bekannt.
Der Charmloop-Artikel über frühere Verdachtsmomente der Buchhändler behandelte die Indizien, die dieser Bestätigung vorausgingen — der AirTag-Fund schließt diesen Kreis. Die breitere Debatte über Datenprovenienz knüpft auch an laufende Fragen darüber an, was KI-Unternehmen mit auf ihren Plattformen erstellten Inhalten tun — ein Muster, das sich über Streaming, soziale Medien und nun auch physische Medien erstreckt.
Amazon hat auf keinen der beiden Berichte öffentlich reagiert. Bis es das tut, bleibt der Umfang des Programms — und seine rechtliche Grundlage — eine offene Frage.