BERLIN / LONDON (IT BOLTWISE) – Gerichtsunterlagen im Streit um KI-Trainingsdaten zeigen, wie Anthropic Millionen gedruckter Bücher aus Europa ankauft, scannen lässt und danach entsorgen kann. Der Ansatz soll laut Unterlagen schneller skalieren als einzelne Lizenzen mit Verlagen oder Autoren. Gleichzeitig steht die Kernfrage vor Gericht: Ist das Training mit urheberrechtlich geschützten Werken zulässig, wenn die Datengrundlage vorher gekauft, aber anschließend physisch zerstört wird? Für die Branche verschiebt sich damit der Konflikt vom Download problematischer Quellen hin zu einem neuen Graubereich industrieller Digitalisierung.

Im Wettlauf um hochwertige Trainingsdaten rückt ein ganz praktischer Vorgang in den Fokus: gedruckte Bücher werden nicht nur digitalisiert, sondern danach gezielt zerstört. Gerichtsakten in einem Urheberrechtsstreit gegen den KI-Anbieter Anthropic liefern dabei einen seltenen Einblick in den operativen Ablauf. Das Muster wirkt auf den ersten Blick effizient – im Kern geht es aber um die Frage, wie Trainingsdaten entstehen dürfen und wo die Grenze zwischen zulässiger Transformation und unzulässiger Nutzung urheberrechtlich geschützter Inhalte verläuft. Für Unternehmen bedeutet das: Datenbeschaffung wird nicht nur zur technischen, sondern zunehmend zur juristischen Disziplin.
Der Hintergrund ist schnell erklärt: Große Sprachmodelle lernen aus Text, und je besser die Qualität der Trainingskorpora, desto stärker lassen sich sprachliche Kohärenz, Stil und Argumentationsmuster trainieren. Befeuert wird dieser Bedarf durch die Konkurrenz mehrerer Akteure, die ihr Modelltraining kontinuierlich erweitern – etwa OpenAI, Meta und Google. In der Branche wird schon lange diskutiert, ob man bevorzugt „saubere“ Quellen nutzen sollte statt Internetinhalte in großen, schwer prüfbaren Mengen. Anthropic soll laut den Dokumenten genau deshalb Bücher als besonders wertvoll ansehen: redigierte Sprache, längere Erzähl- und Argumentationsketten und damit ein anderes Signal als kurze Forenbeiträge oder kommentierte Webseiten.
Technisch läuft die Datenpipeline dabei auf eine industrielle Digitalisierung hinaus. Die entscheidende Weichenstellung, die die Unterlagen beschreiben: Anthropic habe offenbar nicht primär digitale Kopien aus problematischen Umfeldern bezogen, sondern gedruckte Bücher im großen Stil gekauft. Als mögliche Beschaffungswege werden in den Akten Händler wie Better World Books sowie der britische Gebrauchtbuchhändler World of Books genannt. Für KI-Organisationen ist diese Beschaffungsform attraktiv, weil sie die Lizenzverhandlungen mit einzelnen Rechteinhabern in der Breite ersetzt. Gleichzeitig entsteht damit eine andere Risikolandschaft: Selbst wenn der Kauf rechtmäßig ist, kann die anschließende Digitalisierung und Verarbeitung urheberrechtlich angreifbar bleiben.
Nach dem Kauf folgt der Teil, der in Debatten oft zu abstrakt bleibt: das „physische Zerlegen“ für die Scan-Throughput-Rate. Um die Seiten möglichst schnell durch Hochleistungsscanner zu führen, müssen Buchrücken zunächst abgeschnitten werden. Erst dann können Seiten automatisiert und in großer Menge erfasst werden. In den beschriebenen Abläufen wird anschließend das Papier recycelt, während die digitale Kopie als Trainingsmaterial verbleibt. Genau diese Operationalisierung – erst der Einkauf in großen Mengen, dann die standardisierte Scan-Kette und schließlich die Entsorgung – macht den Konflikt so greifbar. Sie illustriert, wie sehr Data Engineering inzwischen wie ein Logistik- und Produktionsprozess funktioniert.
Der Marktkontext erklärt, warum diese Schritte überhaupt so scharf implementiert werden. Wenn ein Anbieter Hunderttausende oder Millionen Seiten in kurzer Zeit in nutzbare Trainingsdaten umwandeln will, ist der Engpass nicht nur die Modell-Compute-Leistung, sondern die Beschaffung und Aufbereitung. Schattenbibliotheken wurden als früherer Weg genannt, allerdings führte genau dieses Vorgehen zu einer Welle von Klagen. Im Branchenvergleich wirkt Anthropics Vorgehen wie ein Versuch, die Datenherkunft auf „klassische“ Handelswege zu verlagern. Gleichzeitig konkurriert die KI-Industrie parallel um ähnliche Trainingsziele: kompetenteres Schreiben, bessere Textkohärenz und zuverlässigere Formulierung. Unternehmen wie OpenAI und andere setzen dabei ebenfalls auf kontinuierliches Curation- und Trainingsdaten-Management – mit unterschiedlichen rechtlichen und praktischen Strategien.
Rechtlich ist die Lage damit nicht automatisch geklärt. Im konkreten Fall soll ein Richter entschieden haben, dass das Training mit Büchern grundsätzlich zulässig sein kann, weil Modelle Inhalte nicht wie eine Kopie reproduzieren, sondern in veränderter Form verarbeiten. Anders wurde offenbar der Umgang mit zuvor heruntergeladenen Büchern aus Schattenbibliotheken bewertet: Dort könnten Urheberrechte verletzt worden sein. Diese Unterscheidung ist für die Praxis entscheidend, denn sie beeinflusst, welche Dokumentations- und Compliance-Anforderungen in Trainingspipelines nötig werden. Experten berichten in solchen Verfahren typischerweise, dass die Beweisbarkeit der Datenherkunft und der Umfang der genutzten Werke künftig stärker gewichtet werden als einzelne „gut klingende“ technische Argumente.
Auch aus Unternehmenssicht ist die wirtschaftliche Logik eindeutig: Ein Buch als physisches Gut lässt sich als Ware beschaffen, während Lizenzen in der Fläche teuer und langsam sind. Die Akten zeigen, wie der Einkauf über große Gebrauchtbuchhändler als Skalierungshebel funktioniert – mit vergleichsweise planbaren Kosten. Der „überraschende“ Teil folgt jedoch nach dem Kauf: Nicht Weiterverkauf oder Archivierung, sondern systematische Digitalisierung und anschließend Entsorgung. Das verändert den Charakter der Nutzung – sie wird zu einem Produktionsschritt, der den ursprünglichen Träger faktisch auslöscht. Genau hier wird die juristische Diskussion für mehrere Parteien relevant: Verlage, Autoren, Sammler und Rechteverwalter beobachten solche Prozesse zunehmend mit dem Ziel, Bedingungen für KI-Training stärker zu monetarisieren.
Für Regulatorik und Datenschutz bleibt das zwar primär eine Urheberrechts- und Verwertungsfrage, berührt aber indirekt auch Privatsphäre- und Sicherheitsaspekte. Wenn Daten aus physischen Quellen in digitale Trainingskorpora überführt werden, steigt der Bedarf an lückenloser Nachverfolgbarkeit: Welche Seiten wurden gescannt, wie wurden Metadaten behandelt, welche Bereinigungsschritte liefen, und wie wird verhindert, dass sensible Inhalte unbemerkt in Datensets landen? Gerade bei großen Scans ist die Gefahr „falscher“ Einträge nicht zu unterschätzen. Zwar geht es im Kern um Texte, doch die Organisation muss die Pipeline so designen, dass spätere Prüfungen – etwa im Rahmen von Audits oder Rechtsstreitigkeiten – möglich bleiben.
Der Streit ist zudem nicht erledigt, weil Gerichte in den USA und anderswo weiterhin klären müssen, unter welchen Voraussetzungen KI-Training als faire Nutzung gelten kann. Anthropic habe sich schließlich offenbar mit Autoren und Verlagen auf einen Vergleich über 1,5 Milliarden US-Dollar geeinigt, ohne ein Fehlverhalten einzuräumen. Vergleichssummen sind für die Branche deshalb mehr als eine Zahl: Sie signalisieren, dass Risiken real sind und dass „Prozessdesign“ allein nicht reicht. In Zukunft ist zu erwarten, dass Anbieter stärker auf nachweisbare Lizenzmodelle, strukturierte Datenverzeichnisse und klare Richtlinien zur Herkunft setzen. Wer das nicht tut, riskiert nicht nur juristische Kosten, sondern auch Verzögerungen bei Modell-Release-Zyklen – und damit strategische Nachteile im Wettbewerb um die nächsten Generationen KI-gestützter Produkte.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Anthropic zerstört Bücher für KI-Training: Gerichtsakten zeigen den Prozess" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Anthropic zerstört Bücher für KI-Training: Gerichtsakten zeigen den Prozess" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Anthropic zerstört Bücher für KI-Training: Gerichtsakten zeigen den Prozess« bei Google Deutschland suchen, bei Bing oder Google News!