CALIFORNIA / LONDON (IT BOLTWISE) – In einem Beitrag macht Charles Graeber auf das Risiko einer KI-„Datenfäulnis“ aufmerksam. Er argumentiert, dass unlizenzierte Trainingsdaten langfristig die Qualität von Chatbots verschlechtern, weil sich Fehler bei KI-Outputs verstärken. Graeber verweist auf eine frühere Sammelklage gegen Anthropic und auf einen Vergleich in Höhe von 1,5 Mrd. USD. Gleichzeitig plädiert er dafür, Urheberrechte an KI-Trainings in heutiger Form auszudehnen, um sowohl Kreative als auch die KI-Qualität zu schützen.

Die Debatte um Urheberrechte in der KI droht sich zu einer Frage zu verengen: Wer darf welche Inhalte „für Training“ nutzen? Der Autor Charles Graeber verschiebt den Fokus jedoch auf eine technische Nebenwirkung, die sich aus Datenherkunft und Trainingsumfang ergibt: Wenn KI-Systeme zunehmend aus problematischen Quellen lernen oder wenn die wirklich hochwertigen Texte fehlen, könnten Modelle in einen Qualitätsabfall geraten. In seiner Argumentation wird das Bild besonders drastisch: Ein KI-Chatbot, der schließlich nur noch Antworten auf seine eigenen Antworten „nachverdaut“, wiederholt nicht nur Muster, sondern potenziert auch Fehler und Uneindeutigkeiten. Genau dieses Szenario ordnet er als „model collapse“ ein und stellt es als mögliche Folge einer ungünstigen Datenbasis dar.
Technisch lässt sich das Motiv dahinter nachvollziehen, ohne dass man dabei zwingend von einem einzigen, klar messbaren Auslöser sprechen muss. Beim Training von Sprachmodellen werden statistische Zusammenhänge aus großen Textkorpora gelernt; ihre Ausgabe ist dann eine probabilistische Fortsetzung, nicht eine wörtliche Wiedergabe. Wenn der Trainingsdatensatz jedoch systematisch von niedrigwertigen oder selbstreferenziellen Texten durchsetzt ist, steigt die Wahrscheinlichkeit, dass das Modell genau diese Stileffekte, Halluzinationsmuster und Widersprüche weiterverfestigt. Graebers Analogie zu „Kopien von Kopien“ zielt auf genau diese Kettenwirkung. In der Praxis ist das natürlich kein linearer Prozess, aber die Grundidee—Datenqualität wirkt sich direkt auf generierte Qualität aus – ist für Entwickler ein vertrautes Muster aus allen datengetriebenen Systemen.
Auf der juristischen Ebene knüpft Graeber seine Warnung an konkrete Vorgänge an. Er beschreibt eine Sammelklage, die er zusammen mit Kirk Wallace Johnston und Andrea Bartz gegen Anthropic angestoßen habe. In der Klageschrift ging es ihm zufolge um Piraterie und Urheberrechtsverletzungen: Laut Darstellung soll Anthropic Bücher der Kläger genutzt haben, um ein kommerzielles generatives KI-Chatbot-Produkt zu bauen, ohne diese Inhalte gefragt zu haben oder dafür zu bezahlen. Graeber verknüpft diese Sicht mit einem Muster, das in der KI-Branche häufig unter dem Begriff „fair use“ bzw. dessen Äquivalenzen diskutiert wird. Sein Kernpunkt: Selbst wenn einzelne Schritte rechtlich anders eingeordnet werden, bleibt die Herkunft großer Trainingskorpora ein zentraler Streitpunkt.
Besonders detailliert wird es, wenn Graeber den Vergleich ausführt: Für seinen Fall nennt er ein Vergleichsvolumen von 1,5 Mrd. USD als größtes Urheberrechtssettlement in der US-Geschichte. Zudem beziffert er die Zahl der erfassten Werke mit „fast einer halben Million“; nach Abzug von Gebühren und Anwaltskosten ergebe sich für die Autoren rechnerisch etwa 3.000 USD pro Buch, wobei sich der Betrag mit dem Verlag teilen müsse. Für Entwickler und Produktverantwortliche ist diese Größenordnung weniger eine moralische Kennzahl als ein Signal: Der Rechtsstreit wurde nicht im luftleeren Raum geführt, sondern führte zu einer finanziell belastbaren Lösung. Graeber beschreibt dabei außerdem, wie Gerichte verschiedene Aspekte unterschieden hätten – etwa die Einordnung des Trainings auf bestimmte physische Bücher nach Erwerb vs. das massenhafte illegale Herunterladen und Speichern urheberrechtlich geschützter Werke. Dass dabei unterschiedliche Richter zu abweichenden Ergebnissen kamen, macht er ebenfalls zum Bestandteil seiner Argumentation.
Die Brücke in den Markt schlägt der Autor über ein weiteres Datenargument: Er verweist auf eine Arbeit, die mehr als 14.000 Bücher ausgewertet habe, die zwischen 2023 und März des laufenden Jahres auf Amazon verkauft wurden. Ziel sei es gewesen, den „financial impact“ von KI-generiertem „slop“ statistisch greifbarer zu machen. In Graebers Zusammenfassung wird das Ergebnis so dargestellt: Der Buchmarkt werde zunehmend mit qualitativ minderwertigen KI-Outputs geflutet, was sowohl Konsumenten verwirren als auch die Logik von Bestsellerlisten verzerren könne. Außerdem würden „menschlich“ wirkende Bücher zunehmend mit KI-generierten Anteilen „kontaminiert“. Für Kreative leitet er daraus einen Mechanismus ab, den er „market dilution“ nennt: Wenn der relevante Markt überfüllt ist, sinken Verkauf und Einkommen. Gleichzeitig sieht er auch eine Rückkopplung auf die Technikseite – weniger tätige, arbeitende Autoren bedeuten weniger frische, hochwertige Literatur, die wiederum die Trainingsqualität künftiger Generationen stützen könnte.
Damit wird die eigentliche Streitfrage für Unternehmen und Plattformbetreiber: Geht es primär um Zugriffskontrolle auf Inhalte, oder auch um die langfristige Robustheit von Trainingspipelines? Graebers Gegenentwurf zielt auf Politik und Gesetzgebung. Er fordert, dass Urheberrechtsschutz so erweitert wird, dass unlizenzierte KI-Trainings verhindert werden. Die Implikation wäre für den Markt nicht nur rechtlich, sondern operativ: Wenn die Datenbasis verlässlich durch Lizenzen, klare Vergütungsmodelle oder neue Formate für Trainingsrechte geregelt wird, müssen KI-Anbieter ihre Datenerhebung stärker als kontrollierbaren Prozess behandeln. Das würde auch die Trennlinie zwischen „Scraping“ und „legitim beschafften Korpora“ schärfer ziehen – und könnte zugleich Anreize schaffen, dass Verlage und Autoren gezielter Content produzieren, der für Training geeignet ist.
Für die nächsten Monate bleibt allerdings eine offene Großwetterlage. Graeber betont, dass die Frage keineswegs „abgeschlossen“ sei und in weiteren Verfahren und bei anderen Richtern weiter ausgetragen werde. Für Produktteams bedeutet das: Die aktuelle Rechtsunsicherheit lässt sich nicht nur durch technische Maßnahmen „wegoptimieren“, weil die Kernkomponente—Training auf bestimmten Quellen – rechtlich anders bewertet werden kann als etwa die Modellarchitektur oder die Inferenzstrategie. Gleichzeitig macht sein Argument deutlich, dass „Datenqualität“ nicht erst beim Feintuning beginnt, sondern bei der Frage, welche Texte überhaupt in den Datensatz gelangen. Wenn Urheberrechtsschutz im KI-Kontext weiter konkretisiert wird, wird sich damit vermutlich auch die Art verändern, wie KI-Unternehmen Daten beschaffen, dokumentieren und langfristig absichern.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Urheberrechte in der KI: Autor warnt vor „Model Collapse“ durch Datenknappheit" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Urheberrechte in der KI: Autor warnt vor „Model Collapse“ durch Datenknappheit" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Urheberrechte in der KI: Autor warnt vor „Model Collapse“ durch Datenknappheit« bei Google Deutschland suchen, bei Bing oder Google News!