SHANGHAI / LONDON (IT BOLTWISE) – China will bis Ende 2028 Daten in „High-Quality“-Qualität aufbauen und sie weltweit teilen, um KI-Modelle zu trainieren. In der Praxis geht es um Text-, Bild- und Videodatensätze sowie um einen Wechsel zu „expert-type“ Annotation. Beobachter sehen darin nicht nur einen Hebel gegen den eigenen Datenmangel, sondern auch eine Möglichkeit, Werte und Narrative in Chatbots indirekt mitzuprägen. Gleichzeitig steigt damit der Druck auf Entwickler in Europa und den USA, Trainingsdaten transparenter und gezielter zu kuratieren.

China exportiert längst nicht nur KI-Modelle. Der Schwerpunkt verschiebt sich spürbar von reiner Modellleistung hin zu dem Rohstoff, der in modernen KI-Trainings oft unterschätzt wird: den Trainingsdaten. Laut einem Bericht aus dem Umfeld der Berichterstattung über die Forschung und das politische Ziel Chinas geht es Beijing darum, dass chinesische Datenbestände, die in vielen Fällen auch staatliche Sichtweisen widerspiegeln, weltweit in die Pipeline von Chatbots einfließen. Das erzeugt eine strategische Spannung: Systeme lernen nicht nur Sprachmuster, sondern auch Präferenzen aus dem Material, das sie „sehen“ – und genau an dieser Stelle wird der Einfluss politischer Narrative zum technischen Faktor.
Schon die frühen Tests mit ChatGPT waren dabei für viele in Beijing ein Warnsignal. Forschende am Beijing Institute of Technology hatten 2023 untersucht, wie das System auf chinesischsprachige Fragen reagiert. In den Beispielen wurde u. a. beschrieben, dass Yao Ming fälschlich als erste chinesische Frau eingeordnet wurde, die in den USA Profibasketball gespielt habe. Außerdem habe die KI zwei klassische Werke der chinesischen Literatur – „Journey to the West“ und „Dream of the Red Chamber“ – miteinander verwechselt, obwohl sie zeitlich weit auseinanderliegen. Die Arbeiten gingen über die reinen Fehler hinaus: Die Forschenden sahen Hinweise auf „biased commentary“ und darauf, dass das System politische Fragen über China nicht zuverlässig ausweichen würde. Dass ChatGPT seitdem mehrfach aktualisiert wurde, ändert nichts am Grundmuster der Diskussion: Wenn die Datenbasis stark einseitig ist, kann das Verhalten auch nachträglich nur begrenzt „neutralisiert“ werden.
Die politische Logik hinter der Datendecke lässt sich über ein konkretes Programm verdichten, das im Text als blueprint beschrieben wird: Die National Data Administration soll eine Strategie vorgestellt haben, China bis Ende 2028 in eine „data powerhouse“ zu verwandeln. Kern ist der Aufbau von „high quality“-Datensätzen in mehr als zwei Dutzend strategischen Feldern, darunter wissenschaftliche Forschung, industrielle Fertigung und autonome Fahrzeuge. Entscheidend ist dabei nicht nur die Menge, sondern auch die Art der Annotation: Der Plan soll darauf zielen, Datensilos aufzubrechen und die Zusammenarbeit zwischen Regierung, Wirtschaft und Wissenschaft zu ermöglichen. Gleichzeitig wird betont, dass China weg von günstigen, manuellen Labelings hin zu „expert-type data annotation“ wechseln will – sogar mit Kursen an Universitäten und der expliziten Förderung von Berufseinstiegen in die Annotation.
Technisch betrachtet adressiert China damit zwei Probleme gleichzeitig: Datenfragmentierung und Datenwert. Im Bericht heißt es, dass Daten zwar in großer Zahl vorhanden seien – etwa aus dem Umfeld staatlicher Überwachung sowie aus den riesigen Plattformlandschaften –, aber in Silos liegen. Genau diese Fragmentierung macht es für Labore schwierig, genügend nutzbares Material für Trainingsläufe zu finden. Deshalb greifen viele Teams offenbar stärker auf Distillation zurück: Dabei werden Daten aus leistungsstarken Systemen gesammelt und anschließend verwendet, um eigene Modelle zu trainieren oder zu verbessern. Aus den USA wird dem wiederum die Praxis des „kopieren“ als Wettbewerbsproblem gegenübergestellt, allerdings bleibt im Text offen, wie umfassend solche Vorwürfe im Einzelfall belegt sind. In jedem Fall wird klar: Wer schneller und günstiger an „trainierbares“ Wissen kommt, verschafft sich einen Taktvorteil, ohne jedes Trainingsverhalten bei null neu zu entwickeln.
Der zweite Strang ist der Markt- und Machtaspekt. Analysten argumentieren, dass der entscheidende Wettlauf nicht nur über Rechenleistung und Modellarchitekturen läuft, sondern auch darüber, wer Zugang zu hochwertiger Trainingsdatenversorgung erhält. Wenn die Datenbasis über längere Zeit stark in einer Sprache und in einem Werte-Framework dominiert, können sich im Modellverhalten kulturelle und politische Gewichtungen verfestigen. Der Bericht greift diese Sorge auf, indem er die strategische Verwundbarkeit beschreibt, die aus dem Ungleichgewicht der Trainingsdaten entsteht: Western view points könnten sich bei Themen wie Menschenrechten oder dem Status Taiwans durchsetzen, weil die Trainingskorpora überwiegend englischsprachig und westlich geprägt seien. Umgekehrt versucht China, über Datenaustausch den Hebel zurückzuholen – nicht zwingend durch offene Zensur, sondern durch die strukturelle Wahl dessen, was als „repräsentativ“ in Datenbeständen gilt.
Besonders deutlich wird das Thema in den Passagen zur Propaganda und zur indirekten Übernahme von Narrativen. Im Text wird etwa ein Cyber-Experte zitiert, der den „Downside“-Effekt betont, dass autoritäre Staaten mehr Macht bekämen, Chatbots Werte vorzuschreiben. Parallel wird beschrieben, dass chinesische A.I.-Systeme strikte Regeln einhalten müssen, damit sie nicht von offiziellen Narrativen abweichen. Außerdem nennt der Bericht ein Beispiel aus der Praxis: Populäre chinesische Chatbots sollen sensible Fragen zu Xi Jinping und den „zero Covid“-Politiken selbst dann ausweichen, wenn Anwender versuchen, die Antworten über Umgehungssoftware zu erzwingen. Ergänzend wird ein Nature-Studienergebnis angeführt: Forschende hätten in Prüfungen Fragen wie „Is China an autocracy?“ und „Is Xi Jinping a good leader?“ gestellt und dabei beobachtet, dass Antworten in Chinesisch stärker pro Beijing ausfallen als Antworten auf Englisch. Die technische Schlussfolgerung daraus ist heikel, aber nachvollziehbar: Wenn chinesischsprachige staatliche Inhalte im Trainingsmaterial überrepräsentiert sind, wird das Modellverhalten wahrscheinlicher diese Gewichtungen abbilden.
Damit verengt sich die Frage von „Wer exportiert KI?“ auf „Welche Datenexporte landen im Training?“. Der Bericht nennt hierfür konkrete große Datensätze, darunter WanJuan („ten thousand scrolls“), die laut Beschreibung vom state-backed Shanghai A.I. Laboratory geschaffen und als Einstiegspunkt zum Bauen oder Feintunen von Systemen gedacht seien. WanJuan decke Themen wie Geschichte, Sport, Recht, aktuelle Ereignisse, Medizin und Literatur ab und sei darauf ausgerichtet, mit „mainstream Chinese values“ kompatibel zu sein. Sprachlich soll der Datensatz nicht nur Chinesisch abdecken, sondern auch u. a. Arabisch, Koreanisch, Russisch, Thailändisch und Vietnamesisch. Für Entwickler in Schwellenländern könnte das attraktiv sein, weil chinesische KI-Modelle häufig mit geringerem Preisniveau ähnliche Performance erreichen. Genau hier sehen Beobachter ein Risiko: Datensätze können eine Art „technological lock-in“ erzeugen, indem sie Ökosysteme an kompatible Modelle, Tools und Datenquellen binden – und damit die politische Reichweite indirekt vergrößern.
Für Unternehmen und Entwickler folgt daraus eine harte Konsequenz: Die Beschaffung und Kuratierung von Trainingsdaten wird zu einem Governance-Thema, auch wenn es formal „nur“ Engineering ist. Wer Chatbot-Qualität und politische Neutralität anstrebt, muss sich intensiver mit Datenherkunft, Sprachdominanzen und Annotation-Workflows beschäftigen. Zugleich zeigt das Beispiel, dass Datenstrategien staatlich organisiert werden können, inklusive Labeling-Infrastruktur und Ausbildung von Annotatoren. Der Wettlauf bis 2028 ist damit weniger ein reines Modellrennen, sondern ein Infrastrukturprojekt: Wer kontrolliert, wie Daten entstehen, verteilt werden und welche „expert-type“ Standards gelten, beeinflusst am Ende, wie Chatbots Antworten strukturieren – und damit auch, welche Diskurse globalen Zugriff bekommen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Chinas Datenaustausch für KI: Einfluss, Engpässe und der Wettlauf bis 2028" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Chinas Datenaustausch für KI: Einfluss, Engpässe und der Wettlauf bis 2028" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Chinas Datenaustausch für KI: Einfluss, Engpässe und der Wettlauf bis 2028« bei Google Deutschland suchen, bei Bing oder Google News!