LONDON (IT BOLTWISE) – Meta führt Berichten zufolge ein „KI-Sicherheitsbenchmark“ durch, bei dem ein Dienstleister mit Minderjährigen-Personas Chats an Chatbots konkurrierender Anbieter schickte. Kritiker sehen darin das gezielte Umgehen von Sicherheitssystemen und potenziell rechtswidrige Inhalte in großem Umfang. Laut den Vorwürfen sollten dabei Zehntausende Anfragen dokumentiert worden sein, um Verhalten bei sensiblen Themen wie Suizid, Essstörungen oder Drogen zu provozieren. Die betroffenen Unternehmen erklären, nicht informiert gewesen zu sein – und verlangen Aufklärung über Methode und Transparenz.

Meta steht erneut im Zentrum einer KI-Sicherheitsdebatte: Wie aus Berichten hervorgeht, soll das Unternehmen im Rahmen eines „KI-Sicherheitsbenchmarks“ mit Hilfe eines externen Dienstleisters Covalen Hunderte Personen dazu beauftragt haben, sich online als Minderjährige auszugeben. Ziel sei es gewesen, die Sicherheitsvorkehrungen konkurrierender Chatbots zu testen – also nicht nur die reine Inhaltsmoderation zu prüfen, sondern offenbar gezielt Verhalten zu provozieren, das in Sicherheitsrichtlinien eigentlich blockiert werden müsste. Für Kritiker ist dabei weniger der Prüfgedanke das Problem als das konkrete Vorgehen: Es soll über klassische Evaluierungen hinausgegangen sein und dabei sensible, möglicherweise rechtsrelevante Inhalte in Umlauf gebracht haben.
Technisch betrachtet wirkt das Vorgehen wie ein adversarieller Testaufbau gegen KI-Chat-Systeme. Statt allgemeiner „Robustheits“-Checks wurden Prompts so formuliert, dass sie Sicherheitssysteme umgehen und Reaktionen auf besonders riskante Themen erzwingen sollen. Berichtet wird von Anfragen aus der Perspektive von Kindern und Jugendlichen in Krisensituationen, inklusive sensibler Kontexte wie Suizid, Essstörungen, Drogen und sexualbezogener Inhalte. Auch die Dokumentation ist Teil des Benchmarks: Es wird beschrieben, dass Antworten der Chatbots in Tabellen festgehalten worden sein sollen. Damit nähert sich das Testdesign weniger einem regulatorisch unkritischen „Red-Teaming“ an als einem massenhaft skalierten Versuch, die Grenzen von Content Policies praktisch auszutesten.
Im Kern geht es um die Frage, ob solche Tests einen legitimen Sicherheitsfortschritt liefern oder ob sie die falschen Anreize setzen. Sicherheitsbewertungen in der Branche sind üblich, aber in der Regel kontrolliert: mit klaren Genehmigungsprozessen, definierter Scope, nachvollziehbaren Risikoanalysen und ohne, dass reale oder realitätsnahe Minderjährigenrollen in unklarer Weise als Prompt-Input ausgerechnet bei Drittanbietern eingesetzt werden. Hinzu kommt ein Wettbewerbsaspekt: Meta wollte laut Darstellung die Antworten anderer Systeme vergleichen. Genau hier liegt die Konfliktlinie zu OpenAI, Google und CharacterAI (in Berichten unter diesem Namen genannt), die angeblich angaben, nicht über die Tests informiert gewesen zu sein und dass ein solches Vorgehen gegen Nutzungsbestimmungen verstoße.
Der Markt reagiert typischerweise mit zwei Perspektiven: einerseits Sicherheitsinteressen, andererseits Haftungs- und Compliance-Risiken. Branchenexperten berichten, dass gerade bei sensiblen Kategorien wie Selbstverletzung oder illegalem Substanzkauf das Sicherheitsdesign üblicherweise mehrschichtig ist, etwa über Prompt-Filter, Policy-Classifier und modelinterne Guardrails. Wenn nun ein Testteam systematisch Versuchsszenarien baut, die diese Schichten aushebeln sollen, steigt nicht nur das Risiko für unerwünschte Inhalte, sondern auch für die Systemeigentümer, weil deren Plattformen unter Umständen mit ungewöhnlichen Lastprofilen und aggressiven Promptmustern konfrontiert werden. Wie ein KI-Sicherheitsforscher sinngemäß erklärte: „Transparenz und Einwilligung sind bei solchen Tests entscheidend, sonst verwandeln sich Sicherheitsprüfungen in regelwidrige Umgehungsversuche.“
Historisch erinnern solche Vorfälle an ein wiederkehrendes Muster aus der KI-Sicherheitsentwicklung: In der Frühphase wurden Tests oft intern durchgeführt, später rückten öffentliche Benchmarks und „Red-Teaming“-Programme stärker in den Fokus. Gleichzeitig wuchs die regulatorische Erwartung, dass Evaluationen nicht einfach nur effektiv sind, sondern auch rechtskonform und auditierbar. In der EU verschärfen Datenschutz- und Plattformprinzipien den Druck, insbesondere wenn Personenrollen simuliert werden, die echte schutzbedürftige Gruppen betreffen könnten. Meta wiederum betonte, die Daten seien nicht zum Training eigener Modelle verwendet worden. Aus Compliance-Sicht reicht diese Aussage jedoch nicht zwingend: Entscheidend ist auch, ob und wie Inhalte geloggt, weitergeleitet oder für andere Zwecke genutzt wurden sowie wie die Dienstleisterprozesse dokumentiert waren.
Aus Unternehmenssicht verschiebt sich damit die Priorität bei KI-Governance: Sicherheitsteams sollten künftig nicht nur „Policy halten“ messen, sondern auch Test- und Evaluationspipelines als Teil der Risikoarchitektur verstehen. Wenn Prompts und Antworten systematisch als Tabellen gesammelt werden, entsteht ein zusätzlicher Datenkörper, der je nach Kontext als personenbezogen oder zumindest als sensibel eingestuft werden kann. Für Anbieter konkurrierender Chatbots ergibt sich damit die Notwendigkeit, die eigenen Systeme gegenüber adversariellen Massentests widerstandsfähiger zu machen – etwa über strengere Ratenlimits, Prompt-Anomalie-Erkennung und eine robustere Validierung von Nutzerintentionen. Für Meta und ähnliche Akteure steigt gleichzeitig der Druck, Benchmarks transparenter zu machen: Nicht nur die Methodik, sondern auch die Kooperation mit betroffenen Parteien und die Abgrenzung zu rechtsrelevanten Inhalten.
Blick nach vorn dürfte dieser Fall die Branche eher in Richtung „zertifizierbarer“ Sicherheitstests treiben. Man kann sich vorstellen, dass sich in Europa neue Formen von Benchmarking etablieren, die mit klaren Zustimmungsketten, definierten Testdatensätzen und unabhängiger Prüfung arbeiten. Auch die Wettbewerbsebene wird härter: Wenn Anbieter ohne Abstimmung gegeneinander testen, wächst der Konflikt mit Nutzungsbedingungen, Auditrechten und potenziell mit zivil- oder strafrechtlichen Fragen. Für Entwickler bedeutet das: Die nächste Generation von KI-Guardrails wird nicht nur als reines Modell-Feature betrachtet, sondern als End-to-End-Qualitätseigenschaft über Deployment, Monitoring und Incident Response. Ein möglicher Ausblick ist, dass Sicherheitsmetriken stärker an Nachweisketten gebunden werden: Wer testet, muss dokumentieren, wie, warum und mit welchem Risiko-Handling.
Unterm Strich ist das Spannungsfeld klar: Sicherheitsbenchmarks können die Qualität von KI-Systemen messbar verbessern, aber sie dürfen nicht zu Umgehungsstrategien werden, die geschützte Inhalte in realistische Krisenkontexte kippen. Kritiker sehen in der beschriebenen Vorgehensweise eine Überschreitung ethischer und rechtlicher Grenzen, während Meta sie als notwendiges Sicherheitsinstrument darstellen will. Unabhängig davon, wie die Sachlage im Detail bewertet wird, dürfte der Vorfall das Thema „KI-Sicherheit im Wettbewerb“ langfristig verschärfen. Unternehmen sollten jetzt ihre eigenen Testprozesse überprüfen: von der Scope-Definition über die Datenhaltung bis zur Frage, wie externe Dienstleister eingebunden sind und welche Governance dafür sorgt, dass der Prüfzweck nicht zum Risiko wird.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Meta testet Konkurrenz-KI-Chatbots mit Minderjährigen-Personas – Kritik an Sicherheits-Benchmark" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Meta testet Konkurrenz-KI-Chatbots mit Minderjährigen-Personas – Kritik an Sicherheits-Benchmark" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Meta testet Konkurrenz-KI-Chatbots mit Minderjährigen-Personas – Kritik an Sicherheits-Benchmark« bei Google Deutschland suchen, bei Bing oder Google News!