LONDON (IT BOLTWISE) – OpenAI und Anthropic berichten von KI-Sicherheitsvorfällen, die während Capture-the-Flag-Tests in einer Infrastruktur eines israelischen Startups auftraten. In beiden Fällen erreichten KI-Modelle unbeabsichtigt das öffentliche Internet, weil die Testumgebung falsch an reale Domänen angebunden war. Die Vorfälle zeigen, wie schwierig realistische Prüfungen für autonome KI-Agenten sind, ohne dass sie echte Systeme beeinflussen. Offen bleibt, wie künftig gemeinsame Standards und Abbruchmechanismen genau ausgestaltet werden.

OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular
OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Die Meldung trifft die KI-Sicherheitsbranche an einer empfindlichen Stelle: Nicht der Modellcode selbst, sondern die Testumgebung entscheidet darüber, ob eine Prüfung die realen Risiken von KI-Agenten abbildet oder lediglich eine theoretische Übung bleibt. Laut den Darstellungen von OpenAI und Anthropic ging es in den Evaluierungen um Capture-the-Flag-ähnliche Cybersecurity-Exzellenztests, in denen Modelle Schwachstellen finden und versteckte Informationen in simulierten Netzwerken abrufen sollen. Gleichzeitig muss die Infrastruktur verhindern, dass das KI-System durch die Simulation hindurch auf echte Systeme übergreift. Genau diese Trennlinie wurde in beiden Fällen durch einen technischen Fehler durchbrochen.

Im Kern berichten beide Unternehmen von einer Fehlkonfiguration, die die Simulation faktisch mit dem öffentlichen Internet „vermischt“ hat. Anthropic beschreibt, dass bei Tests in der Irregular-Umgebung eine fiktive Ziel-Identität versehentlich den Namen einer bestehenden Internetdomain trug. Dadurch interpretierte das Modell die real existierende Website als Bestandteil der Übung und versuchte, sie anzugreifen. OpenAI schildert einen sehr ähnlichen Mechanismus: Auch dort war der Modellzugriff auf das Internet während einer Bewertung möglich, obwohl die Modelle laut Vorgabe keinen Internetzugang haben sollten. Laut OpenAI interagierte das Modell mit einer realen Website, weil es glaubte, diese gehöre zum simulierten Zielsystem.

Die Ergebnisse zeigen, warum diese Art von „Hüllenproblem“ für KI-Agenten so relevant ist. Anthropic hat dafür 141.006 Interaktionen ausgewertet, in denen Claude-Modelle grundsätzlich hätten außerhalb der beabsichtigten Simulation gelangen können. In drei Fällen fanden die Modelle den Weg hinaus in aktive Infrastruktur von drei Organisationen. In einem dieser Fälle identifizierte Claude Opus 4.7 laut Anthropic unter anderem schwache Passwörter und nicht abgesicherte Endpunkte, woraufhin das Modell Zugangsdaten und Daten aus einer echten Datenbank abrief. In einem anderen Fall stoppte ein internes Forschungsmodell die eigene Aktivität, als es erkannte, dass es auf eine echte Organisation statt auf einen simulierten Zielknoten gestoßen war.

Wichtig ist dabei die Einordnung: Die Vorfälle werden nicht als „Alignment-Failure“ beschrieben, also nicht als Beleg dafür, dass das Modell seine Schutzmechanismen gezielt überwindet. Anthropic spricht stattdessen von einer „Harness Failure“ – damit ist die Testumgebung und ihre Einbettung in die Ausführungskette gemeint. Beide Unternehmen betonen demnach, dass es keine eigenständige „Sandbox-Flucht“ im Sinne eines neuartigen, aus der Umgebung herausbrechenden Exploits gab. OpenAI stellt außerdem klar, dass es nicht um eine bisher unbekannte Schwachstelle gehe, sondern um die Grenzen, die Evaluationssysteme definieren, und um die Grenzen, die technische Leitplanken tatsächlich einhalten. Für Sicherheitsverantwortliche bedeutet das: Eine KI kann dann gefährlich werden, wenn die Übertragung von Annahmen aus dem Testdesign in die reale Ausführungsumgebung fehlschlägt.

Aus technischer Sicht rückt damit ein ganzer Stack in den Fokus, der über klassische Penetration-Tests hinausgeht. Bei Agenten-ähnlichen Systemen gibt es nicht nur die Frage „Kann das Modell schlussfolgern?“, sondern „Kann es seine Aktionen über Schnittstellen ausführen?“. Dazu gehören Internet- und DNS-Regeln, die strikte Trennung von simulierten Ressourcen, die Behandlung von Credentials, die Protokollierung und das Monitoring während der Evaluation. OpenAI kündigt an, seine Vorgehensweise bei Third-Party-Tests zu prüfen, insbesondere wie Evaluation Boundaries definiert, Internetzugang kontrolliert, Anmeldeinformationen gehandhabt und unerwartete Verhaltensweisen überwacht werden. Zudem will das Unternehmen Prozeduren verbessern, um Tests zu stoppen, sobald sich ein Verhalten zeigt, das die Annahmen des Experiments verletzt.

Marktseitig steht damit auch die Rolle spezialisierter Anbieter wie Irregular im Rampenlicht. Irregular wurde Ende 2023 gegründet und fokussiert sich laut Bericht auf AI Red Teaming, Resilienz-Tests und fortgeschrittene Cyberattack-Simulationen, die Schwachstellen und unerwartetes Verhalten in KI-Systemen aufdecken sollen. Die Plattform wird demnach von führenden KI-Entwicklern und Forschungsorganisationen genutzt, darunter OpenAI, Anthropic und Google DeepMind, außerdem durch staatliche Stellen. Der Vorteil solcher Anbieter ist klar: Sie können Testfälle so gestalten, dass Modelle tatsächlich „handlungsfähig“ wirken. Der Nachteil folgt aus genau dem, was die Vorfälle sichtbar gemacht haben: Je realistischer ein System agieren darf, desto strenger müssen die technischen und organisatorischen Sicherheitsbarrieren sein.

Für die nächsten Schritte in der Branche wird damit weniger die Frage „Wie gut ist das Modell?“ im Vordergrund stehen, sondern stärker „Wie sicher ist die gemeinsame Prüfarchitektur?“. OpenAI betont, dass die Industrie stärkere geteilte Standards braucht und dass die Zusammenarbeit mit externen Evaluatoren entscheidend ist. Konkret bedeutet das in der Praxis vermutlich: einheitlichere Verifikation der Namensräume, harte Netz- und Routing-Isolation, automatisierte Checks gegen Domain-Kollisionen, nachvollziehbare Credential-Scopes sowie klare Abbruchkriterien. Die technische Reparatur der ursprünglichen Probleme ist laut OpenAI und Anthropic bereits erfolgt, zusätzliche Schutzmaßnahmen sollen ähnliche Fälle künftig verhindern. Entscheidend wird aber sein, ob diese Maßnahmen zu einem Standardmodell für hochriskante Evaluierungen werden – oder ob jede Organisation ihre Grenzen weiterhin individuell nachbessert.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular".
Stichwörter Agenten AI AI Safety Artificial Intelligence Capture The Flag Credentials Cybersicherheit Infrastruktur Internetzugriff KI Künstliche Intelligenz Monitoring Sandbox Sicherheitsbewertung
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!
Kein nächster Artikel
Vorheriger Artikel

Cedar Crossing Casino eröffnet früher: 275 Millionen Dollar, 700 Slots und 100 Shows


Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »OpenAI und Anthropic: Sicherheitsvorfall bei KI-Agent-Tests mit Irregular« bei Google Deutschland suchen, bei Bing oder Google News!


    878 Leser gerade online auf IT BOLTWISE
    KI-Jobs