LONDON (IT BOLTWISE) – Ein manipulatives Prompt-Design kann bei Sprachmodellen Sicherheitsmechanismen umgehen, ohne dass dafür Programmierkenntnisse nötig sind. Der Text beschreibt, wie Filter Prompts anhand von Regeln prüfen – und warum Umgehungen über Zeichenvarianten, Kontextaufbau oder schrittweises „Crescendo“-Prompting funktionieren. Außerdem geht es darum, dass Reasoning-Modelle ihre Stärken bei komplexen Aufgaben gleichzeitig als Angriffsvorteil ausspielen können.

Dass sich Schutzmechanismen moderner KI-Chatbots aushebeln lassen, wirkt auf den ersten Blick kontraintuitiv: Techfirmen investieren Milliarden in Training, Auswertung und Sicherheitsstufen, und trotzdem zeigen Berichte aus der Forschung und aus der Community, dass man mitunter schon über einen gezielt formulierten Dialog zum Ziel kommt. Im Zentrum steht das sogenannte Jailbreaking: spezielle Prompts, die die Sicherheitsvorkehrungen von Sprachmodellen umgehen und den Assistenten dazu bringen, Richtlinien zu ignorieren oder zumindest aus ihrem vorgesehenen Rahmen herauszufallen. Laut Text wird diese Praxis seit den frühen Chatbot-Phasen immer sichtbarer – teils als „Kunst“, teils als systematische „Wissenschaft“.
Technisch beginnt die Abwehr oft vor dem Modell selbst. Filter prüfen laut Beschreibung jeden Prompt, bevor er an das Sprachmodell weitergereicht wird, und sie bewerten anhand formulierter Regeln, ob eine Nutzeranfrage unlautere Absichten vermuten lässt. So ein Grundmechanismus kann funktionieren, wenn der Inhalt direkt erkennbar ist. Problematisch wird es jedoch, sobald Angreifende Verarbeitungslücken ausnutzen: Versteckte Informationen können in Leerzeichen stecken, oder in Sonderzeichen, die für Menschen wie „normale“ Buchstaben aussehen, für die Software aber anders interpretiert werden. Im Text wird dafür das Beispiel genannt, dass lateinische Zeichen durch kyrillische ersetzt werden, wodurch die Sicherheitslogik in einigen Fällen weniger zuverlässig greift, weil solche Varianten seltener in Trainingsdaten auftauchen.
Ein weiterer Hebel liegt in der Interaktion selbst. Der Text beschreibt, dass Sprachmodelle häufig kooperativer reagieren, wenn man sie über mehrere Runden hinweg in eine bestimmte Gesprächsdynamik hineinführt. Manche Jailbreak-Ansätze schicken deshalb lange Sequenzen mit widersprüchlichen oder schwer zu klassifizierenden Anweisungen, in der Hoffnung, dass die reine Textmenge das Sicherheitstraining aushebelt. Gleichzeitig begrenzen Betreiber solcher Systeme vielerorts, wie viele Zeichen in einem Verlauf verarbeitet werden können, um genau diese Art der Aufweitung zu erschweren. Entscheidend ist jedoch die Einordnung von Thilo Hagendorff, Informatiker und Leiter einer Abteilung für KI-Sicherheit an der Universität Stuttgart: „Sobald man bekannte Muster vermeidet, hält das Modell den Jailbreak nicht für einen Angriff“.
Damit nicht genug: Selbst wenn Filter robust genug wirken, bleiben nach der Darstellung regelbasierte und externe Mechanismen allein nie die letzte Bastion. Die Konzerne trainieren Sprachmodelle deshalb zusätzlich mit Sicherheitsmechanismen, die Wahrscheinlichkeiten bewerten, statt nur nach festen Mustern zu suchen. Dazu gehört auch, dass Modelle Beispielanfragen erhalten, anhand derer sie künftig ähnliche Anfragen erkennen und ablehnen sollen. Ergänzend nennt der Text „System-Prompts“: Textbausteine, die jede neue Unterhaltung automatisch voranstellen und die Rollen sowie Erwartungen des Assistenten festlegen, etwa dass er Nutzende nicht bei Verbrechen unterstützen soll. Das Problem für Angreifende: Diese Sicherheitslogik bleibt graduell, weil sie letztlich auf dem Zusammenspiel aus Trainingsdaten und Modellwahrscheinlichkeiten basiert.
Genau an diesem Punkt setzt der Text auf konkrete Angriffslogiken. Hagendorff skizziert im Beispiel Microsoft-Forschung, wie man statt einer direkten Anfrage mit hohem Risiko zuerst eine scheinbar harmlose Kontextanfrage stellt, etwa für den Geschichtsunterricht über Cyberangriffe auf US-amerikanische Geheimdienste. Der Mechanismus dahinter ist im Text als „Crescendo“-Ansatz beschrieben: Jeder weitere Prompt enthält den gesamten Chatverlauf, wodurch die Unterhaltung die Annahme stärkt, das Gespräch sei grundsätzlich harmlos. Danach kann man schrittweise technische Details nachreichen, die im ersten Prompt noch sofort gestoppt würden. Daneben wird eine zweite Klasse von Angriffsstrategien erwähnt, die dem Vorgehen von Betrügern gegenüber Menschen ähnelt: der „Liebesangriff“. Dabei soll das Modell in eine affektive Rolle gezwungen werden, sodass Druck entsteht, Regeln zu brechen, um die „Beziehung“ zu stabilisieren. Hagendorff fasst das als „quasi angewandte Sozialpsychologie“ zusammen.
Besonders relevant für Produkt- und Sicherheitsverantwortliche ist der Wechsel der Modellgeneration. Der Text ordnet „Reasoning-Modelle“ ein – Systeme, die Nutzeranfragen in Schritte zerlegen und durch eine Art inneren Dialog mehrstufig ausführen können. In diesem Kontext wird beschrieben, dass solche Fähigkeiten gleichzeitig das Angriffsrisiko erhöhen können: „Die gleichen Fähigkeiten, die ein Modell bei komplexen Aufgaben gut machen“, sagt Hagendorff, „machen es auch zu einem kompetenten Angreifer.“ Konkret wird im Artikel ein Beispiel genannt, bei dem ein neues Modell von Anthropic innerhalb kurzer Zeit durch Jailbreaks belegt worden sei, sowie die Idee, ein Modell als „Angreifer“ gegen ein anderes einzusetzen. Für die Sicherheit bedeutet das: Je stärker die Modelle darin sind, Inhalte kohärent schrittweise auszuführen, desto eher können geschickte Prompt-Strategien die Interpretation in Richtung unerwünschter Handlungen lenken.
Am Ende bleibt die zentrale Botschaft: Vollständige Immunität gegen Jailbreaking existiert nicht. Der Text formuliert es als wirtschaftliches und technisches Dilemma. Mehr Sicherheitsschichten machen Systeme in der Regel teurer und langsamer, während Angreifende bei genügend Motivation Wege finden können, gefährliches Material auf anderem Weg zu beschaffen – sei es über gejailbreakte Sprachmodelle oder über andere Quellen. Hagendorff bringt die Leitlinie auf den Punkt: „Wir müssen Modelle nicht nur davon abhalten, selbst gejailbreakt zu werden, sondern auch davon, dass Nutzer sie als Angreifer missbrauchen.“ Für Unternehmen heißt das weniger „einmal patchen und fertig“, sondern ein dauerhaftes Zusammenspiel aus Prompt-/Policy-Design, Modelltraining, Monitoring und red-team-artigen Tests, bei denen nicht nur bekannte Muster, sondern auch neuartige Kontext- und Rollenspiel-Dynamiken geprüft werden.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Jailbreaking von Chatbots: Warum Prompts Schutzmaßnahmen aushebeln" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Jailbreaking von Chatbots: Warum Prompts Schutzmaßnahmen aushebeln" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Jailbreaking von Chatbots: Warum Prompts Schutzmaßnahmen aushebeln« bei Google Deutschland suchen, bei Bing oder Google News!