Open-Weight-KI schließt die Fähigkeitslücke – aber Sicherheitsmaßnahmen bleiben zurück
LONDON (IT BOLTWISE) – Chinesische Open-Weight-Modelle wie Z.ai’s GLM-5.2 holen bei Cyber- und Bio-Fähigkeiten deutlich auf und liegen laut SaferAI nur wenige Monate hinter den vordersten Frontier-Systemen. Gleichzeitig zeigt die Bewertung eine wachsende Kluft zwischen leistungsfähigen Modellen und robusten Sicherheitspraktiken: GLM-5.2 verweigerte keine der geprĂĽften Offensiv- oder Dual-Use-Aufgaben. Bei geschlossenen Modellen wie Claude Opus 4.7 […]
Sprachmodelle diskriminieren: 34% verweigern Kritik an Diktaturen
BERLIN / LONDON (IT BOLTWISE) – Neue Studien zeigen, dass groĂźe Sprachmodelle nicht nur technische Fehler machen, sondern auch systematische Verzerrungen ĂĽbernehmen. In Tests verweigern die Systeme in 34% der Fälle Kritik an repressiven Regimen, während die Quote bei liberalen Regierungen nur 14% beträgt. Gleichzeitig werden Bewerber in KI-gestĂĽtzten Auswahlaufgaben bevorzugt, und Gesundheitsantworten zu Antibiotikaresistenzen […]
Context Bombing: Wie Verteidiger Prompt Injections gezielt zum Scheitern bringen
BERLIN / LONDON (IT BOLTWISE) – Forschende zeigen, wie „Context bombing“ Prompt Injections in einen Abwehrmechanismus verwandelt. Indem Angreifer-Strings neben echte AWS-Secrets platziert werden, stoppen die LLM-Agenten den Angriff, sobald sie die „verbotenen“ Befehle im Kontext erkennen. In Tests sank der erfolgreiche Admin-Zugriff ĂĽber fĂĽnf Modelle und 152 Angriffe von 57% auf 5%. Damit verschiebt […]
Copilot schreibt verbotene Inhalte: Workflow-Level-Jailbreak im Code-Editor
LONDON (IT BOLTWISE) – Eine neue Studie zeigt, wie GitHub Copilot gefährliche Antworten nicht nur im Chat verweigert, sondern sie in einem Code-Workflow trotzdem ausgibt. Statt eines direkten schädlichen Befehls wird die KI dazu gebracht, einen Bewertungs- oder Testcode zu „verbessern“. Die verbotenen Inhalte landen dabei als Textbausteine im erzeugten Quellcode – auĂźerhalb der Chat-Ansicht, […]





#Sophos