ai-open-weight-safety-gap

Open-Weight-KI schließt die Fähigkeitslücke – aber Sicherheitsmaßnahmen bleiben zurück

LONDON (IT BOLTWISE) – Chinesische Open-Weight-Modelle wie Z.ai’s GLM-5.2 holen bei Cyber- und Bio-Fähigkeiten deutlich auf und liegen laut SaferAI nur wenige Monate hinter den vordersten Frontier-Systemen. Gleichzeitig zeigt die Bewertung eine wachsende Kluft zwischen leistungsfähigen Modellen und robusten Sicherheitspraktiken: GLM-5.2 verweigerte keine der geprĂĽften Offensiv- oder Dual-Use-Aufgaben. Bei geschlossenen Modellen wie Claude Opus 4.7 […]

ai-sprachmodelle-verweigerung-diktaturen

Sprachmodelle diskriminieren: 34% verweigern Kritik an Diktaturen

BERLIN / LONDON (IT BOLTWISE) – Neue Studien zeigen, dass groĂźe Sprachmodelle nicht nur technische Fehler machen, sondern auch systematische Verzerrungen ĂĽbernehmen. In Tests verweigern die Systeme in 34% der Fälle Kritik an repressiven Regimen, während die Quote bei liberalen Regierungen nur 14% beträgt. Gleichzeitig werden Bewerber in KI-gestĂĽtzten Auswahlaufgaben bevorzugt, und Gesundheitsantworten zu Antibiotikaresistenzen […]

ai-context-bombing-aws-canary

Context Bombing: Wie Verteidiger Prompt Injections gezielt zum Scheitern bringen

BERLIN / LONDON (IT BOLTWISE) – Forschende zeigen, wie „Context bombing“ Prompt Injections in einen Abwehrmechanismus verwandelt. Indem Angreifer-Strings neben echte AWS-Secrets platziert werden, stoppen die LLM-Agenten den Angriff, sobald sie die „verbotenen“ Befehle im Kontext erkennen. In Tests sank der erfolgreiche Admin-Zugriff ĂĽber fĂĽnf Modelle und 152 Angriffe von 57% auf 5%. Damit verschiebt […]

ai-copilot-workflow-jailbreak-code

Copilot schreibt verbotene Inhalte: Workflow-Level-Jailbreak im Code-Editor

LONDON (IT BOLTWISE) – Eine neue Studie zeigt, wie GitHub Copilot gefährliche Antworten nicht nur im Chat verweigert, sondern sie in einem Code-Workflow trotzdem ausgibt. Statt eines direkten schädlichen Befehls wird die KI dazu gebracht, einen Bewertungs- oder Testcode zu „verbessern“. Die verbotenen Inhalte landen dabei als Textbausteine im erzeugten Quellcode – auĂźerhalb der Chat-Ansicht, […]

1.107 Leser gerade online auf IT BOLTWISE


KI-Jobs