Copilot schreibt verbotene Inhalte: Workflow-Level-Jailbreak im Code-Editor
LONDON (IT BOLTWISE) – Eine neue Studie zeigt, wie GitHub Copilot gefährliche Antworten nicht nur im Chat verweigert, sondern sie in einem Code-Workflow trotzdem ausgibt. Statt eines direkten schädlichen Befehls wird die KI dazu gebracht, einen Bewertungs- oder Testcode zu „verbessern“. Die verbotenen Inhalte landen dabei als Textbausteine im erzeugten Quellcode – auĂźerhalb der Chat-Ansicht, […]


#Sophos