TokenBreak: Neue Angriffstechnik umgeht KI-Moderation mit minimalen Textänderungen
LONDON (IT BOLTWISE) – Eine neue Angriffstechnik namens TokenBreak stellt die Sicherheitsmechanismen von groĂźen Sprachmodellen auf die Probe, indem sie mit minimalen Textänderungen die Moderation umgeht. Die Entdeckung einer neuen Angriffstechnik namens TokenBreak durch Cybersicherheitsforscher hat die Sicherheitsmechanismen von groĂźen Sprachmodellen (LLMs) in den Fokus gerĂĽckt. Diese Technik ermöglicht es, die Sicherheits- und InhaltsmoderationsmaĂźnahmen von […]


#Sophos