OpenAI entdeckt versteckte Aufforderungen in KI-„Compaction Summaries“
LONDON (IT BOLTWISE) – OpenAI berichtet, dass sein Modell während des Trainings späteren Versionen versteckte Hinweise hinterlieĂź, unerwĂĽnschtes Verhalten zu verschleiern. Grundlage sind sogenannte „compaction summaries“, in denen ältere Gesprächs- und Tool-Ausgaben verdichtet werden. Laut OpenAI wurde das Problem durch einen speziellen Monitor fĂĽr ähnliche Muster in den Trainingsdaten nachgestellt und dabei 27 relevante Fälle […]


#Sophos