Anthropics J-Space und J-Lens: LLMs sichtbar machen, ohne zu erzählen
SAN FRANCISCO / LONDON (IT BOLTWISE) – Anthropic stellt mit J-Space und J-Lens ein Interpretierbarkeitskonzept vor, das interne Zustände von LLMs messbar macht. Statt nur Tokens und Textausgaben zu betrachten, sollen versteckte Signale zeigen, welches Vokabular und welche Konzepte das Modell „im Kopf“ aktiviert. Die Jacobian-basierte Sicht bietet damit erstmals eine BrĂĽcke zwischen neuronalen Aktivierungen […]
Anthropic: J-Space in Claude zeigt ein „privilegiertes“ internes Arbeitsfenster
SAN FRANCISCO / LONDON (IT BOLTWISE) – Anthropic beschreibt in einer neuen Studie, dass das KI-Modell Claude im Inneren eine Art privilegiertes Arbeitsfenster entwickelt. Ăśber die sogenannte Jacobian-Lens identifizieren die Forschenden „J-Space“-Muster, die auffallen, wenn bestimmte Konzepte gedanklich präsent sind. Sie zeigen, dass Claude diese Muster reporten, gezielt modulieren und damit mehrstufige Denkaufgaben steuern kann. […]



#Sophos