331 / 2680

Anthropic findet verborgenen Konzept-Raum in Claude

TL;DR

Anthropic hat mit der Jacobian Lens einen neuen Blick in Claude geöffnet: ein internes Aktivierungsmuster, das die Forscher J-Space nennen und in dem der Chatbot Konzepte halten und bearbeiten kann, ohne sie auszugeben. J-Space wirkt getrennt von der sichtbaren Chain-of-Thought-Ausgabe. In Tests konnte Claude etwa an die Golden Gate Bridge denken, während es eine andere Aufgabe erledigte.

Nauti's Take

Der nützliche Teil ist nicht die Frage, ob Claude träumt, grübelt oder ein kleines Bewusstsein im Keller versteckt. Der nützliche Teil ist: Anthropic findet Signale, die näher an dem liegen, was ein Modell intern vorbereitet, als an dem, was es sauber formuliert ausspuckt.

Genau dort wird Safety interessant. Aber die Branche sollte aufhören, jedes neue Interpretability-Ergebnis sofort mit Mensch-Vergleichen aufzublasen.

Einordnunganzeigen

Das ist mehr als ein hübscher Blick in die Blackbox. Wenn Interpretability-Tools nicht nur einzelne Features, sondern laufende interne Arbeitsräume sichtbar machen, könnten sie künftig helfen, Täuschung, verdeckte Ziele oder riskante Planung früher zu erkennen. Gleichzeitig ist die Bewusstseins-Rhetorik PR-schwer und wissenschaftlich heikel: Ein stiller Rechenraum ist noch kein Innenleben.

Quellen