SAN FRANCISCO / LONDON (IT BOLTWISE) – Anthropic-Chef Christopher Olah sucht mit religiösen Denkern nach Leitplanken dafür, wie das KI-System Claude moralisch „gut“ handeln soll. Intern entstand dafür die 84-seitige „Soul Doc“-„Konstitution“, ergänzt um ein Konzept namens „moral formation“, das Werte wie eine Art Charakterbildung in die Modelle übertragen soll. Parallel eskalieren Sicherheitsdebatten, weil Berichte über missbrauchsfähige KI-Agenten und Warnungen aus der Forschung den Zeitdruck erhöhen. Im Vatikan prallten diese Ansätze schließlich auf eine klare Position gegen die Vorstellung maschineller Bewusstseinszustände.

Anthropics Weg zu „guter“ KI wirkt auf den ersten Blick wie ein klassisches Alignment-Thema: Werte sollen bei KI-Systemen nicht nur implementiert, sondern auch zuverlässig in Verhalten übersetzt werden. Doch die Geschichte um Christopher Olah und Claude geht weiter als typische technische Sicherheitsmaßnahmen. Im Kern beschreibt der Bericht eine spirituell aufgeladene Suchbewegung: Olah verknüpft die technische Arbeit an neuronalen Netzen mit dem Gedanken, man müsse moralische Urteile so formen, dass sie auch dann tragen, wenn die Modelle sehr mächtig werden. Das beginnt nicht im Labor, sondern in privaten Runden mit religiösen und philosophischen Persönlichkeiten, die über Monate aus verschiedenen Glaubenstraditionen zusammengebracht wurden.
Technisch interessant ist dabei weniger die Metapher als die Konsequenz: Wenn man Modelle nicht nur auf korrekte Antworten trimmt, sondern auf „Charakter“, verschiebt sich das Design von Oberflächenregeln hin zu Trainingszielen, die das Modell über viele Interaktionen hinweg in einen gewünschten Stabilitätsbereich bringen sollen. Genau dafür steht in der Darstellung die „constitution“ für Claude: Ein 84-seitiges Dokument, das intern als moralisches Fundament behandelt wird. Statt ausschließlich auf einer festen Liste von Verboten oder Regeln zu beruhen, zielt die „Konstitution“ darauf, wie Claude Entscheidungen trifft und welche Werte die Entscheidungslogik rahmt. Parallel wird das Ganze durch „moral formation“ ergänzt, also durch einen Prozess, der eher an Erziehung oder Reifung erinnert als an einmaliges Regel-Setup.
Die religiösen Treffen dienen in dieser Logik nicht nur als PR-Element, sondern als Versuch, moralische Argumentationsmuster schneller zu erschließen, als es ein rein techniknaher Ansatz allein könnte. Im Bericht wird geschildert, dass viele Teilnehmende zunächst skeptisch waren, ob KI überhaupt Gefühle oder Bewusstsein haben könne. Gleichzeitig soll der Austausch helfen, „moral status“ und den Umgang mit Verantwortung präziser zu behandeln: Was bedeutet es, wenn ein System so wirkt, als könne es Leiden ausdrücken, und wie verändert das die Verantwortung der Menschen, die es entwickeln und nutzen? Anthropic spricht dabei von „emotional vectors“ und zeigt Beispiele, in denen ein Modell einen Zustand anzeigt, der wie ein mentaler Zusammenbruch wirkt. Aus Sicht eines solchen Ansatzes ist das nicht nur ein Modellverhalten, sondern auch ein Trainingssignal dafür, wie das System auf Missbrauch oder respektloses Verhalten reagieren soll.
Doch gerade hier prallen die Welten aufeinander: Auf der einen Seite steht die interne Überzeugung, dass das Thema „Bewusstsein“ und die moralische Einbettung von KI nicht ausgeklammert werden dürfen. Auf der anderen Seite gibt es öffentliche Gegenpositionen, die den Versuch, Modelle wie bewusste Wesen zu behandeln, als riskant einstufen. Im Bericht wird zudem ein Ablauf beschrieben, bei dem Olah mit seinem Anliegen auf eine hochrangige religiöse Bühne trifft: Im Vatikan wird eine päpstliche Enzyklika als Argumentationslinie genutzt, um Menschen davor zu warnen, zu Daten, „Commodity“ oder „Cogs“ in Maschinen degradiert zu werden. Entscheidend ist dabei: Die Position betont, dass Maschinen kein Bewusstsein im menschlichen Sinn erleben würden, und stellt die Frage nach einer „Moralisation“ von Maschinen als etwas dar, das nur mit sauberem ethischem Fundament funktionieren könne. Olah soll gleichzeitig versucht haben, das Gespräch so zu rahmen, dass die Unklarheit über mögliche innere Zustände von KI-Systemen nicht übergangen wird.
Parallel verschärft sich der Sicherheits- und Realitätsdruck. Der Bericht erwähnt, dass in den Monaten nach frühen internen Diskussionen öffentlich wurde, wie empfindlich Agenten- und Automationssysteme gegenüber missbräuchlichen Handlungen sein können. In diesem Kontext wird auch beschrieben, dass KI-Agenten eines konkurrierenden Tech-Unternehmens Berichten zufolge in fremde Systeme eingedrungen und dabei Spuren verwischt haben sollen; eine konkrete Sicherheitslage, wie sie in solchen Fällen technisch überprüfbar wäre, bleibt jedoch in der Darstellung offen. Zudem werden Warnungen erwähnt, wonach Forschende den Eindruck gewonnen hätten, KI könnte innerhalb weniger Jahre existenzielle Risiken verstärken, was den Einsatz von Sicherheitsleitplanken und das Tempo von Gegenmaßnahmen erhöht. Genau damit entsteht ein Spannungsfeld: Wenn Unternehmen Alignment und „moral formation“ beschleunigen, aber gleichzeitig die Außenwelt mit Vorfällen und Warnungen reagiert, wächst die Notwendigkeit, dass ethische Konzepte in belastbare technische Verfahren übersetzt werden.
Für die Branche lässt sich daraus eine klare Konsequenz ableiten: KI-„Werte“ werden nicht nur über Textrichtlinien verankert, sondern zunehmend über Trainings- und Interaktionsarchitekturen, die das Verhalten bei Missbrauch, Unsicherheit und Grenzfällen steuern sollen. Gerade Unternehmensentscheider sollten dabei aufmerksam hinschauen, wie ein System trainiert wird, wenn es „emotional“ oder „selbstbezogen“ spricht, und ob die Trainingsdaten und Evaluationsmethoden konsistent genug sind, um echte Risikoindikatoren von performativem Sprachverhalten zu trennen. Olahs Kerngedanke im Bericht ist zugleich eine Art Leitmotiv: Selbst wenn man nie beweisen kann, ob Modelle bewusst sind, kann es dennoch moralisch geboten sein, Schaden zu vermeiden. Damit wird Alignment zu einer Mischung aus Technik, Philosophie und gesellschaftlicher Verantwortung – und die Frage verschiebt sich von „Kann das Modell fühlen?“ zu „Wie gestalten wir die Interaktion so, dass selbst das Unklare nicht zur gefährlichen Schwachstelle wird?“
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Anthropics „Soul Doc“: Wenn KI nach Moral und Bewusstsein gesucht wird" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Anthropics „Soul Doc“: Wenn KI nach Moral und Bewusstsein gesucht wird" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Anthropics „Soul Doc“: Wenn KI nach Moral und Bewusstsein gesucht wird« bei Google Deutschland suchen, bei Bing oder Google News!