LONDON / LONDON (IT BOLTWISE) – Forscher erklären, warum Dopaminwerte beim Annähern an einen vorhersehbaren Lohn nicht abflachen, sondern stetig ansteigen. In dem Modell arbeiten zwei Lernprozesse zusammen: ein langsames, „cached“ System und ein schnelles, weltmodellbasiertes Schätzen von Zustandswerten. Dadurch wächst in der Nähe des Ziels die Lücke zwischen Update-Ziel und aktueller Vorhersage. Das liefert eine rechnerische Lösung für ein langjähriges Paradox aus Experimenten zur räumlichen Navigation.

Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an
Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Es ist ein Detail, das in vielen Diskussionen über Belohnungslernen immer wieder für Stirnrunzeln sorgt: Dopamin gilt klassisch als Signal für einen Reward Prediction Error – also für die Abweichung zwischen erwarteter und eingetroffener Belohnung. In einem „sauberen“ Modell müsste dieser Fehler gegen Null gehen, sobald ein Ziel vollständig vorhersagbar ist. Genau das widersprechen Beobachtungen aus räumlichen Navigationsaufgaben: Tiere zeigen nicht nur Vorhersage-Feinkorrekturen, sondern Dopamin-Ramps, also einen kontinuierlichen Anstieg, wenn sie sich einem bekannten Reward nähernd.

Die neue Arbeit setzt hier an, indem sie die Mechanik der Erwartungsaktualisierung neu zusammensetzt – nicht über ein einzelnes neuronales Prinzip, sondern über ein Dual-Process-Design. Im Zentrum steht ein computationales Modell, das zwei Lernsysteme gleichzeitig laufen lässt. Das erste System lernt langsam und nutzt dabei gespeicherte, „gecached“ Werte aus dem Striatum bzw. den basalen Ganglien. Das zweite System arbeitet schnell und flexibel, weil es Werte über ein internes Modell der Umgebung („world model“) inferiert – die Autoren verorten solche schnellen Inferenzmechanismen plausibel im Umfeld der Frontallappen. Entscheidend ist dabei die Asymmetrie: Nur die schnellen, inferierten Werte beeinflussen das Ziel der Aktualisierung, während die aktuelle Vorhersage ausschließlich auf den langsamen, gecachten Werten basiert.

Damit entsteht ein konkreter Mechanismus, der das Paradox mechanisch auflöst. Wenn das Gehirn einen Reward Prediction Error berechnet, vergleicht es eine laufende Vorhersage mit einem neuen Update-Ziel. In dem Modell hängt das Update-Ziel vom schnellen System ab, das bereits weiß, dass die Belohnung nahe ist. Die Vorhersage dagegen hinkt hinterher, weil das langsame System die passenden Zustandswerte noch nachlernen muss. Das führt zu einer wachsenden Lücke zwischen Update-Ziel und Vorhersage, gerade dann, wenn sich das Tier dem Ziel nähert. Dieser wachsende Spalt entspricht in der Modellrechnung dem Signal, das als Dopamin-Ramp sichtbar wird – selbst wenn die Belohnung insgesamt schon als „vorhersehbar“ gilt. Über diesen Ansatz wird aus einem scheinbaren Widerspruch ein erwartbares Ergebnis: Dopamin muss nicht allein dann steigen, wenn etwas „unerwartet gut“ passiert, sondern auch dann, wenn die Systeme zeitlich unterschiedlich schnell aktualisieren.

Um die Plausibilität der Architektur zu prüfen, testen Priestley und Akam die Asymmetrie systematisch in Simulationen. Zuerst läuft der Vergleich in einem simulierten linearen Track, in dem ein Agent sich entlang einer Strecke bewegt. Gegenüber einem Standardmodell und einer Variante, in der inferierte Werte sowohl die Vorhersage als auch das Update-Ziel beeinflussen, zeigt die asymmetrische Dual-Process-Variante einen Vorteil: Sie lernt den wahren Wert der Umgebung schneller und erzeugt Dopamin-Ramps, die das Standardmodell nicht abbildet. Der Schritt in Richtung „Lebensnähe“ folgt anschließend mit einem Szenario aus vielen Durchläufen: Ein Agent navigiert zwischen Bereichen mit hoher und niedriger Belohnung über tausende Trials. In den Biologie-Experimenten, die dabei als Referenz dienen, nimmt die Dopamin-Ramp nach intensiver Trainingszeit allmählich ab. Die Simulation reproduziert genau dieses Verhalten, weil sich die gecachten Werte des langsamen Systems mit der Zeit an die inferierten Werte angleichen. Dadurch schließt sich die Lücke – die Ramp flacht ab.

Besonders interessant ist die Erweiterung auf Lernverhalten in neuartigen Umgebungen und auf globale Aktualisierungen. In realen Versuchsaufbauten sieht man häufig: In einem komplett neuen Maze treten Dopamin-Ramps nicht beim ersten Erkunden auf, sondern erscheinen schnell nach wenigen erfolgreichen Durchläufen. Auch die simulierten Agenten zeigen diesen schnellen „Onset“, weil das schnelle Inferenzsystem bereits nach wenigen erfolgreichen Erfahrungen das world model so ausrichtet, dass der Prediction Error wieder systematisch wächst. Zudem wird ein Grid-Setting mit mehreren Pfaden zu einem gemeinsamen Ziel genutzt. Dort zeigt sich in biologischen Daten, dass eine sofortige Änderung der Belohnung an einem Ort den Dopaminverlauf auf dem nächsten Versuch beeinflusst, selbst wenn das Tier einen anderen Weg nimmt. Die Modelllogik erklärt das über die globale Wirkung des mentalen Karten-Ansatzes: Wenn die flexible Inferenz neue Belohnungsinformationen in das interne Modell einträgt, werden alle Pfade, die zu demselben Ziel führen, in der nächsten Aktualisierung mitgedacht.

Auch „Momentanereignisse“ landen im Test, allerdings in virtueller Form. In VR-ähnlichen Simulationen wird der Agent plötzlich näher an ein Ziel teleportiert oder muss bei veränderter Geschwindigkeit anders navigieren. Diese Eingriffe erzeugen im Modell unerwartete Signalspitzen: Die simulierte Dopamin-Amplitude hängt davon ab, wie stark der Teleport die verbleibende Distanz zum Reward reduziert. Zusätzlich verändert eine geänderte Geschwindigkeit die Steilheit des Ramp-Verlaufs. Damit passt das Modell zu Aufnahmen aus biologischen Experimenten, die nahelegen, dass Dopamin nicht nur langsame Lernfortschritte kodiert, sondern auch kurzfristige Änderungen im erwarteten Wert. Schließlich wird ein weiteres Muster geprüft: räumliche Unsicherheit. In einem VR-Szenario wird die Umgebung schrittweise abgedunkelt. In den realen Daten führt das zu einer Hump-Form statt einer linearen Rampe. Der simulierte Agent produziert identische Formen, weil die Visual-Unsicherheit die Konfidenz der Position im world model verschiebt und dadurch die inferierten Werte so verzerren kann, dass der Prediction Error bereits vor dem Ziel abfällt.

So überzeugend der Ansatz als einheitliche Erklärung wirkt, die Arbeit macht zugleich klar, wo die Modellwelt vereinfacht ist. Das schnelle System wird in der Simulation auf das Berechnen des kürzesten Pfads zu einem finalen Ziel zugespitzt; echte Tiere lernen aber weiter und verwenden nach dem Erreichen eines Rewards häufig generalisierte Strategien statt strikt „episodischer“ Pfadoptimierung. Außerdem nutzt das Modell feste Parameter, um zwischen schneller und langsamer Aktualisierung zu vermitteln. In einem biologischen Gehirn dürfte dieses Gewicht dagegen dynamisch schwanken – etwa in Abhängigkeit von Unsicherheit, Vertrauen in die Karte oder vergangener Erfahrung. Auch die Annahme, dass Distanzen zwischen Orten im Voraus bekannt seien, legt nahe, dass weitere Navigationsschaltkreise existieren müssen, die zumindest teilweise bereits aktiv sind.

Für die nächsten Schritte ist die zentrale Frage damit nicht mehr, ob das Prinzip funktioniert, sondern wie es biologisch verdrahtet ist. Die Autoren stellen dafür in Aussicht, dass man testen kann, ob das zeitliche Zusammenspiel aus frontaler Inferenz und dopaminergen Update-Zentren tatsächlich für die Rampen verantwortlich ist. Ein konsequenter experimenteller Weg wäre, spezifische Schaltkreise temporär zu deaktivieren und zu beobachten, ob die Dopamin-Ramps verschwinden oder sich qualitativ verändern. Gelänge das, würde sich die Perspektive auf den Schnittpunkt zwischen bewusster Planung und automatisierter Gewohnheitsbildung weiter verschieben: Nicht nur die „Art“ des Lernens, sondern auch dessen Architektur und zeitliche Arbeitsteilung würden erklären, warum das Dopamin-Signal in einer scheinbar vorhersehbaren Welt trotzdem so dynamisch ansteigt. Veröffentlicht wurde die Studie unter dem Titel „Dopamine ramps as a normative consequence of dual-process control“ in eLife.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an".
Stichwörter AI Artificial Intelligence Basale Ganglien Belohnung Computational Model Dopamin Frontal Cortex Gehirn Geist KI Künstliche Intelligenz Lernen Neurologie Neuroscience Neurowissenschaften Prediction Error Räumliche Navigation Reinforcement Learning Striatum Vorhersage Weltmodell
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Dopamin-Ramps durch Dual-Process-KI erklärt: Zwei Lernsysteme passen Erwartungen an« bei Google Deutschland suchen, bei Bing oder Google News!


    1.333 Leser gerade online auf IT BOLTWISE
    KI-Jobs