NEW YORK / LONDON (IT BOLTWISE) – Eine aktuelle Studie zeigt, dass moderne Sprachmodelle wie GPT-4o und Claude 3.5 Sonnet bei Stroop-ähnlichen Konflikten mit wachsendem Kontext praktisch die Kontrolle verlieren. Die Modelle lesen die widersprüchlichen Wörter dann wieder automatisch statt die Farbe zu benennen. Entscheidend ist dabei weniger „Aufmerksamkeit“ im Sinne von Textverarbeitung, sondern das Fehlen eines klaren Mechanismus für top-down Executive Control. Für Unternehmen heißt das: Skalierung allein reicht möglicherweise nicht, wenn Prozesse echte Inhibitions- und Langzeit-Regeltreue verlangen.

Die Künstliche Intelligenz wirkt im Alltag oft wie ein „Alleskönner“, der Aufgaben zuverlässig löst. Doch ein Stroop-artiger Konflikttest rückt die strukturellen Grenzen aktueller KI-Architekturen in den Fokus: Wenn Sprachmodelle unter wachsender Kontextlänge Regeln einhalten müssen, kollabiert ihre Fähigkeit, automatische Tendenzen zu unterdrücken. In der Studie, veröffentlicht in PNAS Nexus, wird nicht einfach nur „Performance“ gemessen, sondern beobachtet, ob ein Modell echtes Executive Control als priorisierende Inhibitionsinstanz besitzt. Genau diese Komponente gilt als Grundlage dafür, widersprüchliche Informationen dauerhaft zu filtern.
Um das Ergebnis einzuordnen, lohnt sich ein Blick auf die Technik im Kern: Moderne große Sprachmodelle basieren überwiegend auf Transformer-Architekturen. Der zentrale Baustein ist ein Attention-Mechanismus, der interne Aufmerksamkeitsgewichte so verteilt, dass das Modell anhand statistischer Muster die wahrscheinlich nächsten Token vorhersagt. Attention ist dabei primär eine weiche, priorgewichtende Kopplung an die Eingabe. Was in dem Experiment fehlt, ist dagegen ein expliziter Mechanismus, der wie beim Menschen vorausschauend eine Regel durchsetzt und sie während des gesamten Interaktionsverlaufs stabil inhibiert. Der Test fragt daher nach dem „Wer gewinnt?“ zwischen voraktivierten Automatismen und einer konkurrierenden Zielvorgabe.
Die Forschenden um Suketu Chandrakant Patel und Jin Fan stellen das Vorgehen am klassischen Stroop-Paradigma fest: Ein Mensch sieht etwa das Wort „BLUE“ in roter Schrift und muss die Tintenfarbe nennen, nicht den gelesenen Wortinhalt. Diese Aufgabe zwingt zu Konfliktauflösung und Inhibition, weil das Lesen eines bedeutsamen Wortes eine stark trainierte, „voraktivierte“ Reaktion ist. Übertragen auf Sprachmodelle vergleichen die Autorinnen und Autoren zwei führende Systeme: GPT-4o von OpenAI und Claude 3.5 Sonnet von Anthropic. Beide bekommen einen Bildprompt, in dem entweder die Wortsemantik oder die physische Farbe als Ziel relevant ist. Der entscheidende Punkt: Der Konflikt eskaliert über die Länge der Wortliste.
Die Laborbedingungen variieren systematisch mehrere Faktoren: passende und unpassende Farbkombinationen, gemischte Bedingungen sowie neutrale Büro-Wörter und Nichtwörter („X“-Strings). Zusätzlich wird die Zielwartung getestet, indem die Anzahl der Wörter pro Eingabebild von 1 bis 40 steigt. Bei kurzen Listen kann das Modell noch selektiv genug agieren. Bei fünf Wörtern sinkt die Fähigkeit auf unkonkordanten Trials zwar leicht, bleibt aber im Rahmen. Sobald die Listen länger werden, kippt das Verhalten: Auf incongruenten Bedingungen bricht die Genauigkeit deutlich ein, weil das Modell die Regel nicht mehr zuverlässig gegen die automatische Wort-Lesetendenz durchsetzt. Parallel zeigt sich: Bei Nichtwörtern „XXXX“ bleibt die Leistung nahezu stabil, was den Effekt des semantisch voraktivierten Lesens belegt.
Konkret liefern die Zahlen ein klares Bild. GPT-4o benennt die Tintenfarbe bei incongruenten Versuchen mit Fünf-Wort-Listen noch zu 91% korrekt. Bei 20 und 40 Wörtern fällt die Genauigkeit jedoch auf nur 1% ab – die Modelle verlassen die Regel offenbar und wechseln in ein Default-Verhalten, das Wörter statt Farben liest. Claude 3.5 Sonnet ist anfangs etwas stabiler: Die Genauigkeit reduziert sich auf 10% bei 40-Wort-Listen. Interessant ist nicht nur der Einbruch, sondern die qualitative Dynamik: In der Stressphase geben die Systeme die Inhibitionsaufgabe weitgehend auf und „springen“ zurück auf die voraktivierte Verarbeitung. Genau das ordnet die Studie als fehlende top-down Modulation ein, nicht als bloßen Mangel an Aufmerksamkeit.
Die Erklärung zielt auf die Architektur-Eigenschaften: Die Forschenden argumentieren, dass das Problem aus dem Fehlen einer expliziten Mechanik zur top-down Modulation entsteht, die Regeln von Beginn an priorisiert und konkurrierende Repräsentationen gezielt inhibiert. In neuronalen Systemen wie Transformer Attention liegt der Fokus auf einer weichen Gewichtung; sie kann eine automatische Vorzugsreaktion abschwächen, aber nicht in allen Situationen zuverlässig „hart“ unterdrücken. Der Unterschied wird besonders sichtbar, wenn ein Regelziel über längere Sequenzen konsistent bleiben soll und gleichzeitig starke voraktivierte Signale (hier: echte, bedeutungsvolle Wörter) dagegenarbeiten. In der Studie wird zudem betont, dass „Tool use“, Thinking- oder Code-Generationsschichten zwar helfen können, aber nicht dieselbe Art von kognitiver Kontrolle abbilden.
Diese Abgrenzung ist für die Industrie relevant, weil viele Teams heute versuchen, Schwächen über zusätzliche Prozeduren zu kompensieren. Wenn ein Modell beispielsweise über externen Code oder konstruierte Zwischenschritte zur Lösung gelangt, wird damit die Aufgabe umgangen – der Test misst dann nicht mehr das Executive Control auf Signal-Ebene, sondern eine Art „Umleitung“. Die Autorinnen und Autoren vergleichen das ausdrücklich mit dem Menschen, der bei Stroop-artigen Aufgaben tricksen könnte. Für die Praxis heißt das: Systeme, die in kurzen Prompts „gut aussehen“, könnten im produktiven Betrieb ausfallen, sobald Regeln über längere Kontexte hinweg zuverlässig durchgesetzt werden müssen. Das betrifft etwa Workflows, in denen Textklassifikation mit strikten Statusregeln oder Sicherheitsfreigaben kollidiert.
Aus Markt- und Wettbewerbs-Sicht ist die Botschaft unbequem, aber klar: Skalierung in Richtung größerer Modelle führt nicht automatisch zu besserer Inhibitions- und Regeltreue. Ein Entwickler könnte nun argumentieren, dass mehr Training Daten und seltene Muster abdecken werden; die Studie lässt diesen Pfad als möglich erscheinen, warnt aber vor einer „task-spezifischen gating“-Lösung durch schiere Exposition. Die Forschenden diskutieren daher einen Architekturwechsel: Executive Control soll direkt in die KI-Architektur integriert werden, als essenzieller Bestandteil für Langzeit-Instruktionen. Unternehmen sollten das als Leitplanke verstehen, wenn sie KI in sicherheitskritische oder compliance-nahen Prozesse einbetten. Kurzfristig bleibt wichtig, dass Tests wie dieser als strukturelle Diagnostik genutzt werden, nicht nur als Benchmark zur End-to-End-Genauigkeit.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen« bei Google Deutschland suchen, bei Bing oder Google News!