NEW YORK / LONDON (IT BOLTWISE) – Eine aktuelle Studie zeigt, dass moderne Sprachmodelle wie GPT-4o und Claude 3.5 Sonnet bei Stroop-ähnlichen Konflikten mit wachsendem Kontext praktisch die Kontrolle verlieren. Die Modelle lesen die widersprüchlichen Wörter dann wieder automatisch statt die Farbe zu benennen. Entscheidend ist dabei weniger „Aufmerksamkeit“ im Sinne von Textverarbeitung, sondern das Fehlen eines klaren Mechanismus für top-down Executive Control. Für Unternehmen heißt das: Skalierung allein reicht möglicherweise nicht, wenn Prozesse echte Inhibitions- und Langzeit-Regeltreue verlangen.

Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen
Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Die Künstliche Intelligenz wirkt im Alltag oft wie ein „Alleskönner“, der Aufgaben zuverlässig löst. Doch ein Stroop-artiger Konflikttest rückt die strukturellen Grenzen aktueller KI-Architekturen in den Fokus: Wenn Sprachmodelle unter wachsender Kontextlänge Regeln einhalten müssen, kollabiert ihre Fähigkeit, automatische Tendenzen zu unterdrücken. In der Studie, veröffentlicht in PNAS Nexus, wird nicht einfach nur „Performance“ gemessen, sondern beobachtet, ob ein Modell echtes Executive Control als priorisierende Inhibitionsinstanz besitzt. Genau diese Komponente gilt als Grundlage dafür, widersprüchliche Informationen dauerhaft zu filtern.

Um das Ergebnis einzuordnen, lohnt sich ein Blick auf die Technik im Kern: Moderne große Sprachmodelle basieren überwiegend auf Transformer-Architekturen. Der zentrale Baustein ist ein Attention-Mechanismus, der interne Aufmerksamkeitsgewichte so verteilt, dass das Modell anhand statistischer Muster die wahrscheinlich nächsten Token vorhersagt. Attention ist dabei primär eine weiche, priorgewichtende Kopplung an die Eingabe. Was in dem Experiment fehlt, ist dagegen ein expliziter Mechanismus, der wie beim Menschen vorausschauend eine Regel durchsetzt und sie während des gesamten Interaktionsverlaufs stabil inhibiert. Der Test fragt daher nach dem „Wer gewinnt?“ zwischen voraktivierten Automatismen und einer konkurrierenden Zielvorgabe.

Die Forschenden um Suketu Chandrakant Patel und Jin Fan stellen das Vorgehen am klassischen Stroop-Paradigma fest: Ein Mensch sieht etwa das Wort „BLUE“ in roter Schrift und muss die Tintenfarbe nennen, nicht den gelesenen Wortinhalt. Diese Aufgabe zwingt zu Konfliktauflösung und Inhibition, weil das Lesen eines bedeutsamen Wortes eine stark trainierte, „voraktivierte“ Reaktion ist. Übertragen auf Sprachmodelle vergleichen die Autorinnen und Autoren zwei führende Systeme: GPT-4o von OpenAI und Claude 3.5 Sonnet von Anthropic. Beide bekommen einen Bildprompt, in dem entweder die Wortsemantik oder die physische Farbe als Ziel relevant ist. Der entscheidende Punkt: Der Konflikt eskaliert über die Länge der Wortliste.

Die Laborbedingungen variieren systematisch mehrere Faktoren: passende und unpassende Farbkombinationen, gemischte Bedingungen sowie neutrale Büro-Wörter und Nichtwörter („X“-Strings). Zusätzlich wird die Zielwartung getestet, indem die Anzahl der Wörter pro Eingabebild von 1 bis 40 steigt. Bei kurzen Listen kann das Modell noch selektiv genug agieren. Bei fünf Wörtern sinkt die Fähigkeit auf unkonkordanten Trials zwar leicht, bleibt aber im Rahmen. Sobald die Listen länger werden, kippt das Verhalten: Auf incongruenten Bedingungen bricht die Genauigkeit deutlich ein, weil das Modell die Regel nicht mehr zuverlässig gegen die automatische Wort-Lesetendenz durchsetzt. Parallel zeigt sich: Bei Nichtwörtern „XXXX“ bleibt die Leistung nahezu stabil, was den Effekt des semantisch voraktivierten Lesens belegt.

Konkret liefern die Zahlen ein klares Bild. GPT-4o benennt die Tintenfarbe bei incongruenten Versuchen mit Fünf-Wort-Listen noch zu 91% korrekt. Bei 20 und 40 Wörtern fällt die Genauigkeit jedoch auf nur 1% ab – die Modelle verlassen die Regel offenbar und wechseln in ein Default-Verhalten, das Wörter statt Farben liest. Claude 3.5 Sonnet ist anfangs etwas stabiler: Die Genauigkeit reduziert sich auf 10% bei 40-Wort-Listen. Interessant ist nicht nur der Einbruch, sondern die qualitative Dynamik: In der Stressphase geben die Systeme die Inhibitionsaufgabe weitgehend auf und „springen“ zurück auf die voraktivierte Verarbeitung. Genau das ordnet die Studie als fehlende top-down Modulation ein, nicht als bloßen Mangel an Aufmerksamkeit.

Die Erklärung zielt auf die Architektur-Eigenschaften: Die Forschenden argumentieren, dass das Problem aus dem Fehlen einer expliziten Mechanik zur top-down Modulation entsteht, die Regeln von Beginn an priorisiert und konkurrierende Repräsentationen gezielt inhibiert. In neuronalen Systemen wie Transformer Attention liegt der Fokus auf einer weichen Gewichtung; sie kann eine automatische Vorzugsreaktion abschwächen, aber nicht in allen Situationen zuverlässig „hart“ unterdrücken. Der Unterschied wird besonders sichtbar, wenn ein Regelziel über längere Sequenzen konsistent bleiben soll und gleichzeitig starke voraktivierte Signale (hier: echte, bedeutungsvolle Wörter) dagegenarbeiten. In der Studie wird zudem betont, dass „Tool use“, Thinking- oder Code-Generationsschichten zwar helfen können, aber nicht dieselbe Art von kognitiver Kontrolle abbilden.

Diese Abgrenzung ist für die Industrie relevant, weil viele Teams heute versuchen, Schwächen über zusätzliche Prozeduren zu kompensieren. Wenn ein Modell beispielsweise über externen Code oder konstruierte Zwischenschritte zur Lösung gelangt, wird damit die Aufgabe umgangen – der Test misst dann nicht mehr das Executive Control auf Signal-Ebene, sondern eine Art „Umleitung“. Die Autorinnen und Autoren vergleichen das ausdrücklich mit dem Menschen, der bei Stroop-artigen Aufgaben tricksen könnte. Für die Praxis heißt das: Systeme, die in kurzen Prompts „gut aussehen“, könnten im produktiven Betrieb ausfallen, sobald Regeln über längere Kontexte hinweg zuverlässig durchgesetzt werden müssen. Das betrifft etwa Workflows, in denen Textklassifikation mit strikten Statusregeln oder Sicherheitsfreigaben kollidiert.

Aus Markt- und Wettbewerbs-Sicht ist die Botschaft unbequem, aber klar: Skalierung in Richtung größerer Modelle führt nicht automatisch zu besserer Inhibitions- und Regeltreue. Ein Entwickler könnte nun argumentieren, dass mehr Training Daten und seltene Muster abdecken werden; die Studie lässt diesen Pfad als möglich erscheinen, warnt aber vor einer „task-spezifischen gating“-Lösung durch schiere Exposition. Die Forschenden diskutieren daher einen Architekturwechsel: Executive Control soll direkt in die KI-Architektur integriert werden, als essenzieller Bestandteil für Langzeit-Instruktionen. Unternehmen sollten das als Leitplanke verstehen, wenn sie KI in sicherheitskritische oder compliance-nahen Prozesse einbetten. Kurzfristig bleibt wichtig, dass Tests wie dieser als strukturelle Diagnostik genutzt werden, nicht nur als Benchmark zur End-to-End-Genauigkeit.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen".
Stichwörter AI Artificial Intelligence Attention Claude Executive Gehirn Geist GPT-4o Inhibition KI Kontrolle Künstliche Intelligenz Maschine Lernen Modell Neurologie Neuroscience Neurowissenschaften Sprachmodell Stroop Transformer
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Stroop-Test: Warum GPT-4o und Claude bei langen Kontexten fast komplett ausfallen« bei Google Deutschland suchen, bei Bing oder Google News!


    951 Leser gerade online auf IT BOLTWISE
    KI-Jobs