GRIECHENLAND / LONDON (IT BOLTWISE) – Eine neue Studie zeigt: Lehrkräfte korrigieren einen zu harten Bewertungsfehler seltener, wenn er von einem KI-System zu stammen scheint. Interessanterweise berichten die Teilnehmenden zugleich, sie hielten KI für weniger fair, kompetent und verantwortbar als Menschen. Der entscheidende Effekt hängt jedoch stark davon ab, ob die Empfehlung zu streng oder zu großzügig ausfällt. Für Schulen bedeutet das: „Human in the loop“ allein reicht offenbar nicht—man muss Überprüfung und Verantwortlichkeit gezielt gestalten.

Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren
Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Wenn Künstliche Intelligenz (KI) in Schulen Einzug hält, wird sie häufig als Entlastung für Lehrkräfte verkauft: standardisierte Noten, weniger Zeitaufwand und eine konsistente Bewertung. Der Haken liegt in der Erwartung, dass menschliche Kontrolle automatische Fehler zuverlässig abfangen soll. Eine in PNAS Nexus veröffentlichte Untersuchung in Griechenland stellt diese Annahme jedoch auf die Probe. Sie zeigt, dass Lehrkräfte im Labor zwar insgesamt skeptisch wirken, bei konkreten Bewertungsentscheidungen aber selektiv weniger korrigieren, sobald die falsche Note als „KI“ markiert ist.

Im Kern wurde ein randomisiertes, vorregistriertes Experiment mit über 1.300 aktiven Lehrkräften durchgeführt. Den Teilnehmenden wurde Schülerarbeit vorgelegt, die zu ihrem Fachgebiet passte—von Mathematik und Naturwissenschaften bis zu den Geisteswissenschaften. Zusätzlich erhielten sie eine Checkliste, welche Antwortbestandteile objektiv richtig oder falsch waren, sowie eine vorgesehene Punktzahl von „5 von 10“, die absichtlich fehlerhaft war. Entscheidend: Dieselbe Ausgangszahl wurde je nach Gruppe entweder als Empfehlung einer KI oder als Empfehlung eines menschlichen Kollegen ausgegeben. Danach vergaben die Lehrkräfte ihre eigene Endnote.

Die Forscher manipulierten dabei die Richtung des Bewertungsfehlers. In einem Szenario war die „5/10“-Vorgabe zu streng: Anhand der Checkliste hätte die korrekte Bewertung bei „8/10“ gelegen. In einem zweiten Szenario war dieselbe Vorgabe zu großzügig—hier passte „5/10“ nicht zu dem, was die Schülerleistung objektiv hergab; die richtige Note lag bei „2/10“. Gemessen wurde der sogenannte „Grading Fairness Gap“: der absolute Abstand zwischen der Endnote der Lehrkraft und der objektiv korrekten Benchmark. Das Ergebnis ist eindeutig: Bei zu harter KI-Bewertung korrigierten Lehrkräfte statistisch weniger häufig als bei der identischen falschen Bewertung durch einen Menschen.

Konkret berichten die Autoren von einem um 22% größeren Fairness-Gap in der Situation „KI ist zu streng“. Lehrkräfte neigten dazu, die härtere automatisierte Bewertung weitgehend stehen zu lassen. Bei den zu großzügigen Noten zeigte sich dagegen kein vergleichbarer Effekt: War die Empfehlung von „KI“ oder „Mensch“ gleichermaßen überhöht, korrigierten die Lehrkräfte die Note offenbar gleich gut. Dieses Muster widerspricht der simplen Erwartung, dass Skepsis gegenüber Algorithmen automatisch zu stärkerer Prüfung führt. Stattdessen scheint die Wahrnehmung zu zählen: Wenn die KI „zu niedrig“ bewertet, interpretieren viele Teilnehmende das als Signal für Kompetenz und Verantwortlichkeit—und sind dadurch weniger bereit, den Fehler aktiv zu beheben.

Die Studie ergänzt die Verhaltensdaten um psychologische Bewertungen. Dazu sollten die Teilnehmenden den ursprünglichen Beurteilenden nach fünf Dimensionen einschätzen: wahrgenommene Fähigkeit, Verständnis des Fachgebiets, Fairness, gute Absicht und Verantwortung. Aus Sicht von Lehrkräften wirkt eine „harte“ KI offenbar fähig und verantwortlich genug, um die Entscheidung zu legitimieren. In einem interviewartigen Kontext hebt Rigissa Megalokonomou hervor, der verbreitete Trost laute „keine Sorge, ein Mensch prüft nach“—die Studie prüfe genau, ob das im Alltag tatsächlich trägt. In der lenienten Situation hingegen wirkte die KI in allen Dimensionen schwächer, sodass die Teilnehmenden ihre Empfehlung eher zurückwiesen und den Notenwert korrigierten.

Für den Markt bedeutet das: „Human in the loop“ ist kein Schalter, der automatisch Qualität garantiert. Anbieter von KI-gestützten Assistenzsystemen in Bildung, HR oder Qualitätsmanagement setzen häufig auf Review-Workflows und Audit-Logik. Gleichzeitig ist aus der Praxis bekannt, dass Fehlertypen und Darstellungsformate Vertrauen aktiv steuern. Wie Branchenexperten aus dem Enterprise-Umfeld betonen, treffen KI-Systeme selten exakt das gleiche Risiko wie ein Mensch, sondern erzeugen oft spezifische Fehlerbilder—und Nutzer reagieren dann unterschiedlich. Besonders relevant ist zudem die Frage, wer die Verantwortung tragen soll: Wenn Lehrkräfte den KI-Vorschlag bei strengen Abweichungen zu stark „glauben“, müssen Schulen Überprüfungen so designen, dass sie genau diese Situationen systematisch adressieren.

Historisch betrachtet ist das Thema nicht neu: Bereits in Studien zu Algorithm aversion und Automation bias wurde gezeigt, dass Menschen entweder Computer pauschal misstrauen oder—unter bestimmten Bedingungen—stärker vertrauen, als sie sollten. Neu ist hier die konkrete Evidenz, dass die Richtung der Abweichung (zu streng vs. zu großzügig) die Bereitschaft zur Korrektur stark moduliert. Das lässt sich auch technisch einordnen: Ein Bewertungssystem liefert nicht nur eine Zahl, sondern impliziert eine Art „Rationalität“ durch Kontext, Tonalität oder Begründungslogik. Wenn die KI-Entscheidung als besonders „sachlich“ wirkt, kann sie als Kompetenzsignal gelesen werden—selbst wenn sie objektiv falsch ist. Im Vergleich dazu sind menschliche Kollegen stärker in sozialen Normen verankert und werden eher „nachgeprüft“, sobald etwas unplausibel erscheint.

Regulatorisch und datenschutzrechtlich liegt der nächste Stolperstein. In der EU sind Schulen häufig zugleich Verantwortliche und Verarbeiter von Bildungsdaten—damit greifen DSGVO-Grundsätze wie Datenminimierung, Zweckbindung und Transparenz. Zusätzlich adressiert der EU AI Act gerade Systeme, die in Bildungskontexten eingesetzt werden, mit risikoorientierten Anforderungen, darunter Dokumentation, Governance und wirksame menschliche Aufsicht. Die Studie liefert dafür eine konkrete Begründung: Aufsicht muss operationalisiert werden, etwa durch strukturierte Kontrollpunkte, klare Eskalationspfade und nachvollziehbare Verantwortlichkeiten, statt nur durch die Möglichkeit, „zu prüfen“.

Für die Zukunft ergibt sich eine klare Agenda. Erstens sollten Schulträger und Tool-Anbieter nicht nur die Fehlerquote der KI optimieren, sondern auch die Interaktion: Wann genau sehen Lehrkräfte einen KI-Vorschlag? Wird eine Begründung geliefert, und verändert das die Prüfungstiefe? Zweitens ist es sinnvoll, Trainingsprogramme zu entwickeln, die explizit darauf abzielen, bei „zu harten“ Empfehlungen besonders kritisch zu sein. Megalokonomou arbeitet laut Bericht an einem Lehrer-Training, das nicht nur die Nutzung, sondern das Erkennen des eigenen Urteilsabrutschens adressieren will. Drittens sollte zukünftige Forschung im realen Schulalltag testen, ob ähnliche Muster auch bei formativen Assessments, wiederholten Aufgaben oder anderen Entscheidungsdomänen auftreten.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik intelligenter Schreibtisch Roboter | für Kinder & Erwachsene, mit Emotionen Interaktionen und Animationen, Spielzeug Unterhaltung Begleiter Haustier Persönlicher Assistent, für mehr Spaß
1.501 Bewertungen
Eilik intelligenter Schreibtisch Roboter | für Kinder & Erwachsene, mit Emotionen Interaktionen und Animationen, Spielzeug Unterhaltung Begleiter Haustier Persönlicher Assistent, für mehr Spaß
  • NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren".
Stichwörter AI AI Act Algorithmus Artificial Intelligence Automation Bewertung Bias Bildung Entscheidung Experiment Fairness GDPR Gehirn Geist Greece KI Künstliche Intelligenz Lehrer Ml Neurologie Neuroscience Neurowissenschaften Review
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren« bei Google Deutschland suchen, bei Bing oder Google News!


    2.058 Leser gerade online auf IT BOLTWISE
    KI-Jobs