GRIECHENLAND / LONDON (IT BOLTWISE) – Eine neue Studie zeigt: Lehrkräfte korrigieren einen zu harten Bewertungsfehler seltener, wenn er von einem KI-System zu stammen scheint. Interessanterweise berichten die Teilnehmenden zugleich, sie hielten KI für weniger fair, kompetent und verantwortbar als Menschen. Der entscheidende Effekt hängt jedoch stark davon ab, ob die Empfehlung zu streng oder zu großzügig ausfällt. Für Schulen bedeutet das: „Human in the loop“ allein reicht offenbar nicht—man muss Überprüfung und Verantwortlichkeit gezielt gestalten.

Wenn Künstliche Intelligenz (KI) in Schulen Einzug hält, wird sie häufig als Entlastung für Lehrkräfte verkauft: standardisierte Noten, weniger Zeitaufwand und eine konsistente Bewertung. Der Haken liegt in der Erwartung, dass menschliche Kontrolle automatische Fehler zuverlässig abfangen soll. Eine in PNAS Nexus veröffentlichte Untersuchung in Griechenland stellt diese Annahme jedoch auf die Probe. Sie zeigt, dass Lehrkräfte im Labor zwar insgesamt skeptisch wirken, bei konkreten Bewertungsentscheidungen aber selektiv weniger korrigieren, sobald die falsche Note als „KI“ markiert ist.
Im Kern wurde ein randomisiertes, vorregistriertes Experiment mit über 1.300 aktiven Lehrkräften durchgeführt. Den Teilnehmenden wurde Schülerarbeit vorgelegt, die zu ihrem Fachgebiet passte—von Mathematik und Naturwissenschaften bis zu den Geisteswissenschaften. Zusätzlich erhielten sie eine Checkliste, welche Antwortbestandteile objektiv richtig oder falsch waren, sowie eine vorgesehene Punktzahl von „5 von 10“, die absichtlich fehlerhaft war. Entscheidend: Dieselbe Ausgangszahl wurde je nach Gruppe entweder als Empfehlung einer KI oder als Empfehlung eines menschlichen Kollegen ausgegeben. Danach vergaben die Lehrkräfte ihre eigene Endnote.
Die Forscher manipulierten dabei die Richtung des Bewertungsfehlers. In einem Szenario war die „5/10“-Vorgabe zu streng: Anhand der Checkliste hätte die korrekte Bewertung bei „8/10“ gelegen. In einem zweiten Szenario war dieselbe Vorgabe zu großzügig—hier passte „5/10“ nicht zu dem, was die Schülerleistung objektiv hergab; die richtige Note lag bei „2/10“. Gemessen wurde der sogenannte „Grading Fairness Gap“: der absolute Abstand zwischen der Endnote der Lehrkraft und der objektiv korrekten Benchmark. Das Ergebnis ist eindeutig: Bei zu harter KI-Bewertung korrigierten Lehrkräfte statistisch weniger häufig als bei der identischen falschen Bewertung durch einen Menschen.
Konkret berichten die Autoren von einem um 22% größeren Fairness-Gap in der Situation „KI ist zu streng“. Lehrkräfte neigten dazu, die härtere automatisierte Bewertung weitgehend stehen zu lassen. Bei den zu großzügigen Noten zeigte sich dagegen kein vergleichbarer Effekt: War die Empfehlung von „KI“ oder „Mensch“ gleichermaßen überhöht, korrigierten die Lehrkräfte die Note offenbar gleich gut. Dieses Muster widerspricht der simplen Erwartung, dass Skepsis gegenüber Algorithmen automatisch zu stärkerer Prüfung führt. Stattdessen scheint die Wahrnehmung zu zählen: Wenn die KI „zu niedrig“ bewertet, interpretieren viele Teilnehmende das als Signal für Kompetenz und Verantwortlichkeit—und sind dadurch weniger bereit, den Fehler aktiv zu beheben.
Die Studie ergänzt die Verhaltensdaten um psychologische Bewertungen. Dazu sollten die Teilnehmenden den ursprünglichen Beurteilenden nach fünf Dimensionen einschätzen: wahrgenommene Fähigkeit, Verständnis des Fachgebiets, Fairness, gute Absicht und Verantwortung. Aus Sicht von Lehrkräften wirkt eine „harte“ KI offenbar fähig und verantwortlich genug, um die Entscheidung zu legitimieren. In einem interviewartigen Kontext hebt Rigissa Megalokonomou hervor, der verbreitete Trost laute „keine Sorge, ein Mensch prüft nach“—die Studie prüfe genau, ob das im Alltag tatsächlich trägt. In der lenienten Situation hingegen wirkte die KI in allen Dimensionen schwächer, sodass die Teilnehmenden ihre Empfehlung eher zurückwiesen und den Notenwert korrigierten.
Für den Markt bedeutet das: „Human in the loop“ ist kein Schalter, der automatisch Qualität garantiert. Anbieter von KI-gestützten Assistenzsystemen in Bildung, HR oder Qualitätsmanagement setzen häufig auf Review-Workflows und Audit-Logik. Gleichzeitig ist aus der Praxis bekannt, dass Fehlertypen und Darstellungsformate Vertrauen aktiv steuern. Wie Branchenexperten aus dem Enterprise-Umfeld betonen, treffen KI-Systeme selten exakt das gleiche Risiko wie ein Mensch, sondern erzeugen oft spezifische Fehlerbilder—und Nutzer reagieren dann unterschiedlich. Besonders relevant ist zudem die Frage, wer die Verantwortung tragen soll: Wenn Lehrkräfte den KI-Vorschlag bei strengen Abweichungen zu stark „glauben“, müssen Schulen Überprüfungen so designen, dass sie genau diese Situationen systematisch adressieren.
Historisch betrachtet ist das Thema nicht neu: Bereits in Studien zu Algorithm aversion und Automation bias wurde gezeigt, dass Menschen entweder Computer pauschal misstrauen oder—unter bestimmten Bedingungen—stärker vertrauen, als sie sollten. Neu ist hier die konkrete Evidenz, dass die Richtung der Abweichung (zu streng vs. zu großzügig) die Bereitschaft zur Korrektur stark moduliert. Das lässt sich auch technisch einordnen: Ein Bewertungssystem liefert nicht nur eine Zahl, sondern impliziert eine Art „Rationalität“ durch Kontext, Tonalität oder Begründungslogik. Wenn die KI-Entscheidung als besonders „sachlich“ wirkt, kann sie als Kompetenzsignal gelesen werden—selbst wenn sie objektiv falsch ist. Im Vergleich dazu sind menschliche Kollegen stärker in sozialen Normen verankert und werden eher „nachgeprüft“, sobald etwas unplausibel erscheint.
Regulatorisch und datenschutzrechtlich liegt der nächste Stolperstein. In der EU sind Schulen häufig zugleich Verantwortliche und Verarbeiter von Bildungsdaten—damit greifen DSGVO-Grundsätze wie Datenminimierung, Zweckbindung und Transparenz. Zusätzlich adressiert der EU AI Act gerade Systeme, die in Bildungskontexten eingesetzt werden, mit risikoorientierten Anforderungen, darunter Dokumentation, Governance und wirksame menschliche Aufsicht. Die Studie liefert dafür eine konkrete Begründung: Aufsicht muss operationalisiert werden, etwa durch strukturierte Kontrollpunkte, klare Eskalationspfade und nachvollziehbare Verantwortlichkeiten, statt nur durch die Möglichkeit, „zu prüfen“.
Für die Zukunft ergibt sich eine klare Agenda. Erstens sollten Schulträger und Tool-Anbieter nicht nur die Fehlerquote der KI optimieren, sondern auch die Interaktion: Wann genau sehen Lehrkräfte einen KI-Vorschlag? Wird eine Begründung geliefert, und verändert das die Prüfungstiefe? Zweitens ist es sinnvoll, Trainingsprogramme zu entwickeln, die explizit darauf abzielen, bei „zu harten“ Empfehlungen besonders kritisch zu sein. Megalokonomou arbeitet laut Bericht an einem Lehrer-Training, das nicht nur die Nutzung, sondern das Erkennen des eigenen Urteilsabrutschens adressieren will. Drittens sollte zukünftige Forschung im realen Schulalltag testen, ob ähnliche Muster auch bei formativen Assessments, wiederholten Aufgaben oder anderen Entscheidungsdomänen auftreten.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Warum KI-bewertende Lehrkräfte Fehler seltener korrigieren« bei Google Deutschland suchen, bei Bing oder Google News!