LONDON (IT BOLTWISE) – Experimente mit GPT-4o zeigen, dass moderne KI-Modelle Kompetenz und Vertrauenswürdigkeit aus Gesichtszügen vorhersagen. In Tests wählten sie bei Kompetenzaufgaben das „erwartete“ Gesicht bis zu 98 % der Fälle, bei Trustworthiness 72,67 %. Besonders kritisch: Die Modelle übertrugen solche Muster auf Hochrisiko-Entscheidungen wie Einstellung und sogar auf extreme Vorwürfe in Simulationen. Entscheidend ist dabei, dass die Bildvoreingenommenheit nicht „verschwindet“, nur weil die Modelle mit Sprache trainiert und anschließend ausgerichtet wurden.

KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“
KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“ (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Die Vorstellung klingt plausibel: Ein KI-Modell, das auf Texte und Bilder trainiert wurde, soll Regeln lernen, die unabhängig von menschlichen Vorurteilen funktionieren. Die neuen Ergebnisse widersprechen diesem Komfortgefühl allerdings an einer Stelle, die besonders schwer zu ignorieren ist. In Versuchen mit großen Sprachmodellen zeigte sich, dass sie Gesichter wie Hinweise auf Charaktereigenschaften behandeln – genauer: Sie nutzen visuelle Merkmale, die Menschen instinktiv mit Vertrauenswürdigkeit oder Kompetenz verbinden, obwohl diese Merkmale keinen verlässlichen Zugang zu echten Persönlichkeits- oder Kriminalitätsrisiken liefern. Die Studie wurde in PNAS Nexus veröffentlicht und liefert damit nicht nur einen weiteren Befund zu kognitiven Verzerrungen, sondern auch eine technische Erklärung dafür, warum solche Verzerrungen in der Modellpraxis auftreten können.

Ausgangspunkt ist die bekannte menschliche Tendenz zur sogenannten Face-to-Character-Inferenz: Menschen beurteilen Verlässlichkeit oder Fähigkeiten anhand von Gesichtsform, Textur und fein abgestuften Proportionen, obwohl diese Merkmale als direkte Information über Charaktereigenschaften nicht geeignet sind. Dass das kein reines Erwachsenenphänomen ist, zeigte bereits eine Arbeit aus dem Jahr 2014, in der Kinder und Erwachsene konsistent Charakterurteile aus Gesichtszügen ableiteten (vgl. die Studie). Lehr und seine Mitautoren knüpften daran an, indem sie prüften, ob große Sprachmodelle – trotz moderner Alignment-Trainings – diese spezielle Verzerrung ebenfalls übernehmen. Die Begründung der Forschenden ist dabei technisch: Viele aktuelle Modelle sind multimodal, können also sowohl Text als auch Bilder analysieren. Wenn das Training aus großen Mengen menschlicher Daten besteht, können in diesen Daten auch Muster enthalten sein, die menschliche Bildheuristiken nachzeichnen.

Im Zentrum der Untersuchung stand Steven A. Lehr gemeinsam mit Mahzarin R. Banaji und Yash Lothe. Banaji, die an der Harvard University im Bereich Sozialethik tätig ist (und zudem externe Funktionen am Santa Fe Institute hat), beschrieb die Bedeutung von Gesichtern als soziale Stimuli und stellte heraus, dass der menschliche Wahrnehmungsapparat dafür einen spezialisierten Verarbeitungsweg nutzt. Bei den KI-Modellen ging es dann darum, ob sie ähnliche „Gesichtsexpertisen“ entwickeln, obwohl sie nicht dafür entworfen wurden. Lehr formulierte die Erwartung, dass LLMs als Spiegel menschlicher Eigenschaften und Muster auftauchen können – nicht im Sinne von absichtlicher Voreingenommenheit, sondern als Folge davon, dass Modelle statistisch Zusammenhänge reproduzieren, die im Trainingsmaterial sichtbar sind. Zusätzlich prüften die Forschenden, ob die Alignment-Phase, die schädliche oder diskriminierende Aussagen in öffentlichen Aufgaben verhindern soll, die Modelle in einer weniger öffentlichen Domäne – nämlich bei face-basierter Urteilsbildung – tatsächlich zuverlässig immunisiert.

Die Tests liefen in Summe über 13 Experimente mit nahezu 8.000 Einzelversuchen und gingen konkret so vor, dass das Modell zwischen zwei Gesichtern wählen musste. In den ersten Durchläufen bekamen sie GPT-4o jeweils Paare computergenerierter Gesichter, deren physische Merkmale gezielt in Richtung „Kompetenz“ oder „Vertrauenswürdigkeit“ verändert wurden. In 600 Kompetenz-Entscheidungen wählte das Modell das „erwartete“ Gesicht 87,83 % der Zeit; bei weiteren 600 Entscheidungen zur Trustworthiness lag die Trefferquote bei 72,67 %. Wichtig ist hier nicht nur die Existenz der Tendenz, sondern auch die Stärke: Als die Paare stärker voneinander entfernt waren – gemessen über standardisierte Abstände in den kompetenzbezogenen Merkmalen – stieg die Auswahlrate bei GPT-4o auf 98 %; bei nur zwei Standardabweichungen, also visuell ähnlicheren Paaren, fiel die Rate auf etwa 70 %, blieb aber klar im erwarteten Muster verankert.

Besonders aufschlussreich wird das Bild, wenn man die Ergebnisse mit dem menschlichen Referenzverhalten vergleicht. Für dieselbe Kompetenzaufgabe wäre aus mathematischen Schätzungen der menschlichen Entscheidungen eine deutlich geringere Auswahlwahrscheinlichkeit für das „kompetenter wirkende“ Gesicht zu erwarten gewesen. Die Modelle lagen dagegen wesentlich höher, was Lehr als „praktisch bedeutende Effekte“ einordnet. Technisch kann das zweierlei bedeuten: Entweder sind die Muster im Modell tatsächlich stärker ausgeprägt als in menschlichen Urteilen – oder die Modelle zeigen die Verzerrung so konsistent, dass die Varianz der Reaktionen sinkt und dadurch der Effekt klarer sichtbar wird. In der Praxis ist beides heikel: Bei Auswahl- oder Screening-Prozessen macht Konsistenz Verzerrungen besonders zuverlässig und damit potenziell „operationalisierbar“ für ungerechte Entscheidungen.

Der nächste Schritt prüfte, ob sich diese face-to-character-Assoziationen auf verwandte Eigenschaften übertragen lassen. In einem Experiment mit 2.160 Versuchen bewertete GPT-4o dieselben Gesichter für Merkmale, die zu Kompetenz passen (etwa „intelligent“ oder „faul“) sowie für Vertrauenswürdigkeit (etwa „warm“ oder „egoistisch“). Das Modell generalisierte seine Urteile dabei in beiden Kategorien weitgehend im erwarteten Muster. Um außerdem zu zeigen, dass es nicht bloß um das „Auswendiglernen“ menschlicher Bilddaten geht, testeten die Forschenden das Modell in einem Experiment mit 150 Bildpaaren von Makaken—Menschen hatten diese zuvor als „nice“ oder „mean“ eingestuft. GPT-4o entschied die „nice“-Makaken in 66 % der Fälle als vertrauenswürdiger, was auf eine verallgemeinerte Bildkonzeption für Gesichtstrustworthyness hindeutet. In einem weiteren Setting gingen die Tests in Richtung Hochrisiko-Entscheidungen: GPT-4o sollte in 540 Versuchen aus zwei Gesichtern dasjenige auswählen, das „eher“ zu extremer Kriminalität oder Betrug passe. Zusätzlich gab es 540 „positive“ oder institutionelle Entscheidungen, etwa ob eine Person eingestellt oder ein Projekt finanziert werden sollte. Dabei empfahl das Modell das „kompetenter“ wirkende Gesicht in 75,19 % der Fälle – und zeigte keine erkennbare Zurückhaltung, die gleiche Logik auch bei sehr negativen Vorwürfen anzuwenden.

Um auszuschließen, dass es sich um ein GPT-4o-spezifisches Artefakt handelt, wiederholten die Forschenden das Grundmuster mit drei weiteren neueren Modellen: GPT-5, Gemini 3 Flash Preview und Claude Sonnet 4.5. Alle drei zeigten ebenfalls ausgeprägte face-to-character-Biases; in mehreren Fällen lagen die Verzerrungsniveaus sogar über denen älterer Modelle. GPT-5 erreichte beispielsweise in Kompetenzurteilen eine Auswahlrate von 94,33 % und in realweltlichen Entscheidungsszenarien 97,04 %. Lehr machte daraus den Schluss, dass man die Idee „modernes Reasoning vermeidet den Bias“ nicht einfach annehmen sollte – stattdessen kann sich die Neigung eher verstärken, wenn Modelle leistungsfähiger und gleichzeitig stärker darauf trainiert werden, komplexe Aufgaben konsistent zu lösen.

Natürlich gibt es Grenzen bei der Interpretation. Die Versuche setzten stark auf Forced-Choice-Szenarien, in denen das Modell gezwungen ist, direkt zwischen zwei Gesichtern zu entscheiden. In realen Systemen kann es dagegen vorkommen, dass Modelle erst Kontext erhalten, Abstufungen liefern oder Unsicherheiten ausweisen – das könnte das Verhalten verändern. Außerdem verwendeten die Experimente 2D-Stillbilder; ob Video oder andere Kamerawinkel zu ähnlichen, möglicherweise sogar anderen Mustern führen, bleibt eine offene Frage. Ebenso wichtig ist der Aspekt der Datenerklärung: Lehrs Argument lautet, dass sich diese Verzerrung nicht einfach als „Regurgitation“ plausibler Trainingsmuster abtun lässt, wenn sie in den Generationen zunimmt und messbar stärker ausfällt als menschliche Entscheidungen. Banaji und Lehr schlagen daher vor, dass nicht nur öffentliche Safety-Tests zählen, sondern gezielte Kontrollen für subtile visuelle Biases – insbesondere dann, wenn Modelle in Bereichen eingesetzt werden, in denen Einstellungs- oder Rechtsentscheidungen realen Einfluss auf Personen haben. Der Kern der Botschaft ist eindeutig: Oberflächlich „egalitäres“ Verhalten in vielen Standarddomänen reicht nicht, wenn Modelle dennoch Gesichter als Proxy für Charaktereigenschaften nutzen.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
1.501 Bewertungen
Eilik – Interaktiver Desktop Roboter mit Persönlichkeit, lebendigen Animationen & Reaktionen, Touch-Steuerung, Mini-Spiele, emotionaler Roboter Freund und besonderes Geschenk für Kinder & Erwachsene
  • 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“ - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“".
Stichwörter AI Alignment Artificial Intelligence Bias Einstellung Entscheidungsunterstützung Forced Choice Gehirn Geist Gesichtserkennung GPT-4o KI Kompetenz Künstliche Intelligenz Machine Learning Multimodal Neurologie Neuroscience Neurowissenschaften Sprachmodell Vertrauenswürdigkeit Verzerrung
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!
Kein nächster Artikel
Vorheriger Artikel

Chinesische KI-Modelle dominieren Nutzungsdaten – Washington prüft Risiken


Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »KI-Modelle nutzen Gesichtszüge für „Kriminalitäts- und Job-Treffsicherheit“« bei Google Deutschland suchen, bei Bing oder Google News!


    892 Leser gerade online auf IT BOLTWISE
    KI-Jobs