Zum Inhalt springen
AnamneseArchiv der Psychologie

Mindestens zwei Zeichen

Das Journal29. August 20267 Min. Lesezeit

Das Gesicht war nie ein Beweisstück

Von der Physiognomik zur KI, die dasselbe Versprechen erneuert

Dasselbe Raster, zweimal — und kein Gesicht darunter. Rechts steht, worüber wirklich gestritten wird: bei der Arbeit von 2016 über die Herkunft der Bildersammlungen, bei der von 2018 nicht über die Zahlen, sondern darüber, was gemessen wurde. Übereinstimmung bleibt nicht Genauigkeit.Zeichnung des Archivs

Im November 2016 stellten Xiaolin Wu und Xi Zhang eine Arbeit ins Netz, die behauptete, Kriminalität aus Porträtfotos ablesen zu können. 1.856 Gesichter, knapp die Hälfte davon verurteilte Straftäter, vier Klassifikatoren, alle mit gutem Ergebnis. Die Autoren benannten sogar die Merkmale: die Krümmung der Lippe, der Abstand der inneren Augenwinkel, der Winkel zwischen Nase und Mund. Es lohnt sich, diese Liste zweimal zu lesen. Es sind Streckenmaße und Winkel am Kopf — genau die Größen, die das neunzehnte Jahrhundert mit Zirkel und Tastzirkel abnahm, um daraus auf den Charakter zu schließen. Nicht die Messgrößen haben sich geändert, sondern das Gerät, das sie ausliest. Und sie berichteten, die Gesichter von Nichtkriminellen seien einander ähnlicher — eine „Regel der Normalität“ für Gesichter.

Das Versprechen ist alt, die Rechenleistung neu. Wo die Physiognomik ein Messinglineal an die Stirn hielt, liegt heute ein neuronales Netz zwischen Foto und Urteil. Der logische Sprung ist derselbe geblieben.

Was in einem Zehntel einer Sekunde entsteht

Der Ausgangsbefund ist solide und macht die Sache erst interessant. Menschen bilden Urteile über Gesichter in etwa 100 Millisekunden; wer länger hinsehen darf, wird vor allem sicherer, nicht anders. Die Eindrücke sind also nicht mühsam erschlossen, sondern reflexhaft — sie fühlen sich an wie Wahrnehmung und nicht wie Interpretation.

Genau deshalb täuscht ein einzelnes Foto so zuverlässig. Alexander Todorov und Jenny M. Porter zeigten, dass Bilder derselben Person ähnlich unterschiedliche Eindrücke erzeugen können wie Bilder verschiedener Menschen. Die Streuung innerhalb einer Person erreicht die Streuung zwischen Personen oder übertrifft sie. Beleuchtung, Ausdruck, Winkel und die Auswahl des Bildes verändern den scheinbaren Charakter — also verändert die Wahl des Fotos das Ergebnis jeder Analyse, die auf einem Foto beruht.

Übereinstimmung ist nicht Genauigkeit

Viele Beobachtende finden dasselbe Gesicht kompetent oder vertrauenswürdig. Das beweist, dass sie ähnliche visuelle Regeln teilen — nicht, dass der Mensch diese Eigenschaft besitzt. Ein leichter Ärgerausdruck kann als Dominanz, ein rundes Gesicht als Harmlosigkeit übergeneralisiert werden. Kulturelle Lernprozesse machen das Urteil konsistent und potenziell unfair.

Wie weit die Konsistenz von der Treffsicherheit entfernt ist, hat eine Metaanalyse zur wahrgenommenen Vertrauenswürdigkeit vermessen. Auf der Ebene einzelner Gesichter blieb der Zusammenhang zwischen Eindruck und tatsächlichem Verhalten bei r = .14, auf der Ebene einzelner Beobachter bei r = .27. Die Autorinnen und Autoren halten das ausdrücklich für praktisch nicht nutzbar. Es ist genug, um in großen Stichproben ein Signal zu sehen, und viel zu wenig, um über einen Menschen zu entscheiden.

Zwei Algorithmen und was sie wirklich maßen

Wu und Zhangs Kriminalitätsklassifikator hat den Weg genommen, den solche Arbeiten meist nehmen: erst Aufmerksamkeit, dann Widerspruch. Kevin W. Bowyer, Michael King, Walter Scheirer und Kushal Vangara halten den gesamten Ansatz für aussichtslos und die vielversprechenden Ergebnisse für eine Illusion, die aus unzureichendem Versuchsaufbau entsteht. Genau darin liegt der Streit: Wu und Zhang geben an, ihre Bilder nach Herkunft, Geschlecht, Alter und Gesichtsausdruck kontrolliert zu haben. Die Kritiker halten diese Kontrolle für unzureichend — und weil beide Seiten dieselben Trefferquoten anerkennen, entscheidet nicht die Statistik, sondern die Frage, woher die beiden Bildersammlungen stammten. Wu und Zhang selbst schoben einen Nachtrag hinterher, in dem sie ihre Arbeit als rein akademische Diskussion bezeichneten und sich über die öffentliche Rezeption verwundert zeigten.

Der zweite Fall wiegt schwerer, weil er in einem Fachblatt erschien. Yilun Wang und Michal Kosinski werteten 2018 im Journal of Personality and Social Psychology 35.326 Gesichtsbilder aus. Ihr Klassifikator, so berichteten sie, halte schwule und heterosexuelle Männer in 81 % der Fälle korrekt auseinander, bei Frauen in 71 %. Mit fünf Bildern pro Person stiegen die Werte auf 91 % und 83 %; menschliche Urteilende kamen auf 61 % und 54 %.

Die entscheidende Angabe steht in der Arbeit selbst. Zu den Merkmalen, die der Klassifikator nutzte, zählen die Autoren neben festen Zügen wie der Nasenform ausdrücklich veränderliche: Ausdruck und Pflegestil, also Frisur, Bartwuchs, Brille, Kosmetik. Das sind keine Eigenschaften eines Gesichts, sondern Entscheidungen eines Menschen darüber, wie er auf einem selbst hochgeladenen Porträt erscheinen möchte. Gemessen wurde Selbstdarstellung in einem bestimmten sozialen Umfeld, nicht Physiognomie.

Die Autoren selbst deuten ihren Befund anders. Schwule Männer und lesbische Frauen hätten, so schreiben sie, tendenziell geschlechtsuntypische Gesichtsmorphologie, Mimik und Pflegestile — im Einklang mit der Theorie pränataler Hormonwirkung. Bemerkenswert ist, was sie im selben Atemzug berichten: Modelle, die allein auf Geschlechtstypik zielten, erkannten schwule Männer in 57 % und lesbische Frauen in 58 % der Fälle. Der weitaus größte Teil des Vorsprungs stammt also aus etwas anderem als bloßer Geschlechtstypik — und die Arbeit selbst benennt Pflegestil und Ausdruck als Teil dieses Etwas.

Andrew Gelman, Greggor Mattson und Daniel Simpson haben dem einen Namen gegeben: den Fehlschluss der entkontextualisierten Messung.

the ideals of scientific precision strip the context from intrinsically social phenomena

Andrew Gelman, Greggor Mattson & Daniel Simpson, Gaydar and the Fallacy of Decontextualized Measurement (2018) [Die Ideale wissenschaftlicher Präzision lösen den Zusammenhang von Phänomenen ab, die ihrem Wesen nach gesellschaftlich sind.] Die Annahme, es gebe ein rein biologisches Maß für die Wahrnehmung sexueller Orientierung, löst ein soziales Phänomen aus seinem Kontext und verkauft die Genauigkeit der Statistik als Genauigkeit der Aussage. Wer die Zahl 91 % liest, denkt an eine Eigenschaft. Gemessen wurde ein Datensatz.

Wenn Vorhersage keine Wahrheit bedeutet

Ein Algorithmus kann in einem Datensatz Treffer erzielen und dennoch das falsche Merkmal lernen. Vielleicht erkennt er Beleuchtung, Kameratyp, Kleidung oder soziale Ungleichheit statt Persönlichkeit. Funktioniert das Modell in einer anderen Population nicht, war seine scheinbare Menschenkenntnis nur eine Abkürzung durch die Trainingsdaten.

Selbst eine stabile Vorhersage beweist keine angeborene Eigenschaft des Gesichts. Diskriminierende Behandlung kann Aussehen, Ausdruck und dokumentierte Lebenswege miteinander verbinden: Wer häufiger kontrolliert wird, taucht häufiger in Registern auf, und wer in Registern auftaucht, wird zum Trainingsbeispiel. Ein Algorithmus, der frühere Einstellungs-, Kredit- oder Strafentscheidungen lernt, sagt zuverlässig voraus, wie früher entschieden wurde.

Dazu kommt ein Rechenfehler, der bei jeder Anwendung auf eine große Bevölkerung auftritt und in keiner der Schlagzeilen vorkam. Die 81 Prozent sind an Paaren gemessen: ein schwuler und ein heterosexueller Mann, das Modell soll sie auseinanderhalten. Eine Fahndung arbeitet anders — sie sieht viele Menschen, unter denen das gesuchte Merkmal selten ist. Wer ein Verfahren dieser Güte auf tausend Männer loslässt, von denen vielleicht vierzig schwul sind, bekommt neben etwa dreißig richtigen Treffern rund hundertachtzig falsche. Mehr als vier von fünf Markierten wären dann falsch markiert. Die Zahl 81 hat sich nicht geändert; nur die Frage, die man ihr stellt.

Besonders gefährlich wird das bei Polizei, Bewerbungen und Versicherungen. Ein unprüfbares Charakterurteil erhält den Anschein objektiver Präzision, während Betroffene weder Ursache noch Korrektur kennen. Nötig sind daher externe Validierung, getrennt ausgewiesene Fehlerquoten für verschiedene Gruppen und die Frage, ob eine solche Klassifikation überhaupt legitim eingesetzt werden darf.

PrüfungJahrUmfangWas dabei herauskam
Willis & Todorov2006fünf Experimente100 ms genügen für ein Gesichtsurteil
Todorov & Porter2014Bilder derselben PersonStreuung innerhalb einer Person erreicht die zwischen Personen
Wu & Zhang, Kriminalität20161.856 PorträtsTrefferquoten unbestritten — die Herkunft der Bilder nicht
Wang & Kosinski201835.326 Gesichtsbilder81 % und 71 %; auf Geschlechtstypik allein nur 57 % und 58 %
Bowyer u. a., Nachprüfung2020Kritik des Aufbausdie Ergebnisse als Artefakt, nicht als Befund
Foo u. a., Metaanalyse2022Vertrauenswürdigkeitr = .14 je Gesicht, r = .27 je Beobachter

Was bleibt

Gesichter sind nicht bedeutungslos. Sie zeigen momentanen Ausdruck, Aufmerksamkeit und manche Zustände, und diese Signale sind kontextabhängig. Was gilt, ist der schnelle, geteilte, weitgehend unzutreffende Eindruck: Er entsteht in einem Zehntel einer Sekunde, viele Menschen teilen ihn, und er sagt kaum etwas über die Person. Was nicht gilt, ist der Schritt von diesem Eindruck zu einer Eigenschaft — und daran ändert kein Modell etwas, weil das Problem nicht in der Rechenleistung liegt, sondern im Schluss.

Strittig bleibt, wie mit Modellen umzugehen ist, die tatsächlich Signal finden. Dass ein Klassifikator in einem Datensatz funktioniert, ist eine empirische Aussage über diesen Datensatz; ob dahinter eine Eigenschaft steht oder ein Kontext, entscheidet erst die externe Prüfung. Beide Seiten der Debatte um Wang und Kosinski berufen sich auf dieselben Zahlen.

Im Alltag erkennt man den Fehlschluss an einem fehlenden Satz. Wo jemand ein Gesicht liest und nicht sagt, woran das Urteil überprüfbar wäre, ist es kein Urteil, sondern ein Eindruck mit Berufsbezeichnung. Gute Menschenanalyse beobachtet Verhalten über Situationen und Zeit, nutzt Selbst- und Fremdberichte und fragt nach konkreten Handlungen. Die Physiognomik scheitert nicht daran, dass Gesichter nichts bedeuten. Sie scheitert daran, dass sie aus Bedeutung Schicksal macht.

Quellen und warum sie hier stehen

  1. Willis, J., & Todorov, A. (2006). First impressions: Making up your mind after a 100-ms exposure to a face. Psychological Science, 17(7), 592–598.

    Der solide Ausgangsbefund, ohne den der Artikel keine Spannung hätte: Das Urteil ist da, bevor das Nachdenken beginnt — und mehr Zeit macht nur sicherer, nicht anders.

  2. Todorov, A., & Porter, J. M. (2014). Misleading first impressions: Different for different facial images of the same person. Psychological Science, 25(7), 1404–1417.

    Der Befund, der jede Ein-Foto-Analyse im Kern trifft: Bilder derselben Person streuen so weit wie Bilder verschiedener Menschen. Wer das Foto wählt, wählt das Ergebnis mit.

  3. Todorov, A., Olivola, C. Y., Dotsch, R., & Mende-Siedlecki, P. (2015). Social attributions from faces: Determinants, consequences, accuracy, and functional significance. Annual Review of Psychology, 66, 519–545.

    Die Übersicht, aus der die Übergeneralisierungen stammen — der leichte Ärgerausdruck als Dominanz, das runde Gesicht als Harmlosigkeit.

  4. Foo, Y. Z., Sutherland, C. A. M., Burton, N. S., Nakagawa, S., & Rhodes, G. (2022). Accuracy in facial trustworthiness impressions: Kernel of truth or modern physiognomy? A meta-analysis. Personality and Social Psychology Bulletin, 48(11), 1580–1596.

    Beziffert den Abstand zwischen Übereinstimmung und Treffsicherheit: r = .14 je Gesicht, r = .27 je Beobachter — von den Autorinnen und Autoren ausdrücklich für praktisch unbrauchbar erklärt.

  5. Wu, X., & Zhang, X. (2016). Automated inference on criminality using face images. arXiv:1611.04135.

    Der erste der beiden Fälle. Bemerkenswert ist nicht die Trefferquote, sondern dass die Autoren dieselben Maße benennen, die schon das neunzehnte Jahrhundert nahm.

  6. Bowyer, K. W., King, M. C., Scheirer, W. J., & Vangara, K. (2020). The „criminality from face“ illusion. IEEE Transactions on Technology and Society, 1(4), 175–183.

    Die Gegenrede, die den Streit an die richtige Stelle rückt: Bestritten wird nicht die Statistik, sondern der Versuchsaufbau — also die Herkunft der beiden Bildersammlungen.

  7. Wang, Y., & Kosinski, M. (2018). Deep neural networks are more accurate than humans at detecting sexual orientation from facial images. Journal of Personality and Social Psychology, 114(2), 246–257.

    Der schwerere Fall, weil er ein Fachblatt passierte. Die entscheidende Angabe steht in der Arbeit selbst: Zu den genutzten Merkmalen zählen Pflegestil und Ausdruck — Entscheidungen, keine Gesichtszüge.

  8. Gelman, A., Mattson, G., & Simpson, D. (2018). Gaydar and the fallacy of decontextualized measurement. Sociological Science, 5, 270–280.

    Gibt dem Fehler seinen Namen, und aus der Zusammenfassung stammt das Zitat: Die Ideale wissenschaftlicher Präzision lösen ein soziales Phänomen aus seinem Zusammenhang.