Das Journal7. Juni 20266 Min. Lesezeit
Was auf jeden passt, beschreibt niemanden
Dreizehn Sätze, 39 Studierende, ein Mittelwert von 4,26
Im Jahr 1948 ließ der Psychologe Bertram Forer 39 Studierende einen Persönlichkeitstest ausfüllen und teilte eine Woche später die individuellen Auswertungen aus — dreizehn Sätze, mit der Bitte, die Treffgenauigkeit auf einer Skala von null bis fünf zu bewerten. Der Mittelwert lag bei 4,26. Erst als die Bewertungen eingesammelt waren, löste Forer auf: Das Blatt war für alle dasselbe, Satz für Satz zusammengestellt aus einem Astrologiebuch vom Zeitungskiosk. Der Test selbst wurde nie ausgewertet. „Sie haben ein starkes Bedürfnis, von anderen gemocht zu werden.“ „Zeitweise sind Sie extravertiert und umgänglich, zeitweise vorsichtig und zurückhaltend.“ „Sie haben beträchtliche ungenutzte Fähigkeiten.“
When the inferences are universally valid, as they often are, the confirmation is useless.
Forer nannte den Vorgang den Trugschluss der persönlichen Validierung: Menschen prüfen eine Beschreibung ihrer selbst nicht dagegen, ob sie auch auf andere passt — sondern nur dagegen, ob sich Belege aus dem eigenen Leben finden. Und die finden sich immer, wenn die Sätze richtig gebaut sind. Paul Meehl gab dem Phänomen 1956 den Namen, unter dem es berühmt wurde: Barnum-Effekt. Die Wendung übernahm er von seinem Kollegen Donald G. Paterson, der von Persönlichkeitsbeschreibungen „nach Art von P. T. Barnum“ gesprochen hatte — nach dem Zirkusmann, dem das Prinzip „für jeden etwas“ zugeschrieben wird. Meehl prägte den Begriff in einem Aufsatz, der Klinikerinnen und Kliniker zu statistischen Auswertungsregeln überreden wollte, und er meinte ihn als Warnschild: Ein Befund, dem die beschriebene Person zustimmt, ist damit noch kein Befund über sie.
| Bewertung von null bis fünf | 0 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|---|
| Der Test selbst | 0 | 0 | 0 | 1 | 25 | 13 |
| Die ausgeteilte Auswertung | 0 | 0 | 1 | 4 | 18 | 16 |
Die Bauanleitung der treffenden Beschreibung
Die Forschung nach Forer hat die Zutaten seziert, und sie sind lernbar. Erstens die Zweiseitigkeit: „Mal so, mal so“-Sätze können nicht danebenliegen, weil sie beide Hälften des Spektrums abdecken — und sich trotzdem wie eine Beobachtung anfühlen, weil jeder Mensch beide Hälften kennt. Zweitens das Schmeichelhafte mit Vorbehalt: ungenutzte Fähigkeiten, verborgene Tiefe, Selbstkritik als Zeichen von Anspruch. Menschen akzeptieren positive Aussagen über sich bereitwilliger, und am bereitwilligsten die, die Bescheidenheit imitieren. Drittens die Personalisierungs-Illusion: Dieselben Sätze werden für treffender gehalten, wenn sie angeblich eigens für einen erstellt wurden — der bloße Rahmen „Ihre Auswertung“ erhöht die Zustimmung, wie Studien mit identischen Texten unter verschiedenen Etiketten zeigen. Und viertens die Autorität der Quelle: Ein Befund vom Fachmann, aus dem Computer oder aus einem alten System mit eigener Terminologie trifft angeblich genauer als derselbe Befund vom Flurfunk.
Zwei Übersichtsarbeiten haben den Bestand gesichtet — Dickson und Kelly 1985, Furnham und Schofield 1987 — und kommen zum gleichen Ergebnis: Von den vier Zutaten ist die Schmeichelei die verlässlichste. Ungünstige Beschreibungen werden deutlich zurückhaltender angenommen, und zwar auch dann, wenn sie mit derselben Autorität daherkommen.
Damit ist der Markt beschrieben, der auf dem Effekt steht. Horoskope sind seine älteste Anwendung; Graphologie und Handlesen arbeiten mit demselben Baukasten. Die kränkendste Pointe der Forschung betrifft aber die Psychologie selbst: Typentests, die Menschen in wenige, durchweg wohlwollend beschriebene Sorten einteilen, erzeugen dieselbe Zustimmung auf demselben Weg — die Beschreibungen sind allgemein, positiv und zweiseitig, und die Leser validieren sie persönlich. Die Jung-Akte dieses Archivs erzählt, wie aus einer Begriffsordnung ein Milliardengeschäft mit sechzehn Sorten Mensch wurde; der Barnum-Effekt erklärt, warum die Kundschaft zufrieden bleibt, obwohl ein erheblicher Teil beim Wiederholungstest einen anderen Typ erhält. Zufriedenheit ist kein Gütekriterium. Sie ist das Produkt.
Was der Zuordnungstest zeigt
Zustimmung und Treffgenauigkeit sind zwei verschiedene Größen, und man kann sie auseinanderziehen. Das Verfahren dafür ist simpel: Statt zu fragen, wie gut eine Deutung passt, legt man mehrere Deutungen vor und lässt die richtige heraussuchen. Wer wirklich beschreibt, muss den Unterschied treffen; wer Barnum-Sätze produziert, kann es nicht, weil alle Deutungen auf alle passen.
Genau diesen Test hat der Physiker Shawn Carlson 1985 in Nature an der Astrologie durchgeführt, doppelblind und mit Verfahrensregeln, die mit astrologischen Fachvertretern vorab abgestimmt waren. Astrologinnen und Astrologen, von ihren Verbänden als besonders qualifiziert benannt, erhielten je ein Geburtshoroskop und drei Persönlichkeitsprofile aus dem California Psychological Inventory und sollten sagen, welches Profil zum Horoskop gehört. Sie trafen nicht häufiger als der Zufall. In einem zweiten Teil legte man Testpersonen drei Deutungen vor, von denen eine aus ihrem eigenen Geburtshoroskop stammte — auch sie fanden ihre eigene nicht überzufällig. Dasselbe Material, das im Einzelfall verblüffend genau wirkt, verliert seine Genauigkeit in dem Moment, in dem es mit Konkurrenz antreten muss.
Was eine Aussage prüfbar macht
Der Effekt macht nicht jede Persönlichkeitsbeschreibung wertlos, und genau hier wird er lehrreich. Eine brauchbare Aussage über einen Menschen unterscheidet sich von einer Barnum-Aussage durch drei Eigenschaften. Sie ist falsifizierbar — es ist denkbar, dass sie auf jemanden nicht zutrifft. Sie diskriminiert — sie trifft auf manche Menschen deutlich besser zu als auf andere, was der Zuordnungstest prüft. Und sie sagt etwas vorher, das nicht schon in der Frage steckt. Die seriöse Persönlichkeitsdiagnostik hat sich diese Prüfungen selbst auferlegt und nennt ihr Ergebnis Validität; die Allport-Akte dieses Archivs beschreibt, wie aus achtzehntausend Wörtern über Menschen am Ende fünf Dimensionen wurden, deren Werte Schulnoten, Berufserfolg und Gesundheit bescheiden, aber nachweisbar vorhersagen. Der Unterschied zwischen einem Faktorwert und einem Horoskop ist nicht der Ton — es ist die Möglichkeit, danebenzuliegen.
Ein Seitenblick lohnt auf den Alltag der Wissenschaft selbst, denn der Effekt endet nicht an der Labortür. Rückmeldungen aus Assessments, Stärkenprofile aus Personalabteilungen, die Ergebnisberichte mancher Online-Studien — überall dort, wo Menschen individuelle Auswertungen erhalten, die aus Textbausteinen bestehen, läuft im Kleinen Forers Seminar von 1948. Die Prüfung ist stets dieselbe und dauert eine Minute: Man tausche das Blatt mit dem Nachbarn. Beschreibungen, die den Tausch unbeschadet überstehen, sagen etwas über die Bausteine; nur die, die er ruiniert, sagten etwas über die Person.
Warum der Effekt nicht verschwindet
Bleibt die Frage, warum er so zäh ist, obwohl er seit 1948 aktenkundig ist. Ein Teil der Antwort ist unangenehm praktisch: Die Sätze, die ihn tragen, sind sozial nützlich. Sie eröffnen Gespräche, kränken niemanden und geben dem Gegenüber Material, sich selbst zu erzählen — weshalb kalte Leser, Berater und Wahrsager sie unabhängig voneinander immer wieder erfinden. Der andere Teil ist grundsätzlicher: Die persönliche Validierung ist keine Dummheit, sondern die Alltagsform des Bestätigungsfehlers, und der gehört zur Grundausstattung des Urteilens. Man wird ihn nicht los; man kann ihn nur kennen und an den entscheidenden Stellen — vor Gericht, in der Diagnostik, bei der Personalauswahl — durch Verfahren ersetzen, die ihn aushebeln: Verblindung, Vergleichsgruppen, zugeordnete statt vorgelegter Beschreibungen.
Forers Originalstudie ist zudem eine der wenigen dieses Archivs, die praktisch nie in Zweifel stand. Der Befund wurde über Jahrzehnte in Dutzenden Varianten wiederholt — mit Studierenden und Berufstätigen, mit Horoskopen und Pseudo-Computerauswertungen — und der Mittelwert der Zustimmung landet verlässlich im oberen Bereich der Skala. Er repliziert so gut, weil er nichts Exotisches misst, sondern den Normalbetrieb des menschlichen Selbstbilds.
Was bleibt
Gesichert ist der Effekt selbst: Allgemeine, wohlwollende, zweiseitige Sätze werden als treffende Selbstbeschreibung angenommen, wenn sie als persönliche Auswertung aus glaubwürdiger Quelle daherkommen. Gesichert ist auch, was daraus folgt — dass Zustimmung kein Beleg für Genauigkeit ist. Offen und interessant bleibt die Gegenrichtung: Wie viel von der Zustimmung zu einer guten Diagnostik ebenfalls auf Barnum-Anteile zurückgeht, ist selten sauber getrennt worden. Ein Testbefund kann zugleich valide sein und aus Gründen akzeptiert werden, die mit seiner Validität nichts zu tun haben.
Im Alltag erkennt man eine Barnum-Aussage an einer einzigen Frage: Wem könnte dieser Satz nicht gelten? Findet man keine Antwort, beschreibt er niemanden. Praktisch heißt das, Auswertungen im Plural zu prüfen statt im Singular — das Blatt mit dem Nachbarn tauschen, den Namen abdecken, drei Deutungen nebeneinanderlegen. Forer hat seinen Aufsatz im Untertitel selbst als Unterrichtsvorführung der Leichtgläubigkeit ausgewiesen, nicht als Befund über den besonderen Zustand seiner Studierenden. Der Effekt beschämt nicht, er demonstriert; das ist der Grund, warum das Original bis heute im Unterricht wiederholt wird, als eines der wenigen Experimente, die ihr eigenes Debriefing sind.
Quellen und warum sie hier stehen
Forer, B. R. (1949). The fallacy of personal validation: A classroom demonstration of gullibility. Journal of Abnormal and Social Psychology, 44(1), 118–123.
Die Originalstudie: 39 Studierende, dreizehn Sätze, die Tabellen 1 und 2 des Datenblocks — und die Fundstelle des Zitats.
Meehl, P. E. (1956). Wanted — a good cookbook. American Psychologist, 11, 263–272.
Hier bekommt der Effekt seinen Namen, und zwar als Warnschild in einem Plädoyer für statistische statt intuitiver Auswertung.
Snyder, C. R., Shenkel, R. J., & Lowery, C. R. (1977). Acceptance of personality interpretations: The „Barnum effect“ and beyond. Journal of Consulting and Clinical Psychology, 45(1), 104–114.
Zerlegt die Zustimmung in ihre Bedingungen — Personalisierung, Autorität, Wohlwollen — und liefert damit die Bauanleitung des ersten Abschnitts.
Dickson, D. H., & Kelly, I. W. (1985). The „Barnum effect“ in personality assessment: A review of the literature. Psychological Reports, 57, 367–382.
Erste der beiden Übersichtsarbeiten, auf denen der Befund beruht, dass die Schmeichelei die verlässlichste der vier Zutaten ist.
Furnham, A., & Schofield, S. (1987). Accepting personality test feedback: A review of the Barnum effect. Current Psychology, 6(2), 162–178.
Die zweite Übersichtsarbeit; sie kommt unabhängig zum selben Ergebnis, auch für ungünstige Beschreibungen.
Carlson, S. (1985). A double-blind test of astrology. Nature, 318(6045), 419–425.
Der Zuordnungstest an der Astrologie, doppelblind und mit den Fachverbänden vorab abgestimmt — das Verfahren, das Zustimmung von Treffgenauigkeit trennt.
Zur Wiederholungs-Zuverlässigkeit der Typentests siehe die Belege der Jung-Akte dieses Archivs.
Dass ein erheblicher Teil der Testpersonen beim zweiten Durchgang einen anderen Typ erhält, ist dort belegt und wird hier nicht doppelt geführt.