Das Journal14. Dezember 20258 Min. Lesezeit
Was der IQ misst, misst nicht, was er verspricht
Flynn-Effekt, Erblichkeit und der Superlativ, der 2022 fiel
Vier Jahrzehnte lang trug ein einziger Zahlenwert die Karriere des Intelligenztests. Frank L. Schmidt und John E. Hunter fassten 1998 zusammen, was Hunderte von Auswahlstudien über den Zusammenhang zwischen Testleistung und späterem Berufserfolg hergaben, und kamen auf eine Korrelation von r = .51. Kein anderes Auswahlverfahren erreichte diesen Wert — kein Bewerbungsgespräch, keine Referenz, keine Arbeitsprobe. Die Zahl wanderte in die Lehrbücher, in Gutachten, in Personalabteilungen.
2022 rechneten Paul R. Sackett, Charlene Zhang, Christopher M. Berry und Filip Lievens sie nach. Ihr Befund betrifft nicht die Daten, sondern eine Rechenkonvention: Die übliche Korrektur für Varianzeinschränkung — die statistische Hochrechnung eines Zusammenhangs, der nur an bereits vorausgelesenen Bewerbern gemessen wurde — überkorrigiert systematisch. Die Neuschätzung für den Berufserfolg liegt bei ρ = .31, und das strukturierte Interview rückt vor den Intelligenztest. Der Superlativ, den das Fach ein Jahrhundert lang gepflegt hatte, ist damit nicht widerlegt. Er ist gestrichen.
Was bleibt, ist eine Doppelbilanz, wie sie kein anderes Instrument dieses Archivs hat. Auf der einen Seite: Der IQ gehört weiterhin zu den prognostisch stärksten Einzelmaßen, die die Psychologie je gebaut hat. Schulerfolg, Berufserfolg, sogar Lebenserwartung hängen mit ihm zusammen, und zwar verlässlicher als bei den meisten Konstrukten des Fachs. Auf der anderen Seite: Kein Maß wurde gründlicher missbraucht — als wissenschaftliches Kostüm für Einwanderungsquoten, Zwangssterilisationen und Rassenhierarchien. Wer nur eine der beiden Bilanzen erzählt, erzählt falsch.
Wofür der Test ursprünglich gebaut wurde
Die Geburtsstunde war fürsorglich. 1904 suchte das französische Unterrichtsministerium ein Verfahren, um Kinder zu finden, die dem Regelunterricht nicht folgen konnten und Förderung brauchten. Alfred Binet und Théodore Simon bauten 1905 eine Aufgabenreihe steigender Schwierigkeit und verglichen das einzelne Kind mit seinen Gleichaltrigen. Binet selbst warnte vor beidem, was später kam: Das Maß sei kein festes Organ, Intelligenz nicht eine einzige Zahl, und wer den Wert als Schicksal lese, missbrauche ihn. Er starb am 18. Oktober 1911, bevor er sehen musste, wie recht er behalten sollte.
Er war nicht einmal der Erste. Hermann Ebbinghaus arbeitete ab 1895 für eine Kommission der Breslauer Schulbehörde und legte 1897 seine Kombinations- oder Ergänzungsmethode vor: Lückentexte, die das Kind sinnvoll schließen musste. Gebaut hatte er sie, um geistige Ermüdung über den Schultag zu messen; brauchbar wurde sie als Maß allgemeiner Leistungsfähigkeit — acht Jahre vor Binet und Simon. Die Ebbinghaus-Akte dieses Archivs erzählt den Fall ausführlich. Er zeigt, dass die Intelligenzmessung nicht aus einer Theorie der Intelligenz entstand, sondern aus dem Verwaltungsbedarf von Schulbehörden.
Wie aus Fürsorge Auslese wurde
In Amerika wurde aus dem Fördersuchinstrument ein Sortiergerät. Lewis Terman normierte den Test in Stanford, glaubte an die Erblichkeit des gemessenen Werts und an seine Eignung zur Auslese. Robert Yerkes testete zwischen 1917 und 1919 rund 1,75 Millionen Rekruten der US-Armee, etwa 1,5 Millionen davon mit dem schriftlichen Army Alpha. Die Ergebnisse waren methodisch wertlos und politisch hochwirksam: Englischkenntnisse und Schulbesuch gingen ungetrennt in die Werte ein, eine Konfundierung im Lehrbuchformat. Wer erst seit drei Jahren im Land war, sah auf dem Papier aus wie ein Schwachbegabter.
Aus diesen Daten wurde Munition. Einwanderungsquoten gegen Süd- und Osteuropäer beriefen sich auf sie; Sterilisationsgesetze traten in rund 32 Bundesstaaten in Kraft, bestätigt vom Obersten Gericht 1927 im Fall Buck v. Bell. Der Wortlaut gehört hierher, weil jede Umschreibung die Kälte mildert:
The principle that sustains compulsory vaccination is broad enough to cover cutting the Fallopian tubes. … Three generations of imbeciles are enough.
Was die Vorhersage trägt und was sie nicht trägt
Die Nachkriegsforschung hat den Gegenstand nüchterner vermessen. Der Generalfaktor — dass Leistungen über verschiedenste Aufgaben hinweg positiv zusammenhängen — gehört zu den stabilsten Befunden des Fachs; gestritten wird nicht über den Zusammenhang, sondern über seine Deutung. Die Vorhersagekraft für Schule und Beruf ist real und in Metaanalysen abgesichert, ihre Höhe allerdings gerade in Revision, wie die Rechnung von Sackett und Kollegen zeigt. Auch die Erblichkeit innerhalb von Populationen ist beträchtlich und steigt mit dem Alter. Eine Punktschätzung nennt dieser Text bewusst nicht, weil die Werte je nach Alter und Stichprobe weit streuen.
Genau an dieser Stelle sitzt der folgenreichste Denkfehler des Streits: Erblichkeit innerhalb einer Gruppe erklärt keine Unterschiede zwischen Gruppen. Körpergröße ist hoch erblich — und eine Generation mit besserer Ernährung wächst trotzdem um Zentimeter. Für Gruppendifferenzen im IQ gilt dasselbe Argument, und die Umwelthebel sind benannt: Schulzeit, Ernährung, Blei, Testvertrautheit, Armut.
Zur Nüchternheit gehört auch die Interventionsbilanz, und sie ist zweigeteilt. Frühförderprogramme wie Head Start heben gemessene Testwerte zunächst deutlich; ein Teil des Zugewinns verblasst über die Schuljahre — der berüchtigte Fade-out. Zugleich zeigen Langzeitdaten stabile Wirkungen dort, wo es zählt. David Deming fand für Head Start Effekte auf Schulabschlüsse und den weiteren Bildungsweg. Jens Ludwig und Douglas Miller fanden über einen Vergleich am Förderschwellenwert Wirkungen bis in Bildungsstand und Sterblichkeit hinein. Der Testwert verblasst, der Lebensverlauf nicht.
Eindeutiger ist die Evidenz zur Schulzeit. Stuart Ritchie und Elliot Tucker-Drob trugen 2018 zusammen, was quasi-experimentelle Studien hergeben: 142 Effektstärken aus 42 Datensätzen mit über 600 000 Teilnehmenden, gestützt auf drei unabhängige Designfamilien — Einschulungsstichtage, Schulpflichtreformen und Kontrollen für den Ausgangswert. Jedes zusätzliche Schuljahr hebt den gemessenen IQ um grob ein bis fünf Punkte. Was der Test misst, ist trainierbar. Nur eben nicht mit Wundermitteln, sondern mit Jahren.
Was der Flynn-Effekt ausschließt
Der stärkste Beleg gegen jede fixe Lesart trägt einen Namen: James Flynn. Über das zwanzigste Jahrhundert stiegen die Rohwerte in praktisch allen untersuchten Ländern um rund drei Punkte pro Jahrzehnt — so schnell, dass Gene als Erklärung ausscheiden. Eine Generation, nach den Normen ihrer Großeltern gemessen, läge im Begabtenbereich. Niemand hält das für real, also misst der Test auch Vertrautheit mit abstrakten Denkformaten, die moderne Gesellschaften antrainieren.
Seit den 1990er-Jahren stagnieren oder fallen die Kurven in mehreren reichen Ländern wieder. Die Deutungen reichen von Bildungssystemen bis zu Messartefakten, doch eine Erklärung lässt sich ausschließen. Bernt Bratsberg und Ole Rogeberg werteten die norwegischen Wehrpflichtdaten aus und fanden den Rückgang innerhalb von Familien — zwischen Brüdern also, die dieselben Eltern haben. Was sich zwischen zwei Brüdern verändert, ist keine Genetik. Ein Maß, dessen Mittelwert sich binnen weniger Generationen um Standardabweichungen verschiebt, misst etwas Reales und nichts Festes. Der Flynn-Effekt ist deshalb kein Kuriosum am Rand des Streits, sondern sein wichtigster Einzelbefund.
| Station | Jahr | Was geschah | Was daraus folgte |
|---|---|---|---|
| Ebbinghaus, Kombinationsmethode | 1897 | Lückentexte für die Breslauer Schulbehörde | die Messung kam vor der Theorie |
| Binet & Simon | 1905 | Aufgabenreihe für Förderbedarf | das Kind wird mit Gleichaltrigen verglichen |
| Yerkes, Armeetests | 1917–1919 | rund 1,75 Millionen Rekruten | Sprache und Schulbesuch gehen ungetrennt in den Wert |
| Buck v. Bell | 1927 | Oberstes Gericht bestätigt die Zwangssterilisation | Gesetze in rund 32 Bundesstaaten |
| Flynn | 1987 | 14 Länder | rund drei Punkte Anstieg je Jahrzehnt |
| Ritchie & Tucker-Drob | 2018 | 142 Effektstärken, über 600.000 Teilnehmende | ein Schuljahr hebt um ein bis fünf Punkte |
| Bratsberg & Rogeberg | 2018 | norwegische Wehrpflichtdaten | die Umkehr zeigt sich auch zwischen Brüdern |
| Sackett u. a. | 2022 | Neuschätzung der Validität | aus r = .51 wird ρ = .31 |
Wie das Fach über sich selbst streitet
Zwei Kapitel werden regelmäßig verkürzt. Das erste ist die Bell-Curve-Debatte von 1994: Richard Herrnstein und Charles Murray banden den IQ an Klasse und Herkunft und lösten den größten öffentlichen Schlagabtausch der Fachgeschichte aus. Die Antwort der American Psychological Association kam als Konsensbericht: „Intelligence: Knowns and Unknowns“, verfasst unter dem Vorsitz von Ulric Neisser, dessen Akte in diesem Archiv liegt. Der Bericht bleibt das Muster dafür, wie ein Fach auf eine politisierte Zuspitzung antworten kann. Bestand aufnehmen, Wissen von Nichtwissen trennen, die Zwischengruppen-Kausalfrage ausdrücklich als offen markieren.
Das zweite Kapitel ist die Testfairness. Aus der berechtigten Kritik an kulturlastigen Aufgaben ist eine eigene Methodik geworden: Messinvarianz-Prüfungen, kulturreduzierte Matrizentests, adaptive Verfahren. Die Instrumente von heute sind nicht die Armeetests von 1917. Wer den Missbrauch von damals gegen die Messung von heute zitiert, macht denselben Fehler in Gegenrichtung.
Wie schwer die Selbstprüfung ist, zeigt ausgerechnet ihr berühmtestes Dokument. Stephen Jay Goulds „The Mismeasure of Man“ warf dem Schädelvermesser Samuel George Morton unbewusste Manipulation vor. 2011 maßen Jason Lewis und Kollegen Mortons Sammlung nach und kehrten den Vorwurf um: Nicht Morton, sondern Gould habe voreingenommen gerechnet. Diese Gegenkritik ist ihrerseits bestritten worden, von Michael Weisberg 2014 und von Jonathan Kaplan und Kollegen 2015. Der Streit ist offen, und er ist lehrreich: Auch die Aufdeckung von Voreingenommenheit ist nicht voreingenommenheitsfrei.
Was bleibt
Der Test misst etwas Stabiles und Vorhersagekräftiges, aber nur innerhalb einer Gesellschaft und zu einer Zeit. Wie stark die Vorhersage ist, wird seit 2022 neu verhandelt und fällt nach heutigem Stand niedriger aus als jahrzehntelang gelehrt. Was der Test nicht misst, ist der Wert eines Menschen und keine feste Naturausstattung: Er ist über Schuljahre beeinflussbar, und sein Mittelwert ist im zwanzigsten Jahrhundert um Standardabweichungen gewandert. Gruppenmittel sagen über Einzelne nichts und über Ursachen wenig — das ist der eine Satz, den man aus diesem ganzen Streit mitnehmen sollte.
Im Alltag erkennt man den Fehlgebrauch an einem einfachen Zeichen: Eine Zahl wird als Eigenschaft gelesen statt als Messergebnis unter Bedingungen. Ein Testwert ist immer ein Wert von diesem Menschen, an diesem Tag, mit diesem Instrument, gemessen an dieser Normstichprobe. Fällt eine dieser vier Angaben weg, ist die Zahl ein Etikett. Binets Erfindung sollte Kindern Förderung verschaffen. Es hat ein Jahrhundert gebraucht, sie dorthin zurückzuholen — und die gefährlichste Eigenschaft einer Zahl bleibt ihre scheinbare Neutralität.
Quellen und warum sie hier stehen
Ebbinghaus, H. (1897). Über eine neue Methode zur Prüfung geistiger Fähigkeiten und ihre Anwendung bei Schulkindern. Zeitschrift für Psychologie und Physiologie der Sinnesorgane, 13, 401–459.
Die deutschsprachige Vorgeschichte, acht Jahre vor Binet: Die Intelligenzmessung entstand nicht aus einer Theorie der Intelligenz, sondern aus dem Verwaltungsbedarf einer Schulbehörde.
Binet, A., & Simon, T. (1905). Méthodes nouvelles pour le diagnostic du niveau intellectuel des anormaux. L'Année Psychologique, 11, 191–244.
Die Geburtsstunde — und sie war fürsorglich gemeint. Binet warnte selbst vor beidem, was daraus wurde: der festen Zahl und dem Schicksalsurteil.
Buck v. Bell, 274 U.S. 200 (1927).
Der Tiefpunkt, und die Fundstelle des Zitats. Es steht im Wortlaut da, weil eine Umschreibung die Kälte des Satzes mildert, die zur Sache gehört.
Flynn, J. R. (1987). Massive IQ gains in 14 nations: What IQ tests really measure. Psychological Bulletin, 101, 171–191.
Der stärkste Einzelbefund gegen jede feste Lesart: rund drei Punkte je Jahrzehnt, zu schnell für Gene.
Bratsberg, B., & Rogeberg, O. (2018). Flynn effect and its reversal are environmentally caused. PNAS, 115, 6674–6678.
Schließt eine Erklärung der Umkehr aus, statt bloß Deutungen anzubieten: Der Rückgang zeigt sich zwischen Brüdern derselben Eltern.
Neisser, U., Boodoo, G., Bouchard, T. J., u. a. (1996). Intelligence: Knowns and unknowns. American Psychologist, 51, 77–101.
Der Konsensbericht nach der Bell-Curve-Debatte — das Muster dafür, wie ein Fach auf eine politisierte Zuspitzung antwortet: Bestand aufnehmen, Nichtwissen benennen.
Ritchie, S. J., & Tucker-Drob, E. M. (2018). How much does education improve intelligence? A meta-analysis. Psychological Science, 29(8), 1358–1369.
Die klarste Evidenz der ganzen Frage: 142 Effektstärken, über 600.000 Teilnehmende, drei unabhängige Designfamilien. Was der Test misst, ist trainierbar — mit Jahren.
Deming, D. (2009). Early childhood intervention and life-cycle skill development: Evidence from Head Start. American Economic Journal: Applied Economics, 1(3), 111–134.
Die eine Hälfte der Interventionsbilanz: Der Testwert verblasst, die Wirkung auf Schulabschlüsse nicht.
Ludwig, J., & Miller, D. L. (2007). Does Head Start improve children's life chances? Evidence from a regression discontinuity design. Quarterly Journal of Economics, 122(1), 159–208.
Die andere Hälfte, über einen Vergleich am Förderschwellenwert — mit Wirkungen bis in Bildungsstand und Sterblichkeit.
Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124, 262–274.
Die Zahl, die vier Jahrzehnte lang die Karriere des Tests trug: r = .51, unerreicht von jedem anderen Auswahlverfahren.
Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection: Addressing systematic overcorrection for restriction of range. Journal of Applied Psychology, 107(11), 2040–2068.
Die Korrektur, mit der der Artikel beginnt. Nicht die Daten waren falsch, sondern eine Rechenkonvention — und danach steht das strukturierte Interview vorn.
Gould, S. J. (1981/1996). The Mismeasure of Man. Norton.
Das berühmteste Dokument der Selbstprüfung — und selbst Gegenstand einer Prüfung geworden.
Lewis, J. E., DeGusta, D., Meyer, M. R., Monge, J. M., Mann, A. E., & Holloway, R. L. (2011). The mismeasure of science: Stephen Jay Gould versus Samuel George Morton on skulls and bias. PLoS Biology, 9(6), e1001071.
Die Umkehrung des Vorwurfs nach Nachmessung der Sammlung: nicht Morton, sondern Gould habe voreingenommen gerechnet.
Weisberg, M. (2014). Remeasuring man. Evolution & Development, 16(3), 166–178; und Kaplan, J. M., Pigliucci, M., & Banta, J. A. (2015). Gould on Morton, redux. Studies in History and Philosophy of Biological and Biomedical Sciences, 52, 22–31.
Die Gegenkritik an dieser Umkehrung. Der Streit bleibt offen — und lehrt, dass auch die Aufdeckung von Voreingenommenheit nicht voreingenommenheitsfrei ist.