P-Werte quantifizieren die Stärke der Beweise gegen eine Nullhypothese – insbesondere die Wahrscheinlichkeit, eine so extreme Teststatistik wie Ihre (oder mehr) zu beobachten, wenn die Nullhypothese wahr wäre. Obwohl p-Werte eines der am häufigsten verwendeten statistischen Konzepte in der wissenschaftlichen Forschung sind, gehören sie auch zu den am häufigsten missverstandenen und missbrauchten Zahlen in der gesamten Statistik und tragen zur „Replikationskrise“ in der Psychologie, Medizin und den Sozialwissenschaften bei. In den folgenden Abschnitten wird erläutert, was ein p-Wert tatsächlich misst (und was nicht), wie die übermäßige Abhängigkeit von p-Wert-Schwellenwerten zu P-Hacking und fragwürdigen Forschungspraktiken geführt hat und warum die Angabe der Effektgröße neben p-Werten für eine ehrliche Interpretation statistischer Ergebnisse unerlässlich ist.

Was ein P-Wert ist (und was nicht)

Ein p-Wert ist die Wahrscheinlichkeit, Daten zu sehen, die so extrem sind wie Ihre (oder noch extremer), wenn die Nullhypothese wahr wäre. Es geht ausdrücklich NICHT um die Wahrscheinlichkeit, dass die Nullhypothese wahr ist, und diese Unterscheidung ist einer der wichtigsten konzeptionellen Punkte in der angewandten Statistik. Ein p-Wert von 0,03 bedeutet: Wenn H₀ wahr wäre, besteht nur eine 3-prozentige Chance, ein so extremes oder noch extremeres Ergebnis zu sehen. Es sagt nichts direkt darüber aus, ob H₀ tatsächlich richtig oder falsch ist – das würde eine Bayes'sche Analyse erfordern, die A-priori-Wahrscheinlichkeiten einbezieht.

Häufige Fehlinterpretationen, die es zu vermeiden gilt: „p = 0,03 bedeutet, dass eine Wahrscheinlichkeit von 3 % besteht, dass H₀ wahr ist“ (falsch, dies ist die inverse Wahrscheinlichkeit P(H₀|Daten), die den Satz von Bayes erfordert). „p = 0,03 bedeutet, dass die Wahrscheinlichkeit, dass H₁ wahr ist, bei 97 % liegt“ (ebenfalls falsch). „p > 0,05 bedeutet, dass H₀ wahrscheinlich wahr ist“ (falsch – das Fehlen von Beweisen ist kein Beweis für das Fehlen, insbesondere bei kleinen Stichproben). Die korrekte Interpretation ist eng gefasst: Der p-Wert ist eine Aussage darüber, wie ungewöhnlich Ihre Daten wären, wenn H₀ wahr wäre. Verwenden Sie p-Werte, um Überraschungen unter einem Nullmodell zu quantifizieren, und nicht, um Wahrscheinlichkeitsaussagen über die Hypothesen selbst zu treffen.

Die Replikationskrise und P-Hacking

Eine übermäßige Abhängigkeit vom Schwellenwert p < 0,05 hat erheblich zur nicht reproduzierbaren Forschung in der Psychologie, Medizin und den Sozialwissenschaften beigetragen – ein Problem, das seit der Replikationskrise der 2010er Jahre weithin dokumentiert ist. „P-Hacking“ ist die Praxis, mehrere Analysen durchzuführen, verschiedene Untergruppen zu testen, verschiedene Ergebnismaße auszuprobieren oder bestimmte Datenpunkte auszuschließen, bis etwas den Schwellenwert von 0,05 überschreitet. Dadurch werden die Falsch-Positiv-Raten weit über die nominellen 5 % hinaus erhöht, was bedeutet, dass es sich bei vielen veröffentlichten „signifikanten“ Ergebnissen um statistisches Rauschen handelt, das sich in Folgestudien nicht reproduzieren lässt.

Zu den modernen Best Practices gehören die Vorregistrierung von Hypothesen und Analyseplänen vor der Datenerhebung (was die Forscher dazu zwingt, sich auf bestimmte Tests zu konzentrieren, statt hinterher zu fischen), die Angabe von Effektgrößen neben p-Werten, damit Leser die praktische Signifikanz und nicht nur die statistische Signifikanz beurteilen können, die Verwendung von Konfidenzintervallen zur Kommunikation der Unsicherheitsgröße und die Anwendung von Bayes'schen Methoden, wo dies für explizite Zwecke geeignet ist vorherige Eingliederung und die Behandlung von p = 0,05 als grobe Richtlinie und nicht als harte binäre Schwelle. Für einige Zeitschriften und Fachgebiete gelten strengere Schwellenwerte (p < 0,005) oder sie erfordern eine Vorregistrierung für die Veröffentlichung. Die Tools des Open Science Framework unterstützen die Vorregistrierung und registrierte Berichte, die die Reproduzierbarkeitsraten in den teilnehmenden Bereichen erheblich verbessert haben.

Die Effektgröße ist genauso wichtig wie der P-Wert

Bei ausreichend großen Stichproben wird nahezu jede Abweichung von Null statistisch signifikant, da die p-Werte mit zunehmender Stichprobengröße kleiner werden, selbst wenn der zugrunde liegende Effekt gering ist. Ein p-Wert von 0,0001 für einen Cohen-d von 0,05 bedeutet, dass Sie einen echten, aber trivial kleinen Effekt haben – es lohnt sich nicht, darauf zu reagieren, obwohl er „sehr signifikant“ ist. Big-Data-Studien mit Millionen von Beobachtungen ergeben routinemäßig p < 0,001 für Effektgrößen, die real, aber klinisch oder praktisch bedeutungslos sind. Statistische Signifikanz ist nicht dasselbe wie praktische Signifikanz.

Kombinieren Sie p-Werte immer mit Effektgrößenschätzungen (Cohens d für mittlere Unterschiede, r² für Korrelationsstärke, η² oder partielles η² für ANOVA-Effektgrößen) und Konfidenzintervallen, um ein vollständiges statistisches Bild zu erhalten. Cohens d-Interpretation: 0,2 = kleiner Effekt, 0,5 = mittel, 0,8 = groß. Eine vernünftige Faustregel: Wenn Cohens d < 0,2 ist, ist der Effekt unabhängig vom p-Wert zu gering, um bei den meisten realen Entscheidungen eine Rolle zu spielen. Dieses „Ist es praktisch sinnvoll?“ Filter, der neben „Ist es statistisch signifikant?“ angewendet wird. führt zu viel besseren wissenschaftlichen und geschäftlichen Entscheidungen als p-Wert-Schwellenwerte allein. Moderne Richtlinien von APA, AMA und anderen Berufsverbänden verlangen in veröffentlichten Forschungsergebnissen zusätzlich zu den p-Werten ausdrücklich die Angabe der Effektgröße.