Ein p-Wert sagt Ihnen, ob ein Unterschied zwischen zwei Gruppen wahrscheinlich real und kein zufälliges Rauschen ist. Es sagt nichts darüber aus, wie groß dieser Unterschied ist. Die Effektgröße – am häufigsten Cohens d – füllt diese Lücke, indem sie die Größe eines Unterschieds auf eine standardisierte, vergleichbare Skala setzt. In diesem Leitfaden wird erläutert, wie Cohens d berechnet wird, warum die Standardabweichung zusammengefasst wird und wann stattdessen nach Hedges' g gegriffen werden sollte. Konfidenzintervalle sind Näherungswerte. Bei Etiketten im Cohen-Stil handelt es sich um grobe Referenzkonventionen, nicht um universelle Standards von praktischer Bedeutung. Die Ergebnisse gehen von unabhängigen Beobachtungen, Stichprobenstandardabweichungen, vergleichbaren Skalen und annähernd kontinuierlichen Ergebnissen aus; Gepaarte Daten, stark ungleiche Varianzen, verzerrte Ergebnisse oder ordinale Daten erfordern eine für dieses Design geeignete Methode. Die Methode folgt Cohen (1988) und Hedges und Olkin (1985).

Cohens d vs. p-Wert

Ein p-Wert antwortet: „Könnte dieser Unterschied zufällig entstanden sein?“ – Es handelt sich um eine Aussage über die statistische Signifikanz, die stark von der Stichprobengröße abhängt. Bei einer ausreichend großen Stichprobe kann selbst ein trivial kleiner, praktisch bedeutungsloser Unterschied zu einem winzigen p-Wert führen. Cohens d beantwortet eine andere Frage: „Wie groß ist dieser Unterschied, und zwar unabhängig davon, wie viele Personen an der Studie teilgenommen haben?“ Ein d von 0,1 bleibt ein d von 0,1, unabhängig davon, ob die Studie 20 oder 20.000 Teilnehmer hatte. Die Angabe beider Faktoren – statistische Signifikanz und Effektgröße – ergibt ein vollständiges Bild: Ist der Effekt real und spielt er eine Rolle?

Warum die Standardabweichung bündeln?

Cohens d standardisiert die rohe Mittelwertdifferenz, indem es sie durch eine Standardabweichung dividiert, sodass das Ergebnis in „wie viele Standardabweichungen auseinander“ und nicht in den ursprünglichen Einheiten (Punkte, Dollar, Millisekunden) ausgedrückt wird. Da zwei unabhängige Gruppen unterschiedliche Standardabweichungen haben können, verwendet Cohens d eine gepoolte Standardabweichung – einen gewichteten Durchschnitt der Streuung beider Gruppen, wobei der Beitrag jeder Gruppe durch ihre Stichprobengröße (insbesondere n − 1, ihre Freiheitsgrade) gewichtet wird. Dies setzt voraus, dass die zugrunde liegende Variabilität der beiden Gruppen einigermaßen ähnlich ist; Wenn die Streuung einer Gruppe deutlich größer ist als die der anderen, bevorzugen einige Forscher das Glass-Delta, das nur durch die Standardabweichung der Kontrollgruppe dividiert, statt einer gepoolten Zahl.

Wann sollte Hedges' g anstelle von d verwendet werden?

Cohens d weist einen bekannten Bias bei kleinen Stichproben auf – er tendiert dazu, die wahre Größe des Populationseffekts leicht zu überschätzen, wenn die Stichproben klein sind. Hedges' g wendet einen Korrekturfaktor an, der immer etwas kleiner als 1 ist, der d zum Ausgleich gegen Null schrumpft. Die Korrektur ist bei kleinen Stichproben am größten und geht in Richtung Null zurück, wenn die kombinierte Stichprobengröße etwa 50 überschreitet, wobei d und g an den Punkten nahezu identisch sind. Als Faustregel gilt: Geben Sie Hedges' g anstelle oder neben Cohens d an, wenn eine der Gruppen weniger als etwa 20 Beobachtungen hat, was in Pilotstudien und kleinen klinischen Studien üblich ist.