Das Testen von Hypothesen ist das formale Verfahren, mit dem Wissenschaftler entscheiden, ob beobachtete Effekte in Stichprobendaten real sind oder nur Stichprobenrauschen. Die fünf Tests, die dieser Rechner unterstützt – t bei einer Stichprobe, t bei zwei Stichproben (Welch), gepaartes t, Chi-Quadrat-Anpassungsgüte und Chi-Quadrat-Unabhängigkeit – decken die überwiegende Mehrheit der Anwendungsfälle für einführende und angewandte Statistik ab. Zu verstehen, wann welcher Test zu verwenden ist, was der p-Wert tatsächlich bedeutet und warum neben der Signifikanz auch die Effektgröße eine Rolle spielt, unterscheidet kompetente statistische Praxis vom Cargo-Kult-Ritual.
Den richtigen Test auswählen
Drei Fragen wählen den Test für Sie aus. Vergleichen Sie zunächst Mittelwerte (kontinuierliche numerische Daten) oder Anzahlen (kategoriale Daten)? Mittel → t-Test-Familie; zählt → Chi-Quadrat-Familie. Zweitens: Wie viele Gruppen? Eine Probe im Vergleich zu einer bekannten Referenz → Ein-Probe-t. Zwei unabhängige Gruppen → Welch t mit zwei Stichproben. Zwei verwandte Messungen an denselben Probanden (vorher/nachher, Zwillingspaare) → gepaarte t. Drittens: Wie ist die Struktur der kategorialen Daten? Eine Variable mit k Kategorien → Chi-Quadrat-Anpassungsgüte. Zwei Variablen in einer 2×2-Kontingenztabelle → Chi-Quadrat-Unabhängigkeit. Das Flussdiagramm ist mechanisch, sobald Sie die Fragen verinnerlicht haben. Zu den häufigsten Fehlern von Schülern gehören die Verwendung eines t-Tests für Prozentsätze (bei denen es sich um Proportionen und nicht um Mittelwerte handelt – normalerweise ist ein Chi-Quadrat-Test oder ein Proportionstest erforderlich) und die Verwendung eines gepaarten t-Tests für unabhängige Stichproben (wobei die statistische Aussagekraft ohne Nutzen verloren geht).
p-Werte bedeuten nicht das, was die Leute denken
Der häufigste Interpretationsfehler in der Statistik besteht darin, den p-Wert als „die Wahrscheinlichkeit, dass H₀ wahr ist“ oder „die Wahrscheinlichkeit, dass das Ergebnis auf Zufall zurückzuführen ist“ zu behandeln. Beides ist nicht richtig. Der p-Wert ist die Wahrscheinlichkeit, Daten zu beobachten, die mindestens so extrem sind wie Ihre, angenommen, dass H₀ wahr ist. Dies setzt voraus, dass die Null wahr ist, und gibt keine Auskunft darüber, ob die Null wahr ist. Kleine p-Werte stellen einen Beweis gegen H₀ dar – ein starker Beweis dafür, dass die Daten unter Null unwahrscheinlich sind – aber sie quantifizieren nicht, wie wahrscheinlich H₀ ist. Ein p von 0,04 bedeutet nicht „eine Wahrscheinlichkeit von 4 %, dass die Null richtig ist“; Die Wahrscheinlichkeit, Daten dieser Größenordnung zu sehen, liegt bei 4 %, wenn die Null richtig ist. Aus diesem Grund legen moderne Statistiken neben p-Werten auch Wert auf Effektgrößen: Ein kleiner, aber statistisch signifikanter Unterschied (p = 0,001, d = 0,05) ist real, aber trivial klein; Ein großer, aber nicht signifikanter Unterschied (p = 0,12, d = 0,6) ist zwar aussagekräftig, aber nicht aussagekräftig. Melden Sie beide Nummern.
Warum Welch's t besser ist als Student's t
In den meisten einführenden Lehrbüchern wird der „Student's Pooled T-Test“ immer noch als Standardvergleich für zwei Stichproben angegeben, wobei die Welch-Anpassung als Ausnahmefall für „ungleiche Varianzen“ gezeigt wird. Die moderne Statistik hat diesen Rat umgekehrt: Der T-Test von Welch sollte die Standardeinstellung sein, da die Annahme gleicher Varianzen (die Homoskedastizitätsannahme, auf der der gepoolte Test von Student beruht) in der Praxis selten erfüllt wird und der gepoolte Test bei Verstößen zu überhöhten Falsch-Positiv-Raten führt. Die Welch-Anpassung verwendet die Welch-Satterthwaite-Näherung für df und berechnet den Standardfehler ohne Pooling, wodurch nahezu korrekte Typ-I-Fehlerraten entstehen, unabhängig davon, ob die Varianzen gleich sind. Aus diesem Grund wurde die R-Sprache in t.test() auf Welchs Standardsprache umgestellt; SciPy und die meisten modernen Tools machen jetzt dasselbe. Sofern Sie keinen bestimmten theoretischen Grund haben, Varianzen zu bündeln, verwenden Sie die Methode von Welch – es entstehen im Grunde keine Kosten, wenn die Varianzen gleich sind, und ein echter Vorteil, wenn sie nicht gleich sind.
Chi-Quadrat-Vorbehalte
Die Chi-Quadrat-Näherung beruht darauf, dass die erwartete Zellzahl groß genug ist, dass die diskrete Stichprobenverteilung der Zählungen durch die kontinuierliche Chi-Quadrat-Verteilung gut angenähert wird. Die Standardregel: Jede erwartete Zellzahl sollte mindestens 5 betragen; Einige Referenzen lockern dies auf „mindestens 80 % der Zellen ≥ 5 und keine unter 1“. Kontingenztabellen mit geringer Dichte (Zählungen ≤ 5 in mehreren Zellen) erfordern entweder den genauen Fisher-Test (für 2×2) oder einen Monte-Carlo-Permutationstest (für größere Tabellen) – die Anwendung von Chi-Quadrat ergibt ohnehin unzuverlässige p-Werte. Der Rechner kennzeichnet Verstöße gegen die Regel für die erwartete Anzahl mit einer Warnung; Behandeln Sie den resultierenden p-Wert als ungefähren Wert, wenn er angezeigt wird. Speziell für 2×2-Tabellen wird manchmal die Kontinuitätskorrektur von Yates angewendet, um die Näherung leicht zu verbessern, obwohl die moderne Praxis oft Fisher's Exact für jeden 2×2-Fall bevorzugt, wenn die Rechenkosten dies zulassen.