Ein t-Test beantwortet eine Frage: Ist der von Ihnen beobachtete Unterschied – zwischen einer Stichprobe und einem Ziel, zwischen zwei Gruppen oder zwischen gepaarten Vorher-/Nachher-Messungen – größer, als zufälliges Stichprobenrauschen erzeugen würde? Dieser Rechner führt alle drei gängigen Varianten aus zusammenfassenden Statistiken aus, die Sie bereits haben (Mittelwerte, Standardabweichungen, Stichprobengrößen), sodass Sie keine Rohdaten oder Statistiksoftware benötigen.

Welchen T-Test benötige ich?

Verwenden Sie den Ein-Stichproben-Test, wenn Sie den Durchschnitt einer einzelnen Gruppe mit einem bekannten oder hypothetischen Wert (einer Spezifikation, einem historischen Durchschnitt, einem behaupteten Bevölkerungsmittelwert) vergleichen. Verwenden Sie den Zwei-Stichproben-Test, wenn Sie zwei separate, unabhängige Gruppen haben und wissen möchten, ob sich ihre Mittelwerte unterscheiden. Dieser Rechner verwendet die Welch-Version, bei der nicht davon ausgegangen wird, dass die beiden Gruppen die gleiche Varianz aufweisen, und die in der Praxis die sicherere Standardeinstellung ist. Verwenden Sie den gepaarten Test, wenn dieselben Probanden zweimal gemessen wurden (vorher/nachher, links/rechts, vor/nach) – durch die Paarung wird die Variabilität zwischen Probanden beseitigt, sodass der Test empfindlicher auf einen tatsächlichen Effekt reagiert.

Lesen der t-Statistik, der Freiheitsgrade und des p-Werts

Die t-Statistik misst, wie viele Standardfehler die beobachtete Differenz von Null (oder von µ₀ für den Test mit einer Stichprobe) trennen – je größer der absolute Wert, desto weniger kompatibel sind die Daten mit der Nullhypothese, dass es keine Differenz gibt. Freiheitsgrade (df) spiegeln wider, wie viele unabhängige Informationen in die Schätzung der Variabilität eingeflossen sind; Für den Test mit einer Stichprobe und den gepaarten Tests gilt df = n − 1, während der Welch-Test mit zwei Stichproben die Welch-Satterthwaite-Formel verwendet, die normalerweise einen nicht ganzzahligen df zwischen den beiden Gruppengrößen ergibt. Der p-Wert wandelt (t, df) in eine Wahrscheinlichkeit um: Es handelt sich um die Chance, eine t-Statistik dieses Extrems (oder mehr) zu sehen, wenn die Nullhypothese tatsächlich wahr wäre. Vergleichen Sie es mit Ihrem Signifikanzschwellenwert α (konventionell 0,05) – p < α bedeutet, die Nullhypothese abzulehnen, p ≥ α bedeutet, dass Sie nicht genügend Beweise dafür haben.

Einseitig vs. zweiseitig und was die Annahmen bedeuten

Zweiseitig ist der standardmäßige, konservative Standardwert – er testet, ob die Differenz in beide Richtungen signifikant von Null abweicht. Ein einseitiger Test macht nur dann Sinn, wenn Sie sich vor der Datenerfassung auf eine bestimmte vorhergesagte Richtung festgelegt haben; Dadurch wird der p-Wert für dieselbe t-Statistik halbiert, was es einfacher macht, eine Signifikanz zu finden und im Nachhinein leichter zu missbrauchen. Bei allen hier aufgeführten Varianten wird davon ausgegangen, dass die zugrunde liegenden Daten annähernd normalverteilt sind (oder die Stichprobe groß genug ist, um den zentralen Grenzwertsatz anzuwenden) und dass die Beobachtungen innerhalb jeder Gruppe unabhängig sind. Behandeln Sie bei kleinen, stark verzerrten Stichproben einen grenzwertigen p-Wert mit Vorsicht und ziehen Sie eine nichtparametrische Alternative in Betracht.