Mit der Fragestellung und dem Nullmodell beginnen

Ein statistischer Test benötigt ein klar definiertes Ergebnis, eine Nullhypothese, eine Teststatistik und Annahmen dazu, wie die Daten entstanden sind. Dazu können zufällige Auswahl oder Zuteilung, Unabhängigkeit und ein geeignetes Wahrscheinlichkeitsmodell gehören.

Ein p-Wert ist die Wahrscheinlichkeit, unter diesem Nullmodell und seinen Annahmen eine Teststatistik zu erhalten, die mindestens so extrem ist wie der beobachtete Wert – in der für den Test festgelegten Richtung oder den festgelegten Richtungen.

Die American Statistical Association warnt davor, p-Werte als Wahrscheinlichkeit zu deuten, dass eine Hypothese wahr ist, oder allein anhand eines Grenzwerts wissenschaftliche oder geschäftliche Schlussfolgerungen zu ziehen.[1]

Beispiel: z-Test mit zwei Seiten

Angenommen, ein illustratives Experiment schätzt einen Behandlungsunterschied von 4 Einheiten mit einem Standardfehler von 2 Einheiten. Unter der Nullhypothese „kein Unterschied“ beträgt die z-Statistik 4 ÷ 2 = 2.

Bei einem zweiseitigen Test mit Standardnormalverteilung beträgt der p-Wert ungefähr 0,0455. Das heißt: Wenn Nullmodell und Annahmen zutreffen, läge eine Teststatistik mit einem Abstand von mindestens ±2 zum Nullwert in etwa 4,55 % der Fälle vor.

Es bedeutet nicht, dass die Nullhypothese mit einer Wahrscheinlichkeit von 4,55 % wahr ist. Ebenso wenig bedeutet es, dass die Behandlung mit einer Wahrscheinlichkeit von 95,45 % wirkt oder dass sich der Effekt in der geschätzten Größe wiederholen wird.

Ein ungefährer 95-%-Bereich aus derselben Normalrechnung lautet 4 ± 1,96 × 2, also etwa 0,08 bis 7,92 Einheiten. Diese breite Spanne ist wichtiger Kontext, auch wenn der p-Wert knapp unter 0,05 liegt.

Statistische Signifikanz ist nicht gleich praktische Bedeutung

Ein winziger Effekt kann bei einer sehr großen Stichprobe einen kleinen p-Wert ergeben. Ein möglicherweise relevanter Effekt kann bei kleiner oder stark streuender Stichprobe einen großen p-Wert haben.

Berichten Sie den Effekt in für die Entscheidung relevanten Einheiten: etwa Dollar pro Kunde, Prozentpunkte der Konversionsrate, eingesparte Stunden oder eine andere passende Größe. Geben Sie die Unsicherheit an und vergleichen Sie sie mit einer für die Fragestellung gewählten Relevanzschwelle.

Eine gut gemessene Verbesserung um 0,01 Prozentpunkte kann beispielsweise zu gering sein, um eine teure Umsetzung zu rechtfertigen. Im p-Wert stehen weder Implementierungskosten noch Abwärtsrisiko oder der Wert weiterer Belege.

„Nicht signifikant“ heißt nicht „kein Effekt“

Ein großer p-Wert bedeutet, dass die Daten nach diesem Test nicht besonders unvereinbar mit dem angegebenen Nullmodell sind. Er belegt keine Gleichheit und beweist nicht, dass ein möglicher Unterschied klein genug ist, um ihn zu ignorieren.

Um praktische Gleichwertigkeit zu begründen, müssen Sie einen akzeptablen Unterschied festlegen und ein geeignetes Äquivalenz- oder Nichtunterlegenheitsverfahren nutzen. Leiten Sie Gleichwertigkeit nicht allein daraus ab, dass ein üblicher Unterschiedstest den Grenzwert nicht überschritten hat.

Prüfen Sie das Intervall. Umfasst es sowohl einen erheblichen Vorteil als auch einen erheblichen Nachteil, kann das Experiment nicht schlüssig statt beruhigend sein.

Viele Tests und wiederholtes Nachsehen verändern die Fragestellung

Wer viele Ergebnisse oder Untergruppen prüft, erhöht die Chancen, einen scheinbar ungewöhnlichen Befund zu finden. Auch wiederholte Auswertungen eines gewöhnlichen Tests mit fester Stichprobengröße und ein Abbruch bei Signifikanz können die Fehlerwahrscheinlichkeit verändern.

Legen Sie nach Möglichkeit vorab das primäre Ergebnis, die Analyse, Stichprobengröße oder Abbruchregel und den Umgang mit Mehrfachvergleichen fest. Für laufende Entscheidungen sollte ein Verfahren zur sequenziellen Auswertung verwendet werden.

Explorative Befunde können wertvoll sein. Kennzeichnen Sie sie als explorativ und holen Sie weitere Belege ein, statt ein entdecktes Muster als ursprünglich geplanten Einzeltest darzustellen.

Ergebnis vollständig berichten

Ein hilfreicher Bericht nennt Vergleich, Stichprobe und Studiendesign, geschätzten Effekt, Unsicherheitsintervall, Test, p-Wert und wichtige Grenzen. Reduzieren Sie die Schlussfolgerung nicht auf ein grünes oder rotes Symbol.

Zum Beispiel: „Der geschätzte Unterschied betrug 4 Einheiten; das ungefähre 95-%-Intervall lag unter dem angegebenen Normalmodell zwischen 0,08 und 7,92, der zweiseitige p-Wert bei 0,0455.“ Für die Entscheidung braucht es zusätzlich Kontext zu Kosten, Datenqualität und den Folgen eines Irrtums.

Häufig gestellte Fragen

Ist der p-Wert die Wahrscheinlichkeit, dass die Nullhypothese wahr ist?

Nein. Er wird unter einem bestimmten Nullmodell berechnet und betrifft die Wahrscheinlichkeit, unter diesem Modell ein mindestens ebenso extremes Ergebnis zu erhalten.

Beweist ein p-Wert über 0,05, dass es keinen Effekt gibt?

Nein. Er kann auf geringe Präzision oder Daten zurückgehen, die mit mehreren Effektgrößen vereinbar sind. Prüfen Sie geschätzten Effekt und Unsicherheitsintervall.

Kann ich nach Sichtung des Ergebnisses von einem zweiseitigen zu einem einseitigen Test wechseln?

Das ändert die Analyse anhand der beobachteten Richtung und kann ihre Deutung verzerren. Legen Sie den passenden Test nach Möglichkeit vor der Auswertung fest.

Quellen und Berechnungshinweise

Die wichtigste Referenz ist unten verlinkt. Beispiele veranschaulichen ein Verfahren; ihre Aussagekraft hängt von Definitionen, Daten und Annahmen ab.

  1. American Statistical Association: Erklärung zu p-Werten (PDF)

Weiter zum Rechner

Wenden Sie das Gelernte an.

p-Wert-Rechner

Halten Sie Teststatistik, Testart und gegebenenfalls Freiheitsgrade bereit. Öffnen Sie anschließend den eigenständigen Rechner und berücksichtigen Sie die Annahmen und Grenzen dieses Leitfadens.

Rechner auf eigener Seite öffnen ↗