Statistische Aussagekraft beantwortet eine Frage, die sich jeder Forscher stellen sollte, bevor er Daten sammelt: Wenn der von mir gesuchte Effekt real ist, wie wahrscheinlich ist es, dass meine Studie ihn tatsächlich findet? Unterbewertete Studien gehören zu den häufigsten – und vermeidbarsten – Fehlern in der angewandten Forschung. Sie führen zu Ergebnissen, bei denen „kein signifikanter Unterschied“ vorliegt, bei denen es sich lediglich um „nicht genügend Daten zur Aussage“ handelt. Dieser Rechner führt die Standard-Z-Approximations-Power-Analyse für einen Zwei-Stichproben-Vergleich in beide Richtungen durch: Power aus einer geplanten Stichprobengröße oder die Stichprobengröße, die zum Erreichen einer Zielpower erforderlich ist.
So funktioniert der Rechner
Die Aussagekraft hängt von vier Faktoren ab, die gegeneinander wirken: der Effektgröße, die Sie erkennen möchten, Ihrem Signifikanzniveau (α), Ihrer Stichprobengröße und davon, ob der Test ein- oder zweiseitig ist. Wenn die anderen unverändert bleiben, steigt die Leistung mit zunehmender Effektgröße, mit zunehmender Stichprobengröße oder wenn α gelockert (weniger streng gemacht) wird. Dieser Rechner kombiniert diese vier Eingaben zu einem einzigen Nichtzentralitätsparameter – wie weit der wahre Effekt die Stichprobenverteilung von der Nullhypothese entfernt – und liest die resultierende Potenz aus der Standardnormalkurve ab. Es geht von zwei unabhängigen Gruppen gleicher Größe aus, dem gängigsten Design in vergleichender Forschung (A/B-Tests, Behandlungs-gegen-Kontroll-Studien, Vorher/Nachher-Vergleiche mit einer Kontrollgruppe).
Warum 80 % Leistung die Konvention ist
Jacob Cohens einflussreiches Lehrbuch zur Potenzanalyse aus dem Jahr 1988 schlug 80 % als vernünftigen Standardwert vor: genug Power, dass ein echter Effekt eher gefunden als übersehen wird, ohne dass eine unpraktisch große Stichprobe erforderlich ist. Diese Konvention blieb bestehen, und die meisten Zeitschriften, Fördergutachter und institutionellen Prüfungsausschüsse gehen nun davon aus, dass eine Leistung von mindestens 80 % gemeldet oder geplant wird. Einige Bereiche – insbesondere klinische Studien, bei denen ein verpasster Effekt bedeuten kann, dass eine wirksame Behandlung zurückgestellt wird – drängen stattdessen auf eine Aussagekraft von 90 % und akzeptieren die größere erforderliche Stichprobengröße als Kosten für eine niedrigere Falsch-negativ-Rate.
Grenzen und Randfälle
Dieser Rechner verwendet eine Z-Näherung, die für einigermaßen große Stichproben genau ist, die Leistung für sehr kleine Stichproben jedoch im Vergleich zu einer exakten, auf der T-Verteilung basierenden Berechnung leicht überbewertet (die Lücke schrumpft schnell, wenn n über etwa 20–30 pro Gruppe wächst). Es geht außerdem von gleichen Gruppengrößen, einem kontinuierlichen Ergebnis mit annähernd normalen Daten mit gleicher Varianz und einem Design zwischen Subjekten (unabhängigen Gruppen) aus – es ist nicht das richtige Werkzeug für Designs mit paarigen/wiederholten Messungen, Proportionen, ANOVA mit mehr als zwei Gruppen oder Regression, die jeweils ihre eigene Potenzformel haben. Behandeln Sie das Ergebnis als Planungsschätzung: Abwanderung in der Praxis, ungleiche Gruppengrößen und verletzte Annahmen reduzieren die effektive Leistung unter den vom Rechner gemeldeten Wert.