Ein kritischer Wert ist die Zahl, mit der ein Hypothesentest seine Statistik vergleicht – die Linie, die „nicht genügend Beweise“ von „Nullhypothese ablehnen“ trennt. Bevor p-Werte mithilfe von Tabellenkalkulationen und Statistiksoftware sofort berechnet werden konnten, haben Studierende und Forscher diese Zahlen in gedruckten Tabellen auf der Rückseite eines Lehrbuchs nachgeschlagen; Dieser Rechner ersetzt diese Tabellensuche durch eine exakte inverse CDF-Berechnung für jedes Alpha und jeden Freiheitsgrad über die vier Verteilungen hinweg, auf denen die meisten Hypothesentests basieren.
Was ein kritischer Wert tatsächlich darstellt
Jeder Hypothesentest reduziert Ihre Daten auf eine einzige Teststatistik und fragt dann: Wie extrem müsste diese Statistik sein, bevor sie unter der Nullhypothese unplausibel ist? Der kritische Wert ist der Schwellenwert, der so festgelegt wird, dass die Wahrscheinlichkeit, ihn rein zufällig zu überschreiten, dem von Ihnen gewählten Signifikanzniveau (α) entspricht. Es handelt sich mathematisch gesehen um die gleichen Informationen wie bei einem p-Wert, nur in die entgegengesetzte Richtung berechnet – ein p-Wert fragt „wie extrem ist meine Statistik“, während ein kritischer Wert fragt „wie extrem müsste eine Statistik sein“. In vielen Lehrbüchern und Laborkursen wird immer noch zuerst der Ansatz des kritischen Werts gelehrt, da er die Entscheidungsregel sichtbar macht, bevor Sie jemals echte Daten sehen.
Die Wahl zwischen einseitiger und zweiseitiger Variante
Zweiseitig ist die standardmäßige, konservative Standardeinstellung: Es wird auf einen Unterschied in beide Richtungen getestet, ohne vorher anzunehmen, in welche Richtung der Effekt gehen wird, sodass der Ablehnungsbereich – und der kritische Wert – in jedem Ende bei α/2 liegt. Ein einseitiger Test ist nur gültig, wenn Sie sich vor der Datenerfassung auf eine bestimmte Richtung festgelegt haben (z. B. „Der neue Prozess reduziert Fehler“). Der Wechsel zur einseitigen Methode, nachdem man gesehen hat, in welche Richtung die Daten geneigt sind, ist ein häufiger und schwerwiegender Fehler, da dadurch die tatsächliche Fehlerquote vom Typ I effektiv verdoppelt wird. Im Zweifelsfall verwenden Sie zweiseitig.
Warum vier verschiedene Distributionen
Z geht davon aus, dass Sie die Standardabweichung der Grundgesamtheit genau kennen (oder Ihre Stichprobe groß genug ist, dass die Unterscheidung kaum eine Rolle spielt). t entspannt das – es wird verwendet, wenn die Standardabweichung aus der Stichprobe selbst geschätzt wird, und es verfügt über stärkere Ausläufer, um diese zusätzliche Unsicherheit auszugleichen, und konvergiert zur Z-Verteilung, wenn die Freiheitsgrade größer werden. Das Chi-Quadrat gilt eher für Zählungen und Varianzen als für Mittelwerte, und da es nach unten durch Null begrenzt und rechtsschief ist, wird sein kritischer Wert herkömmlicherweise nur für das obere Ende angegeben. F ist das Verhältnis zweier Varianzen (oder zweier mittlerer Quadrate in der ANOVA) und benötigt zwei Freiheitsgrade – es ist nicht symmetrisch, daher benötigt ein zweiseitiger F-Test wirklich zwei unterschiedliche kritische Werte und nicht ein einzelnes ±-Paar.