Der F-Test beantwortet eine enger gefasste Frage als ein T-Test: nicht, ob zwei Stichproben unterschiedliche Durchschnittswerte aufweisen, sondern ob sie unterschiedliche Streuungen aufweisen. Das allein ist wichtig – inkonsistente Ausgabe, verrauschte Messungen und instabile Prozesse sind alles „Varianz“-Probleme – und es ist auch der Test, den viele Lehrbücher vor einem Zwei-Stichproben-t-Test empfehlen, um zu entscheiden, ob gleiche Varianzen angenommen werden sollen.

Was die F-Statistik misst

Die F-Statistik ist einfach das Verhältnis zweier Stichprobenvarianzen. Bei einem zweiseitigen Test – der standardmäßigen, konservativen Wahl – setzt der Rechner immer die größere Varianz oben, sodass F immer ≥ 1 ist: Ein Wert nahe 1 bedeutet, dass die beiden Stichproben eine ähnliche Streuung aufweisen, während ein großes F bedeutet, dass eine Stichprobe erheblich variabler ist als die andere. Da der Test symmetrisch ist (jede Gruppe könnte die lautere sein), verdoppelt der zweiseitige p-Wert die obere Wahrscheinlichkeit dieses Verhältnisses.

Aus Daten vs. aus Abweichungen

Wenn Sie über die Rohmessungen verfügen, verwenden Sie die Registerkarte „Aus Daten“ – der Rechner berechnet die Stichprobenvarianz jeder Gruppe (unter Verwendung des Standardteilers n − 1) automatisch. Wenn Sie bereits über zusammenfassende Statistiken verfügen – beispielsweise aus einem Laborbericht oder einer früheren Analyse – verwenden Sie die Registerkarte „Aus Varianzen“ und geben Sie die Varianz und den Stichprobenumfang jeder Gruppe direkt ein. Beide Pfade speisen die gleiche zugrunde liegende F-Test-Mathematik ein.

Einseitig vs. zweiseitig und was der F-Test voraussetzt

Zweiseitig ist die Standardeinstellung: Es wird getestet, ob sich die Varianzen in beide Richtungen unterscheiden, ohne vorher anzunehmen, welche Gruppe stärker verrauscht ist. Ein einseitiger Test ist nur gültig, wenn Sie sich vor dem Anzeigen der Daten auf eine bestimmte Richtung festgelegt haben (z. B. „Methode 1 ist lauter als Methode 2“) – er verwendet das Verhältnis genau wie eingegeben, anstatt es neu anzuordnen, um die größere Varianz an die Spitze zu setzen. Beim klassischen F-Test wird davon ausgegangen, dass beide Stichproben aus normalverteilten Populationen stammen. Es reagiert ziemlich empfindlich auf diese Annahme. Behandeln Sie daher bei eindeutig nicht normalen Daten (starke Abweichung oder Ausreißer) einen grenzwertigen p-Wert mit Vorsicht und ziehen Sie eine robustere Alternative wie den Levene-Test in Betracht.