Varianz beantwortet eine einfache Frage: Wie verteilt sind Ihre Daten? – Die genaue Formel hängt jedoch davon ab, ob Sie eine gesamte Population oder nur eine Stichprobe davon betrachten. Dieser Rechner berechnet beides, geht jeden Schritt durch und erklärt, warum die beiden Antworten nie ganz gleich sind.

Wie die Varianz berechnet wird

Varianz beginnt mit dem Mittelwert und misst dann, wie weit jeder Wert davon entfernt ist. Eine einfache Mittelung dieser Abstände würde sich aufheben – ein Wert von 3 unter dem Mittelwert und ein Wert von 3 darüber summieren sich zu Null –, sodass die Varianz zuerst jede Abweichung quadriert. Dies hat auch zur Folge, dass große Abweichungen stärker gewichtet werden als kleine, weshalb ein einzelner Ausreißer die Varianz stark ansteigen lassen kann. Die quadrierten Abweichungen werden zur Quadratsumme (SS) summiert und diese Summe wird entweder durch N (Grundgesamtheit) oder n − 1 (Stichprobe) dividiert, um die endgültige Varianz zu erhalten. Die Standardabweichung, die Quadratwurzel der Varianz, wandelt die Antwort wieder in die gleichen Einheiten wie die Originaldaten um, weshalb es sich normalerweise um die Zahl handelt, die neben einem Mittelwert angegeben wird.

Warum sich die Stichprobenvarianz durch n − 1 teilt

Wenn Sie nur über eine Stichprobe verfügen, kennen Sie den wahren Mittelwert der Grundgesamtheit nicht – Sie verwenden stattdessen den Mittelwert der Stichprobe. Der Mittelwert einer Stichprobe liegt jedoch im Durchschnitt etwas näher an ihren eigenen Datenpunkten als der wahre Mittelwert der Grundgesamtheit, was die Summe der quadratischen Abweichungen etwas zu klein macht. Die Division durch n − 1 anstelle von n (eine nach dem Statistiker Friedrich Bessel benannte Korrektur) erhöht das Ergebnis gerade so weit, dass diese Verzerrung ausgeglichen wird, sodass die Stichprobenvarianz eine unverzerrte Schätzung der wahren Populationsvarianz ist. Der Unterschied ist bei kleinen Stichproben am stärksten ausgeprägt – bei nur einer Handvoll Datenpunkten ändert die Division durch n − 1 anstelle von n die Antwort merklich; Bei Hunderten von Punkten wird der Unterschied vernachlässigbar.

Wann sollte man Varianz vs. Standardabweichung verwenden?

Varianz ist die mathematisch grundlegende Größe – sie ist es, aus der die meisten statistischen Formeln (Konfidenzintervalle, Hypothesentests, ANOVA) direkt aufgebaut werden – aber ihre quadrierten Einheiten erschweren eine intuitive Interpretation. Wenn Ihre Daten in Dollar vorliegen, wird die Abweichung in Dollar zum Quadrat angegeben, was in der realen Welt keine aussagekräftige Einheit darstellt. Die Standardabweichung löst dieses Problem, indem sie die Quadratwurzel zieht und die Spanne auf die ursprünglichen Einheiten zurücksetzt. In der Praxis geben die meisten Leute die Standardabweichung zur besseren Lesbarkeit an und verwenden die Varianz intern für weitere Berechnungen.