Eine Häufigkeitsverteilung organisiert rohe, ungeordnete Daten in einer Tabelle, die zeigt, wie oft jeder Wert – oder Wertebereich – auftritt. Es ist der erste Schritt in fast jedem Einführungsworkflow in die Statistik und verwandelt eine Zahlenwand in eine Zusammenfassung, die Sie tatsächlich lesen, grafisch darstellen und aus der Sie Schlussfolgerungen ziehen können.
Nicht gruppierte vs. gruppierte Daten
Ungruppierte Häufigkeitsverteilungen listen jeden einzelnen Wert im Datensatz zusammen mit der Häufigkeit seines Auftretens auf. Sie funktionieren gut für kleine Datensätze oder Daten mit einer begrenzten Anzahl sich wiederholender Werte – wie zum Beispiel beim Zählen, wie viele Schüler jede mögliche Note in einem 10-Punkte-Quiz erreicht haben.
Gruppierte Häufigkeitsverteilungen sortieren Daten stattdessen in gleich breite Bereiche (Klassen), was wichtig ist, wenn die Daten einen großen Bereich meist eindeutiger Werte abdecken – wie Testergebnisse von 100, Alter in einer Population oder kontinuierliche Messungen. Beim Gruppieren geht etwas Präzision verloren (Sie verlieren den genauen Wert jedes Datenpunkts) zugunsten der Lesbarkeit.
Auswahl der Anzahl der Klassen
Zu wenige Klassen und die Verteilung verbirgt nützliche Details – alles wird in ein oder zwei Balken zusammengefasst. Bei zu vielen Klassen wird die Verteilung verrauscht, da viele Klassen nur einen oder keinen Datenpunkt enthalten. Die Sturges-Regel (k = ⌈log₂(n) + 1⌉) und die √n-Regel (k = ⌈√n⌉) sind zwei weit verbreitete Ausgangspunkte, die beide die Klassenanzahl mit der Größe des Datensatzes skalieren.
Keine der Regeln ist eine harte Anforderung – es handelt sich um Heuristiken. Wenn Ihr Histogramm zu flach oder zu spitz aussieht, passen Sie die Klassenanzahl nach oben oder unten an und beobachten Sie, wie sich die Form ändert.
Relative und kumulative Häufigkeit lesen
Die relative Häufigkeit (f/n) stellt die Anzahl der einzelnen Klassen als Anteil am Ganzen dar, was den Vergleich von Datensätzen unterschiedlicher Größe ermöglicht. Die kumulative Häufigkeit verfolgt eine laufende Summe durch die Klassen und beantwortet Fragen wie „Wie viele Datenpunkte liegen auf oder unter diesem Wert?“ – die Grundlage für die Berechnung von Perzentilen und Quartilen aus gruppierten Daten.
Grenzen und Randfälle
Das Gruppieren von Daten in Klassen ist eine Zusammenfassung und kein Ersatz für die Rohdaten – sobald sie gruppiert sind, geht der genaue Wert jedes Datenpunkts innerhalb einer Klasse verloren (weshalb Klassenmittelpunkte als Näherungswert für weitere Berechnungen verwendet werden, wie zum Beispiel die Schätzung des Mittelwerts gruppierter Daten). Bei sehr kleinen Datensätzen (unter etwa 10 Werten) sollten Sie den Modus „Ungruppiert“ verwenden oder die Rohwerte direkt melden, da die Gruppierung kleiner Stichproben mehr verschleiern als aufdecken kann.