Deskriptive Statistiken fassen die Form, das Zentrum und die Ausbreitung eines Datensatzes zusammen, bevor mit inferenziellen Tests begonnen wird. Der Mittelwert und der Median verraten Ihnen, wo sich die Daten befinden, aber anhand der Varianz, der Schiefe, der Kurtosis, des Konfidenzintervalls und der Ausreißerdiagnose können Sie entscheiden, ob die Zusammenfassung vertrauenswürdig ist und welche nachfolgenden Analysen angemessen sind. In den folgenden Abschnitten werden die vier Entscheidungen behandelt, die jeder Analyst trifft, wenn er nach deskriptiven Statistiken greift: Wahl zwischen Stichproben- und Grundgesamtheitsformeln, korrekte Interpretation von Konfidenzintervallen, Deutung von Schiefe und Wölbung als Verteilungsdiagnose und Auswahl der richtigen Ausreißerregel für Ihre Daten.

Wann sind Stichproben- und Grundgesamtheitsformeln zu verwenden?

Der häufigste Fehler bei der Einführung in die Statistik besteht darin, die Stichproben- und Grundgesamtheitsformeln für Varianz und Standardabweichung zu verwechseln. Die Beispielformel dividiert durch n − 1 (Bessel-Korrektur); die Bevölkerungsformel dividiert durch n. Verwenden Sie die Populationsversion, wenn Ihre Daten die gesamte Gruppe abdecken, die Ihnen am Herzen liegt – jeden Mitarbeiter auf einer Gehaltsabrechnung, jede Transaktion in einem Geschäftsjahr, jeden Studenten auf einem Dienstplan. Verwenden Sie die Beispielversion immer dann, wenn es sich bei Ihren Daten um eine Teilmenge handelt und Sie Rückschlüsse auf eine größere Gruppe ziehen möchten.

Warum n − 1? Da der Stichprobenmittelwert selbst eine Schätzung ist, ist die Summe der quadratischen Abweichungen vom Stichprobenmittelwert etwas kleiner als die Summe der quadrierten Abweichungen vom unbekannten wahren Mittelwert. Die Division durch n − 1 gleicht diese Verzerrung aus. Die Korrektur ist kaum wahrnehmbar, wenn n groß ist (n = 100 gegenüber n = 99 ändert die Antwort um 1 %), aber bei kleinen Stichproben ist es wichtig: Eine Stichprobe mit 5 Werten ergibt eine um 25 % höhere Varianz unter der Stichprobenformel als unter der Grundgesamtheitsformel. Wenn Sie sich nicht sicher sind, verwenden Sie standardmäßig die Stichprobe. Dies ist die konservative Wahl, wenn Ihre Daten aus einem Prozess oder einer Grundgesamtheit erfasst wurden.

Wie Konfidenzintervalle tatsächlich funktionieren

Ein 95 %-Konfidenzintervall für den Mittelwert ist ein Bereich, der – über viele wiederholte Stichproben aus derselben Grundgesamtheit hinweg – in etwa 95 % der Fälle den wahren Mittelwert enthalten würde. Er wird als x̄ ± t × (s / √n) berechnet, wobei t aus der Student-t-Verteilung auf dem gewählten Konfidenzniveau und df = n − 1 stammt. Bei großen Stichproben (n ≥ 30) ist der t-Wert im Wesentlichen der z-Wert: 1,645 für 90 %, 1,960 für 95 %, 2,576 für 99 %. Bei kleinen Stichproben ist t größer, um die zusätzliche Unsicherheit bei der Schätzung der Populations-SD aus einer kleinen Stichprobe zu kompensieren.

Eine häufige Fehlinterpretation besteht darin, zu sagen, dass der wahre Mittelwert mit einer Wahrscheinlichkeit von 95 % innerhalb eines von Ihnen berechneten KI liegt. Das garantiert das Verfahren nicht – sobald Sie ein bestimmtes Intervall berechnet haben, ist der wahre Mittelwert entweder darin enthalten oder nicht. Das Verfahren garantiert, dass die langfristige Rate der Intervalle, die den wahren Mittelwert enthalten, 95 % beträgt. Aus praktischen Gründen führen die beiden Interpretationen zu ähnlichen Entscheidungen, aber Bayesianische Glaubwürdigkeitsintervalle (die die Interpretation „Wahrscheinlichkeit, dass der Mittelwert in diesem Bereich liegt“ unterstützen) erfordern einen anderen Rahmen.

Eine Erhöhung des Konfidenzniveaus erweitert das Intervall. 99 %-Konfidenzintervalle sind etwa 30 % breiter als 95 %-Konfidenzintervalle bei gleicher Stichprobengröße – der Preis für mehr Vertrauen ist eine geringere Präzision. Der andere Hebel ist die Stichprobengröße: Eine Verdoppelung von n schrumpft das KI um den Faktor √2 ≈ 1,41.

Schiefe und Kurtosis als Verteilungsdiagnostik

Schiefe misst Asymmetrie. Eine Schiefe nahe Null zeigt an, dass die Verteilung ungefähr symmetrisch um den Mittelwert ist – ein gutes Zeichen dafür, dass Mittelwert und Median übereinstimmen. Eine positive Schiefe signalisiert einen langen rechten Schwanz (der Mittelwert wird durch extrem hohe Werte über den Median gezogen); Eine negative Schiefe signalisiert einen langen linken Schwanz. Als Faustregel gilt: |skew| < 0,5 ist symmetrisch genug, dass der Mittelwert ein vernünftiges Maß für die Mitte darstellt; |schief| > 1 legt nahe, dass der Median eine bessere Zusammenfassung ist.

Übermäßige Kurtosis misst die Schwanzschwere im Vergleich zu einer Normalverteilung. Positive überschüssige Kurtosis (leptokurtic) bedeutet, dass die Verteilung häufiger Extremwerte erzeugt als eine Glockenkurve – häufig bei finanziellen Erträgen, Netzwerklatenz und Reaktionszeiten. Eine negative übermäßige Kurtosis (Platykurtic) bedeutet, dass die Verteilung hellere Ausläufer als normal hat – gleichmäßige Verteilungen sind ein extremes Beispiel. Eine übermäßige Kurtosis nahe Null steht im Einklang mit der Normalität, beweist sie aber nicht; Schauen Sie sich für eine formale Überprüfung ein Q-Q-Diagramm an oder führen Sie einen Shapiro-Wilk-Test durch.

Beide Statistiken reagieren empfindlich auf Ausreißer, insbesondere bei kleinen Stichproben. Ein einzelner Extremwert kann eine nahezu symmetrische Verteilung in eine mit einer Schiefe > 1 umwandeln. Überprüfen Sie immer das Histogramm neben diesen Zusammenfassungen – die Zahlen sind diagnostisch und nicht endgültig.

Welche Ausreißerregel verwendet werden soll

Die 1,5×IQR-Regel (Tukey-Zäune) kennzeichnet jeden Wert unter Q1 − 1,5×IQR oder über Q3 + 1,5×IQR. Es ist aus zwei Gründen die richtige Standardeinstellung. Erstens werden Quartile verwendet, die von Extremwerten nicht beeinflusst werden – die Regel lässt also nicht zu, dass Ausreißer andere Ausreißer maskieren. Zweitens funktioniert es bei verzerrten Daten, da sich die Zäune an die Form der Daten anpassen, anstatt eine Symmetrie anzunehmen.

Die Z-Score-Regel (|z| ≥ 2 oder 3) ist bekannter, weist jedoch zwei Einschränkungen auf. Es wird davon ausgegangen, dass die Daten annähernd normal sind: Unter dieser Annahme sollten nur etwa 5 % der Werte |z| haben ≥ 2 und 0,3 % sollten |z| haben ≥ 3, daher ist alles über diesen Schwellenwerten verdächtig. Bei stark verzerrten Daten schlägt die Regel jedoch fehl – ​​die Hälfte der Werte in einer logarithmischen Normalverteilung können gemäß der Z-Score-Definition „Ausreißer“ sein. Die zweite Einschränkung ist subtiler: Ein paar extreme Ausreißer erhöhen den Mittelwert und die Standardabweichung, wodurch moderate Ausreißer schwieriger zu erkennen sind (sogenanntes Maskierungsproblem).

Dieser Rechner meldet beide Regeln, sodass Sie sehen können, wann sie übereinstimmen und wann sie abweichen. Wenn sie zustimmen, haben Sie gute Gründe, die gemeldeten Werte zu untersuchen oder zu entfernen. Wenn sie anderer Meinung sind – normalerweise markiert die IQR-Regel mehr Werte bei verzerrten Daten – bevorzugen Sie die IQR-Regel und überlegen Sie, ob Ihre Daten vor der weiteren Analyse eine Protokolltransformation benötigen. Was auch immer Sie tun, dokumentieren Sie immer den Umgang mit Ausreißern: Das Entfernen von Werten ist eine Forschungsentscheidung, die sich auf alle nachgelagerten Statistiken auswirkt.