Mittelwert, Median und Modus sind die drei klassischen Maße der zentralen Tendenz in der Statistik – jedes erfasst einen anderen Aspekt dessen, was es bedeutet, dass ein Datensatz einen „typischen“ Wert hat, und zu verstehen, welcher wann verwendet werden soll, ist eine der wichtigsten praktischen Fähigkeiten in der Datenanalyse. Der Mittelwert bildet den Durchschnitt aller Werte gleichermaßen, der Median ermittelt nach der Sortierung den Mittelwert und der Modus identifiziert den häufigsten Wert. In den folgenden Abschnitten wird erläutert, wann der Mittelwert im Vergleich zum Median eine Verteilung besser darstellt (Einkommen, Wohnverhältnisse, Antwortzeiten begünstigen durchweg den Median), warum Immobilien- und Wirtschaftsstatistiken Mediane anstelle von Mittelwerten angeben, die spezifischen Fälle, in denen der Modus zur aussagekräftigsten zusammenfassenden Statistik wird, und wie sich Ausreißer auf jede Kennzahl auswirken – Wissen, das strenge Analysten von denen unterscheidet, die „durchschnittliche“ Zahlen angeben, ohne zu verstehen, was dieser Durchschnitt tatsächlich darstellt.

Mittelwert vs. Median: Welches Zentrum ist wichtig?

Der Mittelwert und der Median beschreiben beide das „Zentrum“ eines Datensatzes, sie tun dies jedoch durch grundlegend unterschiedliche mathematische Ansätze. Der Mittelwert umfasst alle Datenpunkte mit gleichem Gewicht, was ihn mathematisch elegant und nützlich für symmetrische, normalverteilte Daten macht. Der Median findet nach der Sortierung einfach den Mittelwert, wodurch er für Extremwerte unempfindlich ist und für schiefe Verteilungen bevorzugt wird, bei denen einige Ausreißer das arithmetische Mittel verzerren.

Diese Unterscheidung hat enorme Auswirkungen auf die Praxis, insbesondere in der Wirtschaftsberichterstattung. Das US-Haushaltseinkommen wird immer als Median und nicht als Mittelwert angegeben, da die Verteilung stark rechtsschief ist. Eine kleine Anzahl sehr gut verdienender Personen liegt im Mittel weit über dem Einkommen eines typischen Haushalts. Im Jahr 2023 lag das mittlere US-Haushaltseinkommen bei rund 74.000 US-Dollar, während der Durchschnitt bei über 106.000 US-Dollar lag – ein Unterschied von 43 %, der die erzählte Geschichte grundlegend verändert. Für politische Zwecke ist der Median weitaus aussagekräftiger, da er die Frage „Was verdient ein typischer Haushalt?“ beantwortet. während der Mittelwert antwortet: „Wie hoch ist der Gesamteinkommenspool, der gleichmäßig aufgeteilt wird?“ – zwei sehr unterschiedliche Fragen mit sehr unterschiedlichen Antworten bei ungleichen Einkommensverteilungen.

Hauspreise und Immobilien

Das gleiche verzerrte Verteilungsmuster tritt bei Immobilien auf und führt zu ähnlichen Unterschieden zwischen Mittelwert und Median. Ein einzelner Luxusverkauf in einer Nachbarschaft kann den durchschnittlichen Verkaufspreis dramatisch in die Höhe treiben, sodass der Markt teurer erscheint, als er für typische Käufer ist. Ein 10-Millionen-Dollar-Villenverkauf in einer Straße mit 400.000-Dollar-Häusern erhöht den Mittelwert um Zehntausende Dollar, während der Median im tatsächlichen Käuferbereich bleibt. Immobilienfachleute geben aus diesem Grund fast überall mittlere Immobilienpreise an – der Case-Shiller-Index, die Berichte der National Association of Realtors und Zillow verwenden alle standardmäßig mittlere Kennzahlen.

Der Modus – der häufigste Verkaufspreis – wird in der Immobilienberichterstattung weniger direkt verwendet, kann aber nützlich sein, um zu ermitteln, welcher Preispunkt die meiste Marktaktivität aufweist. Zu wissen, dass „die meisten Häuser in dieser Nachbarschaft zwischen 450.000 und 475.000 US-Dollar verkauft werden“, erfasst ein modeähnliches Konzept, das weder Mittelwert noch Median direkt zum Ausdruck bringt. Multiple-Peak-Verteilungen (bimodale Immobilienmärkte, auf denen Einsteigerimmobilien und Luxusimmobilien nebeneinander existieren) machen einfache zentrale Tendenzstatistiken weniger aussagekräftig, weshalb detaillierte Immobilienberichte Verteilungen häufig anhand von Histogrammen oder Preisklassenaufschlüsselungen zeigen, anstatt sich auf eine einzige zusammenfassende Zahl zu verlassen.

Wenn der Modus am wichtigsten ist

Der Modus ist für kategoriale Daten von entscheidender Bedeutung – „Welche Farbe wählen Kunden am meisten?“ oder „Welche Schuhgröße sollten wir am meisten auf Lager haben?“ – wo ein numerischer Durchschnitt bedeutungslos oder unsinnig ist. Sie können nicht das arithmetische Mittel von „Rot, Blau, Grün, Rot, Rot, Blau“ bilden – der Modus (rot, erscheint dreimal) ist die einzig sinnvolle Zusammenfassung. Bestandsplanung, Umfrageanalyse, Wählerpräferenzdaten und jede Datenanalyse mit diskreter Wahl hängen stark von Modalstatistiken ab.

Für numerische Daten wird der Modus am interessantesten, wenn eine Verteilung multimodal ist. Ein bimodaler Datensatz (zwei klare Peaks) signalisiert häufig zwei unterschiedliche Untergruppen, die in einem Datensatz zusammengefasst sind. Eine Umfrage zum Alter bei einer Universitätsveranstaltung könnte Spitzenwerte bei 20 (Studenten) und 50 (Lehrkräfte) ergeben; Wenn man sie als einzelne Verteilung analysiert, geht die Zwei-Populations-Struktur völlig verloren. Die Daten zu den Kundenausgaben zeigen häufig eine bimodale Struktur mit einem Spitzenwert bei Gelegenheitskäufern mit geringem Wert und einem Spitzenwert bei Power-Usern mit hohem Wert, die unterschiedliche Bindungsstrategien erfordern. Das Erkennen von Multimodalität in einem Histogramm ist oft aussagekräftiger als jede einzelne zusammenfassende Statistik (Mittelwert, Median oder sogar Varianz), da es verborgene Strukturen in den Daten aufdeckt, die sich darauf auswirken, wie Sie sie analysieren und darauf reagieren sollten. Visualisieren Sie immer, bevor Sie zusammenfassende Statistiken berechnen. Wenn Sie zwei Peaks sehen, teilen Sie die Daten auf und analysieren Sie die Untergruppen separat.

Das Ausreißerproblem

Ausreißer – Werte, die weit von der Masse der Daten entfernt sind – verzerren den Mittelwert erheblich, wirken sich aber kaum auf den Median aus. Ein Datensatz von {1, 2, 3, 4, 5} hat einen Mittelwert von 3 und einen Median von 3; Durch Hinzufügen eines einzelnen Ausreißers von 100 ändert sich der Mittelwert auf 19,2, der Median jedoch nur auf 3,5. Ausreißer erhöhen auch den Bereich (maximal – minimal) dramatisch, während sie den IQR kaum beeinflussen (mittlere 50 %-Spanne). Aus diesem Grund werden robuste Statistiken (Median, IQR, MAD) gegenüber nicht robusten Statistiken (Mittelwert, Bereich, SD) bevorzugt, wann immer Ausreißer möglich sind.

Wenn Ausreißer in Ihren Daten auftauchen, hängt die richtige Reaktion von ihrer Ursache ab. Wenn ein Ausreißer einen Dateneingabefehler oder ein Messartefakt darstellt, ist es angebracht, ihn zu korrigieren oder zu entfernen (dokumentieren Sie immer, was Sie getan haben). Wenn es sich bei dem Ausreißer um einen echten Datenpunkt handelt – ein echter Gutverdiener in einer Einkommensumfrage, ein echter Extremwert in einem Sensorprotokoll – besteht die richtige Reaktion darin, sowohl den Mittelwert als auch den Median anzugeben, die Ausreißer explizit zu notieren und zu überlegen, ob die Ausreißer ein separates Phänomen darstellen, das es wert ist, für sich genommen untersucht zu werden. Ausreißerbedingte Anomalien signalisieren oft die interessantesten Geschichten in einem Datensatz; Werden sie als lästig abgetan, gehen wertvolle Informationen verloren. Visualisieren Sie immer mit einem Boxplot oder Histogramm, um auf Ausreißer zu prüfen, bevor Sie sich für eine einzelne zusammenfassende Statistik entscheiden.