Der Mann-Whitney-U-Test (auch Wilcoxon-Rangsummentest genannt) prüft, ob sich zwei unabhängige Gruppen unterscheiden, ohne davon auszugehen, dass eine der beiden Gruppen einer Normalverteilung folgt. Es funktioniert ausschließlich auf Rangstufen und ist daher die standardmäßige nichtparametrische Alternative zum t-Test bei unabhängigen Stichproben, wenn Ihre Daten verzerrt, ordinal oder zu klein sind, um einer Normalitätsannahme zu vertrauen.
So funktioniert der Rang-Summen-Ansatz
Der Test beginnt damit, dass jeder Wert aus beiden Gruppen in einer Liste zusammengefasst und vom kleinsten zum größten in eine Rangfolge gebracht wird. Der Rang eines Werts hat nichts damit zu tun, aus welcher Gruppe er stammt, bis die Rangfolge erstellt wurde. Sobald die Rangfolge erreicht ist, wird die Summe der Ränge, die in Gruppe 1 (R₁) gelandet sind, in U₁ = R₁ − n₁(n₁+1)/2 umgewandelt, was als die Anzahl der in dieser Rangsumme vergrabenen Gruppe-1-Schläge-Gruppe-2-Vergleiche (wobei Unentschieden als halber Sieg gewertet werden) gelesen werden kann. U₂ ist die spiegelbildliche Berechnung für Gruppe 2, und die Summe der beiden ergibt immer n₁ × n₂, was eine nützliche Plausibilitätsprüfung darstellt. Wenn die beiden Gruppen aus identischen Verteilungen stammen, sollten U₁ und U₂ jeweils nahe bei n₁n₂/2 landen; Eine einseitige Spaltung nach einer Seite ist ein Beweis dafür, dass sich die Gruppen unterscheiden.
Warum Mann-Whitney einem t-Test vorziehen?
Der t-Test bei unabhängigen Stichproben geht davon aus, dass beide Gruppen annähernd normalverteilt sind (oder dass die Stichprobengrößen groß genug sind, damit der Zentrale Grenzwertsatz eine Kompensation ermöglicht) und vergleicht die Mittelwerte. Mann-Whitney macht keinerlei Verteilungsannahmen – es geht lediglich davon aus, dass die Verteilungen der beiden Gruppen die gleiche Form haben, und vergleicht die gesamte Rangfolge und nicht eine einzelne zusammenfassende Statistik. Dies macht es zur sichereren Wahl für kleine Stichproben, stark verzerrte Daten (Einkommen, Wartezeiten, Reaktionszeiten), ordinale Bewertungen (Umfrageskalen, Rankings) oder Daten mit Ausreißern, die andernfalls einen Mittelwert verzerren würden. Der Nachteil besteht darin, dass der Mann-Whitney-Test etwas weniger statistische Aussagekraft hat als ein t-Test, wenn die Daten wirklich normal sind. Wenn Sie also von der Normalität überzeugt sind, ist ein t-Test das empfindlichere Werkzeug.
Wie mit Krawatten umgegangen wird
Echte Daten weisen häufig wiederholte Werte auf, insbesondere bei gerundeten Messungen oder diskreten Skalen. Wenn zwei oder mehr gepoolte Werte gleich sind, können ihnen ohne einen willkürlichen Tiebreaker keine unterschiedlichen Ränge zugewiesen werden, sodass jeder gebundene Wert stattdessen den Durchschnitt der Ränge erhält, die er gemeinsam belegen würde – zum Beispiel erhalten drei Werte, die für die Ränge 2, 3 und 4 gleich sind, alle Rang 3. Ohne Korrektur verringern Bindungen auch die wahre Varianz von U, was den Z-Score und den p-Wert zu extrem machen würde. Der Rechner wendet die standardmäßige Tie-Korrektur auf σ²_U an und subtrahiert einen Term proportional zu Σ(t³−t) über jede Tie-Gruppe (eine Gruppe der Größe 1 trägt null bei), sodass der Signifikanztest auch bei stark wiederholten Daten genau bleibt.
Auswahl des richtigen Vergleichstools
Mann-Whitney vergleicht zwei unabhängige Gruppen – wenn es sich bei Ihren beiden Zahlensätzen tatsächlich um Vor-/Nachher-Messungen an denselben Probanden handelt, verwenden Sie stattdessen den gepaarten Wilcoxon-Signed-Rank-Test und nicht diesen. Wenn Sie sicher sind, dass Ihre Daten annähernd normal sind, bietet der T-Test-Rechner (Zwei-Stichproben-Modus) einen aussagekräftigeren Vergleich der Mittelwerte. Um zu testen, ob sich die Varianzen zweier Gruppen und nicht ihre zentrale Tendenz unterscheiden, verwenden Sie den F-Test-Rechner. Wenn Sie statt des Vergleichs zweier Gruppen prüfen möchten, ob sich zwei gepaarte Variablen gemeinsam bewegen, ist Spearmans Korrelation das rangbasierte Tool für diese Aufgabe. Und welchen Test Sie auch durchführen, der P-Wert-Rechner und der Z-Test-Rechner sind nützliche Begleiter für ein allgemeineres Verständnis von Signifikanztests, während der Standardabweichungsrechner dabei hilft, die Streuung innerhalb jeder Gruppe zu charakterisieren, bevor Sie sie vergleichen.