La prueba U de Mann-Whitney (también llamada prueba de rangos con signo de Wilcoxon, rank-sum) verifica si dos grupos independientes difieren, sin asumir que ninguno de los grupos siga una distribución normal. Funciona enteramente con rangos, lo que la convierte en la alternativa no paramétrica estándar a la prueba t de muestras independientes siempre que tus datos estén sesgados, sean ordinales o demasiado pequeños para confiar en un supuesto de normalidad.

Cómo funciona el enfoque de suma de rangos

La prueba comienza agrupando cada valor de ambos grupos en una sola lista y clasificándolos juntos de menor a mayor — el rango de un valor no tiene nada que ver con de qué grupo proviene hasta después de que se completa la clasificación. Una vez clasificados, la suma de los rangos que caen en el Grupo 1 (R₁) se convierte en U₁ = R₁ − n₁(n₁+1)/2, que puede leerse como el número de comparaciones Grupo-1-supera-a-Grupo-2 (contando los empates como medio triunfo) enterradas dentro de esa suma de rangos. U₂ es el cálculo espejo para el Grupo 2, y los dos siempre suman n₁ × n₂, lo cual es una útil comprobación de cordura. Si los dos grupos provinieran de distribuciones idénticas, U₁ y U₂ deberían situarse cerca de n₁n₂/2 cada uno; una división desigual hacia un lado es evidencia de que los grupos difieren.

Por qué elegir Mann-Whitney en lugar de una prueba t

La prueba t de muestras independientes asume que ambos grupos son aproximadamente normalmente distribuidos (o que los tamaños de muestra son lo suficientemente grandes para que el Teorema del Límite Central compense) y compara medias. Mann-Whitney no hace ningún supuesto de distribución en absoluto — solo asume que las distribuciones de los dos grupos tienen la misma forma, y compara el orden de rangos completo en lugar de un único estadístico resumen. Esto la convierte en la opción más segura para muestras pequeñas, datos muy sesgados (ingresos, tiempos de espera, tiempos de reacción), calificaciones ordinales (escalas de encuestas, clasificaciones), o datos con valores atípicos que de otra manera distorsionarían una media. La contrapartida es que Mann-Whitney tiene un poder estadístico ligeramente menor que una prueba t cuando los datos realmente son normales — así que si confías en la normalidad, una prueba t es la herramienta más sensible.

Cómo se manejan los empates

Los datos reales frecuentemente tienen valores repetidos, especialmente con mediciones redondeadas o escalas discretas. Cuando dos o más valores agrupados son iguales, no pueden recibir rangos distintos sin un desempate arbitrario, así que cada valor empatado recibe en su lugar el promedio de los rangos que colectivamente ocuparía — por ejemplo, tres valores empatados para los rangos 2, 3 y 4 reciben todos el rango 3. Sin corregir, los empates también reducen la varianza real de U, lo que haría que la puntuación z y el valor p fueran demasiado extremos. La calculadora aplica la corrección estándar por empates a σ²_U, restando un término proporcional a Σ(t³−t) en cada grupo de empate (un grupo de tamaño 1 aporta cero), de modo que la prueba de significancia se mantenga precisa incluso con datos muy repetidos.

Eligiendo la herramienta de comparación correcta

Mann-Whitney compara dos grupos independientes — si tus dos conjuntos de números en realidad son mediciones antes/después en los mismos sujetos, usa en su lugar la prueba de rangos con signo de Wilcoxon pareada, no esta. Si confías en que tus datos son aproximadamente normales, la Calculadora de Prueba T (modo de dos muestras) da una comparación de medias más potente. Para probar si las varianzas de dos grupos difieren en lugar de su tendencia central, usa la Calculadora de Prueba F. Si en lugar de comparar dos grupos estás verificando si dos variables pareadas se mueven juntas, la Correlación de Spearman es la herramienta basada en rangos para ese trabajo. Y sea cual sea la prueba que ejecutes, la Calculadora de Valor P y la Calculadora de Prueba Z son compañeros útiles para entender las pruebas de significancia en general, mientras que la Calculadora de Desviación Estándar ayuda a caracterizar la dispersión dentro de cada grupo antes de compararlos.