O teste U de Mann-Whitney (também chamado de teste de soma de postos de Wilcoxon) verifica se dois grupos independentes diferem, sem assumir que nenhum dos grupos segue uma distribuição normal. Ele funciona inteiramente em classificações, o que o torna a alternativa não paramétrica padrão ao teste t de amostras independentes sempre que seus dados são distorcidos, ordinais ou muito pequenos para confiar em uma suposição de normalidade.

Como funciona a abordagem de soma de classificação

O teste começa agrupando todos os valores de ambos os grupos em uma lista e classificando-os do menor para o maior — a classificação de um valor não tem nada a ver com o grupo de onde ele veio até que a classificação seja concluída. Uma vez classificado, a soma das classificações que chegaram ao Grupo 1 (R₁) é convertida em U₁ = R₁ − n₁(n₁+1)/2, que pode ser lida como o número de comparações do Grupo 1-bate-Grupo-2 (com empates contados como meia vitória) enterradas dentro dessa soma de classificação. U₂ é o cálculo da imagem espelhada para o Grupo 2, e os dois sempre somam n₁ × n₂, o que é uma verificação de sanidade útil. Se os dois grupos viessem de distribuições idênticas, U₁ e U₂ deveriam cair perto de n₁n₂/2 cada; uma divisão desequilibrada para um lado é uma evidência de que os grupos diferem.

Por que escolher Mann-Whitney em vez de um teste t

O teste t para amostras independentes assume que ambos os grupos são aproximadamente normalmente distribuídos (ou que os tamanhos das amostras são grandes o suficiente para serem compensados pelo Teorema do Limite Central) e compara as médias. Mann-Whitney não faz nenhuma suposição distributiva - apenas assume que as distribuições dos dois grupos têm a mesma forma e compara toda a ordem de classificação em vez de uma única estatística resumida. Isso o torna a escolha mais segura para amostras pequenas, dados fortemente distorcidos (renda, tempos de espera, tempos de reação), classificações ordinais (escalas de pesquisa, classificações) ou dados com valores discrepantes que, de outra forma, distorceriam uma média. A desvantagem é que Mann-Whitney tem um poder estatístico ligeiramente menor do que um teste t quando os dados são genuinamente normais. Portanto, se você está confiante na normalidade, um teste t é a ferramenta mais sensível.

Como os laços são tratados

Os dados reais frequentemente apresentam valores repetidos, especialmente com medidas arredondadas ou escalas discretas. Quando dois ou mais valores agrupados são iguais, eles não podem receber classificações distintas sem um desempate arbitrário; portanto, cada valor empatado recebe a média das classificações que ocuparia coletivamente - por exemplo, três valores empatados para as classificações 2, 3 e 4 recebem a classificação 3. Se não forem corrigidos, os empates também reduzirão a verdadeira variação de U, o que tornaria a pontuação z e o valor p muito extremos. A calculadora aplica a correção de empate padrão a σ²_U, subtraindo um termo proporcional a Σ(t³−t) em cada grupo de empate (um grupo de tamanho 1 contribui com zero), para que o teste de significância permaneça preciso mesmo com dados muito repetidos.

Escolhendo a ferramenta de comparação certa

Mann-Whitney compara dois grupos independentes — se seus dois conjuntos de números são, na verdade, medições antes/depois dos mesmos assuntos, use o teste de postos sinalizados de Wilcoxon pareado, e não este. Se você tiver certeza de que seus dados estão aproximadamente normais, a Calculadora de teste T (modo de duas amostras) oferece uma comparação de médias mais poderosa. Para testar se as variâncias de dois grupos diferem em vez de sua tendência central, use a Calculadora do Teste F. Se em vez de comparar dois grupos você estiver verificando se duas variáveis ​​emparelhadas se movem juntas, Correlação de Spearman é a ferramenta baseada em classificação para esse trabalho. E qualquer que seja o teste executado, a Calculadora de valor P e a Calculadora de teste Z são companheiros úteis para entender os testes de significância de forma mais geral, enquanto a Calculadora de desvio padrão ajuda a caracterizar a distribuição dentro de cada grupo antes de compará-los.