Média, mediana e moda são as três medidas clássicas de tendência central em estatísticas - cada uma captura um aspecto diferente do que significa para um conjunto de dados ter um valor "típico", e entender qual usar quando é uma das habilidades práticas mais importantes na análise de dados. A média calcula a média de todos os valores igualmente, a mediana encontra o valor médio após a classificação e a moda identifica o valor mais frequente. As secções abaixo cobrem quando a média versus mediana representa melhor uma distribuição (rendimento, habitação, tempos de resposta favorecem consistentemente a mediana), porque é que as estatísticas imobiliárias e económicas citam medianas em vez de médias, os casos específicos em que a moda se torna a estatística resumida mais informativa, e como os valores discrepantes afectam cada medida - conhecimento que distingue os analistas rigorosos daqueles que citam números "médios" sem compreender o que essa média realmente representa.
Média x mediana: qual centro é importante?
A média e a mediana descrevem o "centro" de um conjunto de dados, mas fazem isso por meio de abordagens matemáticas fundamentalmente diferentes. A média incorpora todos os pontos de dados com peso igual, tornando-a matematicamente elegante e útil para dados simétricos e normalmente distribuídos. A mediana simplesmente encontra o valor médio após a classificação, tornando-a impermeável a valores extremos e preferida para distribuições distorcidas, onde alguns valores discrepantes distorcem a média aritmética.
Esta distinção tem enormes consequências no mundo real, especialmente nos relatórios económicos. O rendimento familiar nos EUA é sempre reportado como mediana – e não como média – porque a distribuição é fortemente distorcida à direita. Um pequeno número de pessoas com rendimentos muito elevados eleva a média muito acima do rendimento de um agregado familiar típico. Em 2023, o rendimento familiar médio nos EUA era de cerca de 74.000 dólares, enquanto a média era superior a 106.000 dólares – uma diferença de 43% que muda fundamentalmente a história contada. Para efeitos de política, a mediana é muito mais informativa porque responde "quanto ganha um agregado familiar típico?" enquanto a média responde "qual é o conjunto de renda total dividido igualmente?" — duas perguntas muito diferentes com respostas muito diferentes em distribuições desiguais de renda.
Preços de casas e imóveis
O mesmo padrão de distribuição distorcida aparece no setor imobiliário e produz diferenças semelhantes entre média e mediana. Uma única venda de luxo num bairro pode inflacionar drasticamente o preço médio de venda, fazendo com que o mercado pareça mais caro do que para os compradores típicos. Uma venda de mansão de US$ 10 milhões em uma rua com casas de US$ 400.000 aumenta a média em dezenas de milhares de dólares, enquanto a mediana permanece na faixa real do comprador. Os profissionais do setor imobiliário citam quase universalmente os preços médios das casas por esse motivo - o Índice Case-Shiller, os relatórios da Associação Nacional de Corretores de Imóveis e o Zillow adotam como padrão as métricas medianas.
A moda - o preço de venda mais comum - é menos usada diretamente em relatórios imobiliários, mas pode ser útil para identificar qual ponto de preço tem maior atividade de mercado. Saber que "a maioria das casas neste bairro vende entre US$ 450.000 e US$ 475.000" captura um conceito semelhante ao modo que nem a média nem a mediana expressam diretamente. Distribuições de picos múltiplos (mercados imobiliários bimodais onde coexistem casas iniciais e casas de luxo) tornam as estatísticas simples de tendência central menos informativas, razão pela qual relatórios imobiliários detalhados geralmente mostram distribuições por meio de histogramas ou detalhamentos de níveis de preços, em vez de depender de um único número resumido.
Quando o modo é mais importante
O modo é essencial para dados categóricos — "qual cor os clientes mais escolhem?" ou "qual tamanho de sapato devemos estocar mais?" - onde uma média numérica não tem sentido ou é absurda. Você não pode calcular a média aritmética de “vermelho, azul, verde, vermelho, vermelho, azul” – a moda (vermelho, aparecendo 3 vezes) é o único resumo significativo. O planejamento de inventário, a análise de pesquisas, os dados de preferência dos eleitores e qualquer análise de dados de escolha discreta dependem fortemente de estatísticas modais.
Para dados numéricos, a moda se torna mais interessante quando uma distribuição é multimodal. Um conjunto de dados bimodal (dois picos claros) geralmente sinaliza dois subgrupos distintos combinados em um conjunto de dados. Uma pesquisa de idades em um evento universitário pode mostrar picos aos 20 (alunos) e 50 (docentes); analisá-los como uma distribuição única ignora completamente a estrutura de duas populações. Os dados de gastos dos clientes geralmente mostram bimodalidade com um pico de compradores casuais de baixo valor e um pico de usuários avançados de alto valor que exigem diferentes estratégias de retenção. Identificar a multimodalidade em um histograma costuma ser mais informativo do que qualquer estatística de resumo única (média, mediana ou mesmo variância), porque revela uma estrutura oculta nos dados que afeta como você deve analisá-los e responder a eles. Sempre visualize antes de calcular estatísticas resumidas. Se você observar dois picos, divida os dados e analise os subgrupos separadamente.
O problema atípico
Outliers — valores distantes da maior parte dos dados — distorcem significativamente a média, mas quase não afetam a mediana. Um conjunto de dados de {1, 2, 3, 4, 5} tem média 3 e mediana 3; adicionar um único valor discrepante de 100 altera a média para 19,2, mas a mediana apenas para 3,5. Os valores discrepantes também inflacionam o intervalo (máximo - mínimo) dramaticamente, ao mesmo tempo que mal afetam o IQR (spread médio de 50%). É por isso que estatísticas robustas (mediana, IQR, MAD) são preferidas às não robustas (média, intervalo, DP) sempre que valores discrepantes são possíveis.
Quando valores discrepantes aparecem em seus dados, a resposta correta depende de sua causa. Se um valor discrepante representar um erro de entrada de dados ou um artefato de medição, corrigi-lo ou removê-lo é apropriado (sempre documente o que você fez). Se o valor atípico for um dado genuíno — um indivíduo com rendimentos realmente elevados num inquérito ao rendimento, uma leitura extrema real num registo de sensores — a resposta correta é reportar tanto a média como a mediana, anotar explicitamente os valores atípicos e considerar se os valores atípicos representam um fenómeno separado que vale a pena investigar por si só. Anomalias geradas por valores discrepantes geralmente sinalizam as histórias mais interessantes em um conjunto de dados; descartá-los como incômodos perde informações valiosas. Sempre visualize com um gráfico de caixa ou histograma para verificar valores discrepantes antes de decidir por qualquer estatística de resumo única.