As estatísticas descritivas resumem a forma, o centro e a distribuição de um conjunto de dados antes do início de qualquer teste inferencial. A média e a mediana informam onde estão os dados, mas a variância, a assimetria, a curtose, o intervalo de confiança e os diagnósticos de valores discrepantes são o que permitem decidir se o resumo é confiável e quais análises subsequentes são apropriadas. As seções abaixo cobrem as quatro decisões que todo analista toma ao buscar estatísticas descritivas: escolher entre fórmulas amostrais e populacionais, interpretar intervalos de confiança corretamente, ler assimetria e curtose como diagnósticos de distribuição e escolher a regra de outlier correta para seus dados.

Quando usar fórmulas de amostra versus população

O erro mais comum nas estatísticas introdutórias é misturar as fórmulas amostrais e populacionais para variância e desvio padrão. A fórmula amostral divide por n − 1 (correção de Bessel); a fórmula populacional divide por n. Use a versão populacional quando seus dados abrangem todo o grupo de seu interesse: todos os funcionários em uma folha de pagamento, todas as transações em um ano fiscal, todos os alunos em uma lista. Use a versão de amostra sempre que seus dados forem um subconjunto e você quiser tirar conclusões sobre um grupo maior.

Por que n − 1? Como a média amostral é em si uma estimativa, a soma dos desvios quadrados da média amostral é ligeiramente menor do que a soma dos desvios quadrados da média verdadeira desconhecida. A divisão por n − 1 compensa esse viés. A correção é quase imperceptível quando n é grande (n = 100 versus n = 99 altera a resposta em 1%), mas com amostras pequenas isso importa: uma amostra de 5 valores fornece uma variância 25% maior na fórmula amostral do que na fórmula populacional. Quando não tiver certeza, use como padrão amostra. É a escolha conservadora quando seus dados foram coletados de um processo ou população.

Como os intervalos de confiança realmente funcionam

Um intervalo de confiança de 95% para a média é um intervalo que - ao longo de muitas amostras repetidas extraídas da mesma população - conteria a média verdadeira cerca de 95% das vezes. É calculado como x̄ ± t × (s / √n), onde t vem da distribuição t de Student no nível de confiança escolhido e df = n − 1. Para amostras grandes (n ≥ 30), o valor t é essencialmente o valor z: 1,645 para 90%, 1,960 para 95%, 2,576 para 99%. Para amostras pequenas, t é maior para compensar a incerteza extra na estimativa do DP da população a partir de uma amostra pequena.

Um erro de interpretação comum é dizer que a média verdadeira tem 95% de chance de estar dentro de qualquer IC que você calcular. Não é isso que o procedimento garante – uma vez calculado um intervalo específico, a verdadeira média está nele ou não. O que o procedimento garante é que a taxa de longo prazo dos intervalos que contêm a média verdadeira é de 95%. Para fins práticos, as duas interpretações levam a decisões semelhantes, mas os intervalos bayesianos confiáveis ​​(que apoiam a interpretação da 'probabilidade de a média estar neste intervalo') exigem uma estrutura diferente.

O aumento do nível de confiança amplia o intervalo. Os ICs de 99% são aproximadamente 30% mais amplos do que os ICs de 95% no mesmo tamanho de amostra – o preço de mais confiança é menos precisão. A outra alavanca é o tamanho da amostra: duplicar n reduz o IC por um fator de √2 ≈ 1,41.

Skewness e curtose como diagnóstico de distribuição

A assimetria mede a assimetria. Uma assimetria próxima de zero indica que a distribuição é aproximadamente simétrica em torno da média – um bom sinal de que a média e a mediana concordam. A assimetria positiva sinaliza uma cauda longa para a direita (a média é puxada acima da mediana por valores extremamente altos); a assimetria negativa sinaliza uma longa cauda esquerda. Como regra geral, |skew| <0,5 é simétrico o suficiente para que a média seja uma medida razoável do centro; |inclinar| > 1 sugere que a mediana é um resumo melhor.

O excesso de curtose mede o peso da cauda em comparação com uma distribuição normal. Curtose excessiva positiva (leptocúrtica) significa que a distribuição produz valores extremos com mais frequência do que uma curva em sino – comum em retornos financeiros, latência de rede e tempos de reação. Excesso de curtose negativa (platicúrtica) significa que a distribuição tem caudas mais claras que o normal – distribuições uniformes são um exemplo extremo. O excesso de curtose próximo de zero é consistente com a normalidade, mas não a prova; para uma verificação formal, observe um gráfico Q-Q ou execute um teste de Shapiro-Wilk.

Ambas as estatísticas são sensíveis a valores discrepantes, especialmente com amostras pequenas. Um único valor extremo pode transformar uma distribuição quase simétrica em uma com assimetria > 1. Sempre inspecione o histograma junto com esses resumos — os números são diagnósticos, não definitivos.

Qual regra de outlier usar

A regra 1,5×IQR (cercas de Tukey) sinaliza qualquer valor abaixo de Q1 − 1,5×IQR ou acima de Q3 + 1,5×IQR. É o padrão correto por dois motivos. Primeiro, ela usa quartis, que não são afetados por valores extremos — portanto, a regra não permite que valores discrepantes mascarem outros valores discrepantes. Em segundo lugar, funciona em dados distorcidos porque as cercas se ajustam à forma dos dados em vez de assumirem simetria.

A regra de pontuação z (|z| ≥ 2 ou 3) é mais familiar, mas tem duas limitações. Ele assume que os dados são aproximadamente normais: sob essa suposição, apenas cerca de 5% dos valores deveriam ter |z| ≥ 2 e 0,3% devem ter |z| ≥ 3, portanto, qualquer coisa acima desses limites é suspeita. Em dados fortemente distorcidos, no entanto, a regra falha – metade dos valores em uma distribuição log-normal podem ser “outliers” pela definição de pontuação z. A segunda limitação é mais sutil: alguns valores discrepantes extremos inflacionam a média e o DP, dificultando a detecção de valores discrepantes moderados (chamado de problema de mascaramento).

Esta calculadora relata ambas as regras para que você possa ver quando elas concordam e quando divergem. Quando eles concordam, você tem argumentos fortes para investigar ou remover os valores sinalizados. Quando eles discordam – normalmente a regra IQR sinaliza mais valores em dados distorcidos – prefira a regra IQR e considere se seus dados precisam de uma transformação de log antes de uma análise mais aprofundada. Faça o que fizer, sempre documente o tratamento de valores discrepantes: a remoção de valores é uma decisão de pesquisa que afeta todas as estatísticas posteriores.