A covariância mede se duas variáveis tendem a se mover juntas, mover-se em direções opostas ou não mostrar nenhuma relação linear consistente. É o alicerce por trás da correlação, regressão e variação de portfólio em finanças - esta calculadora percorre as versões de população e amostra lado a lado, além de como a covariância se padroniza no coeficiente de correlação de Pearson, mais familiar.

Como funciona a covariância

A covariância soma o produto do desvio de cada ponto da média X e da média Y: Σ(xᵢ − x̄)(yᵢ − ȳ). Quando o X de um ponto está acima da média e ao mesmo tempo o seu Y está acima da média (ou ambos abaixo da média), esse produto é positivo – puxando a soma e a covariância para cima. Quando um está acima da média enquanto o outro está abaixo, o produto é negativo – puxando a soma para baixo. Uma covariância próxima de zero significa que esses produtos positivos e negativos se cancelam aproximadamente, indicando nenhuma tendência linear consistente.

População vs. amostra — por que o divisor muda

A covariância populacional divide a soma dos produtos de desvio por N, a contagem completa — apropriada quando seus dados já representam todo o grupo de seu interesse. A covariância da amostra divide por n − 1. Este ajuste, conhecido como correção de Bessel, existe porque a média da própria amostra é calculada a partir dos mesmos dados usados ​​para medir os desvios, o que subestima ligeiramente a verdadeira variabilidade em relação à população maior da qual a amostra foi retirada. A divisão por um número menor (n − 1 em vez de n) inflaciona a estimativa apenas o suficiente para corrigir esse viés, tornando a estatística amostral um estimador imparcial da covariância populacional.

Relação com correlação

A maior limitação da covariância é que sua magnitude depende das unidades e da escala de X e Y — uma covariância de 1.000 poderia refletir uma relação fraca entre variáveis de grande escala ou uma relação forte entre variáveis de pequena escala, e não há como saber qual delas apenas olhando para o número. A correlação de Pearson resolve isso dividindo a covariância pelo produto dos desvios padrão das duas variáveis, r = Cov(X,Y) / (σx · σy), que redimensiona o resultado para sempre ficar entre -1 e +1, independentemente das unidades originais. É por isso que a correlação é geralmente o número mais útil para comparar relações entre diferentes conjuntos de dados, enquanto a covariância permanece fundamental em contextos — como cálculos de variação de portfólio — onde a escala real das variáveis é importante.