La covariance mesure si deux variables tendent à évoluer ensemble, en sens opposés ou sans relation linéaire cohérente. Elle constitue le fondement de la corrélation, de la régression et de la variance de portefeuille en finance. Ce calculateur présente côte à côte les versions pour une population et un échantillon, ainsi que la standardisation de la covariance en coefficient de corrélation de Pearson.
Fonctionnement de la covariance
La covariance est la somme des produits des écarts de chaque point par rapport à la moyenne de X et à celle de Y : Σ(xᵢ − x̄)(yᵢ − ȳ). Lorsqu’un point a une valeur X supérieure à la moyenne en même temps que sa valeur Y (ou que les deux sont inférieures à leur moyenne), le produit est positif et augmente la somme ainsi que la covariance. Si l’une est supérieure à la moyenne tandis que l’autre lui est inférieure, le produit est négatif et réduit la somme. Une covariance proche de zéro signifie que les produits positifs et négatifs s’annulent à peu près, ce qui indique l’absence de tendance linéaire cohérente.
Population ou échantillon : pourquoi le diviseur change
La covariance de population divise la somme des produits des écarts par N, le nombre total d’observations ; elle convient lorsque vos données constituent déjà tout le groupe qui vous intéresse. La covariance d’échantillon divise plutôt par n − 1. Cette correction, appelée correction de Bessel, tient au fait que la moyenne d’un échantillon est calculée à partir des mêmes données que celles utilisées pour mesurer les écarts, ce qui sous-estime légèrement la variabilité réelle par rapport à la population plus vaste dont l’échantillon provient. En divisant par un nombre inférieur (n − 1 plutôt que n), on augmente l’estimation juste assez pour corriger ce biais et obtenir un estimateur sans biais de la covariance de population.
Lien avec la corrélation
La principale limite de la covariance est que son ampleur dépend des unités et de l’échelle de X et Y : une covariance de 1,000 peut traduire une relation faible entre des variables de grande échelle ou une relation forte entre des variables de petite échelle ; le nombre seul ne permet pas de le savoir. Le coefficient de corrélation de Pearson résout ce problème en divisant la covariance par le produit des écarts-types des deux variables, r = Cov(X,Y) / (σx · σy), ce qui ramène toujours le résultat entre −1 et +1, indépendamment des unités d’origine. La corrélation est donc généralement plus utile pour comparer des relations entre différents jeux de données, tandis que la covariance reste essentielle dans les contextes — comme le calcul de la variance de portefeuille — où l’échelle réelle des variables compte.