La variance répond à une question simple — dans quelle mesure les données sont-elles dispersées ? — mais la formule dépend du fait que l’on étudie une population entière ou seulement un échantillon. Cette calculatrice calcule les deux, détaille chaque étape et explique pourquoi les résultats diffèrent.
Calcul de la variance
Le calcul part de la moyenne, puis mesure la distance de chaque valeur par rapport à celle-ci. Faire simplement la moyenne de ces écarts les annulerait : une valeur située 3 unités sous la moyenne et une autre située 3 unités au-dessus totalisent zéro. La variance élève donc chaque écart au carré avant de les additionner. Cela accorde aussi plus de poids aux grands écarts, raison pour laquelle une valeur aberrante peut augmenter fortement la variance. La somme des écarts au carré est appelée somme des carrés (SC). On la divise ensuite par N (population) ou n − 1 (échantillon) pour obtenir la variance. L’écart-type, racine carrée de la variance, ramène le résultat à l’unité des données d’origine ; on le cite donc souvent avec la moyenne.
Pourquoi la variance d’échantillon divise par n − 1
Avec un échantillon, la vraie moyenne de la population est inconnue : on utilise la moyenne de l’échantillon à sa place. Or, en moyenne, cette moyenne est légèrement plus proche de ses propres observations que ne le serait la moyenne réelle de la population. La somme des écarts au carré est alors un peu trop faible. Diviser par n − 1 plutôt que par n — correction nommée d’après le statisticien Friedrich Bessel — augmente le résultat juste assez pour compenser ce biais. La variance d’échantillon devient ainsi une estimation sans biais de la vraie variance de population. Cette différence compte surtout avec de petits échantillons : pour quelques observations, la division par n − 1 au lieu de n modifie sensiblement le résultat ; à partir de centaines de valeurs, l’effet devient négligeable.
Quand utiliser la variance ou l’écart-type
La variance est la quantité fondamentale des formules statistiques — intervalles de confiance, tests d’hypothèse et ANOVA, par exemple — mais ses unités au carré sont difficiles à interpréter. Si les données sont en dollars, la variance est en dollars carrés, une unité qui n’a pas de sens concret. L’écart-type résout ce problème en prenant la racine carrée et en exprimant la dispersion dans l’unité d’origine. En pratique, on communique généralement l’écart-type, plus lisible, et l’on utilise la variance dans les calculs suivants.