L’écart-type mesure la dispersion des valeurs autour de la moyenne d’un jeu de données : un faible écart-type signifie que les valeurs sont regroupées près de la moyenne, tandis qu’un écart-type élevé indique une grande variabilité. Avec la moyenne, il s’agit de la statistique descriptive fondamentale dans toutes les disciplines quantitatives : contrôle qualité, finance, recherche scientifique, enseignement et apprentissage automatique. Les sections suivantes expliquent pourquoi l’écart-type complète la moyenne, quelle différence technique entre les formules de population et d’échantillon influe sur les petits jeux de données, quelles mesures robustes conviennent aux distributions non normales et comment les investisseurs utilisent l’écart-type pour quantifier le risque d’investissement.

Pourquoi l’écart-type est important

La moyenne ne raconte pas toute l’histoire d’un jeu de données. Se fier aux moyennes sans comprendre la variabilité peut conduire à de mauvaises décisions fondées sur des chiffres statistiquement « propres ». Deux classes peuvent avoir la même note moyenne de 75 %, mais des distributions très différentes : dans l’une, chaque élève a obtenu entre 73 et 77 (valeurs très regroupées, faible écart-type) ; dans l’autre, les notes vont de 45 à 98 (valeurs très dispersées, écart-type élevé). Ces classes nécessitent des stratégies pédagogiques complètement différentes malgré leur moyenne identique. Une décision fondée uniquement sur la moyenne passerait à côté de cette réalité liée à la variance.

L’écart-type quantifie cette dispersion et joue un rôle essentiel dans plusieurs domaines : le contrôle qualité l’utilise pour mesurer la régularité des pièces produites (Six Sigma vise un écart-type assez faible pour placer six écarts-types entre la moyenne du procédé et les limites de spécification) ; la finance l’utilise pour mesurer la volatilité et le risque d’un investissement (l’écart-type annualisé des rendements est la principale mesure du risque des actions et des fonds) ; la recherche scientifique l’utilise pour caractériser la précision des mesures (un écart-type plus faible indique un instrument plus fiable) ; et la science des données l’utilise pour mettre les variables à l’échelle (en normalisant les entrées autour d’une moyenne de 0 et d’un écart-type de 1 avant l’entraînement de modèles d’apprentissage automatique).

Population ou échantillon : pourquoi n−1 ?

Lorsqu’on calcule l’écart-type à partir d’un échantillon plutôt que de toute une population, diviser par (n−1) au lieu de n corrige la tendance d’un échantillon à sous-estimer systématiquement la variance de la population. Cet ajustement, appelé correction de Bessel (du nom du mathématicien Friedrich Bessel), tient au fait que la moyenne de l’échantillon est elle-même estimée à partir des données, et non connue indépendamment. Son estimation consomme un degré de liberté : il ne reste que n−1 informations indépendantes pour estimer la variabilité autour de cette moyenne.

Pour les grands échantillons (n ≥ 100), la différence entre une division par n et par n−1 est négligeable : 1 % pour n = 100, 0.1 % pour n = 1,000. Avec les petits jeux de données, la correction est importante : pour n = 10, diviser par 9 au lieu de 10 entraîne une différence de 11 % dans l’écart-type obtenu. Utilisez toujours l’écart-type de l’échantillon (division par n−1), sauf si vous êtes certain que les données comprennent tous les membres de la population étudiée. Pour les statistiques descriptives calculées à partir d’enquêtes, d’essais expérimentaux ou de tout sous-ensemble d’un groupe plus large, l’écart-type de l’échantillon fournit une estimation sans biais du paramètre de population recherché. La plupart des logiciels statistiques utilisent cette mesure par défaut, car elle convient à la grande majorité des analyses réelles.

Au-delà de l’écart-type : IQR, asymétrie et kurtosis

L’écart-type est particulièrement adapté aux données approximativement symétriques autour de la moyenne. Or, les données réelles sont souvent asymétriques, et l’écart-type peut induire en erreur lorsque la distribution présente une asymétrie ou des queues épaisses. Pour une distribution asymétrique, l’écart interquartile (IQR, soit le 75e percentile moins le 25e) mesure la dispersion de façon plus robuste : il n’est pas affecté par les valeurs extrêmes. Quelques valeurs aberrantes le déplacent à peine, mais peuvent fortement augmenter l’écart-type.

L’asymétrie indique quelle queue de la distribution est la plus longue. Une asymétrie positive (queue droite plus longue) est fréquente pour les revenus, les prix immobiliers et les temps de réponse : une longue queue de valeurs élevées tire la moyenne au-dessus de la médiane. Une asymétrie négative (queue gauche plus longue) apparaît notamment dans les notes d’examen soumises à un effet plafond ou pour l’âge au décès dans les pays développés. L’excès de kurtosis indique si les queues sont plus épaisses (leptokurtique, kurtosis > 0) ou plus fines (platykurtique, kurtosis < 0) que celles d’une loi normale. Les rendements financiers présentent généralement un excès de kurtosis positif (queues épaisses) : les mouvements extrêmes surviennent donc plus souvent que ne le prévoit une loi normale, ce qui explique pourquoi les crises financières de type 2008 sont plus fréquentes que ne le laisserait penser un calcul normal à « six sigma ». Pour analyser des données réelles, calculez toujours l’asymétrie et la kurtosis en plus de l’écart-type afin de vérifier les hypothèses de normalité.

L’écart-type en finance

En investissement, l’écart-type est la principale mesure quantitative de la volatilité des rendements et la mesure de référence du risque des actions, des obligations et des portefeuilles. Une action dont l’écart-type annualisé est de 20 % fluctue beaucoup plus qu’une action à 8 % et est donc considérée comme plus risquée, malgré des rendements espérés potentiellement supérieurs. Écarts-types annuels typiques des principales classes d’actifs : grandes capitalisations américaines ~15–20 %, petites capitalisations américaines ~20–25 %, actions internationales ~20–25 %, obligations d’entreprise ~5–8 %, obligations du Trésor américain ~3–6 %, REIT ~15–20 %, matières premières ~20–30 %.

La théorie moderne du portefeuille (Markowitz, 1952) utilise l’écart-type pour construire des portefeuilles diversifiés qui minimisent la volatilité globale pour un rendement espéré donné. La célèbre « frontière efficiente » est calculée à partir des matrices de covariance dérivées des écarts-types et des corrélations des actifs. L’histogramme de cette calculatrice permet de comparer visuellement la distribution réelle de vos données à la loi normale théorique. Les écarts par rapport à la courbe en cloche peuvent signaler des queues épaisses (plus d’événements extrêmes que prévu) ou une distribution bimodale (deux groupes indiquant des données hétérogènes). En finance, la plupart des distributions de rendements ont des queues épaisses : l’événement « centennal » selon une loi normale survient en réalité tous les 5 à 10 ans. Utilisez l’écart-type comme mesure du risque en gardant à l’esprit les hypothèses de normalité.