La moyenne et l’écart-type indiquent où se situe le centre d’un jeu de données et à quel point les valeurs sont dispersées, mais ils ne renseignent pas sur sa forme. L’asymétrie et le kurtosis comblent cette lacune : la première mesure la dissymétrie, le second le poids des queues et le degré de concentration autour du sommet. Ensemble, ils donnent une image plus complète de la distribution.
Ce que révèle l’asymétrie
L’asymétrie indique de quel côté de la distribution se trouve la queue la plus longue. Une asymétrie positive signifie que la queue s’étire vers la droite : quelques valeurs exceptionnellement élevées font monter la moyenne. C’est pourquoi les revenus des ménages, les prix de l’immobilier et les temps d’attente présentent généralement une asymétrie à droite. Une asymétrie négative signifie que la queue s’étire vers la gauche ; c’est moins fréquent, mais on l’observe notamment pour l’âge au départ à la retraite ou pour les notes d’examen plafonnées. Une asymétrie proche de zéro indique une distribution à peu près symétrique, comme les tailles ou les erreurs de mesure regroupées autour d’une valeur réelle.
Ce que révèle le kurtosis
Le kurtosis décrit le poids des queues — autrement dit, la probabilité d’observer des valeurs extrêmes — ainsi que le degré de concentration de la distribution autour de son centre. Cette calculatrice affiche le kurtosis excédentaire, soit le kurtosis brut moins 3 ; une loi normale vaut donc toujours 0. Un kurtosis excédentaire positif (distribution leptokurtique) signifie qu’une plus grande part des données se concentre dans un sommet central marqué et dans les queues extrêmes, avec moins de valeurs intermédiaires. Les rendements financiers en sont un exemple classique : les périodes calmes sont fréquentes, mais les krachs graves, bien que rares, le sont aussi. Un kurtosis excédentaire négatif (distribution platykurtique) signifie que les données sont réparties plus uniformément, avec un sommet aplati et des queues plus légères, comme pour une loi uniforme.
Pourquoi les formules pour une population et un échantillon diffèrent
Comme pour la variance, il existe des formules distinctes pour l’asymétrie et le kurtosis d’une population et d’un échantillon. Lorsque vous ne disposez que d’un échantillon, les formules brutes (celles de la population) donnent des estimations légèrement biaisées de la forme réelle de la population. Les statisticiens appliquent donc des facteurs de correction — le coefficient ajusté de Fisher-Pearson pour l’asymétrie et une formule similaire corrigée du biais pour le kurtosis — afin d’obtenir des estimations plus précises à partir de données limitées. L’écart entre les deux formules diminue à mesure que l’échantillon grandit ; avec seulement quelques observations, le choix de l’estimateur peut changer sensiblement le résultat.