Les statistiques descriptives résument la forme, le centre et la dispersion d’un jeu de données avant les tests inférentiels. La moyenne et la médiane indiquent où se situent les données ; la variance, l’asymétrie, la kurtosis, l’intervalle de confiance et l’analyse des valeurs aberrantes aident à juger la fiabilité du résumé et à choisir les analyses suivantes. Ce guide aborde quatre décisions : formules d’échantillon ou de population, interprétation des intervalles, diagnostic par asymétrie et kurtosis, et choix d’une règle pour les valeurs aberrantes.
Quand utiliser les formules d’échantillon ou de population
L’erreur la plus fréquente en statistique élémentaire consiste à confondre les formules d’échantillon et de population pour la variance et l’écart-type. La formule d’échantillon divise par n − 1 (correction de Bessel) ; celle de population divise par n. Utilisez la formule de population lorsque les données couvrent tout le groupe étudié — chaque salarié, transaction d’un exercice ou élève d’une liste. Utilisez celle d’échantillon si les données ne sont qu’un sous-ensemble servant à tirer des conclusions sur un groupe plus vaste.
Pourquoi n − 1 ? La moyenne d’échantillon est une estimation : la somme des écarts carrés par rapport à cette moyenne est légèrement inférieure à celle par rapport à la vraie moyenne inconnue. Diviser par n − 1 compense ce biais. La correction est presque imperceptible pour n = 100 plutôt que 99 (différence de 1 %), mais compte pour les petits échantillons : avec 5 valeurs, la variance d’échantillon est 25 % plus élevée que celle de population. En cas de doute, privilégiez la formule d’échantillon si les données proviennent d’un processus ou d’une population.
Comment fonctionnent les intervalles de confiance
Un intervalle de confiance à 95 % de la moyenne contiendrait la vraie moyenne environ 95 % du temps si l’on répétait de nombreux échantillonnages dans la même population. Il se calcule par x̄ ± t × (s / √n), où t provient de la loi t de Student au niveau choisi et df = n − 1. Pour n ≥ 30, t est pratiquement égal à z : 1.645 pour 90 %, 1.960 pour 95 % et 2.576 pour 99 %. Pour un petit échantillon, t est plus grand afin de tenir compte de l’incertitude sur l’écart-type de population.
On interprète souvent à tort un IC comme une probabilité de 95 % que la vraie moyenne se trouve dans l’intervalle calculé. Une fois l’intervalle fixé, elle s’y trouve ou non. La garantie porte sur le long terme : 95 % des intervalles ainsi construits contiennent la vraie moyenne. L’interprétation probabiliste d’un intervalle crédible bayésien exige une autre méthode.
Un niveau de confiance plus élevé élargit l’intervalle. À taille égale, un IC à 99 % est environ 30 % plus large qu’un IC à 95 %. Doubler n réduit sa largeur d’un facteur √2 ≈ 1.41.
Asymétrie et kurtosis : diagnostics de distribution
L’asymétrie mesure le manque de symétrie. Une valeur proche de zéro indique une distribution approximativement symétrique autour de la moyenne. Une asymétrie positive signale une longue queue droite (les valeurs élevées tirent la moyenne au-dessus de la médiane) ; une asymétrie négative indique une longue queue gauche. À titre indicatif, |skew| < 0.5 est assez symétrique pour que la moyenne résume le centre ; si |skew| > 1, la médiane convient souvent mieux.
L’excès de kurtosis mesure l’épaisseur des queues par rapport à la loi normale. Un excès positif (leptokurtique) signifie que les valeurs extrêmes surviennent plus souvent que dans une courbe en cloche, comme pour les rendements financiers, la latence réseau et les temps de réaction. Un excès négatif (platykurtique) indique des queues plus fines ; une distribution uniforme en est un exemple extrême. Un excès proche de zéro est compatible avec la normalité sans la prouver ; examinez un graphique Q-Q ou réalisez un test de Shapiro-Wilk.
Ces deux statistiques sont sensibles aux valeurs aberrantes, surtout dans les petits échantillons. Une valeur extrême peut transformer une distribution presque symétrique en une distribution d’asymétrie > 1. Examinez toujours l’histogramme : ces nombres sont des indices, pas des conclusions définitives.
Choisir une règle pour les valeurs aberrantes
La règle 1.5×IQR (bornes de Tukey) signale toute valeur sous Q1 − 1.5×IQR ou au-dessus de Q3 + 1.5×IQR. C’est un bon choix par défaut : les quartiles ne sont pas influencés par les valeurs extrêmes, qui ne peuvent donc pas en masquer d’autres ; et les bornes suivent la forme des données au lieu de supposer une symétrie.
La règle du score z (|z| ≥ 2 ou 3) est connue, mais suppose des données approximativement normales : environ 5 % des valeurs devraient avoir |z| ≥ 2 et 0.3 % |z| ≥ 3. Pour des données très asymétriques, elle peut mal fonctionner : la moitié des valeurs d’une distribution log-normale peuvent être aberrantes selon cette règle. En outre, quelques valeurs extrêmes gonflent moyenne et écart-type, rendant les valeurs aberrantes modérées plus difficiles à détecter (effet de masquage).
Le calculateur affiche les deux règles. Si elles désignent les mêmes valeurs, examinez-les. En cas de désaccord — l’IQR en repère souvent davantage dans les données asymétriques — privilégiez l’IQR et envisagez une transformation logarithmique avant l’analyse. Documentez toujours le traitement des valeurs aberrantes : leur exclusion affecte toutes les statistiques suivantes.