Une distribution des fréquences organise des données brutes non triées dans un tableau qui indique combien de fois chaque valeur, ou chaque intervalle de valeurs, apparaît. C’est l’une des premières étapes de nombreux travaux de statistique descriptive : une longue liste de nombres devient un résumé lisible, que l’on peut représenter graphiquement et interpréter.
Séries groupées ou non groupées
Une distribution non groupée énumère chaque valeur distincte de la série et indique combien de fois elle apparaît. Elle convient aux petits jeux de données ou à ceux qui comportent peu de valeurs répétées, par exemple pour compter le nombre d’élèves ayant obtenu chaque note possible à un contrôle sur 10.
Une distribution groupée répartit les données en intervalles de même largeur (les classes). Elle devient essentielle lorsque les valeurs uniques couvrent une grande étendue, par exemple des notes sur 100, les âges d’une population ou des mesures continues. Le regroupement améliore la lisibilité au prix d’une partie de la précision : la valeur exacte de chaque donnée n’est plus connue.
Choisir le nombre de classes
Avec trop peu de classes, la distribution masque des détails utiles : toutes les données se retrouvent dans une ou deux barres. Avec trop de classes, elle devient difficile à lire et plusieurs classes ne contiennent qu’une seule donnée, voire aucune. La règle de Sturges (k = ⌈log₂(n) + 1⌉) et la règle de √n (k = ⌈√n⌉) sont deux points de départ très enseignés ; elles adaptent toutes deux le nombre de classes à la taille de la série.
Aucune de ces règles n’est impérative : ce sont des heuristiques. Si l’histogramme paraît trop aplati ou trop irrégulier, augmentez ou réduisez le nombre de classes et observez l’évolution de sa forme.
Lire les fréquences relatives et cumulées
La fréquence relative (f / n) exprime l’effectif de chaque classe comme une part de l’ensemble, ce qui permet de comparer des séries de tailles différentes. La fréquence cumulée additionne progressivement les effectifs des classes et répond à des questions comme « combien de données sont inférieures ou égales à cette valeur ? ». Elle sert notamment à calculer les percentiles et les quartiles d’une série groupée.
Limites et cas particuliers
Le regroupement en classes résume les données brutes, mais ne les remplace pas : une fois les données groupées, leur valeur exacte au sein de chaque classe est perdue. C’est pourquoi on utilise les centres de classe comme approximations dans d’autres calculs, par exemple pour estimer la moyenne d’une série groupée. Pour les très petites séries (moins d’une dizaine de valeurs), préférez le mode non groupé ou indiquez directement les valeurs brutes : le regroupement peut masquer davantage d’informations qu’il n’en révèle.