La moyenne, la médiane et le mode sont les trois mesures classiques de tendance centrale en statistique. Chacune décrit un aspect différent de la valeur « typique » d’une série ; savoir laquelle utiliser et dans quelles circonstances est une compétence essentielle en analyse de données. La moyenne attribue le même poids à toutes les valeurs, la médiane repère la valeur centrale après tri, et le mode indique la valeur la plus fréquente. Les sections ci-dessous expliquent quand la médiane représente mieux une distribution (revenus, logements et temps de réponse favorisent souvent la médiane), pourquoi les statistiques immobilières et économiques citent des médianes plutôt que des moyennes, quand le mode est la mesure la plus informative et comment les valeurs aberrantes influencent chacune de ces mesures. Cette compréhension distingue les analyses rigoureuses de celles qui citent des « moyennes » sans savoir ce qu’elles représentent.
Moyenne ou médiane : quel centre choisir ?
La moyenne et la médiane décrivent toutes deux le « centre » d’une série, mais s’appuient sur des approches mathématiques fondamentalement différentes. La moyenne donne le même poids à chaque observation ; elle est mathématiquement élégante et utile pour les données symétriques distribuées normalement. La médiane repère simplement la valeur centrale après tri ; elle n’est pas influencée par les valeurs extrêmes et convient mieux aux distributions asymétriques que quelques valeurs aberrantes déforment.
Cette distinction a de grandes conséquences concrètes, notamment dans la présentation des données économiques. Le revenu des ménages américains est toujours présenté sous forme de médiane, et non de moyenne, car sa distribution est fortement asymétrique à droite. Quelques revenus très élevés font grimper la moyenne bien au-dessus du revenu d’un ménage habituel. En 2023, le revenu médian des ménages américains était d’environ $74,000, contre plus de $106,000 pour le revenu moyen, soit un écart de 43 % qui change profondément l’interprétation. Pour les politiques publiques, la médiane est beaucoup plus instructive, car elle répond à la question « quel est le revenu d’un ménage typique ? », tandis que la moyenne répond à « quel serait le revenu si le total était réparti également ? » ; dans une distribution inégalitaire, ces deux questions appellent des réponses très différentes.
Prix des logements et immobilier
On retrouve cette asymétrie dans l’immobilier, où elle produit des écarts similaires entre moyenne et médiane. Une seule vente de luxe dans un quartier peut faire fortement monter le prix moyen et donner l’impression que le marché est plus cher pour les acheteurs habituels. La vente d’une demeure à $10M au milieu de maisons à $400,000 peut augmenter la moyenne de plusieurs dizaines de milliers de dollars, tandis que la médiane reste représentative des prix réellement accessibles. C’est pourquoi les professionnels de l’immobilier citent presque toujours le prix médian des logements : l’indice Case-Shiller, les rapports de la National Association of Realtors et Zillow utilisent tous par défaut des mesures médianes.
Le mode — le prix de vente le plus fréquent — est moins utilisé directement dans les rapports immobiliers, mais peut aider à repérer le niveau de prix où l’activité du marché est la plus forte. Dire que « la plupart des maisons du quartier se vendent entre $450,000 et $475,000 » exprime une notion proche du mode que la moyenne et la médiane ne traduisent pas directement. Les distributions multimodales — par exemple, un marché bimodal où coexistent logements pour primo-accédants et maisons de luxe — rendent les mesures simples de tendance centrale moins utiles. Les rapports immobiliers détaillés présentent donc souvent des histogrammes ou des tranches de prix au lieu de s’appuyer sur un chiffre récapitulatif unique.
Quand le mode est le plus utile
Le mode est essentiel pour les données catégorielles : « quelle couleur les clients choisissent-ils le plus ? » ou « quelles pointures faut-il stocker en plus grande quantité ? ». Dans ces cas, la moyenne numérique est dépourvue de sens. Il est impossible de calculer une moyenne arithmétique de « rouge, bleu, vert, rouge, rouge, bleu » ; le mode (rouge, choisi 3 fois) est le seul résumé utile. La gestion des stocks, l’analyse de sondages, les préférences électorales et l’étude de tout choix parmi plusieurs options reposent largement sur les statistiques modales.
Pour les données numériques, le mode devient particulièrement intéressant lorsque la distribution est multimodale. Une série bimodale, avec deux pics distincts, révèle souvent deux sous-groupes réunis dans un même jeu de données. Un sondage sur les âges lors d’un événement universitaire pourrait présenter des pics à 20 ans (étudiants) et 50 ans (enseignants) ; analyser l’ensemble comme une seule distribution masque la présence de ces deux populations. Les dépenses des clients peuvent également être bimodales, avec un pic pour les acheteurs occasionnels dépensant peu et un autre pour les utilisateurs intensifs, qui appellent des stratégies de fidélisation différentes. Repérer plusieurs modes sur un histogramme est souvent plus instructif qu’une statistique résumée unique, car cela révèle une structure cachée qui influence l’analyse et les décisions. Visualisez toujours les données avant de calculer les statistiques : en présence de deux pics, séparez les groupes et analysez-les à part.
Le problème des valeurs aberrantes
Les valeurs aberrantes, très éloignées de la majorité des données, déforment fortement la moyenne, mais affectent à peine la médiane. La série {1, 2, 3, 4, 5} a une moyenne et une médiane de 3 ; l’ajout d’une seule valeur aberrante de 100 porte la moyenne à 19.2, mais ne fait passer la médiane qu’à 3.5. Les valeurs aberrantes gonflent également fortement l’étendue (max − min), tandis qu’elles modifient à peine l’intervalle interquartile (dispersion des 50 % centraux). C’est pourquoi les statistiques robustes (médiane, IQR, MAD) sont préférées aux mesures non robustes (moyenne, étendue, écart-type) lorsque des valeurs aberrantes sont possibles.
Lorsqu’une valeur aberrante apparaît, la bonne réaction dépend de sa cause. S’il s’agit d’une erreur de saisie ou de mesure, il peut être approprié de la corriger ou de la retirer (en documentant toujours la décision). Si elle correspond à une observation réelle — un revenu élevé dans une enquête sur les revenus, une valeur extrême réellement mesurée par un capteur — il convient d’indiquer à la fois la moyenne et la médiane, de signaler explicitement les valeurs aberrantes et de se demander si elles révèlent un phénomène distinct à étudier. Les anomalies liées à des valeurs aberrantes peuvent révéler les aspects les plus intéressants d’une série ; les écarter comme de simples nuisances fait perdre de l’information. Examinez toujours un diagramme en boîte ou un histogramme pour repérer les valeurs aberrantes avant de retenir une mesure résumée unique.