Le coefficient de corrélation quantifie à quel point deux variables évoluent ensemble. Près de +1, elles montent et descendent de concert ; près de −1, l’une augmente quand l’autre diminue ; près de 0, il n’y a pas de schéma linéaire. Utilisé en sciences, en finance, en médecine et en recherche sociale, il résume des relations qui nécessiteraient autrement une analyse complexe.
Pearson r — mesurer une association linéaire
Pearson r est la covariance de X et Y divisée par le produit de leurs écarts-types, soit une valeur sans unité entre −1 et +1. Un r positif signifie que X et Y augmentent ensemble, un r négatif qu’ils évoluent en sens opposés, et r = 0 indique l’absence de relation linéaire. La valeur absolue indique la force : |r| ≥ 0.70 est généralement qualifié de fort en sciences sociales (les physiciens peuvent exiger |r| ≥ 0.99). Pearson ne mesure que les relations linéaires : une courbe en U parfaite peut donner r = 0. Le quartet d’Anscombe (1973) l’illustre avec quatre jeux de données ayant tous r ≈ 0.816 mais des nuages de points très différents. Visualisez donc toujours les données ; le calculateur affiche le graphique avec le coefficient.
Spearman ρ — corrélation robuste fondée sur les rangs
Le ρ (rhô) de Spearman calcule Pearson r sur les rangs des valeurs plutôt que sur X et Y bruts. Une valeur extrême devient le rang le plus haut ou le plus bas, et ne domine pas le calcul. Cette méthode convient aux données ordinales, où l’ordre est connu mais pas les écarts précis, comme les réponses sur une échelle de Likert ou les classements. Spearman détecte aussi les relations monotones non linéaires : si Y augmente toujours avec X mais pas à rythme constant, Spearman ρ vaut 1.0 même si Pearson r est inférieur. Un écart marqué entre les deux peut signaler des valeurs aberrantes, une relation non linéaire ou des données ordinales traitées comme continues.
Intervalles de confiance et transformation z de Fisher
La distribution d’échantillonnage de Pearson r est asymétrique, surtout si la vraie corrélation approche ±1. La transformation z de Fisher convertit r en z' = 0.5 × ln[(1+r)/(1−r)], grandeur approximativement normale d’erreur-type 1/√(n−3). On peut alors calculer l’intervalle dans l’espace z avec les quantiles normaux, puis reconvertir ses bornes à l’échelle r. Pour r = 0.80 et n = 30, un IC à 95 % pourrait aller de [0.62, 0.90], montrant qu’un petit échantillon donne une estimation grossière ; avec n = 100, l’IC est environ [0.71, 0.87]. Indiquez toujours n avec r : r = 0.50 pour n = 10 est difficile à interpréter, tandis que r = 0.50 pour n = 500 est informatif et stable. Fisher z sert aussi à tester si deux corrélations de groupes différents diffèrent significativement.
Valeurs aberrantes et influence sur Pearson r
Une valeur aberrante extrême peut modifier Pearson r, car les écarts au carré amplifient les points éloignés. Dix-neuf points proches de r = 0 et un point de levier peuvent donner r = 0.90, masquant la tendance générale. Le calculateur signale les résidus standardisés au-delà de ±2.5σ comme valeurs aberrantes possibles ; ils apparaissent en triangles rouges. Comparez Pearson r à Spearman ρ : un écart |r_Pearson − r_Spearman| > 0.15 indique une influence possible. Vérifiez s’il s’agit d’une erreur de saisie, d’un artefact de mesure ou d’un événement rare réel. Supprimer des valeurs valides pour embellir r biaise les conclusions ; présentez plutôt l’analyse avec et sans la valeur, expliquez l’écart et laissez les lecteurs en juger.
Corrélation n’est pas causalité
Une association n’implique pas une causalité. X peut causer Y, Y peut causer X, une variable Z peut causer les deux (facteur de confusion), ou la corrélation peut être fortuite parmi de nombreuses variables testées. Les ventes de glaces et les noyades sont positivement corrélées en été ; leur cause commune est la chaleur. Les pays ayant plus de téléviseurs par habitant ont aussi une espérance de vie supérieure, mais le téléviseur ne prolonge pas la vie : les deux facteurs sont liés à la richesse. Établir une causalité nécessite une expérience contrôlée, idéalement randomisée, ou des méthodes d’inférence causale comme les variables instrumentales ou les doubles différences. La corrélation aide à formuler des hypothèses, mais ne prouve pas à elle seule la cause et l’effet. Évaluez la valeur p et l’intervalle de confiance, puis menez des études de suivi pour écarter les facteurs de confusion avant d’en tirer des conclusions politiques ou cliniques.