Mathématiques et statistiques

Coefficient de corrélation : interpréter le r de Pearson sans exagérer ses conclusions

Comprenez la corrélation de Pearson, calculez r à partir de données appariées et repérez les effets des valeurs aberrantes, de la non-linéarité et des facteurs de confusion.

Mis à jour le 4 min de lecture

En bref

Le coefficient de corrélation de Pearson mesure la direction et l’intensité d’une relation linéaire entre deux variables numériques appariées. Lorsqu’il est défini, il varie de −1 à +1, mais n’établit pas de lien de causalité et n’exclut pas une relation non linéaire.

Dans ce guide
  1. Ce que mesure le r de Pearson
  2. Le calcul sous forme centrée
  3. Exemple de calcul avec des valeurs appariées
  4. La corrélation n’est pas un dispositif causal
  5. Les valeurs aberrantes et les formes non linéaires peuvent induire en erreur
  6. Présentez l’incertitude et les limites
  7. Questions fréquentes
  8. Sources et notes de calcul
  9. Passer à la calculatrice

Ce que mesure le r de Pearson

Une corrélation positive signifie que les valeurs élevées d’une variable tendent à aller de pair avec des valeurs élevées de l’autre dans une relation linéaire. Une corrélation négative signifie que les valeurs élevées de l’une tendent à accompagner les valeurs faibles de l’autre. Un coefficient proche de zéro indique une faible association linéaire, pas nécessairement une absence de relation.

Examinez un nuage de points avant d’interpréter le coefficient. Les recommandations du NIST sur les nuages de points mettent en évidence des formes non linéaires, des changements de dispersion et des valeurs aberrantes qu’un indicateur unique peut masquer. [1]

Les observations doivent être appariées de façon cohérente. La taille d’une personne doit être associée à la mesure de l’autre variable relevée chez cette même personne. Trier séparément chaque liste avant de calculer la corrélation détruit ces appariements.

Le calcul sous forme centrée

Soustrayez la moyenne de chaque variable, multipliez les écarts appariés, puis comparez leur somme à la dispersion de chaque variable.

r = Σ[(x − x̄)(y − ȳ)] ÷ √[Σ(x − x̄)² × Σ(y − ȳ)²]

Cette forme évite d’avoir à choisir séparément le dénominateur de la covariance d’échantillon ou de population, car les facteurs correspondants s’annulent. Les deux variables doivent varier. Si toutes les valeurs de x ou toutes celles de y sont identiques, le r de Pearson n’est pas défini.

Changer d’unité au moyen d’un facteur d’échelle linéaire positif, par exemple passer des centimètres aux mètres, ne modifie pas r. Multiplier une variable par un nombre négatif inverse son signe.

Exemple de calcul avec des valeurs appariées

Prenez les valeurs de x 1, 2, 3, 4 et 5, appariées aux valeurs de y 2, 1, 4, 3 et 5. Les deux moyennes sont égales à 3. Les sommes des écarts au carré valent 10 pour x et 10 pour y, tandis que la somme des produits croisés vaut 8.

r = 8 ÷ √(10 × 10) = 0.8

Cet échantillon présente une association linéaire positive. Il ne nous indique pas ce que représentent les variables, si l’une cause l’autre, ni si cinq observations suffisent à produire une estimation stable de la population.

Une qualification comme « forte » dépend du contexte. Un coefficient utile dans un domaine comportemental très variable peut être insuffisant pour un travail d’étalonnage de précision. Présentez la valeur et son contexte plutôt que de traiter une échelle de qualificatifs comme universelle.

La corrélation n’est pas un dispositif causal

Deux variables peuvent évoluer ensemble parce que l’une agit sur l’autre, parce qu’un troisième facteur agit sur les deux, à cause d’un biais de sélection ou d’une tendance temporelle commune. Le coefficient seul ne permet pas de distinguer ces explications.

Par exemple, une entreprise peut constater que ses clients les plus importants bénéficient de davantage d’assistance et renouvellent aussi plus souvent. Cela ne prouve pas à lui seul que l’assistance supplémentaire a causé les renouvellements : la taille du compte, l’adéquation du produit et la structure du contrat peuvent influer sur les deux.

Une question causale nécessite un protocole adapté et des hypothèses, par exemple une expérience randomisée bien menée ou une stratégie observationnelle justifiée. Ajouter un coefficient de corrélation à un graphique ne fournit pas ce protocole.

Les valeurs aberrantes et les formes non linéaires peuvent induire en erreur

Une seule observation appariée extrême peut modifier fortement r. Avant de décider comment la traiter, vérifiez s’il s’agit d’un point valide, d’une erreur de saisie ou de l’indice d’un processus distinct.

Une relation en forme de U peut présenter une corrélation proche de zéro même si y dépend fortement de x. Restreindre l’étendue d’une variable peut également affaiblir la corrélation observée. Le regroupement de populations distinctes peut produire une tendance globale différente de celle observée dans chaque groupe.

Une corrélation fondée sur les rangs peut aider à répondre à une question portant sur une association monotone, mais ne résout pas automatiquement toute relation non linéaire ou affectée par des facteurs de confusion. Choisissez la mesure adaptée à la question.

Présentez l’incertitude et les limites

Un coefficient calculé sur un échantillon est une estimation dont la stabilité dépend de la taille de l’échantillon, de la distribution des données, de leur indépendance et du processus d’échantillonnage. Avec seulement deux observations appariées non constantes, r vaut nécessairement +1 ou −1 ; cette apparente perfection apporte très peu d’éléments probants.

Lorsque vous présentez r, indiquez le nombre de paires complètes, les données exclues, les unités de mesure et un graphique adapté. Les intervalles de confiance et les tests nécessitent des hypothèses supplémentaires par rapport au calcul descriptif de la corrélation.

Questions fréquentes

Une corrélation nulle signifie-t-elle qu’il n’existe aucune relation ?

Non. La corrélation de Pearson mesure l’association linéaire. Une relation non linéaire forte peut avoir un coefficient proche de zéro.

Peut-on calculer la corrélation de Pearson lorsqu’une variable est constante ?

Non. Le dénominateur contient la dispersion nulle de cette variable, ce qui rend le coefficient indéfini.

r au carré représente-t-il toujours le pourcentage causé par une variable ?

Non. Dans une régression linéaire simple avec une constante, r au carré décrit la part de la variation de l’échantillon expliquée par le modèle linéaire ajusté. Ce n’est pas un pourcentage causal.

Sources et notes de calcul

Les références principales sont indiquées ci-dessous. Les dates, limites et conditions des produits peuvent changer ; vérifiez les détails applicables avant d’agir.

  1. NIST : interpréter les nuages de points

Utilisez ce guide avec discernement. Les exemples illustrent une méthode de calcul, sans garantir un résultat. La pertinence de tout résultat dépend des définitions, mesures et hypothèses retenues.