Ce que mesure le r de Pearson
Une corrélation positive signifie que les valeurs élevées d’une variable tendent à aller de pair avec des valeurs élevées de l’autre dans une relation linéaire. Une corrélation négative signifie que les valeurs élevées de l’une tendent à accompagner les valeurs faibles de l’autre. Un coefficient proche de zéro indique une faible association linéaire, pas nécessairement une absence de relation.
Examinez un nuage de points avant d’interpréter le coefficient. Les recommandations du NIST sur les nuages de points mettent en évidence des formes non linéaires, des changements de dispersion et des valeurs aberrantes qu’un indicateur unique peut masquer. [1]
Les observations doivent être appariées de façon cohérente. La taille d’une personne doit être associée à la mesure de l’autre variable relevée chez cette même personne. Trier séparément chaque liste avant de calculer la corrélation détruit ces appariements.
Le calcul sous forme centrée
Soustrayez la moyenne de chaque variable, multipliez les écarts appariés, puis comparez leur somme à la dispersion de chaque variable.
r = Σ[(x − x̄)(y − ȳ)] ÷ √[Σ(x − x̄)² × Σ(y − ȳ)²]
Cette forme évite d’avoir à choisir séparément le dénominateur de la covariance d’échantillon ou de population, car les facteurs correspondants s’annulent. Les deux variables doivent varier. Si toutes les valeurs de x ou toutes celles de y sont identiques, le r de Pearson n’est pas défini.
Changer d’unité au moyen d’un facteur d’échelle linéaire positif, par exemple passer des centimètres aux mètres, ne modifie pas r. Multiplier une variable par un nombre négatif inverse son signe.
Exemple de calcul avec des valeurs appariées
Prenez les valeurs de x 1, 2, 3, 4 et 5, appariées aux valeurs de y 2, 1, 4, 3 et 5. Les deux moyennes sont égales à 3. Les sommes des écarts au carré valent 10 pour x et 10 pour y, tandis que la somme des produits croisés vaut 8.
r = 8 ÷ √(10 × 10) = 0.8
Cet échantillon présente une association linéaire positive. Il ne nous indique pas ce que représentent les variables, si l’une cause l’autre, ni si cinq observations suffisent à produire une estimation stable de la population.
Une qualification comme « forte » dépend du contexte. Un coefficient utile dans un domaine comportemental très variable peut être insuffisant pour un travail d’étalonnage de précision. Présentez la valeur et son contexte plutôt que de traiter une échelle de qualificatifs comme universelle.
La corrélation n’est pas un dispositif causal
Deux variables peuvent évoluer ensemble parce que l’une agit sur l’autre, parce qu’un troisième facteur agit sur les deux, à cause d’un biais de sélection ou d’une tendance temporelle commune. Le coefficient seul ne permet pas de distinguer ces explications.
Par exemple, une entreprise peut constater que ses clients les plus importants bénéficient de davantage d’assistance et renouvellent aussi plus souvent. Cela ne prouve pas à lui seul que l’assistance supplémentaire a causé les renouvellements : la taille du compte, l’adéquation du produit et la structure du contrat peuvent influer sur les deux.
Une question causale nécessite un protocole adapté et des hypothèses, par exemple une expérience randomisée bien menée ou une stratégie observationnelle justifiée. Ajouter un coefficient de corrélation à un graphique ne fournit pas ce protocole.
Les valeurs aberrantes et les formes non linéaires peuvent induire en erreur
Une seule observation appariée extrême peut modifier fortement r. Avant de décider comment la traiter, vérifiez s’il s’agit d’un point valide, d’une erreur de saisie ou de l’indice d’un processus distinct.
Une relation en forme de U peut présenter une corrélation proche de zéro même si y dépend fortement de x. Restreindre l’étendue d’une variable peut également affaiblir la corrélation observée. Le regroupement de populations distinctes peut produire une tendance globale différente de celle observée dans chaque groupe.
Une corrélation fondée sur les rangs peut aider à répondre à une question portant sur une association monotone, mais ne résout pas automatiquement toute relation non linéaire ou affectée par des facteurs de confusion. Choisissez la mesure adaptée à la question.
Présentez l’incertitude et les limites
Un coefficient calculé sur un échantillon est une estimation dont la stabilité dépend de la taille de l’échantillon, de la distribution des données, de leur indépendance et du processus d’échantillonnage. Avec seulement deux observations appariées non constantes, r vaut nécessairement +1 ou −1 ; cette apparente perfection apporte très peu d’éléments probants.
Lorsque vous présentez r, indiquez le nombre de paires complètes, les données exclues, les unités de mesure et un graphique adapté. Les intervalles de confiance et les tests nécessitent des hypothèses supplémentaires par rapport au calcul descriptif de la corrélation.
Questions fréquentes
Une corrélation nulle signifie-t-elle qu’il n’existe aucune relation ?
Non. La corrélation de Pearson mesure l’association linéaire. Une relation non linéaire forte peut avoir un coefficient proche de zéro.
Peut-on calculer la corrélation de Pearson lorsqu’une variable est constante ?
Non. Le dénominateur contient la dispersion nulle de cette variable, ce qui rend le coefficient indéfini.
r au carré représente-t-il toujours le pourcentage causé par une variable ?
Non. Dans une régression linéaire simple avec une constante, r au carré décrit la part de la variation de l’échantillon expliquée par le modèle linéaire ajusté. Ce n’est pas un pourcentage causal.
Sources et notes de calcul
Les références principales sont indiquées ci-dessous. Les dates, limites et conditions des produits peuvent changer ; vérifiez les détails applicables avant d’agir.
Utilisez ce guide avec discernement. Les exemples illustrent une méthode de calcul, sans garantir un résultat. La pertinence de tout résultat dépend des définitions, mesures et hypothèses retenues.