R au carré (R²) est l’un des nombres les plus cités en statistique, mais aussi l’un des plus mal compris. Ce calculateur détermine R² de deux façons — à partir de données brutes appariées avec un ajustement aux moindres carrés, et directement à partir d’un coefficient de corrélation — afin d’illustrer pourquoi ces deux méthodes concordent toujours et ce que le résultat permet, ou non, de conclure.
Fonctionnement du calculateur de R²
Lorsque vous saisissez des valeurs X et Y appariées, le calculateur ajuste la droite de régression des moindres carrés — celle qui minimise la somme des distances verticales au carré (les résidus) entre chaque point et la droite. Il calcule ensuite R² = 1 − SSres/SStot, en comparant l’erreur restante après l’ajustement (SSres) à la variabilité totale de Y avant l’application d’un modèle (SStot).
Si vous saisissez plutôt un coefficient de corrélation r, le calculateur utilise l’identité algébrique R² = r², qui est exacte pour une régression linéaire simple à un prédicteur. Pour les mêmes données sous-jacentes, les deux méthodes donnent le même résultat : cette équivalence est l’idée centrale que le calculateur illustre.
Les données saisies et leur signification
Dans l’onglet R², les listes X et Y doivent être appariées et de même longueur : chaque position de X correspond à la même position de Y. Les entrées manquantes ou non numériques sont ignorées par paire afin qu’une simple faute de frappe ne décale pas silencieusement toutes les valeurs suivantes.
Dans l’onglet À partir de la corrélation, r doit être un nombre décimal compris entre −1 et 1. C’est l’intervalle standard du coefficient de corrélation de Pearson ; les valeurs hors de cet intervalle ne sont pas des corrélations valides et le calculateur les signalera.
Limites et cas particuliers
R² mesure uniquement la qualité d’ajustement d’un modèle linéaire : une relation courbe (non linéaire) forte peut produire un R² faible même si X et Y sont étroitement liées. Examinez donc toujours le nuage de points en plus de la valeur. R² tend aussi à augmenter automatiquement quand on ajoute des prédicteurs à un modèle (cela ne concerne pas ce calculateur à une seule variable, mais il est utile de le savoir avant de passer à la régression multiple, où le R² ajusté permet une comparaison plus honnête).
Un R² élevé ne prouve pas à lui seul un lien de causalité, et quelques valeurs aberrantes peuvent fortement augmenter ou diminuer R². Considérez R² comme un indicateur parmi d’autres, et non comme un verdict définitif sur l’utilité d’un modèle.