La régression linéaire est un modèle statistique courant pour étudier les relations entre deux variables, utilisé en finance, en médecine et dans l’analyse sportive. Ce calculateur ajuste une droite par la méthode des moindres carrés ordinaires, fournit les mesures utiles aux enseignants, analystes et chercheurs, et permet de prédire de nouvelles valeurs avec des intervalles d’incertitude adaptés.
Fonctionnement du calculateur de régression linéaire
À partir de valeurs X et Y appariées, le calculateur trouve la pente m et l’ordonnée à l’origine b qui minimisent la somme des carrés des résidus verticaux Σ(y − ŷ)². Cette méthode des moindres carrés ordinaires possède une solution explicite : m = Sxy / Sxx et b = ȳ − m·x̄, où Sxx = Σ(x − x̄)² et Sxy = Σ(x − x̄)(y − ȳ).
Le calculateur en déduit la corrélation de Pearson r, le coefficient de détermination R² = r², l’erreur standard résiduelle SE = √(SSE / (n − 2)) et la valeur p bilatérale de la pente, au moyen d’un test t de Student avec n − 2 degrés de liberté. Les intervalles de confiance et de prédiction utilisent le niveau choisi (90, 95 ou 99 %).
Interpréter les résidus
La droite ajustée n’est utile que si ses hypothèses sont raisonnables. La régression linéaire suppose (1) une relation approximativement linéaire, (2) une variance des résidus à peu près constante et (3) des résidus indépendants. L’onglet Analyse des résidus représente les résidus en fonction de Y prédit : un bon ajustement ressemble à un nuage sans structure autour de zéro.
À surveiller : une courbe suggère une relation non linéaire (essayez une transformation polynomiale ou logarithmique) ; un éventail qui s’élargit avec Y prédit indique une hétéroscédasticité (envisagez les moindres carrés pondérés) ; un résidu standardisé au-delà de ±3 peut être une valeur aberrante ou une erreur de saisie à examiner.
Prédire de nouvelles valeurs et connaître les limites
L’onglet Prédiction fournit l’estimation de Y du modèle pour une nouvelle valeur de X, avec deux intervalles. L’intervalle de confiance de la moyenne encadre la valeur moyenne attendue de Y pour ce X. L’intervalle de prédiction d’une observation individuelle est plus large, car il inclut la dispersion habituelle des points individuels autour de la droite.
Les deux intervalles s’élargissent lorsque X s’éloigne de x̄ et deviennent peu fiables loin de la plage observée : n’extrapolez pas au-delà des données. Un R² élevé ne prouve pas une causalité. L’exemple de la température et des ventes de glaces montre que deux variables peuvent évoluer ensemble parce qu’un troisième facteur (l’été) agit sur les deux.