Die lineare Regression ist das leistungsstärkste statistische Modell für Zwei-Variablen-Beziehungen – es wird in Bereichen von der Finanzwelt über die Medizin bis hin zur Sportanalytik eingesetzt. Dieser Rechner passt eine gewöhnliche Linie der kleinsten Quadrate an Ihre Daten an, meldet jede Menge, die Lehrer, Analysten und Forscher tatsächlich benötigen, und ermöglicht Ihnen die Vorhersage neuer Werte mit geeigneten Unsicherheitsintervallen.
So funktioniert der lineare Regressionsrechner
Anhand gepaarter X- und Y-Werte ermittelt der Rechner die Steigung m und den Achsenabschnitt b, die die Summe der quadrierten vertikalen Residuen Σ(y − ŷ)² minimieren. Dieser gewöhnliche Ansatz der kleinsten Quadrate hat eine saubere Lösung in geschlossener Form: m = Sxy / Sxx und b = ȳ − m·x̄, wobei Sxx = Σ(x − x̄)² und Sxy = Σ(x − x̄)(y − ȳ).
Von dort leitet der Rechner die Pearson-Korrelation r, das Bestimmtheitsmaß R² = r² und den Reststandardfehler SE = ab √(SSE / (n − 2)) und der zweiseitige p-Wert für die Steigung unter Verwendung eines Student-t-Tests mit n − 2 Freiheitsgraden. Konfidenz- und Vorhersageintervalle verwenden das vom Benutzer ausgewählte Niveau (90, 95 oder 99 %).
Lesen der Residuen
Die angepasste Linie ist nur dann nützlich, wenn ihre Annahmen zutreffen. Bei der linearen Regression wird davon ausgegangen, dass (1) die Beziehung annähernd linear ist, (2) die Residuen eine annähernd konstante Varianz aufweisen und (3) die Residuen unabhängig sind. Auf der Registerkarte „Residuenanalyse“ werden Residuen gegen das vorhergesagte Y aufgetragen – eine gesunde Anpassung sieht aus wie eine strukturlose Wolke um Null.
Muster, auf die Sie achten sollten: Ein gekrümmter Sweep deutet auf eine nichtlineare Beziehung hin (versuchen Sie es mit einer Polynom- oder Log-Transformation); ein Fächer, der sich mit dem vorhergesagten Y erweitert, weist auf Heteroskedastizität hin (gewichtete kleinste Quadrate berücksichtigen); Ein einzelner Punkt mit einem standardisierten Residuum über ±3 ist ein wahrscheinlicher Ausreißer oder Dateneingabefehler, der untersucht werden sollte.
Neue Werte vorhersagen – und die Grenzen kennen
Die Registerkarte „Vorhersage“ gibt die beste Schätzung des Modells für Y bei einem neuen X zusammen mit zwei Intervallen zurück. Das Konfidenzintervall für den Mittelwert klammert den erwarteten Durchschnitt Y bei diesem X ein – nützlich, wenn Sie Wert auf den Mittelwert der Grundgesamtheit legen. Das Vorhersageintervall für eine einzelne Beobachtung ist breiter, da es die typische Streuung einzelner Datenpunkte entlang der Linie umfasst.
Beide Intervalle werden größer, wenn sich X von x̄ entfernt, und sie werden für Vorhersagen weit außerhalb des beobachteten X-Bereichs unzuverlässig – extrapolieren Sie niemals über Ihre Daten hinaus. Eine häufige Falle: Ein starkes R² beweist keinen Kausalitätszusammenhang. Das Temperatur-/Eiscreme-Beispiel zeigt, dass sich zwei Variablen gemeinsam bewegen können, da ein dritter Faktor (Sommer) beide beeinflusst.