La regresión lineal es el modelo estadístico de referencia para relaciones entre dos variables — usado en campos que van desde las finanzas hasta la medicina y la analítica deportiva. Esta calculadora ajusta una línea de mínimos cuadrados ordinarios a tus datos, reporta cada cantidad que profesores, analistas e investigadores realmente necesitan, y te permite predecir nuevos valores con intervalos de incertidumbre apropiados.
Cómo funciona la calculadora de regresión lineal
Dados valores emparejados de X e Y, la calculadora encuentra la pendiente m y el intercepto b que minimizan la suma de residuos verticales al cuadrado Σ(y − ŷ)². Este enfoque de mínimos cuadrados ordinarios tiene una solución cerrada y limpia: m = Sxy / Sxx y b = ȳ − m·x̄, donde Sxx = Σ(x − x̄)² y Sxy = Σ(x − x̄)(y − ȳ).
A partir de ahí, la calculadora deriva la correlación de Pearson r, el coeficiente de determinación R² = r², el error estándar residual SE = √(SSE / (n − 2)) y el valor p de dos colas para la pendiente usando una prueba t de Student con n − 2 grados de libertad. Los intervalos de confianza y de predicción usan el nivel seleccionado por el usuario (90, 95 o 99%).
Leyendo los residuos
La línea ajustada solo es útil si se cumplen sus supuestos. La regresión lineal supone que (1) la relación es aproximadamente lineal, (2) los residuos tienen una varianza aproximadamente constante y (3) los residuos son independientes. La pestaña de Análisis de Residuos grafica los residuos contra la Y predicha — un ajuste saludable se ve como una nube sin estructura alrededor de cero.
Patrones a vigilar: una curva sugiere una relación no lineal (prueba un polinomio o una transformación logarítmica); un abanico que se ensancha con la Y predicha indica heterocedasticidad (considera mínimos cuadrados ponderados); un único punto con un residuo estandarizado más allá de ±3 es probablemente un valor atípico o un error de captura que vale la pena investigar.
Prediciendo nuevos valores — y conociendo los límites
La pestaña de Predicción devuelve la mejor estimación del modelo para Y en una nueva X, junto con dos intervalos. El intervalo de confianza para la media acota la Y promedio esperada en esa X — útil cuando te interesa la media de la población. El intervalo de predicción para una observación individual es más amplio porque incluye la dispersión típica de los puntos individuales alrededor de la línea.
Ambos intervalos se ensanchan a medida que X se aleja de x̄, y se vuelven poco confiables para predicciones muy fuera del rango observado de X — nunca extrapoles más allá de tus datos. Un error común: un R² alto no prueba causalidad. El ejemplo de temperatura/helado muestra que dos variables pueden moverse juntas porque un tercer factor (el verano) impulsa a ambas.