A regressão linear é o modelo estatístico robusto para relacionamentos de duas variáveis – usado em áreas que vão de finanças a medicina e análise esportiva. Esta calculadora ajusta uma linha de mínimos quadrados comum aos seus dados, relata todas as quantidades que professores, analistas e pesquisadores realmente precisam e permite prever novos valores com intervalos de incerteza adequados.

Como funciona a calculadora de regressão linear

Dados os valores emparelhados de X e Y, a calculadora encontra a inclinação m e a interceptação b que minimiza a soma dos resíduos verticais quadrados Σ(y − ŷ)². Esta abordagem de mínimos quadrados comuns tem uma solução limpa de forma fechada: m = Sxy / Sxx e b = ȳ − m·x̄, onde Sxx = Σ(x − x̄)² e Sxy = Σ(x − x̄)(y − ȳ).

A partir daí, a calculadora deriva a correlação de Pearson r, o coeficiente de determinação R² = r², o erro padrão residual SE = √(SSE / (n − 2)), e o valor p bicaudal para a inclinação usando um teste t de Student com n − 2 graus de liberdade. Os intervalos de confiança e previsão usam o nível selecionado pelo usuário (90, 95 ou 99%).

Lendo os resíduos

A linha ajustada só é útil se suas suposições forem válidas. A regressão linear assume (1) a relação é aproximadamente linear, (2) os resíduos têm variância aproximadamente constante e (3) os resíduos são independentes. A guia Análise de resíduos representa os resíduos em relação ao Y previsto — um ajuste saudável se parece com uma nuvem sem estrutura em torno de zero.

Padrões a serem observados: uma varredura curva sugere uma relação não linear (tente uma transformação polinomial ou logarítmica); um leque que se alarga com Y previsto indica heterocedasticidade (considere mínimos quadrados ponderados); um único ponto com um resíduo padronizado além de ±3 é um provável valor discrepante ou erro de entrada de dados que vale a pena investigar.

Prever novos valores — e conhecer os limites

A guia Predição retorna a melhor estimativa do modelo para Y em um novo X, juntamente com dois intervalos. O intervalo de confiança para a média coloca entre colchetes a média esperada Y naquele X – útil quando você se preocupa com a média da população. O intervalo de previsão para uma observação individual é mais amplo porque inclui a dispersão típica de pontos de dados únicos ao redor da linha.

Ambos os intervalos aumentam à medida que X se afasta de x̄ e se tornam não confiáveis para previsões muito fora do intervalo X observado – nunca extrapole além dos seus dados. Uma armadilha comum: um R² forte não prova a causalidade. O exemplo da temperatura/sorvete mostra que duas variáveis podem se mover juntas porque um terceiro fator (verão) impulsiona ambas.