O coeficiente de correlação quantifica a proximidade entre duas variáveis. Um valor próximo de +1 significa que eles sobem e descem em sincronia; perto de -1 significa que um sobe enquanto o outro desce; próximo de 0 significa nenhum padrão linear. Usado em ciência, finanças, medicina e pesquisa social, este número único resume relações que de outra forma exigiriam uma análise complexa.

Pearson r - Medindo Associação Linear

O r de Pearson é calculado dividindo a covariância de X e Y pelo produto de seus desvios padrão, produzindo um valor adimensional entre −1 e +1. Um r positivo significa que X e Y tendem a aumentar juntos; um r negativo significa que eles se movem em direções opostas; r = 0 significa que não há relação linear. O valor absoluto indica força: |r| ≥ 0,70 é normalmente chamado de forte nas ciências sociais (embora os físicos possam exigir |r| ≥ 0,99). O r de Pearson mede apenas relações lineares – uma curva perfeita em forma de U entre X e Y pode produzir r = 0 mesmo que a relação seja matematicamente exata. O Quarteto de Anscombe (1973) ilustrou isso com quatro conjuntos de dados que compartilham r ≈ 0,816, mas parecem completamente diferentes em um gráfico de dispersão. É por isso que a visualização dos seus dados com um gráfico de dispersão deve sempre acompanhar o valor numérico r, e é por isso que a calculadora exibe um gráfico de dispersão ao lado do coeficiente.

Spearman ρ - Correlação de classificação robusta

O ρ (rho) de Spearman calcula o r de Pearson dos dados transformados por classificação. Em vez de usar valores brutos de X e Y, ele os converte em suas classificações (1º, 2º, 3º…) e correlaciona essas classificações. Isso torna o ρ de Spearman robusto contra valores discrepantes – um valor bruto extremo apenas se torna a classificação mais alta ou mais baixa, e não um número extremo que domina o cálculo. Também é válido para dados ordinais onde você conhece a ordem, mas não as magnitudes precisas, como respostas em escala Likert (discordo totalmente a concordo totalmente) ou classificações de concorrência. Spearman também detecta relações monotônicas, mas não lineares: se Y sempre aumenta quando X aumenta, mas não a uma taxa constante, Spearman ρ será 1,0, embora Pearson r possa estar bem abaixo de 1,0. Compare os dois valores na calculadora: uma grande discrepância entre Pearson r e Spearman ρ normalmente sinaliza valores discrepantes influentes, um relacionamento não linear ou dados ordinais sendo tratados como contínuos - todas as situações em que Pearson r está fornecendo uma imagem enganosa e Spearman ρ é a medida mais confiável.

Intervalos de confiança e transformação z de Fisher

Pearson r tem uma distribuição amostral distorcida, especialmente quando a verdadeira correlação populacional está próxima de ±1, onde a distribuição se torna altamente assimétrica. A transformação z de Fisher converte r em z' = 0,5 × ln[(1+r)/(1−r)], que é distribuído aproximadamente normalmente com erro padrão 1/√(n−3), independentemente do verdadeiro valor de correlação. Essa normalidade permite a construção direta de intervalos de confiança: calcule o intervalo no espaço z usando quantis normais padrão e, em seguida, faça a transformação reversa de ambos os limites para a escala r. Um IC de 95% para r = 0,80 com n = 30 pode abranger [0,62, 0,90] — um intervalo notavelmente amplo, revelando que 30 pontos de dados fornecem apenas uma estimativa grosseira da verdadeira correlação populacional. Com n = 100, o mesmo r = 0,80 produz um IC mais restrito de aproximadamente [0,71, 0,87]. É por isso que relatar o tamanho da amostra juntamente com r é essencial: um r = 0,50 com n = 10 é essencialmente não interpretável, enquanto r = 0,50 com n = 500 é altamente informativo e estatisticamente estável. A transformação z de Fisher também é usada para testar se duas correlações medidas em grupos diferentes diferem significativamente, comparando seus valores z' usando um teste normal padrão.

Outliers e sua influência na Pearson r

Um único valor atípico extremo pode alterar drasticamente o r de Pearson porque a fórmula envolve desvios quadrados da média, o que amplifica pontos distantes desproporcionalmente. Um conjunto de dados com 19 pontos agrupados perto de r = 0, mas com um ponto de alavancagem distante, pode mostrar r = 0,90 — o valor discrepante domina inteiramente o cálculo, mascarando o verdadeiro padrão na maior parte dos dados. Esta calculadora sinaliza pontos com resíduos padronizados além de ±2,5σ como possíveis valores discrepantes, exibidos como triângulos vermelhos no gráfico de dispersão. Quando há valores discrepantes, compare sempre o r de Pearson com o ρ de Spearman: uma grande discrepância (|r_Pearson − r_Spearman| > 0,15) sinaliza que o valor discrepante é influente e os resultados devem ser interpretados com cautela. Antes de agir sobre essa discrepância, investigue se o valor discrepante representa um erro de entrada de dados, um artefato de medição ou um evento genuinamente raro do mundo real. Remover valores extremos válidos apenas para melhorar a aparência de r é uma forma de manipulação de dados que distorce as conclusões. A abordagem cientificamente correta é relatar a análise com e sem o valor discrepante, explicar a diferença e deixar que os leitores julguem sua importância por si próprios.

Correlação não é causalidade

O princípio mais importante na interpretação da correlação é que a associação não implica causalidade. Duas variáveis ​​podem ser correlacionadas por vários motivos: X causa Y diretamente, Y causa X (causação reversa), uma terceira variável Z causa ambas (confusão), ou a correlação é puramente coincidente e estatisticamente espúria, dadas variáveis ​​suficientes testadas simultaneamente. O exemplo clássico é que as vendas de gelados e as mortes por afogamento estão positivamente correlacionadas durante os meses de verão – ambas são impulsionadas pelo clima quente, que é a verdadeira causa comum. Outra: países com mais televisores per capita tendem a ter maior esperança de vida, mas comprar um televisor não prolonga a vida; ambos se correlacionam com a riqueza nacional. Estabelecer a causalidade requer um desenho experimental controlado – idealmente ensaios clínicos randomizados – ou métodos rigorosos de inferência causal observacional, como variáveis ​​instrumentais ou diferenças em diferenças. A correlação é um poderoso ponto de partida para gerar e priorizar hipóteses, mas não pode, por si só, provar causa e efeito. Sempre use o valor p e o intervalo de confiança para avaliar se uma correlação é estatisticamente distinguível do acaso antes de passar para a interpretação causal e sempre projete estudos de acompanhamento para descartar fatores de confusão antes de tirar conclusões políticas ou clínicas.