Koefisien korelasi mengukur seberapa dekat dua variabel bergerak bersama. Nilai yang mendekati +1 berarti keduanya naik dan turun secara beriringan; dekat −1 berarti yang satu naik sementara yang lain turun; mendekati 0 berarti tidak ada pola linier. Digunakan dalam sains, keuangan, kedokteran, dan penelitian sosial, angka tunggal ini merangkum hubungan-hubungan yang memerlukan analisis kompleks.

Pearson r - Mengukur Asosiasi Linier

Pearson r dihitung dengan membagi kovarians X dan Y dengan produk deviasi standarnya, sehingga menghasilkan nilai tak berdimensi antara −1 dan +1. R yang positif berarti X dan Y cenderung meningkat secara bersamaan; r negatif berarti mereka bergerak berlawanan arah; r = 0 berarti tidak ada hubungan linier. Nilai absolut menunjukkan kekuatan: |r| ≥ 0,70 biasanya disebut kuat dalam ilmu sosial (meskipun fisikawan mungkin memerlukan |r| ≥ 0,99). Pearson r hanya mengukur hubungan linier — kurva berbentuk U sempurna antara X dan Y dapat menghasilkan r = 0 meskipun hubungannya tepat secara matematis. Kuartet Anscombe (1973) mengilustrasikan hal ini dengan empat kumpulan data yang semuanya memiliki r ≈ 0,816 namun terlihat sangat berbeda pada plot sebar. Inilah sebabnya mengapa memvisualisasikan data Anda dengan diagram sebar harus selalu disertai dengan nilai numerik r, dan mengapa kalkulator menampilkan diagram sebar di samping koefisien.

Spearman ρ — Korelasi Peringkat yang Kuat

Spearman's ρ (rho) menghitung Pearson r dari data transformasi peringkat. Alih-alih menggunakan nilai X dan Y mentah, ini mengubahnya menjadi peringkatnya (1, 2, 3…) dan menghubungkan peringkat tersebut. Hal ini membuat Spearman ρ kuat terhadap outlier — nilai mentah ekstrem hanya menjadi peringkat tertinggi atau terendah, bukan angka ekstrem yang mendominasi penghitungan. Hal ini juga berlaku untuk data ordinal dimana Anda mengetahui urutannya tetapi tidak mengetahui besarannya secara tepat, seperti tanggapan skala Likert (sangat tidak setuju hingga sangat setuju) atau peringkat kompetisi. Spearman juga mendeteksi hubungan monotonik tetapi non-linier: jika Y selalu meningkat ketika X meningkat tetapi tidak pada laju yang konstan, Spearman ρ akan menjadi 1,0 meskipun Pearson r mungkin jauh di bawah 1,0. Bandingkan kedua nilai dalam kalkulator: perbedaan besar antara Pearson r dan Spearman ρ biasanya menandakan outlier yang berpengaruh, hubungan non-linier, atau data ordinal diperlakukan sebagai data kontinu — semua situasi ketika Pearson r memberikan gambaran yang menyesatkan dan Spearman ρ adalah ukuran yang lebih dapat dipercaya.

Interval Keyakinan dan Transformasi Fisher z

Pearson r memiliki distribusi pengambilan sampel yang miring, terutama ketika korelasi populasi sebenarnya mendekati ±1, sehingga distribusinya menjadi sangat asimetris. Transformasi z Fisher mengubah r menjadi z' = 0,5 × ln[(1+r)/(1−r)], yang kira-kira terdistribusi normal dengan kesalahan standar 1/√(n−3), terlepas dari nilai korelasi sebenarnya. Normalitas ini memungkinkan konstruksi interval kepercayaan secara langsung: hitung interval dalam ruang-z menggunakan kuantil normal standar, lalu transformasikan kembali kedua batas ke skala r. CI 95% untuk r = 0,80 dengan n = 30 mungkin mencakup [0,62, 0,90] — rentang yang sangat luas, menunjukkan bahwa 30 titik data hanya memberikan perkiraan kasar mengenai korelasi populasi sebenarnya. Dengan n = 100, r = 0,80 yang sama menghasilkan CI yang lebih ketat sekitar [0,71, 0,87]. Inilah sebabnya mengapa melaporkan ukuran sampel bersama r sangat penting: r = 0,50 dengan n = 10 pada dasarnya tidak dapat ditafsirkan, sedangkan r = 0,50 dengan n = 500 sangat informatif dan stabil secara statistik. Transformasi z Fisher juga digunakan untuk menguji apakah dua korelasi yang diukur pada kelompok berbeda berbeda secara signifikan, dengan membandingkan nilai z'nya menggunakan uji normal standar.

Pencilan dan Pengaruhnya terhadap Pearson r

Sebuah pencilan ekstrem dapat mengubah r Pearson secara dramatis karena rumusnya melibatkan deviasi kuadrat dari mean, yang memperkuat titik-titik jauh secara tidak proporsional. Kumpulan data dengan 19 titik yang dikelompokkan di dekat r = 0 tetapi satu titik leverage yang jauh dapat menunjukkan r = 0,90 — outlier sepenuhnya mendominasi penghitungan, menutupi pola sebenarnya di sebagian besar data. Kalkulator ini menandai titik-titik dengan residu terstandar di luar ±2,5σ sebagai potensi outlier, ditampilkan sebagai segitiga merah pada plot sebar. Jika terdapat outlier, selalu bandingkan Pearson r dengan Spearman ρ: perbedaan yang besar (|r_Pearson − r_Spearman| > 0,15) menandakan bahwa outlier tersebut berpengaruh dan hasilnya harus diinterpretasikan dengan hati-hati. Sebelum mengambil tindakan atas perbedaan tersebut, selidiki apakah outlier mewakili kesalahan entri data, artefak pengukuran, atau peristiwa nyata yang jarang terjadi. Menghapus nilai ekstrem yang valid semata-mata untuk menyempurnakan tampilan r adalah bentuk manipulasi data yang membuat kesimpulan menjadi bias — pendekatan yang benar secara ilmiah adalah dengan melaporkan analisis dengan dan tanpa outlier, menjelaskan perbedaannya, dan membiarkan pembaca menilai sendiri pentingnya hal tersebut.

Korelasi Bukan Penyebab

Prinsip terpenting dalam menafsirkan korelasi adalah bahwa asosiasi tidak berarti sebab-akibat. Dua variabel dapat dikorelasikan karena beberapa alasan: X menyebabkan Y secara langsung, Y menyebabkan X (penyebab terbalik), variabel ketiga Z menyebabkan keduanya (pengganggu), atau korelasi tersebut murni kebetulan dan palsu secara statistik jika cukup banyak variabel yang diuji secara bersamaan. Contoh klasiknya adalah penjualan es krim dan kematian akibat tenggelam berkorelasi positif selama musim panas – keduanya disebabkan oleh cuaca panas, yang merupakan penyebab umum sebenarnya. Alasan lainnya: negara-negara dengan lebih banyak televisi per kapita cenderung memiliki harapan hidup lebih lama, namun membeli TV tidak memperpanjang umur; keduanya berkorelasi dengan kekayaan nasional. Menetapkan sebab-akibat memerlukan desain eksperimen terkontrol – idealnya uji coba terkontrol secara acak – atau metode inferensi sebab-akibat observasional yang ketat seperti variabel instrumental atau perbedaan-dalam-perbedaan. Korelasi adalah titik awal yang kuat untuk menghasilkan dan memprioritaskan hipotesis, namun korelasi tidak dapat membuktikan sebab dan akibat dengan sendirinya. Selalu gunakan nilai p dan interval kepercayaan untuk menilai apakah suatu korelasi dapat dibedakan secara statistik dari kebetulan sebelum beralih ke interpretasi sebab akibat, dan selalu rancang studi lanjutan untuk menyingkirkan perancu sebelum menarik kesimpulan kebijakan atau klinis.