Nilai-P mengukur kekuatan bukti terhadap hipotesis nol - khususnya, probabilitas mengamati statistik uji yang ekstrem seperti milik Anda (atau lebih) jika hipotesis nol itu benar. Meskipun merupakan salah satu konsep statistik yang paling banyak digunakan dalam penelitian ilmiah, nilai-p juga merupakan salah satu angka yang paling disalahpahami dan disalahgunakan dalam semua statistik, sehingga berkontribusi terhadap "krisis replikasi" dalam psikologi, kedokteran, dan ilmu sosial. Bagian di bawah ini membahas apa yang sebenarnya diukur oleh nilai p (dan apa yang tidak diukur), bagaimana ketergantungan yang berlebihan pada ambang batas nilai p telah mendorong praktik penelitian yang diretas dan dipertanyakan, dan mengapa pelaporan ukuran efek bersama dengan nilai p sangat penting untuk interpretasi hasil statistik yang jujur.
Apa Itu Nilai-P (dan Bukan)
Nilai p adalah probabilitas melihat data sama ekstremnya dengan milik Anda (atau lebih ekstrem) jika hipotesis nolnya benar. Dengan tegas BUKAN kemungkinan hipotesis nol itu benar, dan perbedaan ini adalah salah satu poin konseptual terpenting dalam statistik terapan. Nilai p 0,03 berarti: jika H₀ benar, hanya ada peluang 3% untuk melihat hasil ekstrem atau ekstrem ini. Hal ini tidak menjelaskan secara langsung apakah H₀ benar atau salah — hal ini memerlukan analisis Bayesian yang menggabungkan probabilitas sebelumnya.
Kesalahan penafsiran umum yang harus dihindari: "p = 0,03 berarti ada 3% kemungkinan H₀ benar" (salah, ini adalah probabilitas kebalikan P(H₀|data) yang memerlukan teorema Bayes). "p = 0,03 berarti ada 97% kemungkinan H₁ benar" (juga salah). "p > 0,05 berarti H₀ mungkin benar" (salah — tidak adanya bukti bukanlah bukti ketidakhadiran, terutama dengan sampel yang kecil). Penafsiran yang benar sangatlah sempit: nilai p adalah pernyataan tentang betapa tidak lazimnya data Anda jika H₀ benar. Gunakan nilai p untuk mengukur kejutan dalam model nol, bukan untuk membuat pernyataan probabilitas tentang hipotesis itu sendiri.
Krisis Replikasi & P-Hacking
Ketergantungan yang berlebihan pada ambang batas p <0,05 telah memberikan kontribusi signifikan terhadap penelitian yang tidak dapat direproduksi di bidang psikologi, kedokteran, dan ilmu sosial — sebuah masalah yang banyak didokumentasikan sejak krisis replikasi pada tahun 2010-an. "P-hacking" adalah praktik menjalankan beberapa analisis, menguji berbagai subkelompok, mencoba ukuran hasil yang berbeda, atau mengecualikan titik data tertentu hingga ada yang melewati ambang batas 0,05. Hal ini meningkatkan tingkat positif palsu jauh di atas angka nominal 5%, yang berarti banyak temuan "signifikan" yang dipublikasikan merupakan gangguan statistik yang tidak akan direplikasi dalam penelitian selanjutnya.
Praktik terbaik modern mencakup pra-pendaftaran hipotesis dan rencana analisis sebelum mengumpulkan data (memaksa peneliti untuk berkomitmen pada pengujian tertentu dibandingkan melakukan pengujian setelahnya), melaporkan ukuran efek bersama dengan nilai p sehingga pembaca dapat menilai signifikansi praktis bukan hanya signifikansi statistik, menggunakan interval kepercayaan untuk mengomunikasikan besaran ketidakpastian, mengadopsi metode Bayesian jika diperlukan untuk eksplisit penggabungan sebelumnya, dan memperlakukan p = 0,05 sebagai pedoman kasar dan bukan ambang batas biner yang kaku. Beberapa jurnal dan bidang telah beralih ke ambang batas yang lebih ketat (p <0,005) atau memerlukan prapendaftaran untuk publikasi. Alat Open Science Framework mendukung prapendaftaran dan laporan terdaftar yang telah meningkatkan tingkat reproduksibilitas secara signifikan di bidang yang berpartisipasi.
Ukuran Efek Sama Pentingnya dengan Nilai-P
Dengan sampel yang cukup besar, hampir semua perbedaan dari nol menjadi signifikan secara statistik karena nilai p menyusut seiring bertambahnya ukuran sampel, bahkan ketika efek dasarnya kecil. Nilai p sebesar 0,0001 untuk Cohen's d sebesar 0,05 berarti Anda mempunyai pengaruh yang nyata namun kecil - tidak layak untuk ditindaklanjuti meskipun "sangat signifikan". Studi data besar dalam jutaan observasi secara rutin menghasilkan p <0,001 untuk ukuran efek yang nyata namun tidak bermakna secara klinis atau praktis. Signifikansi statistik tidak sama dengan signifikansi praktis.
Selalu pasangkan nilai p dengan estimasi ukuran efek (Cohen's d untuk perbedaan rata-rata, r² untuk kekuatan korelasi, η² atau parsial η² untuk ukuran efek ANOVA) dan interval kepercayaan untuk mendapatkan gambaran statistik yang lengkap. Interpretasi d Cohen: 0,2 = pengaruh kecil, 0,5 = sedang, 0,8 = besar. Aturan praktis yang masuk akal: jika d Cohen < 0,2, efeknya terlalu kecil untuk menjadi masalah dalam sebagian besar keputusan di dunia nyata terlepas dari nilai p. Ini "apakah ini bermakna secara praktis?" filter diterapkan bersama "apakah ini signifikan secara statistik?" menghasilkan keputusan ilmiah dan bisnis yang jauh lebih baik daripada ambang batas nilai p saja. Pedoman modern dari APA, AMA, dan badan profesional lainnya secara eksplisit mewajibkan pelaporan ukuran efek selain nilai p dalam penelitian yang dipublikasikan.