Mulailah dengan pertanyaan dan model nol
Uji statistik memerlukan hasil yang pasti, hipotesis nol, statistik uji, dan asumsi tentang cara data dihasilkan. Asumsi tersebut dapat mencakup pengambilan sampel atau penugasan secara acak, independensi, dan model probabilitas yang sesuai.
Nilai p adalah probabilitas, di bawah model nol dan asumsinya, untuk memperoleh statistik uji setidaknya sama ekstremnya dengan statistik yang diamati dalam arah atau arah yang ditentukan oleh pengujian.
American Statistical Association memperingatkan agar tidak menafsirkan nilai p sebagai kemungkinan kebenaran suatu hipotesis atau menggunakan ambang batas saja untuk membuat kesimpulan ilmiah atau bisnis. [1]
Contoh yang berhasil: uji z dua sisi
Misalkan suatu eksperimen ilustratif memperkirakan perbedaan perlakuan sebesar 4 unit dengan kesalahan standar sebesar 2 unit. Di bawah hipotesis nol tidak ada perbedaan, statistik-z adalah 4 2 = 2.
Untuk uji standar-normal dua sisi, nilai p kira-kira 0,0455. Hal ini menyatakan bahwa, jika model dan asumsi nol benar, statistik setidaknya jauh dari nol yaitu ±2 akan terjadi sekitar 4,55% dari keseluruhan waktu.
Memang benar tidak katakanlah ada kemungkinan 4,55% bahwa hipotesis nol benar. Laporan ini juga tidak menyatakan bahwa ada kemungkinan sebesar 95,45% bahwa pengobatan tersebut akan berhasil, atau bahwa efeknya akan terulang pada ukuran yang diperkirakan.
Perkiraan interval 95% berdasarkan perhitungan normal yang sama adalah 4 ± 1,96 × 2, atau sekitar 0,08 hingga 7,92 unit. Kisaran luas tersebut merupakan konteks penting meskipun nilai p sedikit di bawah 0,05.
Signifikansi statistik bukanlah kepentingan praktis
Efek yang kecil dapat menghasilkan nilai p yang kecil dalam sampel yang sangat besar. Efek yang berpotensi berarti dapat menghasilkan nilai p yang besar dalam sampel yang kecil atau mengandung noise.
Laporkan dampaknya dalam satuan yang penting bagi keputusan: dolar per pelanggan, poin persentase konversi, jam yang dihemat, atau kuantitas lain yang relevan. Sertakan ketidakpastian dan bandingkan dengan ambang batas praktis yang dipilih untuk permasalahan tersebut.
Misalnya, peningkatan yang terukur sebesar 0,01 poin persentase mungkin masih terlalu kecil untuk membenarkan penerapan yang mahal. Nilai p tidak mengandung biaya implementasi, risiko penurunan, atau nilai menunggu bukti yang lebih baik.
“Tidak signifikan” tidak sama dengan “tidak berpengaruh”
Nilai p yang besar berarti data tersebut tidak terlalu tidak kompatibel dengan model nol yang ditentukan menurut pengujian tersebut. Hal ini tidak menegakkan kesetaraan atau membuktikan bahwa perbedaan yang tersisa cukup kecil untuk diabaikan.
Untuk berpendapat bahwa dua pendekatan secara praktis setara, tentukan perbedaan yang dapat diterima dan gunakan kerangka kesetaraan atau noninferioritas yang sesuai. Jangan menyimpulkan kesetaraan hanya karena uji perbedaan konvensional tidak melewati ambang batas.
Lihatlah intervalnya. Jika eksperimen tersebut mencakup manfaat dan kerugian yang besar, eksperimen tersebut mungkin tidak meyakinkan dan tidak meyakinkan.
Beberapa tes dan pengintipan berulang kali mengubah pertanyaan
Menguji banyak hasil atau segmen menciptakan lebih banyak peluang untuk menemukan hasil yang tampaknya tidak biasa. Memeriksa pengujian sampel tetap biasa secara berulang-ulang dan menghentikannya ketika pengujian menjadi signifikan juga dapat mengubah perilaku kesalahannya.
Rencanakan hasil utama, analisis, ukuran sampel atau aturan penghentian, dan perlakuan terhadap beberapa perbandingan terlebih dahulu jika memungkinkan. Gunakan metode yang dirancang untuk pemantauan berurutan ketika keputusan harus dibuat secara terus menerus.
Temuan eksplorasi bisa sangat berharga. Beri label pada pola tersebut sebagai eksplorasi dan carilah bukti tambahan daripada menyajikan pola yang ditemukan seolah-olah itu adalah pengujian tunggal yang asli.
Gunakan kalimat pelaporan yang lengkap
Laporan yang berguna menyebutkan perbandingan, sampel dan desain, perkiraan efek, interval ketidakpastian, pengujian, nilai p, dan batasan penting. Hindari mengurangi kesimpulan menjadi lencana hijau atau merah.
Sebagai contoh ilustratif: “Perbedaan yang diperkirakan adalah 4 unit, dengan perkiraan interval 95% dari 0,08 hingga 7,92 berdasarkan model normal yang dinyatakan; nilai p dua sisi adalah 0,0455.” Keputusan tersebut masih memerlukan konteks mengenai biaya, kualitas data, dan konsekuensi jika melakukan kesalahan.
Pertanyaan yang sering diajukan
Apakah nilai p berarti probabilitas hipotesis nol benar?
Tidak. Hal ini dihitung dengan asumsi model nol tertentu dan menyangkut probabilitas hasil yang setidaknya sama ekstremnya dengan model tersebut.
Apakah p lebih besar dari 0,05 membuktikan tidak ada pengaruh?
Tidak. Ini mungkin mencerminkan presisi terbatas atau data yang kompatibel dengan beberapa ukuran efek. Pertimbangkan perkiraan efek dan interval ketidakpastian.
Bisakah saya mengubah tes dua sisi menjadi satu sisi setelah melihat hasilnya?
Hal itu mengubah analisis berdasarkan arah pengamatan dan dapat mendistorsi penafsirannya. Pilih tes yang sesuai dengan pertanyaan sebelum memeriksa hasilnya jika memungkinkan.
Sumber & catatan perhitungan
Referensi utama ditautkan di bawah. Tanggal, batasan, dan ketentuan produk dapat berubah; konfirmasikan detail yang berlaku sebelum bertindak.
Gunakan panduan ini dengan bijaksana. Contoh menggambarkan metode perhitungan, bukan hasil yang dijamin. Kegunaan hasil apa pun bergantung pada definisi, pengukuran, dan asumsi yang digunakan.