Pengujian hipotesis adalah prosedur formal yang digunakan para ilmuwan untuk memutuskan apakah efek yang diamati dalam data sampel adalah nyata atau hanya gangguan pengambilan sampel. Lima pengujian yang didukung kalkulator ini — t satu sampel, t dua sampel (Welch), t berpasangan, kesesuaian chi-kuadrat, dan independensi chi-kuadrat — mencakup sebagian besar kasus penggunaan statistik pengantar dan terapan. Memahami kapan harus menggunakan tes yang mana, apa arti sebenarnya dari nilai p, dan mengapa ukuran efek penting di samping signifikansi, membedakan praktik statistik yang kompeten dari ritual pemujaan kargo.

Memilih Tes yang Tepat

Tiga pertanyaan pilih tes untuk Anda. Pertama, apakah Anda membandingkan rata-rata (data numerik kontinu) atau jumlah (data kategorikal)? Berarti → keluarga uji-t; hitungan → keluarga chi-kuadrat. Kedua, berapa kelompok? Satu sampel dibandingkan dengan referensi yang diketahui → satu sampel t. Dua kelompok independen → Welch t dua sampel. Dua pengukuran terkait pada subjek yang sama (sebelum/sesudah, pasangan kembar) → berpasangan t. Ketiga, bagaimana struktur data kategorikalnya? Satu variabel dengan k kategori → chi-square goodness-of-fit. Dua variabel dalam tabel kontingensi 2×2 → independensi chi-kuadrat. Diagram alur bersifat mekanis setelah Anda menginternalisasi pertanyaan. Kesalahan umum yang dilakukan siswa mencakup penggunaan uji-t pada persentase (yang merupakan proporsi, bukan rata-rata — biasanya menginginkan uji chi-kuadrat atau proporsi) dan penggunaan uji-t berpasangan pada sampel independen (yang kehilangan kekuatan statistik tanpa manfaat).

nilai-p Tidak Berarti Apa yang Orang Pikirkan

Satu-satunya kesalahan penafsiran yang paling umum dalam statistik adalah memperlakukan nilai p sebagai 'probabilitas bahwa H₀ benar' atau 'probabilitas bahwa hasilnya terjadi secara kebetulan.' Tidak ada yang benar. Nilai p adalah probabilitas mengamati data yang setidaknya sama ekstremnya dengan data Anda, dengan asumsi H₀ benar. Ini tergantung pada apakah null itu benar, tidak informatif tentang apakah null itu benar. Nilai p yang kecil merupakan bukti yang menentang H₀ — bukti kuat bahwa data tidak mungkin berada di bawah nol — tetapi nilai tersebut tidak mengukur seberapa besar kemungkinan H₀. P sebesar 0,04 bukanlah 'kemungkinan 4% bahwa nolnya benar'; ini adalah 'peluang 4% untuk melihat data ekstrem ini jika nolnya benar.' Inilah sebabnya mengapa statistik modern menekankan ukuran efek di samping nilai-p: perbedaan kecil namun signifikan secara statistik (p = 0,001, d = 0,05) adalah nyata namun kecil; perbedaan yang besar tetapi tidak signifikan (p = 0,12, d = 0,6) bersifat sugestif tetapi kurang bertenaga. Laporkan kedua nomor tersebut.

Mengapa Welch's t Mengalahkan Student's t

Sebagian besar buku pengantar masih menampilkan 'Uji-t gabungan siswa' sebagai perbandingan dua sampel default, dengan penyesuaian Welch ditampilkan sebagai kasus pengecualian untuk 'varians yang tidak setara'. Statistik modern telah membalikkan saran ini: Uji-t Welch harus menjadi standar karena asumsi variansi yang sama (asumsi homoskedastisitas yang diandalkan oleh uji gabungan Student) jarang terpenuhi dalam praktiknya, dan uji gabungan memberikan tingkat positif palsu yang meningkat jika dilanggar. Penyesuaian Welch menggunakan pendekatan Welch–Satterthwaite untuk df dan menghitung kesalahan standar tanpa pengumpulan, menghasilkan tingkat kesalahan Tipe I yang hampir benar terlepas dari apakah variansnya sama. Bahasa R beralih ke bahasa Welch sebagai default di t.test() karena alasan ini; SciPy dan sebagian besar alat modern kini melakukan hal yang sama. Kecuali jika Anda mempunyai alasan teoritis khusus untuk menggabungkan varians, gunakanlah teori Welch — pada dasarnya tidak ada biaya jika varians sama, dan ada manfaat nyata jika varians tidak sama.

Peringatan Chi-Square

Perkiraan chi-kuadrat bergantung pada jumlah sel yang diharapkan cukup besar sehingga distribusi jumlah sampel diskrit dapat didekati dengan baik oleh distribusi chi-kuadrat berkelanjutan. Aturan standarnya: setiap jumlah sel yang diharapkan minimal harus 5; beberapa referensi menguranginya menjadi 'setidaknya 80% sel ≥ 5 dan tidak ada yang di bawah 1.' Tabel kontingensi jarang (jumlah ≤ 5 dalam beberapa sel) memerlukan Uji Tepat Fisher (untuk 2×2) atau uji permutasi Monte Carlo (untuk tabel yang lebih besar) — menerapkan chi-kuadrat tetap memberikan nilai p yang tidak dapat diandalkan. Kalkulator menandai pelanggaran aturan penghitungan yang diharapkan dengan peringatan; perlakukan nilai p yang dihasilkan sebagai perkiraan saat muncul. Khusus untuk tabel 2×2, koreksi kontinuitas Yates terkadang diterapkan untuk sedikit meningkatkan perkiraan, meskipun praktik modern sering kali lebih memilih Fisher's Exact untuk kasus 2×2 mana pun yang biaya komputasinya memungkinkan.