Pengujian A/B menimbulkan pertanyaan — apakah perubahan ini mengubah metrik? — menjadi uji hipotesis. Kalkulator ini menjalankan uji z dua proporsi pada tingkat konversi kontrol dan varian Anda, lalu membantu Anda merencanakan pengujian di masa mendatang dengan menghitung ukuran sampel dan durasi pengujian yang diperlukan. Ini dimaksudkan untuk pemasar, insinyur pertumbuhan, dan manajer produk yang membandingkan tingkat konversi pada halaman arahan, formulir pendaftaran, CTA email, alur pembayaran, dan pengujian terpisah serupa.
Cara kerja pengujian signifikansi
Kami memulai dengan mengasumsikan kedua varian memiliki rasio konversi sebenarnya yang sama (hipotesis nol) dan menanyakan seberapa kecil kemungkinan perbedaan yang Anda amati berdasarkan asumsi tersebut. z-score yang dikumpulkan mengukur berapa banyak kesalahan standar yang memisahkan dua tingkat pengamatan; nilai p mengonversi z tersebut menjadi probabilitas melalui CDF normal standar.
Nilai p yang kecil (misalnya di bawah 0,05) berarti: jika kedua varian benar-benar dikonversi dengan laju yang sama, Anda akan melihat perbedaan sebesar atau lebih besar secara kebetulan dalam waktu kurang dari 5%. Itulah ambang batas yang kami sebut signifikansi statistik sebesar 95%. Bagan di tab kalkulator memberi warna pada wilayah penolakan untuk tingkat keyakinan yang Anda pilih dan menandai titik jatuhnya z yang Anda amati.
Input yang memindahkan hasilnya
Ukuran sampel adalah faktor terbesar. Menggandakan pengunjung kira-kira mengurangi separuh kesalahan standar, mempertajam interval kepercayaan, dan membuat peningkatan kecil dapat terdeteksi. Ukuran efek juga penting — peningkatan relatif sebesar 50% memerlukan lalu lintas yang jauh lebih sedikit dibandingkan peningkatan sebesar 5%. Tingkat kepercayaan mengorbankan kesalahan Tipe I (positif palsu): 95% adalah default pemasaran, 99% sesuai bila biaya pengiriman varian buruk tinggi. Pilihan ekor jarang mengubah keputusan bisnis — tetaplah dua sisi kecuali Anda memiliki hipotesis arah yang telah didaftarkan sebelumnya.
Jebakan dan batasan
Satu-satunya kesalahan terbesar dalam pengujian A/B adalah mengintip — memeriksa nilai p setiap hari dan berhenti segera setelah melewati 0,05. Hal ini meningkatkan angka positif palsu secara dramatis. Jalankan pengujian selama durasi yang dikembalikan oleh Perencana Ukuran Sampel, lalu periksa sekali. Beberapa varian (pengujian A/B/C/n) memerlukan koreksi beberapa perbandingan (Bonferroni, Holm) atau Anda akan melihat pemenang palsu. Efek kebaruan dan keutamaan dapat mengubah metrik pada minggu pertama namun menghilang pada minggu ketiga; siklus mingguan dalam lalu lintas berarti pengujian yang lebih pendek dari seminggu penuh sering kali kehilangan pola sebenarnya. Terakhir, kalkulator ini menggunakan perkiraan normal — untuk sampel yang sangat kecil (n < 30 konversi per varian) atau tingkat ekstrim (< 1% atau > 99%), lebih memilih pengujian eksak seperti Fisher.