Distribusi frekuensi mengatur data mentah dan tidak berurutan ke dalam tabel yang menunjukkan seberapa sering setiap nilai — atau rentang nilai — muncul. Ini adalah langkah pertama dalam hampir setiap alur kerja pengantar statistik, mengubah kumpulan angka menjadi ringkasan yang benar-benar dapat Anda baca, buat bagan, dan tarik kesimpulannya.

Data yang tidak dikelompokkan vs. data yang dikelompokkan

Distribusi frekuensi yang tidak dikelompokkan mencantumkan setiap nilai berbeda dalam kumpulan data beserta berapa kali nilai tersebut muncul. Distribusi frekuensi ini berfungsi dengan baik untuk kumpulan data kecil atau data dengan jumlah nilai berulang yang terbatas — seperti menghitung berapa banyak siswa yang memperoleh nilai pada setiap kemungkinan nilai pada kuis 10 poin.

Distribusi frekuensi yang dikelompokkan akan mengurutkan data ke dalam rentang (kelas) dengan lebar yang sama, yang sangat penting jika data mencakup rentang nilai yang sebagian besar unik — seperti nilai ujian dari 100, usia dalam suatu populasi, atau pengukuran berkelanjutan. Pengelompokan akan menghasilkan presisi (Anda kehilangan nilai pasti setiap titik data) agar mudah dibaca.

Memilih jumlah kelas

Terlalu sedikit kelas dan distribusi menyembunyikan detail yang berguna — semuanya dikelompokkan menjadi satu atau dua batang. Terlalu banyak kelas dan distribusi menjadi berisik, dengan banyak kelas yang hanya berisi satu atau nol titik data. Aturan Sturges (k = ⌈log₂(n) + 1⌉) dan aturan √n (k = ⌈√n⌉) adalah dua titik awal yang diajarkan secara luas, keduanya menskalakan jumlah kelas dengan ukuran kumpulan data.

Tidak ada aturan yang merupakan persyaratan yang sulit — aturan tersebut bersifat heuristik. Jika histogram Anda terlihat terlalu datar atau runcing, naikkan atau turunkan jumlah kelas dan lihat perubahan bentuknya.

Membaca frekuensi relatif dan kumulatif

Frekuensi relatif (f / n) membingkai ulang jumlah setiap kelas sebagai bagian dari keseluruhan, sehingga memungkinkan untuk membandingkan kumpulan data dengan ukuran berbeda. Frekuensi kumulatif melacak total berjalan di seluruh kelas, menjawab pertanyaan seperti "berapa banyak titik data yang berada pada atau di bawah nilai ini?" — dasar untuk menghitung persentil dan kuartil dari data yang dikelompokkan.

Batasan dan kasus tepi

Pengelompokan data ke dalam kelas adalah ringkasan, bukan pengganti data mentah — setelah dikelompokkan, nilai pasti setiap titik data dalam suatu kelas akan hilang (itulah sebabnya titik tengah kelas digunakan sebagai perkiraan untuk penghitungan lebih lanjut, seperti memperkirakan rata-rata data yang dikelompokkan). Untuk kumpulan data yang sangat kecil (di bawah ~10 nilai), pertimbangkan untuk menggunakan mode Tidak Dikelompokkan atau melaporkan nilai mentah secara langsung, karena mengelompokkan sampel kecil dapat mengaburkan lebih banyak hal daripada yang terungkap.