Sistem pemeringkatan Elo, yang dikembangkan oleh profesor fisika Arpad Elo untuk Federasi Catur AS pada tahun 1960, memecahkan masalah mendasar dalam pemeringkatan kompetitif: bagaimana mengukur keterampilan relatif antara pemain yang tidak semuanya bermain satu sama lain. Dengan memodelkan probabilitas kemenangan sebagai fungsi logistik dari perbedaan peringkat dan memperbarui peringkat setelah setiap pertandingan berdasarkan hasil aktual vs. yang diharapkan, Elo menciptakan sistem yang terus menyesuaikan diri dengan informasi baru tanpa memerlukan satu pun turnamen round-robin. Keanggunan dan keakuratan desain asli Elo menjadikannya landasan bagi sistem pemeringkatan dalam catur, Go, permainan online, olahraga tim, dan bahkan tinjauan sejawat akademis.

Matematika Skor yang Diharapkan

Rumus skor yang diharapkan E = 1/(1 + 10^((R_opp − R_me)/400)) memetakan perbedaan peringkat untuk memenangkan probabilitas menggunakan kurva logistik. Faktor skala 400 adalah sebuah konvensi: Arpad Elo memilihnya sehingga perbedaan peringkat sebesar 400 poin sesuai dengan rasio skor yang diharapkan sebesar 10:1 — yang berarti pemain dengan peringkat lebih tinggi harus mencetak sekitar 10 poin untuk setiap 1 poin yang dicetak oleh pemain dengan peringkat lebih rendah. Pada perbedaan peringkat 0, E = 0,5 (probabilitas menang 50%). Pada +200 poin, E ≈ 0,76; pada +400, E ≈ 0,91; pada +600, E ≈ 0,97. Bentuk logistik mencerminkan pengamatan empiris bahwa perbedaan keterampilan dalam catur menghasilkan distribusi probabilitas kemenangan yang kira-kira seperti ini. Rumus Elo asli menggunakan distribusi normal, bukan logistik, namun versi logistik (diadopsi oleh FIDE pada tahun 1978) secara matematis setara untuk sebagian besar tujuan dan lebih mudah dihitung.

K-Factor: Stabilitas vs. Responsif

Faktor K mengontrol volatilitas sistem pemeringkatan. K yang tinggi memungkinkan peringkat berubah dengan cepat, hal ini sesuai ketika kekuatan sebenarnya seorang pemain tidak pasti (pemain baru, junior yang berkembang pesat) — sistem peringkat perlu 'menemukan' level yang tepat dengan cepat. K yang rendah menghasilkan peringkat stabil yang berubah perlahan, cocok untuk pemain elit mapan yang kekuatan sejatinya diketahui dengan keyakinan tinggi. FIDE menggunakan tiga tingkatan faktor K: K=40 untuk pemain dalam 30 game pertama atau di bawah 2300, K=20 untuk pemain mapan (2100–2400), K=10 untuk pemain elit di atas 2400 dengan pengalaman bermain seumur hidup. Platform catur online seperti Chess.com dan Lichess sering kali menggunakan faktor K yang lebih tinggi (32–64) karena permainan online lebih cepat dan lebih banyak, sehingga memungkinkan konvergensi yang lebih cepat menuju kekuatan sebenarnya. Konsekuensi dari faktor K yang tinggi adalah satu gangguan dapat menaikkan peringkat sebesar 30–40 poin; K yang rendah berarti bahkan gangguan besar pun akan menaikkan peringkat hanya sebesar 8–10 poin. Keduanya tepat untuk kasus penggunaan yang dimaksudkan.

Elo Beyond Chess: Olahraga Tim dan Permainan Online

Keanggunan Elo — hanya membutuhkan hasil menang/seri/kalah dan peringkat saat ini — menjadikannya ideal untuk diadopsi di luar catur. FIFA menggunakan varian Elo untuk peringkat tim nasional yang menetapkan bobot pertandingan berdasarkan kepentingan turnamen dan menyesuaikan selisih gol. NFL telah menggunakan peringkat daya berbasis Elo untuk peramalan sejak tahun 1980-an, dan model NFL Elo FiveThirtyEight mencapai akurasi prediksi yang luar biasa. Sistem perjodohan multipemain video game di League of Legends, Dota 2, dan sebagian besar game kompetitif menggunakan Elo atau TrueSkill (ekstensi Bayesian yang menangani permainan tim dan memperhitungkan ketidakpastian). Wawasan utama yang membuat Elo dapat diperluas: setiap permainan zero-sum dengan hasil biner (menang/kalah) atau hasil berurutan (menang/seri/kalah) dapat dimodelkan dengan kerangka skor yang diharapkan sama, dengan faktor K dan konstanta skala disesuaikan dengan lingkungan kompetitif permainan tertentu. Batasan utama Elo klasik untuk olahraga tim adalah ia memperlakukan tim sebagai pemain tunggal — varian performa individu dirata-ratakan, dan perubahan roster memerlukan penyesuaian manual.