Das Elo-Bewertungssystem, das 1960 vom Physikprofessor Arpad Elo für den US-Schachverband entwickelt wurde, löste ein grundlegendes Problem bei der Rangliste von Wettbewerben: Wie lässt sich das relative Können von Spielern messen, die nicht alle gegeneinander spielen? Durch die Modellierung der Gewinnwahrscheinlichkeit als logistische Funktion der Bewertungsdifferenz und die Aktualisierung der Bewertungen nach jedem Spiel basierend auf tatsächlichen und erwarteten Ergebnissen hat Elo ein System geschaffen, das sich kontinuierlich an neue Informationen anpasst, ohne dass ein einziges Round-Robin-Turnier erforderlich ist. Die Eleganz und Genauigkeit des ursprünglichen Designs von Elo haben es zur Grundlage für Bewertungssysteme in Schach, Go, Online-Gaming, Mannschaftssportarten und sogar akademischen Peer-Reviews gemacht.

Die Mathematik der erwarteten Punktzahl

Die Formel für die erwartete Punktzahl E = 1/(1 + 10^((R_opp − R_me)/400)) ordnet Bewertungsunterschiede mithilfe einer logistischen Kurve den Gewinnwahrscheinlichkeiten zu. Der Skalierungsfaktor von 400 ist eine Konvention: Arpad Elo hat ihn so gewählt, dass eine Bewertungsdifferenz von 400 Punkten einem erwarteten Punkteverhältnis von 10:1 entspricht – das bedeutet, dass der Spieler mit der höheren Bewertung ungefähr 10 Punkte für jeden Punkt erzielen sollte, den der Spieler mit der niedrigeren Bewertung erzielt. Bei einem Bewertungsunterschied von 0 ist E = 0,5 (50 % Gewinnwahrscheinlichkeit). Bei +200 Punkten ist E ≈ 0,76; bei +400, E ≈ 0,91; bei +600 ist E ≈ 0,97. Die logistische Form spiegelt die empirische Beobachtung wider, dass Fähigkeitsunterschiede im Schach ungefähr zu dieser Gewinnwahrscheinlichkeitsverteilung führen. Die ursprüngliche Elo-Formel verwendete eine Normalverteilung anstelle einer Logistik, aber die logistische Version (1978 von der FIDE übernommen) ist für die meisten Zwecke mathematisch äquivalent und einfacher zu berechnen.

K-Faktor: Stabilität vs. Reaktionsfähigkeit

Der K-Faktor steuert die Volatilität des Bewertungssystems. Ein hoher K ermöglicht eine schnelle Änderung der Bewertungen, was angemessen ist, wenn die wahre Stärke eines Spielers ungewiss ist (neue Spieler, sich schnell verbessernde Junioren) – das Bewertungssystem muss schnell das richtige Niveau „finden“. Ein niedriges K führt zu stabilen Bewertungen, die sich langsam ändern, was für etablierte Elitespieler geeignet ist, deren wahre Stärke mit hoher Sicherheit bekannt ist. Die FIDE verwendet drei K-Faktor-Stufen: K=40 für Spieler in ihren ersten 30 Spielen oder unter 2300, K=20 für etablierte Spieler (2100–2400), K=10 für Elitespieler über 2400 mit lebenslanger Spielerfahrung. Online-Schachplattformen wie Chess.com und Lichess verwenden oft höhere K-Faktoren (32–64), da Online-Spiele schneller und zahlreicher sind, was eine schnellere Konvergenz zur wahren Stärke ermöglicht. Ein hoher K-Faktor hat zur Folge, dass eine einzelne Überraschung die Bewertung um 30–40 Punkte verschieben kann; Ein niedriges K bedeutet, dass selbst eine große Überraschung die Wertung nur um 8–10 Punkte verschiebt. Beide sind für ihre beabsichtigten Anwendungsfälle korrekt.

Elo Beyond Chess: Mannschaftssport und Online-Spiele

Elos Eleganz – es erfordert nur Sieg-/Unentschieden-/Niederlagenergebnisse und aktuelle Bewertungen – machte es ideal für die Einführung über Schach hinaus. Die FIFA verwendet für die Rangliste der Nationalmannschaften eine Elo-Variante, die die Spielgewichte nach Turnierbedeutung zuordnet und die Tordifferenz berücksichtigt. Die NFL verwendet seit den 1980er Jahren Elo-basierte Leistungsbewertungen für Prognosen, und das NFL-Elo-Modell von FiveThirtyEight erreichte eine bemerkenswerte Vorhersagegenauigkeit. Videospiel-Multiplayer-Matchmaking-Systeme in League of Legends, Dota 2 und den meisten kompetitiven Spielen verwenden Elo oder TrueSkill (eine Bayes'sche Erweiterung, die Teamspiele verwaltet und Unsicherheiten berücksichtigt). Die wichtigste Erkenntnis, die Elo erweiterbar gemacht hat: Jedes Nullsummenspiel mit binären Ergebnissen (Sieg/Niederlage) oder geordneten Ergebnissen (Sieg/Unentschieden/Niederlage) kann mit demselben erwarteten Ergebnisrahmen modelliert werden, wobei der K-Faktor und die Skalierungskonstante auf die Wettbewerbsumgebung des jeweiligen Spiels abgestimmt sind. Die Haupteinschränkung des klassischen Elo für Mannschaftssportarten besteht darin, dass Teams als einzelne Spieler behandelt werden – individuelle Leistungsschwankungen werden gemittelt und Kaderänderungen erfordern eine manuelle Anpassung.