A/B-Tests stellen eine Frage dar: Verändert diese Änderung die Metrik? – in einen Hypothesentest. Dieser Rechner führt einen Zwei-Proportionen-Z-Test für Ihre Kontroll- und Variantenkonvertierungsraten durch und hilft Ihnen dann bei der Planung zukünftiger Tests, indem er die erforderlichen Stichprobengrößen und Testdauern berechnet. Es ist für Vermarkter, Wachstumsingenieure und Produktmanager gedacht, die Konversionsraten auf Zielseiten, Anmeldeformularen, E-Mail-CTAs, Checkout-Abläufen und ähnlichen Split-Tests vergleichen.

Wie Signifikanztests funktionieren

Wir beginnen mit der Annahme, dass beide Varianten die gleiche tatsächliche Conversion-Rate aufweisen (die Nullhypothese) und fragen, wie unwahrscheinlich Ihr beobachteter Unterschied unter dieser Annahme wäre. Der gepoolte z-score misst, wie viele Standardfehler die beiden beobachteten Raten trennen; Der p-Wert wandelt dieses z über den standardmäßigen normalen CDF in eine Wahrscheinlichkeit um.

Ein kleiner p-Wert (z. B. unter 0,05) bedeutet: Wenn beide Varianten wirklich mit der gleichen Rate konvertiert würden, würden Sie in weniger als 5 % der Fälle zufällig einen so großen oder größeren Unterschied feststellen. Das ist der Schwellenwert, den wir 95 % statistische Signifikanz nennen. Das Diagramm auf der Registerkarte „Rechner“ schattiert den Ablehnungsbereich für Ihr gewähltes Vertrauen und markiert, wo Ihr beobachtetes Z liegt.

Eingaben, die das Ergebnis bewegen

Die Stichprobengröße ist der größte Hebel. Durch die Verdoppelung der Besucherzahlen wird der Standardfehler etwa halbiert, das Konfidenzintervall verschärft und kleine Steigerungen erkennbar. Auch die Effektgröße spielt eine Rolle – eine relative Steigerung um 50 % erfordert weit weniger Traffic als eine Steigerung um 5 %. Konfidenzniveau kompensiert Typ-I-Fehler (False-Positives): 95 % ist der Marketingstandard, 99 % ist angemessen, wenn die Kosten für den Versand einer schlechten Variante hoch sind. Die Tail-Wahl ändert selten Geschäftsentscheidungen – bleiben Sie zweiseitig, es sei denn, Sie haben eine vorab registrierte Richtungshypothese.

Fallstricke und Grenzen

Der größte Fehler bei A/B-Tests ist das Peeking – das tägliche Überprüfen des p-Werts und das Anhalten, sobald er 0,05 überschreitet. Dies erhöht die Falsch-Positiv-Rate dramatisch. Führen Sie den Test für die Dauer aus, die der Stichprobengrößenplaner zurückgibt, und überprüfen Sie ihn dann einmal. Mehrere Varianten (A/B/C/n-Tests) erfordern eine Korrektur mehrerer Vergleiche (Bonferroni, Holm), sonst werden falsche Gewinner angezeigt. Neuheits- und Vorrangeffekte können Kennzahlen in der ersten Woche verändern, verschwinden aber in der dritten Woche; Wöchentliche Zyklen im Verkehr bedeuten, dass Tests, die kürzer als eine ganze Woche sind, oft echte Muster übersehen. Schließlich verwendet dieser Rechner eine normale Näherung – für sehr kleine Stichproben (n < 30 Konvertierungen pro Variante) oder extreme Raten (< 1 % oder > 99 %) bevorzugen Sie einen exakten Test wie den von Fisher.