Les tests A/B transforment une question — ce changement améliore-t-il l’indicateur ? — en test d’hypothèse. Ce calculateur applique un test z à deux proportions aux taux de conversion du contrôle et de la variante, puis aide à planifier les tests suivants en calculant la taille d’échantillon et la durée nécessaires. Il s’adresse aux spécialistes du marketing, aux ingénieurs croissance et aux responsables produit qui comparent des taux de conversion sur des pages d’accueil, des formulaires d’inscription, des appels à l’action par courriel, des parcours de paiement et d’autres tests fractionnés.

Fonctionnement des tests de significativité

Nous commençons par supposer que les deux variantes ont le même taux de conversion réel (l’hypothèse nulle), puis évaluons la probabilité d’observer une différence comme celle mesurée si cette hypothèse était vraie. Le score z regroupé indique le nombre d’erreurs-types séparant les deux taux observés ; la valeur p convertit ce score en probabilité à l’aide de la fonction de répartition de la loi normale standard.

Une valeur p faible (par ex. inférieure à 0.05) signifie que, si les deux variantes avaient réellement le même taux, une différence aussi grande ou supérieure apparaîtrait par hasard moins de 5 % du temps. C’est le seuil appelé significativité statistique à 95 %. Le graphique de l’onglet calcul affiche la région de rejet correspondant au niveau de confiance choisi et indique la position du score z observé.

Les paramètres qui influencent le résultat

La taille de l’échantillon est le levier principal. Doubler le nombre de visiteurs réduit approximativement l’erreur-type de moitié, resserre l’intervalle de confiance et rend détectables de petites hausses. La taille de l’effet compte également : détecter une hausse relative de 50 % demande beaucoup moins de trafic qu’une hausse de 5 %. Le niveau de confiance implique un compromis sur l’erreur de type I (faux positifs) : 95 % est la valeur par défaut en marketing ; 99 % convient lorsque le coût d’un déploiement de variante défavorable est élevé. Le choix du nombre de queues change rarement une décision commerciale ; conservez le test bilatéral sauf si l’hypothèse directionnelle a été préenregistrée.

Pièges et limites

L’erreur la plus fréquente dans les tests A/B est le contrôle répété des résultats : consulter la valeur p chaque jour et arrêter dès qu’elle passe sous 0.05. Cela augmente fortement le taux de faux positifs. Exécutez le test pendant la durée indiquée par le planificateur de taille d’échantillon, puis vérifiez le résultat une seule fois. Les tests à plusieurs variantes (A/B/C/n) nécessitent une correction pour comparaisons multiples (Bonferroni, Holm), faute de quoi de faux gagnants apparaîtront. Les effets de nouveauté et de primauté peuvent modifier les indicateurs la première semaine puis disparaître dès la troisième ; les cycles hebdomadaires du trafic font qu’un test de moins d’une semaine peut manquer de vrais motifs. Enfin, ce calculateur utilise une approximation normale : pour les très petits échantillons (n < 30 conversions par variante) ou les taux extrêmes (< 1 % ou > 99 %), préférez un test exact, comme celui de Fisher.