Commencez par la question et le modèle nul
Un test statistique nécessite un résultat défini, une hypothèse nulle, une statistique de test et des hypothèses sur la manière dont les données ont été produites. Ces hypothèses peuvent porter sur l’échantillonnage ou l’affectation aléatoires, l’indépendance et un modèle probabiliste adapté.
Une valeur p est la probabilité, selon ce modèle nul et ses hypothèses, d’obtenir une statistique de test au moins aussi extrême que celle observée dans la ou les directions spécifiées par le test.
L’American Statistical Association met en garde contre l’interprétation des valeurs p comme la probabilité qu’une hypothèse soit vraie et contre l’utilisation d’un seuil seul pour tirer une conclusion scientifique ou commerciale. [1]
Exemple : un test z bilatéral
Supposons qu’une expérience illustrative estime un écart de traitement de 4 unités avec une erreur standard de 2 unités. Sous l’hypothèse nulle d’absence d’écart, la statistique z est 4 ÷ 2 = 2.
Pour un test bilatéral fondé sur la loi normale standard, la valeur p est d’environ 0.0455. Cela signifie que, si le modèle nul et ses hypothèses étaient corrects, une statistique au moins aussi éloignée de zéro que ±2 apparaîtrait environ 4.55 % du temps.
Cela ne pas signifie pas qu’il existe une probabilité de 4.55 % que l’hypothèse nulle soit vraie. Cela ne signifie pas non plus que le traitement fonctionne avec une probabilité de 95.45 %, ni que l’effet sera reproduit avec la taille estimée.
Un intervalle approximatif à 95 % fondé sur le même calcul normal est de 4 ± 1.96 × 2, soit environ 0.08 à 7.92 unités. Cet intervalle large est un élément de contexte important, même si la valeur p est légèrement inférieure à 0.05.
La significativité statistique n’est pas l’importance pratique
Un effet minime peut produire une faible valeur p dans un très grand échantillon. Un effet potentiellement important peut produire une valeur p élevée dans un échantillon réduit ou bruité.
Présentez l’effet dans des unités pertinentes pour la décision : dollars par client, points de pourcentage de conversion, heures économisées ou autre mesure adaptée. Indiquez l’incertitude et comparez le résultat à un seuil d’importance pratique choisi pour le problème.
Par exemple, une amélioration mesurée avec précision de 0.01 point de pourcentage peut rester trop faible pour justifier une mise en œuvre coûteuse. Une valeur p ne tient compte ni du coût de mise en œuvre, ni du risque de perte, ni de l’intérêt d’attendre des données plus probantes.
« Non significatif » ne signifie pas « aucun effet »
Une valeur p élevée signifie que, selon ce test, les données ne sont pas particulièrement incompatibles avec le modèle nul spécifié. Elle n’établit pas l’égalité et ne prouve pas que l’écart éventuel soit assez faible pour être ignoré.
Pour soutenir que deux approches sont pratiquement équivalentes, définissez un écart acceptable et utilisez un cadre adapté d’équivalence ou de non-infériorité. Ne déduisez pas une équivalence du simple fait qu’un test classique de différence n’a pas franchi un seuil.
Examinez l’intervalle. S’il inclut à la fois un avantage important et un préjudice important, l’expérience peut être non concluante plutôt que rassurante.
Les tests multiples et les vérifications répétées modifient la question
Tester de nombreux résultats ou sous-groupes multiplie les possibilités de trouver un résultat apparemment inhabituel. Vérifier sans cesse un test classique à échantillon fixe et s’arrêter dès qu’il devient significatif peut également modifier son taux d’erreur.
Dans la mesure du possible, définissez à l’avance le résultat principal, l’analyse, la taille de l’échantillon ou la règle d’arrêt, ainsi que le traitement des comparaisons multiples. Si les décisions doivent être prises en continu, utilisez une méthode conçue pour le suivi séquentiel.
Les résultats exploratoires peuvent être utiles. Présentez-les comme tels et recherchez des éléments supplémentaires au lieu de présenter une tendance découverte après coup comme si elle provenait du test unique prévu au départ.
Rédigez une phrase de compte rendu complète
Un compte rendu utile précise la comparaison, l’échantillon et le protocole, l’effet estimé, l’intervalle d’incertitude, le test, la valeur p et les principales limites. Évitez de réduire la conclusion à un badge vert ou rouge.
Pour l’exemple illustratif : « L’écart estimé était de 4 unités, avec un intervalle approximatif à 95 % de 0.08 à 7.92 selon le modèle normal indiqué ; la valeur p bilatérale était de 0.0455. » La décision nécessite toujours de tenir compte des coûts, de la qualité des données et des conséquences d’une erreur.
Questions fréquentes
La valeur p correspond-elle à la probabilité que l’hypothèse nulle soit vraie ?
Non. Elle est calculée en supposant un modèle nul donné et concerne la probabilité d’obtenir des résultats au moins aussi extrêmes sous ce modèle.
Une valeur p supérieure à 0.05 prouve-t-elle l’absence d’effet ?
Non. Cela peut refléter une précision limitée ou des données compatibles avec plusieurs tailles d’effet. Examinez l’effet estimé et son intervalle d’incertitude.
Puis-je passer d’un test bilatéral à un test unilatéral après avoir vu le résultat ?
Cela modifie l’analyse en fonction de la direction observée et peut fausser son interprétation. Dans la mesure du possible, choisissez le test adapté à la question avant d’examiner les résultats.
Sources et notes de calcul
Les références principales sont indiquées ci-dessous. Les dates, limites et conditions peuvent changer ; vérifiez les détails applicables avant d’agir.
Utilisez ce guide avec discernement. Les exemples illustrent une méthode de calcul, sans garantir un résultat. La pertinence de tout résultat dépend des définitions, mesures et hypothèses retenues.