Les valeurs p quantifient la force des éléments qui s’opposent à une hypothèse nulle : elles expriment la probabilité d’observer une statistique de test au moins aussi extrême que celle mesurée si l’hypothèse nulle était vraie. Bien qu’il s’agisse de l’un des concepts les plus employés en recherche scientifique, la valeur p est aussi l’un des nombres les plus mal compris et mal utilisés en statistique, et a contribué à la « crise de la reproductibilité » en psychologie, en médecine et en sciences sociales. Les sections suivantes expliquent ce que mesure réellement une valeur p (et ce qu’elle ne mesure pas), comment la confiance excessive dans ses seuils a encouragé le p-hacking et d’autres pratiques de recherche discutables, et pourquoi il est essentiel de présenter la taille de l’effet pour interpréter honnêtement les résultats.
Ce qu’est une valeur p — et ce qu’elle n’est pas
Une valeur p est la probabilité d’observer des données au moins aussi extrêmes que les vôtres si l’hypothèse nulle était vraie. Elle n’est absolument pas la probabilité que l’hypothèse nulle soit vraie ; c’est l’une des distinctions conceptuelles les plus importantes en statistique appliquée. Une valeur p de 0.03 signifie que, si H₀ était vraie, il n’y aurait que 3 % de chances d’observer un résultat aussi extrême ou davantage. Elle ne dit pas directement si H₀ est vraie ou fausse : répondre à cette question nécessiterait une analyse bayésienne tenant compte des probabilités a priori.
Voici quelques interprétations à éviter : « p = 0.03 signifie qu’il y a 3 % de chances que H₀ soit vraie » (faux : il s’agit de la probabilité inverse P(H₀|données), qui nécessite le théorème de Bayes) ; « p = 0.03 signifie qu’il y a 97 % de chances que H₁ soit vraie » (faux également) ; « p > 0.05 signifie que H₀ est probablement vraie » (faux : l’absence de preuve n’est pas une preuve d’absence, surtout avec de petits échantillons). L’interprétation correcte est plus limitée : la valeur p indique à quel point les données seraient inhabituelles si H₀ était vraie. Servez-vous-en pour quantifier la surprise sous un modèle nul, et non pour attribuer des probabilités aux hypothèses elles-mêmes.
La crise de la reproductibilité et le p-hacking
La confiance excessive accordée au seuil p < 0.05 a largement contribué aux difficultés de reproductibilité en psychologie, en médecine et en sciences sociales, documentées depuis la crise de la reproductibilité des années 2010. Le « p-hacking » consiste à multiplier les analyses, à tester plusieurs sous-groupes ou mesures de résultat, ou à exclure certains points de données jusqu’à ce qu’un résultat franchisse le seuil de 0.05. Cette pratique augmente les faux positifs bien au-delà des 5 % attendus : de nombreux résultats publiés comme « significatifs » ne sont alors que du bruit statistique qui ne se reproduira pas dans les études de suivi.
Les bonnes pratiques actuelles consistent notamment à préenregistrer les hypothèses et les plans d’analyse avant la collecte des données (afin que les chercheurs s’engagent sur des tests précis au lieu de chercher après coup), à présenter les tailles d’effet avec les valeurs p pour évaluer la pertinence pratique autant que la significativité statistique, à utiliser des intervalles de confiance pour quantifier l’incertitude, à recourir aux méthodes bayésiennes lorsque cela convient et à considérer p = 0.05 comme un repère plutôt que comme une frontière absolue. Certaines revues et disciplines ont adopté des seuils plus stricts (p < 0.005) ou exigent un préenregistrement pour publier. Les outils de l’Open Science Framework facilitent le préenregistrement et les rapports enregistrés, qui ont nettement amélioré la reproductibilité dans les disciplines participantes.
La taille de l’effet compte autant que la valeur p
Avec un échantillon assez grand, presque toute différence par rapport à zéro devient statistiquement significative, car les valeurs p diminuent quand la taille de l’échantillon augmente, même si l’effet réel est minime. Une valeur p de 0.0001 associée à un d de Cohen de 0.05 indique un effet réel mais négligeable, qui ne justifie pas d’action malgré sa « très forte significativité ». Les études de mégadonnées portant sur des millions d’observations obtiennent couramment p < 0.001 pour des effets réels mais dépourvus d’importance clinique ou pratique. La significativité statistique et la pertinence pratique sont deux choses différentes.
Associez toujours les valeurs p à une estimation de la taille de l’effet (d de Cohen pour les différences de moyennes, r² pour la force d’une corrélation, η² ou η² partiel pour les tailles d’effet en ANOVA) et à des intervalles de confiance pour obtenir une vue statistique complète. Repères usuels pour d de Cohen : 0.2 = effet faible, 0.5 = moyen, 0.8 = grand. En règle générale, un d de Cohen inférieur à 0.2 correspond à un effet trop faible pour compter dans la plupart des décisions réelles, quelle que soit la valeur p. Se demander « est-ce pertinent en pratique ? » en plus de « est-ce statistiquement significatif ? » améliore les décisions scientifiques et commerciales. Les recommandations actuelles de l’APA, de l’AMA et d’autres organismes professionnels exigent expressément de présenter la taille de l’effet avec les valeurs p dans les publications.