Un score z exprime une valeur en nombre d’écarts-types par rapport à la moyenne de sa distribution. Cette unité universelle élimine l’échelle propre à la mesure et permet de comparer des tests, des populations et des systèmes très différents. Les scores z sont essentiels aux tests d’hypothèse, au contrôle qualité, à l’interprétation des analyses médicales, aux résultats des tests standardisés et à presque toutes les méthodes statistiques liées à la loi normale. Les sections suivantes expliquent comment ils permettent des comparaisons équitables entre échelles, où ils interviennent dans la vie courante et pourquoi la distinction entre test unilatéral et bilatéral compte pour les tests d’hypothèse.
Pourquoi les scores z permettent des comparaisons équitables
Un élève qui obtient 85 en histoire et 75 en physique peut avoir mieux réussi en physique si l’épreuve était plus difficile et si les notes de la classe étaient plus dispersées. Si la moyenne en histoire était de 80 avec un écart-type de 5 (z = +1.0), tandis qu’en physique la moyenne était de 60 avec un écart-type de 10 (z = +1.5), le résultat en physique est plus remarquable malgré une note brute inférieure. Les scores z neutralisent les différences d’échelle et de dispersion en exprimant chaque résultat en écarts-types, ce qui permet de comparer équitablement des tests, des populations ou des systèmes de mesure.
Cette standardisation rend les scores z indispensables en statistique, en psychologie, en éducation et en science des données. Sans eux, comparer un résultat au SAT (moyenne 1050, écart-type 200 ces dernières années) à un résultat à l’ACT (moyenne 21, écart-type 5) nécessiterait de mémoriser les deux distributions. Les convertir en scores z donne une comparaison directe : un SAT de 1250 correspond à z = +1.0, tout comme un ACT de 26 ; les deux résultats sont donc aussi remarquables au sein de leurs populations respectives. Les responsables des admissions, les psychologues et les chercheurs raisonnent constamment en scores z, même lorsqu’ils calculent des percentiles ou des intervalles de confiance qui en dérivent.
Les scores z dans la vie courante
Les scores z sont discrètement à la base de nombreux systèmes du quotidien. Les modèles d’évaluation du crédit convertissent les indicateurs financiers bruts en scores standardisés afin que les prêteurs puissent comparer les demandeurs sur une échelle commune. Dans les analyses médicales, la mention « dans les limites normales » signifie généralement que le score z se situe entre environ −2 et +2 ; au-delà, le résultat est automatiquement signalé pour examen clinique. Les tests standardisés (SAT, ACT, GRE, tests de QI) transforment les résultats bruts en échelles normalisées fondées sur les scores z, puis les convertissent en échelles de restitution plus faciles à comprendre.
Les courbes de croissance pédiatriques représentent la taille, le poids et le périmètre crânien des enfants sous forme de scores z (souvent appelés « SDS », pour score d’écart-type) par rapport à des populations de référence du même âge. Les pédiatres peuvent ainsi repérer rapidement les mesures hors de la plage attendue ; un score z de −2 ou moins déclenche des examens supplémentaires pour rechercher d’éventuels problèmes de croissance. La gestion des risques financiers utilise les scores z pour mesurer le caractère inhabituel d’un mouvement de marché et tarifer les options. Dans l’industrie, le contrôle qualité utilise des scores z (souvent appelés niveaux sigma) pour évaluer la stabilité des processus : un processus « Six Sigma » reste dans les limites de contrôle de ±6σ, ce qui correspond à un taux de défaut extrêmement faible. Dès qu’on y prête attention, les scores z apparaissent partout où des décisions s’appuient sur des données.
Tests unilatéraux et bilatéraux
Pour effectuer un test d’hypothèse, il faut choisir entre un test unilatéral et un test bilatéral avant de calculer la valeur p. Ce choix dépend de ce que l’on cherche réellement à savoir, et non de la méthode qui rend la valeur p plus avantageuse. Choisissez un test unilatéral si seul un dépassement (ou une valeur inférieure) à un seuil vous intéresse, et non les deux directions. Par exemple, vérifier si un nouveau procédé de fabrication réduit les défauts appelle un test unilatéral portant sur leur diminution ; une hausse des défauts n’est pas le résultat recherché.
Choisissez un test bilatéral lorsque les écarts dans les deux directions ont un sens. Par exemple, pour déterminer si un médicament a un effet sur la tension artérielle, à la hausse OU à la baisse, il faut un test bilatéral, car les deux effets sont cliniquement pertinents. À valeur |z| identique, la valeur p d’un test bilatéral est exactement le double de celle d’un test unilatéral ; il faut donc un signal plus fort pour atteindre la significativité. Préenregistrez votre choix avant d’examiner les données : passer d’un test bilatéral à un test unilatéral après avoir vu que les données vont dans le « bon » sens constitue une forme de p-hacking qui gonfle le taux de faux positifs. La plupart des études scientifiques et médicales utilisent par défaut le test bilatéral, plus prudent, sauf raison préalable solide de ne s’intéresser qu’à une direction.