Les tests d’hypothèse sont la procédure formelle que les scientifiques utilisent pour déterminer si les effets observés dans un échantillon sont réels ou s’ils relèvent du hasard d’échantillonnage. Les cinq tests proposés ici — t à un échantillon, t de Welch à deux échantillons, t apparié, chi carré d’ajustement et chi carré d’indépendance — couvrent la plupart des situations statistiques courantes. Savoir choisir le test, interpréter correctement la valeur p et tenir compte de la taille de l’effet distingue une pratique statistique rigoureuse d’un rituel mal compris.

Choisir le bon test

Trois questions permettent de choisir le test. Comparez-vous des moyennes (données numériques continues) ou des effectifs (données catégorielles) ? Moyennes : famille des tests t ; effectifs : famille du chi carré. Combien de groupes comparez-vous ? Un échantillon à une référence connue : test t à un échantillon. Deux groupes indépendants : test t de Welch à deux échantillons. Deux mesures liées sur les mêmes sujets (avant/après, paires de jumeaux) : test t apparié. Quelle est la structure des données catégorielles ? Une variable avec k catégories : chi carré d’ajustement. Deux variables dans un tableau de contingence 2×2 : chi carré d’indépendance. Une fois ces questions maîtrisées, le choix est mécanique. Erreurs fréquentes : utiliser un test t sur des pourcentages (des proportions, et non des moyennes, qui appellent plutôt un chi carré ou un test de proportion) ou utiliser un test t apparié sur des échantillons indépendants, ce qui réduit la puissance sans apporter d’avantage.

Les valeurs p ne signifient pas ce que l’on croit

L’erreur d’interprétation la plus fréquente consiste à prendre la valeur p pour « la probabilité que H₀ soit vraie » ou « la probabilité que le résultat soit dû au hasard ». Ces deux interprétations sont fausses. La valeur p est la probabilité d’observer des données au moins aussi extrêmes que les vôtres en supposant H₀ vraie. Elle est conditionnelle à la vérité de l’hypothèse nulle et ne renseigne pas directement sur cette vérité. Une petite valeur p constitue un argument contre H₀ — elle indique que les données sont peu probables sous cette hypothèse — sans mesurer la probabilité que H₀ soit vraie. Une valeur p de 0.04 ne signifie pas « 4 % de chances que l’hypothèse nulle soit juste », mais « 4 % de chances d’obtenir des données aussi extrêmes si elle était juste ». Les statistiques modernes soulignent donc l’importance de rapporter aussi la taille de l’effet : une petite différence avec p = 0.001 et d = 0.05 est réelle mais minime ; une grande différence avec p = 0.12 et d = 0.6 est prometteuse, mais l’étude manque peut-être de puissance. Indiquez les deux valeurs.

Pourquoi le test t de Welch est préférable au test t de Student

Les manuels d’introduction présentent souvent le « test t de Student avec variance regroupée » comme la comparaison par défaut de deux échantillons, et le test de Welch comme une exception en cas de « variances inégales ». Les recommandations statistiques modernes ont évolué : le test de Welch devrait être le choix par défaut. L’hypothèse d’égalité des variances, dont dépend le test regroupé de Student, est rarement vérifiée en pratique ; lorsqu’elle est fausse, ce test augmente le taux de faux positifs. L’ajustement de Welch utilise l’approximation de Welch-Satterthwaite pour les degrés de liberté et calcule l’erreur standard sans regrouper les variances. Il contrôle ainsi presque correctement le risque d’erreur de type I, qu’elles soient égales ou non. Le langage R a choisi cette méthode par défaut dans t.test() pour cette raison ; SciPy et la plupart des outils modernes font de même. À moins d’avoir une raison théorique précise de regrouper les variances, préférez Welch : le coût est pratiquement nul lorsqu’elles sont égales, et le bénéfice réel lorsqu’elles ne le sont pas.

Précautions pour le chi carré

L’approximation du chi carré suppose que les effectifs attendus soient assez grands pour que la distribution discrète des effectifs soit correctement approchée par une distribution continue. La règle habituelle exige au moins 5 observations attendues dans chaque cellule ; certaines références tolèrent qu’au moins 80 % des cellules en aient 5 ou plus, à condition qu’aucune ne soit inférieure à 1. Pour les tableaux clairsemés (plusieurs cellules à 5 observations ou moins), utilisez plutôt le test exact de Fisher (en 2×2) ou un test de permutation Monte-Carlo (pour les tableaux plus grands) : le chi carré donnerait des valeurs p peu fiables. La calculatrice signale les écarts à la règle des effectifs attendus ; considérez alors la valeur p comme une approximation. Pour les tableaux 2×2, on applique parfois la correction de continuité de Yates pour améliorer légèrement l’approximation, mais la pratique moderne privilégie souvent le test exact de Fisher dès que le coût de calcul est acceptable.