La taille d’échantillon est l’un des facteurs de qualité de recherche les plus faciles à contrôler. Trop faible, elle mobilise des ressources pour des résultats non concluants. Trop importante, elle entraîne des dépenses inutiles alors qu’une étude plus petite aurait suffi. Déterminer la bonne taille avant de recueillir les données est l’une des décisions statistiques les plus importantes d’un chercheur.
Pourquoi la taille de l’échantillon compte
Une étude trop petite manque de puissance statistique pour détecter des effets réels : elle gaspille des ressources et produit des faux négatifs qui peuvent retarder des découvertes importantes. Dans un essai clinique, elle peut ne pas détecter un traitement réellement efficace, qui risque alors d’être abandonné trop tôt. À l’inverse, une étude trop grande coûte inutilement cher et, en recherche clinique, expose davantage de participants aux conditions expérimentales que nécessaire, ce qui soulève des questions éthiques au regard du principe d’équipoise. Pour les sondages, un échantillon trop petit donne des marges d’erreur si larges que les résultats deviennent ininterprétables : avec n = 30 et un niveau de confiance de 95 %, la marge est de ±18 %, ce qui empêche de distinguer statistiquement même de grands mouvements d’opinion. Le calcul de la taille d’échantillon équilibre précision, puissance et contraintes pratiques. Il doit être effectué avant le recueil des données, car l’ajuster après coup introduit un biais. Les pratiques modernes de reproductibilité exigent désormais de préenregistrer ce calcul : c’est une exigence méthodologique autant qu’une obligation éthique pour les recherches financées.
Rendements décroissants des grands échantillons
La marge d’erreur diminue avec la racine carrée de la taille d’échantillon. Multiplier n par quatre ne divise la marge que par deux. Passer de n = 100 à n = 400 la réduit de moitié ; passer ensuite de 400 à 1,600 la divise encore par deux, mais multiplie une nouvelle fois le coût par quatre. Cette relation en racine carrée rend les gains de précision de plus en plus coûteux à mesure que les échantillons grandissent. Avec la formule standard des proportions n = z²p(1−p)/E², diviser E par deux exige quatre fois plus de répondants. À 95 % de confiance, la marge est d’environ ±5 % pour n ≈ 384, de ±2.5 % (deux fois plus précise) pour n ≈ 1,537, et de ±1 % (cinq fois plus précise) pour n ≈ 9,604. En pratique, un compromis se situe souvent entre 400 et 1,500 personnes pour un sondage ; au-delà, les gains de précision coûtent parfois plus qu’ils ne valent. Comprendre cette courbe aide à fixer des objectifs réalistes plutôt qu’à rechercher une perfection théorique.
Analyse de puissance : l’étape souvent oubliée
De nombreux chercheurs ne tiennent compte que du niveau de confiance et de la marge d’erreur, en oubliant la puissance statistique. La puissance (1 − β) est la probabilité de détecter un effet réel d’une taille donnée. Un intervalle de confiance à 95 % étroit n’empêche pas une étude de manquer de puissance si l’effet recherché est faible par rapport à l’échantillon. L’analyse de puissance permet de poser les questions dans les deux sens : pour un budget donné (donc un échantillon fixé), quel est le plus petit effet que l’on peut détecter de façon fiable ? Ou, pour une taille d’effet ciblée (d’après la littérature ou son importance pratique), combien de sujets faut-il pour atteindre 80 % de puissance ? Le d de Cohen standardise les effets afin de les comparer entre études : 0.2 (petit), 0.5 (moyen) et 0.8 (grand). Avec 50 personnes par groupe, la puissance n’est que de 40 % pour détecter un petit effet (d = 0.2), mais atteint 98 % pour un grand effet (d = 0.8). Négliger la puissance conduit à publier des résultats négatifs d’études sous-dimensionnées qui écartent à tort des effets réels, ce qui contribue à la crise de reproductibilité en psychologie et en médecine.
Populations finies et mythe du recensement
Une idée reçue veut qu’il faille interroger une grande fraction d’une population pour obtenir des résultats fiables. En réalité, au-delà d’environ 10,000 personnes, la taille d’échantillon requise évolue à peine, car le facteur de correction pour population finie tend vers 1. La précision d’un sondage dépend presque entièrement de l’effectif absolu de l’échantillon, pas de la fraction étudiée. Un sondage de n = 1,068 permet une marge de ±3 % à 95 % de confiance, que la population compte 100,000 ou 330 millions de personnes. La correction n_adj = nN/(n + N − 1) ne compte que lorsque l’on échantillonne plus de 5 à 10 % de la population, par exemple 100 employés sur 500. Pour une petite population (N = 500), un échantillon de 50 correspond à un n ajusté d’environ 44 au lieu de 384 : une réduction substantielle. Savoir quand appliquer cette correction évite à la fois le suréchantillonnage (gaspillage de ressources) et un échantillon insuffisant dans le contrôle qualité, les sondages de petites collectivités ou les études de populations animales.