Calculatrice de taille d’échantillon
Résultat
Taille d’échantillon nécessaire
- Valeur critique
- 1,9600
Une calculatrice de taille d’échantillon répond à la question qui précède l’enquête : combien de réponses faut-il pour atteindre la marge d’erreur que vous êtes prêt à accepter ? Indiquez-lui un niveau de confiance, une marge d’erreur visée et une idée approximative de la proportion que vous attendez, et elle renvoie le plus petit échantillon qui atteint cet objectif. La formule est la marge d’erreur retournée — la même relation que la page de l’intervalle de confiance applique dans l’autre sens, résolue pour l’échantillon au lieu de la largeur. Quand l’enquête porte sur une petite population, une correction pour population finie réduit la réponse, et pour un effectif salarié ou une école unique elle la réduit considérablement.
Formule
n₀ = z² · p (1 − p) / e² petite population : n = n₀ / ( 1 + (n₀ − 1) / N )
- z
- La valeur critique du niveau de confiance — 1,9600 à 95 %, 1,6449 à 90 % et 2,5758 à 99 %. Elle est imprimée sur sa propre ligne parce que c’est le seul nombre de la formule qui vienne du niveau de confiance plutôt que de vos hypothèses sur la population
- p
- La proportion que vous vous attendez à trouver, sous forme décimale. C’est la seule entrée qui soit une supposition, et elle intervient sous la forme p(1 − p), maximale en p = 0,5 — saisir 50 % est donc l’hypothèse qui produit le plus grand échantillon et la plus prudente
- e
- La marge d’erreur, sous forme décimale — la demi-largeur que vous acceptez, dans la même unité que la proportion. Elle est élevée au carré au dénominateur, ce qui explique que la diviser par deux quadruple à peu près l’échantillon
- n₀
- La taille d’échantillon pour une population assez grande pour que sa taille n’ait pas d’importance. C’est la réponse chaque fois que la population est inconnue, et c’est l’entrée de la correction plutôt que la réponse finale quand elle ne l’est pas
- N
- La taille de la population, saisie à 0 lorsqu’elle est inconnue ou pratiquement illimitée. La correction divise n₀ par un nombre supérieur à la fraction n₀/N, l’échantillon corrigé ressort donc toujours en dessous de N — demander plus de personnes qu’il n’en existe n’est pas un risque que cette formule puisse produire
Servez-vous-en avant de collecter les données, chaque fois que le coût de l’échantillon est réel — une enquête avec une contrepartie par réponse, une mesure de laboratoire facturée à l’échantillon, une étude clinique avec des objectifs de recrutement. L’ordre des décisions est le suivant : fixez la marge d’erreur avec laquelle vous pouvez vivre, fixez le niveau de confiance, puis estimez la proportion, puis lisez la taille d’échantillon. Seule la première est un jugement porté sur l’étude ; les deux autres sont des conventions ou des suppositions. Si la réponse est hors budget, la seule attitude honnête est d’élargir la marge d’erreur et de le dire dans le rapport, parce qu’une marge d’erreur que vous ne pouvez pas financer n’est pas un objectif. Saisissez la taille de la population chaque fois que la population est réellement petite — en dessous de quelques milliers — parce que la correction y est substantielle et que l’ignorer revient à recruter bien plus de personnes que l’étude n’en a besoin.
Exemples détaillés
Une enquête nationale à 95 % de confiance et ±5 points
- Valeur critique à 95 % de confiance : 1,96
- Avec p = 0,5, le produit p(1 − p) vaut 0,25, sa plus grande valeur possible
- n₀ = 1,96² × 0,25 / 0,05² = 3,8416 × 0,25 / 0,0025 = 384,1459
- Arrondi à la personne entière supérieure : 385 réponses
385 est le nombre derrière l’affirmation familière selon laquelle un sondage d’un millier de personnes environ est précis à trois points près — resserrez la marge à ±3 et la réponse devient 1 068, d’où vient ce chiffre. La taille de la population a été laissée à 0 parce qu’une enquête nationale représente une fraction négligeable du pays, et à ce rapport la correction changerait la réponse de moins d’une personne.
La même enquête avec une marge resserrée à ±3 points
- Valeur critique inchangée à 1,96, parce que le niveau de confiance n’a pas changé
- n₀ = 1,96² × 0,25 / 0,03² = 0,9604 / 0,0009 = 1 067,0719
- Arrondi au supérieur : 1 068 réponses
- À comparer avec 385 : la marge a été divisée par 1,667 et l’échantillon a été multiplié par 2,78, soit 1,667²
La précision s’achète de façon quadratique. Passer de ±5 à ±3 points n’est pas une augmentation de 67 % du travail mais de 178 %, parce que la marge d’erreur est élevée au carré au dénominateur. La conséquence pratique est qu’il existe un plancher à la précision qu’une enquête peut atteindre à bon compte, et qu’annoncer une marge plus serrée qu’environ ±3 points implique un échantillon de plusieurs milliers — exactement la zone où le biais de non-réponse commence à peser plus que l’erreur d’échantillonnage que la formule maîtrise.
Une enquête du personnel dans une entreprise de 1 000 salariés
- Le chiffre non corrigé reste 384,1459, puisqu’il ne connaît pas encore la population
- Correction : 384,1459 / ( 1 + 383,1459 / 1 000 ) = 384,1459 / 1,3831459 = 277,73
- Arrondi au supérieur : 278 salariés
- Soit 28 % de l’effectif plutôt que les 38 % qu’aurait laissé supposer le chiffre non corrigé
La correction est ce qui rend les enquêtes sur petite population abordables : 278 au lieu de 385, une économie de plus de cent entretiens pour la même marge annoncée. Elle grandit à mesure que l’échantillon représente une part plus large de la population. Sur 100 salariés la réponse est 80 — on ne peut pas échantillonner plus qu’il n’y a — et sur un million de salariés la correction vaut une seule personne, ce qui explique que 0 pour une population inconnue soit une valeur par défaut raisonnable plutôt qu’un raccourci.
Limites
La formule dimensionne un échantillon de réponses, pas une liste d’invitations. Si un tiers des personnes sollicitées ne répond pas, 385 réponses supposent d’en solliciter environ 580, et si celles qui répondent diffèrent systématiquement de celles qui ne répondent pas, aucune taille d’échantillon ne répare le biais qui en résulte — elle rend seulement l’erreur d’échantillonnage plus petite que l’erreur totale. Le modèle suppose également que chaque réponse est un tirage indépendant dans la population, ce qui tombe en défaut pour les plans par grappes : une enquête auprès de 400 élèves tirés de 8 classes a un échantillon effectif bien plus proche de 8, et l’effectif donné par cette page doit être multiplié par un effet de plan avant d’être utilisé. L’estimation porte sur une proportion unique ; une moyenne demande un écart type à la place, ce que cette page ne prend pas, et une enquête qui sera découpée en sous-groupes a besoin d’un échantillon dimensionné pour le plus petit sous-groupe plutôt que pour l’ensemble. Enfin, les trois niveaux de confiance proposés sont des conventions, et aucun ne tient compte des nombreuses comparaisons qu’une analyse réelle effectue généralement.
Questions fréquentes
- De combien de réponses ai-je besoin pour mon enquête ?
- Pour les ±5 points de pourcentage conventionnels à 95 % de confiance, 385 — et 1 068 si vous visez ±3 points. Ces deux nombres couvrent la grande majorité des enquêtes publiées, et ils supposent une population assez grande pour que sa taille n’ait pas d’importance. Si la population est assez petite pour que vous puissiez raisonnablement en interroger une part importante, saisissez sa taille et la correction abaissera le chiffre : 1 000 salariés demandent 278 réponses plutôt que 385, et 200 salariés en demandent 132. Ancrez-vous d’abord sur la marge d’erreur, parce que c’est le nombre que votre public lira réellement.
- Pourquoi la proportion attendue vaut-elle 50 % par défaut ?
- Parce que p(1 − p) est maximal en p = 0,5 et que la taille d’échantillon lui est proportionnelle, saisir 50 % donne donc la réponse la plus grande que puisse exiger une proportion quelconque. Cela en fait l’hypothèse prudente quand vous ne savez vraiment pas : une enquête qui revient à 60 % aura une marge d’erreur légèrement meilleure que celle que vous aviez prévue. Être plus précis paie — à p = 90 % le terme tombe de 0,25 à 0,09, la même marge d’erreur ne demande donc plus que 36 % de l’échantillon. N’utilisez une valeur autre que 50 % que si vous disposez d’un a priori défendable, comme une vague antérieure de la même enquête.
- À quoi sert la correction pour population finie ?
- Elle réduit l’échantillon quand la population est assez petite pour qu’un tirage sans remise diminue sensiblement l’incertitude. L’effet dépend de la part de la population que vous échantillonnez : à 10 % la correction vaut quelques pour cent de l’échantillon, à 28 % elle en vaut environ un quart, et à 50 % elle en vaut près d’un tiers. Saisissez 0 comme taille de population lorsqu’elle est inconnue ou très grande, et saisissez le chiffre réel quand la population est inférieure à quelques milliers — c’est le champ qui le plus souvent modifie une réponse que les gens avaient déjà calculée.
- Quelle marge d’erreur et quel niveau de confiance viser ?
- ±5 points à 95 % est la valeur par défaut de la plupart des travaux publiés, ±3 points quand une décision repose sur un résultat serré, et ±10 points pour un travail exploratoire où seule une différence importante compte. Sur le niveau de confiance, 95 % est la convention et 99 % coûte environ 73 % d’échantillon en plus pour un intervalle seulement un tiers plus large. Avant de resserrer l’un ou l’autre, vérifiez ce que la réponse coûte : ±3 points à 99 % de confiance demande 1 843 réponses, soit à peu près cinq fois la valeur par défaut. Si c’est hors budget, rapportez la marge plus large plutôt que de recruter un échantillon que vous ne pourrez pas compléter. C’est la même relation que la page de la marge d’erreur parcourt dans l’autre sens : là-bas on saisit la taille d’échantillon pour lire la marge, ici on saisit la marge pour lire la taille.
- Pourquoi la réponse est-elle arrondie à la personne entière supérieure ?
- Parce que le chiffre fractionnaire est l’arithmétique exacte et qu’un nombre entier est ce qui peut être recruté, et que les deux conventions possibles pour passer de l’un à l’autre tirent dans des directions opposées. Arrondir au plus proche pourrait ramener 384,1459 à 384, ce qui manque la marge d’erreur visée d’un cheveu — et cette marge est précisément ce que vous aviez demandé. Arrondir au supérieur garantit que la marge est atteinte ou dépassée, coûte au plus un entretien supplémentaire, et correspond à la façon dont les tailles d’échantillon sont spécifiées dans un protocole, où 385 est un engagement et 384,1459 une valeur intermédiaire.
- Pourquoi n’y a-t-il pas de table de tailles d’échantillon sur cette page ?
- Parce que la table que les gens viennent chercher ici est une grille croisant le niveau de confiance et la marge d’erreur, et que cette grille est exactement ce que le panneau calcule déjà. Une table imprimée à 95 % fixe contredirait le panneau dès que vous passeriez à 99 %, et qu’une page se contredise elle-même est pire que de n’avoir aucune table — le lecteur devrait décider lequel des deux nombres croire. La seconde raison est qu’une telle table devrait aussi choisir une proportion, et que 50 % n’est le bon choix que tant qu’il reste la valeur par défaut prudente. Changez le niveau de confiance, la marge d’erreur, la proportion ou la taille de la population et la réponse se recalcule : c’est là tout le contenu de la table que l’on cherche.
Références
- 3.1 Terminology — Introductory Statistics 2e (relative frequency approaching probability as a sample grows, which is the property that makes a target margin of error meaningful in advance) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the distribution of an estimate, which is what the margin of error is a quantile of) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the cumulative function the critical values come from; the same values, used in reverse here to size a sample rather than to bound an estimate) — National Institute of Standards and Technology (NIST)