Calculatrice du théorème central limite
Résultat
Erreur type
- Moyenne des moyennes d’échantillon
- 100,0000
- Variance des moyennes d’échantillon
- 6,2500
Une calculatrice du théorème central limite décrit la distribution d’échantillonnage d’une moyenne : où elle est centrée, quelle est sa largeur, et comment les deux réagissent à la taille d’échantillon. Le centre est la partie surprenante — la moyenne de toutes les moyennes d’échantillon est égale à la moyenne de la population, quelle que soit la taille de l’échantillon, si bien que collecter plus de données ne la déplace pas. La largeur, elle, change : l’erreur type est l’écart type de la population divisé par √n, donc quadrupler l’échantillon la divise par deux, tandis que la variance est divisée par quatre. L’affirmation propre au théorème — la forme se rapproche de la normale quand n grandit — porte sur la forme et non sur la largeur, et aucun calcul de cette page ne peut la montrer.
Comment l’erreur type diminue quand l’échantillon grandit
| Taille d’échantillon, n | √n | Erreur type ÷ σ |
|---|---|---|
| 1 | 1 | 1 |
| 4 | 2 | 0.5 |
| 16 | 4 | 0.25 |
| 25 | 5 | 0.2 |
| 100 | 10 | 0.1 |
| 400 | 20 | 0.05 |
| 2500 | 50 | 0.02 |
| 10000 | 100 | 0.01 |
La troisième colonne est le facteur par lequel multiplier σ — un écart type de population de 15 avec un échantillon de 100 donne une erreur type de 0,1 × 15 = 1,5. Rien dans le tableau ne dépend de votre moyenne ni de votre écart type, c’est pourquoi il ne peut pas contredire le panneau au-dessus : c’est la fonction 1/√n, et le panneau évalue cette fonction en un point. En lisant les lignes, la loi de la racine carrée apparaît comme une régularité et non comme une affirmation — chaque fois que la taille d’échantillon quadruple, l’erreur type est divisée par deux, et les huit lignes sont choisies par pas de quatre pour que la régularité se répète au lieu de dériver. Les tailles d’échantillon sont celles dont la racine carrée est un nombre entier, chaque ligne se vérifie donc à la main. Les nombres sont repris tels quels : dans le tableau, le séparateur décimal est le point (0.5 plutôt que 0,5), parce que les valeurs viennent du calcul et non d’un texte — et les milliers ne sont pas groupés (2500 plutôt que 2 500).
Formule
E[X̄] = μ ; Var(X̄) = σ² / n ; SE = σ / √n
- μ
- La moyenne de la population — le centre de la distribution dans laquelle les échantillons sont prélevés. Elle ressort inchangée comme moyenne de la distribution d’échantillonnage, ce qui est le premier des trois résultats et le seul qui soit vrai à toute taille d’échantillon
- σ
- L’écart type de la population. Il s’exprime dans l’unité des données, et l’erreur type aussi, ce qui permet de les comparer directement — une erreur type de 2,5 à côté d’un σ de 15 est une affirmation sur la taille de l’échantillon, pas sur les données
- n
- Le nombre d’observations d’un échantillon — la taille de chaque prélèvement, et non le nombre de prélèvements. Il apparaît en √n sous une division et en n sous une autre, et cet écart est tout le message pratique : la variance diminue proportionnellement à n, l’erreur type seulement à sa racine carrée
- X̄
- La moyenne d’échantillon, considérée comme une grandeur aléatoire et non comme un nombre. Un échantillon donne une seule moyenne d’échantillon ; répéter le prélèvement en donne une distribution, et les trois sorties décrivent cette distribution plutôt qu’un échantillon particulier
- SE
- L’erreur type — l’écart type des moyennes d’échantillon, et le résultat principal de la page. C’est avec elle que se construit un intervalle de confiance et que se divise une statistique de test, et c’est pourquoi ce nombre mérite d’être lu plutôt que la variance dont il est la racine carrée
Servez-vous de cette page quand vous voulez savoir de combien une moyenne d’échantillon peut varier d’un échantillon à l’autre — avant de concevoir une étude, en lisant une erreur type dans un rapport et en voulant voir d’où elle vient, ou pour vérifier qu’une intuition sur la taille d’échantillon est juste. L’intuition qu’elle corrige le plus souvent est qu’un échantillon plus grand donne une estimation proportionnellement meilleure : c’est faux, parce que l’erreur type diminue avec la racine carrée. Passer de 100 observations à 400 divise par deux la dispersion de l’estimation, et obtenir un nouveau facteur deux coûte 1 600 observations. Les deux résultats du haut tiennent pour toute forme de population, ce qui permet de les utiliser avant de savoir quoi que ce soit de la distribution. Ce que la page ne peut pas dire, c’est si un n donné est assez grand pour que la moyenne d’échantillon soit à peu près normale : cela dépend de l’asymétrie de la distribution sous-jacente, et c’est un jugement et non un calcul.
Exemples détaillés
Le cas par défaut : une population de moyenne 100 et d’écart type 15, échantillonnée par 36
- Variance des moyennes d’échantillon : σ² / n = 225 / 36 = 6,25
- Erreur type : √6,25 = 2,5
- Moyenne des moyennes d’échantillon : 100, la moyenne de la population inchangée
- À comparer à σ = 15 : échantillonner 36 à la fois réduit la dispersion d’un facteur 6, qui est √36
15 et 36 ont été choisis pour que l’arithmétique se fasse de tête — 225 sur 36 font 6,25, et sa racine carrée est un 2,5 rond. La troisième ligne mérite un second regard précisément parce qu’elle donne l’impression que rien ne s’est passé : la moyenne de toutes les moyennes d’échantillon est la moyenne de la population, à toute taille d’échantillon, et c’est un fait sur l’espérance et non une approximation. Voir 100 = 100 est tout l’intérêt de la ligne, et c’est pourquoi elle est imprimée alors qu’elle répète l’entrée.
La même population échantillonnée par 9 au lieu de 36
- L’échantillon est quatre fois plus petit, la variance est donc quatre fois plus grande : 225 / 9 = 25
- Erreur type : √25 = 5
- La moyenne vaut toujours 100 — réduire l’échantillon a changé la dispersion et rien d’autre
- Par rapport au premier exemple, n est tombé au quart et l’erreur type n’a fait que doubler
Cette paire est la loi de la racine carrée rendue concrète : divisez l’échantillon par quatre et l’erreur type ne fait que doubler, parce que c’est la variance qui varie avec n. Lue dans l’autre sens, c’est la raison pour laquelle la précision coûte cher — l’échantillon quadruple achète une amélioration d’un facteur deux, et le facteur deux suivant coûte seize fois l’échantillon d’origine. Toute décision de taille d’échantillon est cet arbitrage, et la table de référence ci-dessous le montre sur une plage de n plus large.
Échantillonner une seule observation à la fois ne touche pas à la dispersion
- Avec n = 1, la moyenne d’échantillon est l’observation unique, la distribution d’échantillonnage est donc la population elle-même
- Variance : 225 / 1 = 225, soit σ²
- Erreur type : √225 = 15, soit σ
- La moyenne des moyennes d’échantillon vaut toujours 100
L’extrémité n = 1 vaut la peine d’être vue une fois parce qu’elle ancre toute l’idée : un échantillon d’une observation est un tirage dans la population, rien n’a donc été moyenné et l’erreur type est l’écart type de la population lui-même. Toute autre taille d’échantillon est ce point de départ divisé par √n. La page accepte n = 1 au lieu d’exiger au moins deux, parce que c’est une entrée légitime et instructive — la distribution d’échantillonnage n’a simplement pas été resserrée par l’échantillon.
Limites
Les deux identités du haut de la formule tiennent pour toute population et tout n, mais elles ne décrivent que les deux premiers moments de la distribution d’échantillonnage. La troisième affirmation du théorème — la normalité approchée — est ce sur quoi repose presque tout l’usage pratique, et c’est la partie que cette page ne peut pas vérifier, parce que la taille nécessaire dépend de l’asymétrie de la distribution sous-jacente : pour une population à peu près symétrique, 10 suffisent souvent, tandis qu’une distribution à longue queue peut en demander plusieurs centaines avant que la moyenne d’échantillon se stabilise. Traitez le seuil de 30 si souvent répété comme une règle empirique et non comme un résultat. La formule suppose en outre que les observations sont indépendantes, ce qu’un tirage sans remise dans une petite population viole — la page de la taille d’échantillon applique cette correction et vous demandera moins de personnes que celle-ci n’en implique. Rien ici n’est estimé à partir de données : les deux entrées sont des valeurs de population, et si vous ne disposez que d’un écart type d’échantillon, c’est la page de l’intervalle de confiance qui connaît la différence.
Questions fréquentes
- Quelle différence entre l’écart type et l’erreur type ?
- L’écart type décrit de combien les observations individuelles s’écartent de la moyenne ; l’erreur type décrit de combien une moyenne d’échantillon s’écarte de la moyenne de la population. La seconde est la première divisée par √n, et cette division est tout le contenu de la différence : une population d’écart type 15 est tout aussi dispersée qu’on en prélève 9 ou 900, mais la moyenne de 900 observations tombe trois fois plus près de la vérité que celle de 100. C’est pourquoi σ s’exprime dans l’unité des données tandis que l’erreur type rétrécit à mesure que l’étude grandit — et pourquoi c’est l’erreur type qui entre dans un intervalle de confiance ou une statistique de test.
- La moyenne des moyennes d’échantillon change-t-elle si je prends des échantillons plus grands ?
- Non, et c’est le résultat que l’on a le plus de mal à croire. La moyenne de la distribution d’échantillonnage est égale à la moyenne de la population à toute taille d’échantillon, depuis n = 1, parce que moyenner ne pousse l’estimation dans aucun sens — cela la rend seulement moins variable. La distribution des moyennes d’échantillon devient plus étroite et plus haute autour du même centre. La taille d’échantillon achète la précision, jamais l’exactitude : elle resserre la dispersion de l’estimation sans déplacer son centre. Une méthode de prélèvement biaisée, à l’inverse, déplace le centre et aucune taille d’échantillon ne l’y ramènera, ce qui vaut la peine de garder les deux modes de défaillance distincts.
- Quelle taille d’échantillon faut-il pour que le théorème central limite s’applique ?
- Cela dépend de la forme de la population, et il n’existe aucun seuil valable pour toutes. Une population symétrique se comporte bien dès n = 10, tandis qu’une population fortement asymétrique peut demander plusieurs centaines d’observations avant que la moyenne d’échantillon soit proche de la normale. La règle empirique bien connue de 30 vient de simulations sur des données modérément asymétriques et constitue une valeur par défaut raisonnable, pas un théorème. Ce que la page donne sans aucune hypothèse sur la forme, c’est le centre et la largeur — la moyenne et l’erreur type sont exactes à tout n. Seule l’approximation normale a besoin du grand échantillon, et seuls les intervalles de confiance et les valeurs p construits sur elle héritent de cette exigence.
- Pourquoi la variance des moyennes d’échantillon est-elle si inférieure à celle des données ?
- Parce que moyenner annule les erreurs indépendantes des observations individuelles, et que cette annulation se fait proportionnellement à la taille d’échantillon — alors que l’erreur type, que l’on compare en général, varie proportionnellement à sa racine carrée. Avec σ = 15 et n = 36, la variance passe de 225 à 6,25, un facteur 36, tandis que l’écart type passe de 15 à 2,5, un facteur 6 seulement. Les deux lignes sont imprimées pour cette raison. La variance est la forme sous laquelle on énonce habituellement le théorème, l’erreur type est la forme qui sert, et l’écart entre les deux facteurs est la racine carrée.
- Est-ce la même chose que la calculatrice d’erreur type ?
- Les deux calculent la même grandeur à partir d’entrées différentes, et le choix dépend de ce que vous avez. Cette page prend l’écart type de la population et la taille d’échantillon — les valeurs qui existent avant toute collecte de données — et c’est le bon outil pour concevoir une étude ou vérifier une intuition sur la façon dont n gouverne la précision. La calculatrice d’erreur type prend l’échantillon lui-même et en calcule l’écart type, ce qui est l’usage une fois les données en main et la valeur de population inconnue. Les deux diffèrent exactement par l’étape d’estimation au milieu, et c’est la page de l’intervalle de confiance où cette différence a des conséquences.
Références
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a sample statistic as a quantity with its own distribution, which is the object this page describes) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the curve the sampling distribution approaches as the sample grows, and the table it is read from) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (the law of large numbers: sample averages settling towards the population mean as the sample grows, which is the behaviour the mean of sample means states exactly) — OpenStax (Rice University)
- Écart-type — définition statistique (la dispersion des valeurs autour de leur moyenne, à ne pas confondre avec l’erreur type, qui décrit la dispersion d’une moyenne d’échantillon autour de la moyenne de la population) — Insee (Institut national de la statistique et des études économiques)