Calculatrice d’intervalle de confiance
Résultat
Borne inférieure
- Borne supérieure
- 52,3811
- Marge d’erreur
- 2,3811
- Erreur type
- 1,2000
- Valeur critique
- 1,9842
Une calculatrice d’intervalle de confiance transforme un seul échantillon en une plage de valeurs plausibles pour la grandeur que vous estimez, qu’il s’agisse d’une moyenne de population ou d’une proportion. Elle imprime les deux bornes, la marge d’erreur qui les a produites, l’erreur type de l’estimation et la valeur critique par laquelle celle-ci a été multipliée, de sorte que l’intervalle puisse être démonté au lieu d’être seulement cité. La valeur critique applicable dépend de ce qui est estimé : une moyenne relève de la loi de Student à n − 1 degrés de liberté, une proportion de la loi normale.
Formule
moyenne : x̄ ± t(α/2, n − 1) · s / √n ; proportion : p̂ ± z(α/2) · √( p̂ (1 − p̂) / n )
- x̄
- La moyenne de l’échantillon — le nombre que vous avez mesuré, dans l’unité des données. L’intervalle se construit autour d’elle, toute la plage se déplace donc lorsqu’elle se déplace
- s
- L’écart type de l’échantillon, la dispersion des observations autour de leur propre moyenne. C’est s et non σ parce que vous ne disposez que d’un échantillon ; le diviser par la racine carrée de la taille d’échantillon est ce qui le transforme en erreur type
- n
- Le nombre d’observations de l’échantillon, au moins 2. Il entre deux fois dans le calcul : dans l’erreur type, puis par les degrés de liberté du quantile de Student, qui valent n − 1
- t(α/2, n − 1)
- La valeur critique d’une moyenne : le point d’une loi de Student à n − 1 degrés de liberté qui laisse la moitié de α dans chaque queue. Elle est toujours un peu plus grande que la valeur critique normale, et beaucoup plus grande pour les petits échantillons, ce qui est la façon dont la loi de Student paie le fait que s a été estimé et non connu
- p̂
- La proportion observée dans l’échantillon, saisie en pourcentage. Tout le calcul de proportion reste en points de pourcentage, les bornes, la marge d’erreur et l’erreur type se situent donc sur la même échelle que le nombre saisi
- z(α/2)
- La valeur critique d’une proportion : 1,9600 à 95 % de confiance, et la même à toute taille d’échantillon, parce qu’une proportion se juge sur la loi normale et non sur celle de Student. Elle apparaît deux fois dans la ligne de la proportion, une fois devant la racine et une fois dedans par l’intermédiaire de p̂
Servez-vous de cette page quand vous disposez d’un échantillon et voulez dire à quel point l’estimation qui en découle est précise — une moyenne tirée de quelques mesures, ou un pourcentage tiré d’une enquête. C’est la façon honnête de rapporter un nombre seul : une moyenne de 50 sur 100 observations n’est pas la même affirmation qu’une moyenne de 50 sur 5, et l’intervalle est cette différence, parce que la taille d’échantillon se trouve au dénominateur de l’erreur type. Deux réglages décident du reste. Choisissez la branche moyenne quand la grandeur est une mesure — une longueur, une durée, un score —, et la branche proportion quand c’est un décompte rapporté à un total, saisi en pourcentage. Choisissez ensuite le niveau de confiance : 95 % est la convention, et les trois niveaux proposés couvrent la quasi-totalité des chiffres publiés. Notez ce que l’intervalle ne fait pas — il ne dit pas où se trouve la vraie valeur, et il ne dit pas quelle part des observations futures y tombera. C’est une affirmation sur la procédure d’estimation, pas sur les données.
Exemples détaillés
Une moyenne tirée d’un échantillon de 100 mesures
- Erreur type : 12 / √100 = 12 / 10 = 1,2
- Degrés de liberté : n − 1 = 99, ce qui donne une valeur critique de 1,9842 à 95 % de confiance
- Marge d’erreur : 1,9842 × 1,2 = 2,3811
- Bornes : 50 − 2,3811 = 47,6189 et 50 + 2,3811 = 52,3811
La valeur critique est le nombre à remarquer ici : 1,9842 et non le 1,96 familier. L’écart est ce que la loi de Student facture pour avoir estimé la dispersion à partir des mêmes 100 observations, et il diminue à mesure que l’échantillon grandit — à n = 1 000, il a pratiquement disparu. À noter aussi que le champ de la proportion contient encore 60 et ne fait rien : les deux groupes d’entrées sont toujours à l’écran, et c’est le sélecteur du haut qui décide lequel la formule utilise.
Une proportion tirée d’une enquête sur 1 000 personnes
- La proportion observée de 50 % vaut 0,5 sous forme décimale, et 1 − p̂ vaut 0,5 également
- Erreur type : √( 0,5 × 0,5 / 1 000 ) = 0,015811, soit 1,5811 point de pourcentage
- Valeur critique : 1,96 à 95 % de confiance, la même à toute taille d’échantillon
- Marge d’erreur : 1,96 × 1,5811 = 3,099 points de pourcentage, ce qui donne les bornes 46,901 % et 53,099 %
Tous les nombres de cet exemple sont en points de pourcentage et non en proportions : l’erreur type vaut 1,58 point et non 0,0158. C’est la convention d’échelle que la page adopte pour une proportion, et c’est pourquoi l’erreur type paraît grande ici à côté de celle du premier exemple — elle mesure autre chose, une part et non une mesure. Le même calcul est à l’origine de l’affirmation bien connue selon laquelle une enquête sur un millier de personnes porte une marge d’erreur d’environ trois points.
Les mêmes 100 observations rapportées à 99 % de confiance
- L’erreur type reste à 12 / √100 = 1,2, parce que rien n’a changé dans l’échantillon
- Seule la valeur critique bouge : 2,6264 au lieu de 1,9842
- Marge d’erreur : 2,6264 × 1,2 = 3,1517
- Bornes : 50 ± 3,1517, soit 46,8483 à 53,1517
Comparer cet exemple au premier isole exactement ce que le niveau de confiance achète : les mêmes données, la même erreur type, et un intervalle plus large de 32 %. Rien n’a été appris en élevant le niveau — l’information contenue dans l’échantillon n’a pas changé, seule l’affirmation portée sur elle. C’est pourquoi 95 % est la convention, et pourquoi citer un intervalle à 99 % sans le dire est trompeur plutôt que simplement prudent.
Limites
Les deux branches supposent que les observations sont indépendantes les unes des autres. Un échantillon de 500 relevés pris sur le même instrument, ou de 500 élèves issus de 20 classes, porte moins d’information que l’arithmétique ne le croit, et l’intervalle ressort plus étroit qu’il ne devrait. Les deux supposent aussi que l’estimation est à peu près symétrique autour de la vérité : la branche moyenne s’appuie sur un échantillon à peu près normal, ou sur un n assez grand pour que la loi de Student soit indulgente, et la branche proportion est la plus fragile des deux — près de 0 % ou de 100 %, la formule est simplement la mauvaise, ce qui explique pourquoi la page refuse ces deux valeurs au lieu de renvoyer un intervalle étroit avec assurance autour d’une proportion qui ne peut pas être estimée ainsi. Les populations finies ne sont pas corrigées ici. Si l’échantillon représente une part importante d’une petite population, la page de la taille d’échantillon applique la correction et vous demandera moins de personnes que celle-ci n’en implique.
Questions fréquentes
- Que signifie au juste un intervalle de confiance ?
- C’est une plage construite par une procédure qui capture la vraie valeur dans 95 % des échantillons, au réglage de 95 % — et non une probabilité de 95 % que cette plage-ci la contienne. La distinction compte parce que la vraie valeur est fixe et inconnue : elle est soit entre les bornes que vous venez de calculer, soit en dehors, et aucune probabilité ne s’attache à cela. Ce que le nombre décrit, c’est la fiabilité de la méthode. En pratique, la lecture retenue est que les valeurs proches du milieu de l’intervalle sont plus plausibles que celles proches des extrémités, et qu’une valeur hors de l’intervalle est en tension avec les données — ce qui fait le pont avec les tests d’hypothèse de la page de la valeur p.
- Pourquoi une moyenne passe-t-elle par Student et une proportion par la loi normale ?
- Parce qu’avec une moyenne vous estimez la dispersion en même temps que le centre, alors qu’avec une proportion non. L’erreur type d’une moyenne vaut s / √n, et s est lui-même calculé sur le même échantillon, l’intervalle doit donc tenir compte de cette incertitude supplémentaire — c’est exactement ce que fait la loi de Student, et pourquoi sa valeur critique vaut 1,9842 à n = 100 plutôt que 1,96. Une proportion n’a pas de seconde estimation de ce genre : la dispersion de l’estimation découle de la proportion elle-même, par p̂(1 − p̂), si bien que la loi normale s’applique à toute taille d’échantillon. Les deux groupes d’entrées sont toujours visibles à l’écran ; c’est le sélecteur du haut qui décide lequel le calcul lit.
- Quelle différence entre la marge d’erreur et l’erreur type ?
- L’erreur type est une unité d’incertitude et la marge d’erreur est le nombre d’unités sur lesquelles l’intervalle s’étend. La marge d’erreur est l’erreur type multipliée par la valeur critique, donc à 95 % de confiance avec un grand échantillon elle vaut environ le double de l’erreur type (1,96 fois) et à 99 % environ deux fois et demie (2,5758). Les deux lignes sont imprimées pour que la structure en deux temps reste visible : si vous voulez un intervalle plus étroit, c’est la ligne de l’erreur type qu’il faut attaquer, parce qu’elle est la seule à réagir à une collecte de données supplémentaire. La valeur critique ne bouge que si vous changez le niveau de confiance.
- L’intervalle peut-il descendre sous 0 % ou monter au-dessus de 100 % ?
- Oui, et la page l’imprime au lieu de le tronquer en silence. À 50 % avec un échantillon de 2, les bornes valent −19,3 % et 119,3 %, ce qui n’est pas un défaut : avec deux observations il n’y a réellement presque aucune information sur une proportion, et un intervalle qui le dit est plus honnête qu’un intervalle ramené à l’intervalle de valeurs qu’une proportion peut prendre. Lisez-le comme « cet échantillon ne permet pas d’estimer quoi que ce soit d’utile ici » et collectez davantage de données. Ce que la page refuse en revanche, c’est une proportion saisie exactement à 0 % ou à 100 %, parce qu’en ces deux points la formule divise par une dispersion de largeur nulle et renverrait un intervalle de largeur nulle — une affirmation de certitude que la méthode ne peut pas soutenir.
- Où se trouve la table des valeurs critiques ?
- Il n’y en a pas sur cette page, et c’est délibéré. Tout ce à quoi sert ici une table de valeurs critiques est déjà fait : vous choisissez un niveau, et la seule valeur que ce niveau implique est imprimée sur sa propre ligne. Une table devrait en outre être construite pour un niveau de confiance donné, si bien qu’un lecteur passant à 99 % lirait une table contredisant le panneau au-dessus d’elle — le mode de défaillance où une page se contredit elle-même. La loi de Student pose un problème supplémentaire, puisque sa valeur critique dépend des degrés de liberté autant que du niveau, ce qui demanderait une grille entière plutôt qu’une table. L’outil dédié aux valeurs critiques, qui prend le niveau et les degrés de liberté en entrées, est l’endroit prévu pour cette lecture.
Références
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the source of the critical values this page multiplies the standard error by, and of the tail areas they leave behind) — National Institute of Standards and Technology (NIST)
- Measures of Scale — e-Handbook of Statistical Methods, section 1.3.5.6 (the standard deviation the standard error is built from, and why a spread estimated from a sample is itself an estimate with a distribution) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (relative frequency as an estimate of a probability, which is the step that lets a sample proportion stand in for the population proportion) — OpenStax (Rice University)
- Intervalle de confiance — définition statistique (l’intervalle construit autour d’une estimation, et la lecture correcte d’un niveau de confiance : une propriété de la procédure et non une probabilité portant sur la vraie valeur) — Insee (Institut national de la statistique et des études économiques)