Calculatrice de la règle empirique
Résultat
Part dans 1σ
- 1σ sous la moyenne
- 85,00
- 1σ au-dessus de la moyenne
- 115,00
- 2σ sous la moyenne
- 70,00
- 2σ au-dessus de la moyenne
- 130,00
- Part dans 2σ
- 95,45 %
- 3σ sous la moyenne
- 55,00
- 3σ au-dessus de la moyenne
- 145,00
- Part dans 3σ
- 99,73 %
La règle empirique — la règle 68-95-99,7 — dit que pour une loi normale environ 68 % des valeurs se situent à moins d’un écart type de la moyenne, environ 95 % à moins de deux, et environ 99,7 % à moins de trois. Cette page transforme cet énoncé en les nombres dont il parle : donnez-lui une moyenne et un écart type et elle affiche les six extrémités de ces intervalles — les valeurs à un, deux et trois écarts types de part et d’autre de la moyenne — ainsi que la part de la distribution que couvre chaque intervalle. Les trois parts sont calculées plutôt que citées, et sortent donc à 68,27 %, 95,45 % et 99,73 %, c’est-à-dire la règle empirique débarrassée de ses arrondis. Le nom de la règle est un raccourci ; le nombre affiché par la page est ce dont ce raccourci tient lieu.
Formule
un sigma : moyenne ± 1σ · deux sigma : moyenne ± 2σ · trois sigma : moyenne ± 3σ · part dans kσ = 2Φ(k) − 1, où Φ est la fonction de répartition de la loi normale centrée réduite
- moyenne
- Le centre de la distribution. Les six extrémités sont symétriques autour d’elle, donc la déplacer fait glisser tout l’ensemble des intervalles sans changer aucune des trois parts
- écart type
- L’étalement de la distribution, et l’unité dans laquelle la règle se compte — un sigma, deux sigma, trois sigma. Il doit être positif : une loi normale d’écart type nul est un point unique, et la règle n’a rien à en dire
- kσ
- Le nombre d’écarts types — 1, 2 ou 3. La part contenue dans un intervalle ne dépend que de k, et c’est pourquoi les trois pourcentages sont les mêmes sur toutes les pages de résultats, quelle que soit la moyenne et quel que soit l’écart type
- 2Φ(k) − 1
- La part exacte entre −kσ et +kσ. La règle empirique arrondit cette valeur à 68 / 95 / 99,7 pour la lecture ; la page affiche la valeur non arrondie, qui est ce dont la valeur arrondie est le raccourci
Utilisez-la pour transformer une moyenne et un écart type en intervalles que l’on peut réellement désigner. La règle empirique se rencontre le plus souvent sous forme de phrase sur des pourcentages, ce qui s’applique mal à une mesure particulière ; le même énoncé sous la forme « tout ce qui dépasse 130 est à plus de deux écarts types » s’y applique. C’est aussi le contrôle rapide de l’écart type lui-même : si un écart type de part et d’autre de la moyenne couvre un intervalle qui ne peut pas contenir 68 % des données — parce qu’il franchit une limite dure, ou parce que les données sont visiblement dissymétriques — alors le modèle normal est le mauvais pour ces données, et ce contrôle ne coûte rien. La page suppose une loi normale du début à la fin ; elle n’en ajuste pas une à vos données et ne vous dit pas si l’hypothèse tient.
Exemples détaillés
Une moyenne de 100 et un écart type de 15
- Un écart type de part et d’autre de 100 donne 100 − 15 = 85 à 100 + 15 = 115
- Deux écarts types donnent 100 − 30 = 70 à 100 + 30 = 130
- Trois écarts types donnent 100 − 45 = 55 à 100 + 45 = 145
- Les parts n’utilisent ni la moyenne ni l’écart type : 68,27 % dans 1σ, 95,45 % dans 2σ, 99,73 % dans 3σ
Les trois pourcentages sont identiques sur tous les exemples de cette page, et c’est là le contenu de la règle plutôt qu’une coïncidence de celui-ci. Une loi normale est entièrement décrite par son centre et son étalement, et la part de cette loi située à moins de k écarts types du centre ne dépend que de k — la moyenne et l’écart type déplacent donc les extrémités et ne touchent jamais les parts. Si un résultat montrait un pourcentage qui bouge avec la moyenne, c’est que les pourcentages seraient calculés à partir de la mauvaise grandeur, et c’est en les imprimant sur ces trois mêmes lignes que l’erreur devient visible.
La loi normale centrée réduite : moyenne 0, écart type 1
- Un écart type de part et d’autre de 0 donne −1 à 1
- Deux écarts types donnent −2 à 2, et trois donnent −3 à 3
- Les parts restent inchangées à 68,27 %, 95,45 % et 99,73 %
Avec une moyenne nulle et un écart type unitaire, les extrémités sont les nombres d’écarts types eux-mêmes, ce qui fait de cette version la seule de la règle qui vaille la peine d’être mémorisée : les nombres −1, −2, −3 et leurs positifs sont les scores z, et toute autre loi normale est celle-ci étirée et décalée. Cela montre aussi pourquoi les parts ne peuvent pas dépendre des entrées — ici les extrémités sont littéralement les valeurs de k, et les pourcentages à côté sont les mêmes qu’à une moyenne de 100.
Un petit écart type : moyenne 500, écart type 0,5
- Un écart type vaut une demi-unité, donc le premier intervalle va de 499,5 à 500,5
- Deux écarts types donnent 499 à 501, et trois donnent 498,5 à 501,5
- Les parts valent toujours 68,27 %, 95,45 % et 99,73 %
Rien dans la règle n’est lié au fait que l’écart type soit rond ou grand, et c’est sur une distribution étroite que les intervalles cessent d’être lisibles d’un coup d’œil. Une tolérance sur une pièce usinée s’écrit en général de cette façon — une cible et un étalement bien plus petit que la cible — et la sortie utile est alors la ligne des extrémités plutôt que celle des pourcentages. C’est aussi un rappel que l’intervalle à 99,7 % ne couvre presque tout que si la distribution est réellement normale : trois écarts types forment ici un intervalle petit en valeur absolue, et tout processus réel à queue plus épaisse laisserait bien plus de 0,27 % à l’extérieur.
Une moyenne négative : −2,5 avec un écart type de 1,25
- Un écart type de part et d’autre de −2,5 donne −3,75 à −1,25
- Deux écarts types donnent −5 à 0 — l’extrémité supérieure tombe exactement sur zéro
- Trois écarts types donnent −6,25 à 1,25, ce qui traverse zéro
- Les parts restent inchangées à 68,27 %, 95,45 % et 99,73 %
Une moyenne négative est ordinaire — une anomalie de température, un rendement logarithmique, une différence entre deux mesures — et c’est le cas où les intervalles traversent zéro, si bien qu’une implémentation fautive sur les signes peut continuer à paraître juste sur tous les exemples positifs. L’extrémité supérieure à deux sigma qui tombe exactement sur zéro est le genre de coïncidence qui fait passer une réponse fausse pour voulue, et c’est pourquoi ce cas est figé comme test plutôt que laissé au hasard. L’écart type reste positif dans tous les cas : c’est une largeur, pas une coordonnée, et seule la moyenne porte le signe.
Limites
La règle appartient à la loi normale et à rien d’autre. On la répète souvent comme si 68 % était un fait sur les données en général, alors que c’est une propriété d’une courbe particulière — une distribution de forme différente a d’autres parts à un, deux et trois écarts types, et une distribution dissymétrique peut avoir des parts très différentes de part et d’autre de la moyenne. La page suppose donc la normalité au lieu de la vérifier, et un résultat n’y vaut que ce que vaut cette hypothèse. Trois autres limites. L’écart type doit être positif : à zéro la distribution s’effondre en un point unique et la question de la part située à moins de zéro de la moyenne n’a pas de réponse utile, donc la page refuse l’entrée plutôt que d’en choisir une. Les trois parts sont les valeurs exactes de la fonction de répartition de la loi normale, et diffèrent donc à la deuxième décimale des 68, 95 et 99,7 avec lesquels la règle est habituellement citée — la page ne les arrondit pas pour coller au nom, parce que l’arrondi est le raccourci et que le nombre imprimé est ce dont il tient lieu. Et la page n’ajuste aucune distribution à vos données et ne teste pas si une distribution convient ; elle prend une moyenne et un écart type comme donnés et rapporte ce qui en découle.
Questions fréquentes
- Pourquoi la page affiche-t-elle 68,27 % alors que la règle dit 68 % ?
- Parce que le 68 du nom est une valeur arrondie et que 68,27 % est la valeur qu’il arrondit. La règle empirique est une façon de retenir trois nombres, et environ 68 %, 95 % et 99,7 % est ce que la plupart des gens peuvent garder en tête ; les parts exactes situées à moins d’un, deux et trois écarts types de la moyenne d’une loi normale valent 68,27 %, 95,45 % et 99,73 %, et c’est ce que la page calcule au lieu de le citer. Si un calcul doit être bâti sur l’un de ces nombres, c’est la valeur non arrondie qu’il faut prendre — une valeur arrondie utilisée comme entrée produit une réponse faussée d’une manière que personne ne pourra rattacher à l’arrondi.
- Les pourcentages changent-ils si je change la moyenne ou l’écart type ?
- Non, et c’est là tout le contenu de la règle. Une loi normale est fixée par deux nombres, son centre et son étalement, et la part de cette loi qui tombe à moins de k écarts types du centre ne dépend que de k — un, deux ou trois. Changer la moyenne fait donc glisser les six extrémités le long de la droite des nombres et changer l’écart type les étire ou les resserre, tandis que les trois parts restent exactement où elles étaient. Si un résultat montrait une part qui bouge avec les entrées, c’est que les parts seraient calculées à partir des extrémités plutôt qu’à partir du nombre d’écarts types, et ce serait une erreur et non une propriété des données.
- Que me dit réellement cet intervalle — est-ce une probabilité ?
- C’est une probabilité, lue comme une part de la distribution. Si une grandeur est réellement distribuée selon une loi normale avec la moyenne et l’écart type que vous avez saisis, alors la probabilité qu’une valeur tirée de cette loi tombe dans l’intervalle à un sigma vaut 68,27 %, et les intervalles traduisent les écarts types dans l’unité de vos mesures pour que l’énoncé s’applique à un nombre précis. Ce n’est en revanche pas un énoncé sur votre échantillon particulier : une distribution peut concentrer 68 % de sa probabilité dans un intervalle alors que les données devant vous en contiennent une proportion différente, et la page n’a pas de données — elle a deux paramètres que vous avez tapés.
- Comment savoir si la loi normale est le bon modèle ?
- Cette page ne peut pas vous le dire, parce qu’elle ne voit jamais les données. Ce qu’elle offre, c’est un contrôle rapide de la plausibilité du modèle : si un écart type de part et d’autre de la moyenne couvre un intervalle qui ne peut pas contenir environ deux tiers des valeurs — parce que l’intervalle franchit un plancher ou un plafond dur, parce que les valeurs sont des effectifs qui ne peuvent pas descendre sous zéro, ou parce que la distribution est visiblement dissymétrique — alors l’hypothèse normale fait réellement des dégâts et les pourcentages de cette page décrivent une courbe que les données ne suivent pas. Un histogramme ou un diagramme de probabilité normale est la façon habituelle de répondre correctement à la question ; l’arithmétique d’ici vient après cette réponse, elle ne la remplace pas.
- Pourquoi l’écart type ne peut-il pas être nul ?
- Parce qu’une loi normale d’écart type nul s’est effondrée en un point unique, et que la règle cesse alors de signifier quoi que ce soit. Toutes les valeurs se situeraient exactement sur la moyenne, donc les intervalles larges d’un, deux et trois écarts types auraient tous une largeur nulle, et demander quelle part de la distribution ils contiennent admet deux réponses défendables — la totalité, puisque tout est à la moyenne, ou rien, puisque l’intervalle n’a aucune étendue — sans moyen de choisir entre elles. Plutôt que d’en choisir une en silence, la page refuse l’entrée et indique que l’écart type doit être positif. Un écart type qui sort nul dans un vrai calcul signale presque toujours une observation unique ou un problème de saisie plutôt qu’une distribution véritable.
- Est-ce la même chose que la calculatrice qui donne des probabilités à partir des scores z ?
- Ce sont deux entrées dans la même loi normale. La calculatrice de scores z prend une valeur et vous dit où elle tombe et quelle probabilité se trouve en dessous ; cette page prend la moyenne et l’écart type et déploie les trois intervalles d’écarts types avec la part que chacun couvre. C’est le sens de la question qui diffère — l’une part d’une mesure, l’autre part de la règle elle-même. Les entrées sont délibérément identiques, la moyenne et l’écart type dans les deux mêmes champs, pour que passer d’une page à l’autre n’oblige à rien ressaisir, et les deux ne peuvent pas être en désaccord sur la distribution sous-jacente puisqu’elles la calculent de la même façon.
Références
- 68-95-99.7 Rule — from Wolfram MathWorld (the rule stated as approximately 68%, 95% and 99.7%, the more precise probabilities, and the note that the rule is specific to the normal distribution rather than a general statement about arbitrary distributions) — Wolfram MathWorld
- 6.1 The Standard Normal Distribution — Introductory Statistics 2e (the empirical rule stated for a normally distributed variable: about 68% of values within one standard deviation of the mean, 95% within two, 99.7% within three) — OpenStax (Rice University)
- 1.3.6.6.1. Normal Distribution — e-Handbook of Statistical Methods (the normal distribution its parameters and its cumulative distribution function, which is what the three shares on this page are computed from) — National Institute of Standards and Technology (NIST)