Калькулятор эмпирического правила
Результат
Доля в пределах 1σ
- 1σ ниже среднего
- 85,00
- 1σ выше среднего
- 115,00
- 2σ ниже среднего
- 70,00
- 2σ выше среднего
- 130,00
- Доля в пределах 2σ
- 95,45 %
- 3σ ниже среднего
- 55,00
- 3σ выше среднего
- 145,00
- Доля в пределах 3σ
- 99,73 %
Эмпирическое правило — правило 68-95-99,7 — говорит, что для нормального распределения около 68 % значений лежат в пределах одного стандартного отклонения от среднего, около 95 % — в пределах двух и около 99,7 % — в пределах трёх. Эта страница превращает формулировку в те числа, о которых она: задайте среднее и стандартное отклонение, и она напечатает шесть границ этих диапазонов — значения на одну, две и три сигмы в обе стороны от среднего, — а вместе с ними долю распределения, которую покрывает каждый диапазон. Три доли не цитируются, а считаются, поэтому получаются 68,27 %, 95,45 % и 99,73 % — это эмпирическое правило со снятым округлением. Название правила — сокращение, а число, которое печатает страница, и есть то, для чего это сокращение служит.
Формула
одна сигма: mean ± 1σ · две сигмы: mean ± 2σ · три сигмы: mean ± 3σ · доля внутри kσ = 2Φ(k) − 1, где Φ — функция стандартного нормального распределения
- mean
- Центр распределения. Шесть границ симметричны относительно него, поэтому его сдвиг двигает весь набор диапазонов, не меняя ни одной из трёх долей
- standardDeviation
- Насколько распределение разбросано, и в каких единицах считается правило — одна сигма, две сигмы, три сигмы. Оно должно быть положительным: нормальное распределение с нулевым стандартным отклонением — это одна точка, и правилу о ней сказать нечего
- kσ
- Число стандартных отклонений — 1, 2 или 3. Доля внутри диапазона зависит только от k, и поэтому три процента одинаковы на любой странице результатов, каковы бы ни были среднее и стандартное отклонение
- 2Φ(k) − 1
- Точная доля между −kσ и +kσ. Эмпирическое правило округляет её до 68 / 95 / 99,7 для запоминания; страница печатает неокруглённое значение, для которого округлённое и служит сокращением
Берите его, чтобы превратить среднее и стандартное отклонение в диапазоны, на которые можно показать пальцем. а эмпирическое правило обычно встречается в виде фразы о процентах, и эту фразу трудно приложить к конкретному измерению; та же мысль в форме «всё выше 130 — это больше двух стандартных отклонений» — уже нет. Это ещё и быстрая проверка здравого смысла для самого стандартного отклонения: если одно стандартное отклонение в обе стороны от среднего накрывает диапазон, который не может содержать 68 % данных — потому что выходит за жёсткий предел или потому что данные заметно перекошены, — значит, нормальная модель для этих данных неверна, и такая проверка ничего не стоит. Страница всюду предполагает нормальное распределение; она не подгоняет его под ваши данные и не говорит, выполняется ли это допущение.
Разобранные примеры
Среднее 100 и стандартное отклонение 15
- Одно стандартное отклонение в обе стороны от 100 — это от 100 − 15 = 85 до 100 + 15 = 115
- Два стандартных отклонения — от 100 − 30 = 70 до 100 + 30 = 130
- Три стандартных отклонения — от 100 − 45 = 55 до 100 + 45 = 145
- Доли вовсе не используют среднее и стандартное отклонение: 68,27 % внутри 1σ, 95,45 % внутри 2σ, 99,73 % внутри 3σ
Три процента одинаковы на всех примерах этой страницы, и в этом содержание правила, а не совпадение этого примера. Нормальное распределение полностью описывается своим центром и своим разбросом, а доля, попадающая в k стандартных отклонений от центра, зависит только от k, поэтому среднее и стандартное отклонение двигают границы и никогда не трогают доли. Если бы результат когда-нибудь показал долю, меняющуюся вместе со средним, значит доли считались бы не из той величины, и печать их в одних и тех же трёх строках как раз и делает это заметным.
Стандартное нормальное: среднее 0, стандартное отклонение 1
- Одно стандартное отклонение в обе стороны от 0 — это от −1 до 1
- Два стандартных отклонения — от −2 до 2, а три — от −3 до 3
- Доли не изменились: 68,27 %, 95,45 % и 99,73 %
При среднем ноль и стандартном отклонении единица границы и есть сами числа сигм, что делает этот вариант правила тем, который стоит запомнить: числа −1, −2, −3 и положительные к ним — это z-оценки, а любое другое нормальное распределение есть это же, растянутое и сдвинутое. Здесь же видно, почему доли не могут зависеть от входных данных: границы буквально равны значениям k, а проценты рядом с ними те же, что были при среднем 100.
Маленькое стандартное отклонение: среднее 500, отклонение 0,5
- Одно стандартное отклонение равно половине единицы, поэтому первый диапазон — от 499,5 до 500,5
- Два стандартных отклонения — от 499 до 501, а три — от 498,5 до 501,5
- Доли по-прежнему 68,27 %, 95,45 % и 99,73 %
В правиле нет ничего привязанного к тому, чтобы стандартное отклонение было круглым или большим, и именно на узком распределении диапазоны перестают читаться с одного взгляда. Поле допуска на обработанной детали обычно записывают именно так — цель и разброс много меньше самой цели, — и полезен здесь столбец границ, а не столбец долей. Это и напоминание, что диапазон 99,7 охватывает почти всё только тогда, когда распределение действительно нормальное: три стандартных отклонения здесь малы в абсолютных величинах, и любой реальный процесс с более тяжёлым хвостом вывел бы за эти пределы куда больше 0,27 %.
Отрицательное среднее: −2,5 при стандартном отклонении 1,25
- Одно стандартное отклонение в обе стороны от −2,5 — это от −3,75 до −1,25
- Два стандартных отклонения — от −5 до 0: верхний конец попадает ровно в ноль
- Три стандартных отклонения — от −6,25 до 1,25, и этот диапазон пересекает ноль
- Доли не изменились: 68,27 %, 95,45 % и 99,73 %
Среднее ниже нуля — вещь обычная (температурная аномалия, логарифмическая доходность, разность двух измерений), и это тот случай, когда диапазоны пересекают ноль, так что реализация с ошибкой в знаке может выглядеть правильно на всех положительных примерах. Верхний конец двух сигм, попадающий здесь ровно в ноль, — как раз то совпадение, из-за которого неверный ответ выглядит намеренным, и поэтому случай закреплён тестом, а не оставлен на волю случая. Стандартное отклонение при этом остаётся положительным: это ширина, а не координата, и знак несёт только среднее.
Ограничения
Правило принадлежит нормальному распределению и ничему больше. Его часто повторяют так, будто 68 % — факт о данных вообще, но это свойство одной конкретной кривой: у распределения другой формы доли на одной, двух и трёх сигмах другие, а у перекошенного они могут сильно отличаться по разные стороны от среднего. Поэтому страница предполагает нормальность, а не проверяет её, и результат здесь значим ровно настолько, насколько верно это допущение. Ещё три ограничения. Стандартное отклонение должно быть положительным: при нуле распределение схлопывается в одну точку, и вопрос о том, какая доля лежит в нуле от среднего, не имеет полезного ответа, поэтому страница отклоняет ввод, а не выбирает один из вариантов. Три доли — точные значения функции нормального распределения, поэтому во втором знаке они отличаются от 68, 95 и 99,7, которыми правило обычно цитируют: страница не округляет их под название, потому что округление — это сокращение, а напечатанное число — то, что оно обозначает. И страница не подгоняет распределение под ваши данные и не проверяет, подходит ли оно: она принимает среднее и стандартное отклонение как данность и сообщает следствия.
Частые вопросы
- Почему страница говорит 68,27 %, когда правило говорит 68 %?
- Потому что 68 в названии — округлённая величина, а 68,27 % — то значение, которое она округляет. Эмпирическое правило — способ запомнить три числа, и примерно 68 %, 95 % и 99,7 % — это то, что большинство может удержать в голове; точные доли внутри одного, двух и трёх стандартных отклонений от среднего нормального распределения равны 68,27 %, 95,45 % и 99,73 %, и именно их страница считает, а не цитирует. Если на одном из этих чисел будет строиться расчёт, строить его нужно на неокруглённом: округлённая величина, взятая как вход, даёт ответ, ошибку которого никто не сможет проследить до округления.
- Меняются ли проценты, если изменить среднее или стандартное отклонение?
- Нет, и в этом всё содержание правила. Нормальное распределение задаётся двумя числами — центром и разбросом, — а доля, попадающая в k стандартных отклонений от центра, зависит только от k: один, два или три. Поэтому смена среднего сдвигает все шесть границ вдоль числовой оси, а смена стандартного отклонения растягивает или сжимает их, тогда как три доли остаются ровно там, где были. Если бы результат когда-нибудь показал долю, меняющуюся вместе с входными данными, значит доли считались бы из границ, а не из числа стандартных отклонений, и это была бы ошибка, а не свойство данных.
- Что этот диапазон мне на самом деле даёт — это вероятность?
- Это вероятность, читаемая как доля распределения. Если величина действительно нормально распределена со введёнными вами средним и стандартным отклонением, то шанс, что одно взятое из неё значение попадёт внутрь диапазона одной сигмы, равен 68,27 %, а диапазоны переводят стандартные отклонения в единицы, в которых вы измеряете, чтобы утверждение можно было приложить к конкретному числу. Чего это не даёт, так это утверждения о вашей конкретной выборке: распределение может содержать 68 % своей вероятности в диапазоне, тогда как у данных перед вами доля внутри него другая, — а у страницы данных нет, у неё два введённых вами параметра.
- Как понять, нормальное ли распределение здесь подходящая модель?
- Эта страница не может вам сказать, потому что данных она не видит. Что она даёт — быструю проверку правдоподобия модели: если одно стандартное отклонение в обе стороны от среднего накрывает диапазон, который не может правдоподобно содержать около двух третей значений — потому что диапазон выходит за жёсткий пол или потолок, потому что значения это счётчики, которые не могут быть ниже нуля, или потому что распределение заметно перекошено, — значит, нормальное допущение наносит реальный ущерб и проценты на этой странице описывают кривую, которой данные не следуют. Гистограмма или вероятностный график нормальности — обычный способ ответить на вопрос как следует; арифметика здесь идёт после этого ответа, а не вместо него.
- Почему стандартное отклонение не может быть нулевым?
- Потому что нормальное распределение с нулевым стандартным отклонением схлопнулось в одну точку, и правило там теряет смысл. Все значения лежали бы ровно на среднем, поэтому диапазоны шириной в одну, две и три сигмы имели бы нулевую ширину, а вопрос, какую долю распределения они содержат, допускал бы два защитимых ответа — все, раз всё находится на среднем, или ноль, раз у интервала нет протяжённости, — и выбрать между ними нечем. Вместо того чтобы молча выбрать один, страница отклоняет ввод и говорит, что стандартное отклонение должно быть положительным. Стандартное отклонение, вышедшее нулевым в реальном расчёте, почти всегда означает единственное наблюдение или ошибку ввода данных, а не настоящее распределение.
- Это то же самое, что калькулятор вероятностей по z-оценкам?
- Это два входа в одно и то же нормальное распределение. Калькулятор z-оценки берёт значение и говорит, где оно находится и какая вероятность лежит ниже него; эта страница берёт среднее и стандартное отклонение и раскладывает три стандартных диапазона с долей, которую каждый покрывает. Различается направление вопроса: один начинает от измерения, другой — от самого правила. Входные данные намеренно одинаковы — среднее и стандартное отклонение в тех же двух полях, — чтобы переход между страницами не означал повторного ввода, и два результата не могут разойтись насчёт лежащего в основе распределения, потому что считают его одинаково.
Источники
- 68-95-99.7 Rule — from Wolfram MathWorld (the rule stated as approximately 68%, 95% and 99.7%, the more precise probabilities, and the note that the rule is specific to the normal distribution rather than a general statement about arbitrary distributions) — Wolfram MathWorld
- 6.1 The Standard Normal Distribution — Introductory Statistics 2e (the empirical rule stated for a normally distributed variable: about 68% of values within one standard deviation of the mean, 95% within two, 99.7% within three) — OpenStax (Rice University)
- 1.3.6.6.1. Normal Distribution — e-Handbook of Statistical Methods (the normal distribution its parameters and its cumulative distribution function, which is what the three shares on this page are computed from) — National Institute of Standards and Technology (NIST)