Перейти к основному содержанию
CalcMax

Калькулятор эмпирического правила

Результат

68,27 %

Доля в пределах 1σ

1σ ниже среднего
85,00
1σ выше среднего
115,00
2σ ниже среднего
70,00
2σ выше среднего
130,00
Доля в пределах 2σ
95,45 %
3σ ниже среднего
55,00
3σ выше среднего
145,00
Доля в пределах 3σ
99,73 %

Эмпирическое правило — правило 68-95-99,7 — говорит, что для нормального распределения около 68 % значений лежат в пределах одного стандартного отклонения от среднего, около 95 % — в пределах двух и около 99,7 % — в пределах трёх. Эта страница превращает формулировку в те числа, о которых она: задайте среднее и стандартное отклонение, и она напечатает шесть границ этих диапазонов — значения на одну, две и три сигмы в обе стороны от среднего, — а вместе с ними долю распределения, которую покрывает каждый диапазон. Три доли не цитируются, а считаются, поэтому получаются 68,27 %, 95,45 % и 99,73 % — это эмпирическое правило со снятым округлением. Название правила — сокращение, а число, которое печатает страница, и есть то, для чего это сокращение служит.

Формула

одна сигма: mean ± 1σ · две сигмы: mean ± 2σ · три сигмы: mean ± 3σ · доля внутри kσ = 2Φ(k) − 1, где Φ — функция стандартного нормального распределения

mean
Центр распределения. Шесть границ симметричны относительно него, поэтому его сдвиг двигает весь набор диапазонов, не меняя ни одной из трёх долей
standardDeviation
Насколько распределение разбросано, и в каких единицах считается правило — одна сигма, две сигмы, три сигмы. Оно должно быть положительным: нормальное распределение с нулевым стандартным отклонением — это одна точка, и правилу о ней сказать нечего
kσ
Число стандартных отклонений — 1, 2 или 3. Доля внутри диапазона зависит только от k, и поэтому три процента одинаковы на любой странице результатов, каковы бы ни были среднее и стандартное отклонение
2Φ(k) − 1
Точная доля между −kσ и +kσ. Эмпирическое правило округляет её до 68 / 95 / 99,7 для запоминания; страница печатает неокруглённое значение, для которого округлённое и служит сокращением

Берите его, чтобы превратить среднее и стандартное отклонение в диапазоны, на которые можно показать пальцем. а эмпирическое правило обычно встречается в виде фразы о процентах, и эту фразу трудно приложить к конкретному измерению; та же мысль в форме «всё выше 130 — это больше двух стандартных отклонений» — уже нет. Это ещё и быстрая проверка здравого смысла для самого стандартного отклонения: если одно стандартное отклонение в обе стороны от среднего накрывает диапазон, который не может содержать 68 % данных — потому что выходит за жёсткий предел или потому что данные заметно перекошены, — значит, нормальная модель для этих данных неверна, и такая проверка ничего не стоит. Страница всюду предполагает нормальное распределение; она не подгоняет его под ваши данные и не говорит, выполняется ли это допущение.

Разобранные примеры

  1. Среднее 100 и стандартное отклонение 15

    1. Одно стандартное отклонение в обе стороны от 100 — это от 100 − 15 = 85 до 100 + 15 = 115
    2. Два стандартных отклонения — от 100 − 30 = 70 до 100 + 30 = 130
    3. Три стандартных отклонения — от 100 − 45 = 55 до 100 + 45 = 145
    4. Доли вовсе не используют среднее и стандартное отклонение: 68,27 % внутри 1σ, 95,45 % внутри 2σ, 99,73 % внутри 3σ

    Три процента одинаковы на всех примерах этой страницы, и в этом содержание правила, а не совпадение этого примера. Нормальное распределение полностью описывается своим центром и своим разбросом, а доля, попадающая в k стандартных отклонений от центра, зависит только от k, поэтому среднее и стандартное отклонение двигают границы и никогда не трогают доли. Если бы результат когда-нибудь показал долю, меняющуюся вместе со средним, значит доли считались бы не из той величины, и печать их в одних и тех же трёх строках как раз и делает это заметным.

  2. Стандартное нормальное: среднее 0, стандартное отклонение 1

    1. Одно стандартное отклонение в обе стороны от 0 — это от −1 до 1
    2. Два стандартных отклонения — от −2 до 2, а три — от −3 до 3
    3. Доли не изменились: 68,27 %, 95,45 % и 99,73 %

    При среднем ноль и стандартном отклонении единица границы и есть сами числа сигм, что делает этот вариант правила тем, который стоит запомнить: числа −1, −2, −3 и положительные к ним — это z-оценки, а любое другое нормальное распределение есть это же, растянутое и сдвинутое. Здесь же видно, почему доли не могут зависеть от входных данных: границы буквально равны значениям k, а проценты рядом с ними те же, что были при среднем 100.

  3. Маленькое стандартное отклонение: среднее 500, отклонение 0,5

    1. Одно стандартное отклонение равно половине единицы, поэтому первый диапазон — от 499,5 до 500,5
    2. Два стандартных отклонения — от 499 до 501, а три — от 498,5 до 501,5
    3. Доли по-прежнему 68,27 %, 95,45 % и 99,73 %

    В правиле нет ничего привязанного к тому, чтобы стандартное отклонение было круглым или большим, и именно на узком распределении диапазоны перестают читаться с одного взгляда. Поле допуска на обработанной детали обычно записывают именно так — цель и разброс много меньше самой цели, — и полезен здесь столбец границ, а не столбец долей. Это и напоминание, что диапазон 99,7 охватывает почти всё только тогда, когда распределение действительно нормальное: три стандартных отклонения здесь малы в абсолютных величинах, и любой реальный процесс с более тяжёлым хвостом вывел бы за эти пределы куда больше 0,27 %.

  4. Отрицательное среднее: −2,5 при стандартном отклонении 1,25

    1. Одно стандартное отклонение в обе стороны от −2,5 — это от −3,75 до −1,25
    2. Два стандартных отклонения — от −5 до 0: верхний конец попадает ровно в ноль
    3. Три стандартных отклонения — от −6,25 до 1,25, и этот диапазон пересекает ноль
    4. Доли не изменились: 68,27 %, 95,45 % и 99,73 %

    Среднее ниже нуля — вещь обычная (температурная аномалия, логарифмическая доходность, разность двух измерений), и это тот случай, когда диапазоны пересекают ноль, так что реализация с ошибкой в знаке может выглядеть правильно на всех положительных примерах. Верхний конец двух сигм, попадающий здесь ровно в ноль, — как раз то совпадение, из-за которого неверный ответ выглядит намеренным, и поэтому случай закреплён тестом, а не оставлен на волю случая. Стандартное отклонение при этом остаётся положительным: это ширина, а не координата, и знак несёт только среднее.

Ограничения

Правило принадлежит нормальному распределению и ничему больше. Его часто повторяют так, будто 68 % — факт о данных вообще, но это свойство одной конкретной кривой: у распределения другой формы доли на одной, двух и трёх сигмах другие, а у перекошенного они могут сильно отличаться по разные стороны от среднего. Поэтому страница предполагает нормальность, а не проверяет её, и результат здесь значим ровно настолько, насколько верно это допущение. Ещё три ограничения. Стандартное отклонение должно быть положительным: при нуле распределение схлопывается в одну точку, и вопрос о том, какая доля лежит в нуле от среднего, не имеет полезного ответа, поэтому страница отклоняет ввод, а не выбирает один из вариантов. Три доли — точные значения функции нормального распределения, поэтому во втором знаке они отличаются от 68, 95 и 99,7, которыми правило обычно цитируют: страница не округляет их под название, потому что округление — это сокращение, а напечатанное число — то, что оно обозначает. И страница не подгоняет распределение под ваши данные и не проверяет, подходит ли оно: она принимает среднее и стандартное отклонение как данность и сообщает следствия.

Частые вопросы

Почему страница говорит 68,27 %, когда правило говорит 68 %?
Потому что 68 в названии — округлённая величина, а 68,27 % — то значение, которое она округляет. Эмпирическое правило — способ запомнить три числа, и примерно 68 %, 95 % и 99,7 % — это то, что большинство может удержать в голове; точные доли внутри одного, двух и трёх стандартных отклонений от среднего нормального распределения равны 68,27 %, 95,45 % и 99,73 %, и именно их страница считает, а не цитирует. Если на одном из этих чисел будет строиться расчёт, строить его нужно на неокруглённом: округлённая величина, взятая как вход, даёт ответ, ошибку которого никто не сможет проследить до округления.
Меняются ли проценты, если изменить среднее или стандартное отклонение?
Нет, и в этом всё содержание правила. Нормальное распределение задаётся двумя числами — центром и разбросом, — а доля, попадающая в k стандартных отклонений от центра, зависит только от k: один, два или три. Поэтому смена среднего сдвигает все шесть границ вдоль числовой оси, а смена стандартного отклонения растягивает или сжимает их, тогда как три доли остаются ровно там, где были. Если бы результат когда-нибудь показал долю, меняющуюся вместе с входными данными, значит доли считались бы из границ, а не из числа стандартных отклонений, и это была бы ошибка, а не свойство данных.
Что этот диапазон мне на самом деле даёт — это вероятность?
Это вероятность, читаемая как доля распределения. Если величина действительно нормально распределена со введёнными вами средним и стандартным отклонением, то шанс, что одно взятое из неё значение попадёт внутрь диапазона одной сигмы, равен 68,27 %, а диапазоны переводят стандартные отклонения в единицы, в которых вы измеряете, чтобы утверждение можно было приложить к конкретному числу. Чего это не даёт, так это утверждения о вашей конкретной выборке: распределение может содержать 68 % своей вероятности в диапазоне, тогда как у данных перед вами доля внутри него другая, — а у страницы данных нет, у неё два введённых вами параметра.
Как понять, нормальное ли распределение здесь подходящая модель?
Эта страница не может вам сказать, потому что данных она не видит. Что она даёт — быструю проверку правдоподобия модели: если одно стандартное отклонение в обе стороны от среднего накрывает диапазон, который не может правдоподобно содержать около двух третей значений — потому что диапазон выходит за жёсткий пол или потолок, потому что значения это счётчики, которые не могут быть ниже нуля, или потому что распределение заметно перекошено, — значит, нормальное допущение наносит реальный ущерб и проценты на этой странице описывают кривую, которой данные не следуют. Гистограмма или вероятностный график нормальности — обычный способ ответить на вопрос как следует; арифметика здесь идёт после этого ответа, а не вместо него.
Почему стандартное отклонение не может быть нулевым?
Потому что нормальное распределение с нулевым стандартным отклонением схлопнулось в одну точку, и правило там теряет смысл. Все значения лежали бы ровно на среднем, поэтому диапазоны шириной в одну, две и три сигмы имели бы нулевую ширину, а вопрос, какую долю распределения они содержат, допускал бы два защитимых ответа — все, раз всё находится на среднем, или ноль, раз у интервала нет протяжённости, — и выбрать между ними нечем. Вместо того чтобы молча выбрать один, страница отклоняет ввод и говорит, что стандартное отклонение должно быть положительным. Стандартное отклонение, вышедшее нулевым в реальном расчёте, почти всегда означает единственное наблюдение или ошибку ввода данных, а не настоящее распределение.
Это то же самое, что калькулятор вероятностей по z-оценкам?
Это два входа в одно и то же нормальное распределение. Калькулятор z-оценки берёт значение и говорит, где оно находится и какая вероятность лежит ниже него; эта страница берёт среднее и стандартное отклонение и раскладывает три стандартных диапазона с долей, которую каждый покрывает. Различается направление вопроса: один начинает от измерения, другой — от самого правила. Входные данные намеренно одинаковы — среднее и стандартное отклонение в тех же двух полях, — чтобы переход между страницами не означал повторного ввода, и два результата не могут разойтись насчёт лежащего в основе распределения, потому что считают его одинаково.

Источники

Похожие калькуляторы