Перейти к основному содержанию
CalcMax

Калькулятор нормального распределения

Результат

1,00

Z-оценка

Вероятность ниже этого значения
84,13 %
Вероятность выше этого значения
15,87 %
Вероятность в пределах этого отклонения от среднего
68,27 %

Этот калькулятор нормального распределения берёт значение, среднее и стандартное отклонение распределения, к которому оно относится, и сообщает, насколько далеко это значение стоит от среднего, если убрать разброс из картины. Расстояние в стандартных отклонениях и есть z-оценка, а вместе с ней приходят три вероятности: вероятность ниже значения, вероятность выше него и доля, которая попадает в тот же интервал по обе стороны от среднего. Смысл пересчёта в том, что одно число начинает покрывать любую нормальную кривую: z-оценка 1 значит одно и то же и для оценок с разбросом 15, и для деталей, измеряемых в десятых долях миллиметра. Значения выше среднего дают положительную z-оценку, значения ниже — отрицательную, а два хвоста всегда зеркальны друг другу. Стандартное нормальное распределение — это тот же случай при среднем 0 и отклонении 1, и именно к нему приводят любые таблицы.

Какая доля нормальной кривой лежит в одном, двух и трёх стандартных отклонениях от среднего

ДиапазонДоля (%)
±1σ (|z| ≤ 1)68.27
±2σ (|z| ≤ 2)95.45
±3σ (|z| ≤ 3)99.73

Три доли считаются той же функцией распределения, которой пользуется калькулятор, поэтому полоса на панели результатов и эта таблица разойтись не могут — это одно и то же число, прочитанное на разных расстояниях. Перед тем как их цитировать, две оговорки. Это свойства нормального распределения, а не ваших данных: у распределения с перекосом или с длинным хвостом в третьей полосе окажется больше значений, чем 0,3 %, и таблица об этом предупредить не сможет. И каждая строка кумулятивна, а не является отдельным куском, поэтому строки не дают в сумме 100 % — вторая строка уже содержит первую, а за третьей строкой остаётся ещё 0,27 %. Это эмпирическое правило, записанное расстояниями от среднего вместо площадей под кривой, и то и другое — одно утверждение.

Формула

z = (value − mean) / standardDeviation → ниже = Φ(z), выше = 1 − Φ(z), внутри = 2Φ(|z|) − 1

value
Измерение, о котором идёт вопрос, — одно наблюдение, а не среднее нескольких. Оно сравнивается со средним и стандартным отклонением того распределения, против которого читается
mean
Центр нормального распределения, обозначаемый μ. Каждая вероятность на панели отсчитывается от него, поэтому при среднем 0 и разбросе 1 само значение становится z-оценкой
standardDeviation
Разброс распределения, обозначаемый σ, и он должен быть больше нуля. Это единица, в которой измеряется расстояние, и именно поэтому одна таблица z-оценок годится для распределений любого масштаба
z
Сколько стандартных отклонений значение отстоит от среднего. Положительное выше среднего, отрицательное ниже, а при значении, равном среднему, оно равно нулю
Φ
Функция распределения стандартного нормального закона: доля кривой, лежащая левее заданного z. Элементарной формулы у неё нет, поэтому её считают, а не берут из таблицы

Берите его всюду, где вопрос о положении, а не о самом числе: насколько необычно измерение для процесса, который его породил, какая доля совокупности лежит выше порога или какую часть поля допуска покрывает настроенный процесс. Это и обычная дорога к таблице нормального распределения — сначала пересчёт в z-оценку, и тогда одна таблица годится для всех распределений. Соседний калькулятор z-оценок берите тогда, когда важна сама z-оценка, а доли не нужны; этот — когда нужны площади, потому что z-оценка говорит, как далеко ушло значение, но не говорит, сколько кривой ушло туда вместе с ним. Здесь же стоит увидеть, что расстояния из таблицы и есть то же эмпирическое правило, только записанное в сигмах, а не в процентах.

Разобранные примеры

  1. Одно стандартное отклонение выше среднего

    1. Вычтем среднее: 115 − 100 = 15
    2. Разделим на стандартное отклонение: 15 / 15 = 1, значит z-оценка равна 1
    3. Доля нормальной кривой ниже z = 1 равна примерно 84,13 %, а выше остаётся 15,87 %
    4. Доля внутри одного стандартного отклонения в обе стороны равна примерно 68,27 %, а два односторонних числа — просто остатки на каждом конце

    Три числа — один и тот же факт, сказанный тремя способами, и среднее из них читают неверно чаще всего: 84,13 % ниже означают, что значение в одном стандартном отклонении выше среднего обгоняет примерно пять шестых распределения, а выше него всё ещё лежит 15,87 %. Заметьте заодно, что доля внутри — это не сумма двух односторонних вероятностей, а только средняя полоса, поэтому рядом со средним она наименьшая из трёх, а по мере ухода значения в хвост растёт к 100 %.

  2. Значение ровно на среднем

    1. Вычтем среднее: 100 − 100 = 0
    2. Деление на любой положительный разброс оставляет 0, значит z-оценка равна 0
    3. Нормальная кривая симметрична, поэтому ровно половина её лежит ниже среднего и половина выше
    4. Полоса нулевой ширины вокруг среднего не содержит ничего, поэтому доля внутри равна 0 %

    Ноль в графе «внутри» — не округление чего-то малого, а точное значение, и это единственный случай, когда ширина полосы действительно равна нулю. Поэтому пример и есть самая чистая проверка направления полосы: внутри измеряет расстояние до значения в обе стороны, а на среднем расстояния нет вовсе. Здесь же видна и симметрия, на которую опирается вся остальная панель: две односторонние вероятности делятся ровно пополам.

  3. Значение далеко в верхнем хвосте

    1. Вычтем среднее: 200 − 100 = 100
    2. Разделим на стандартное отклонение: 100 / 15 ≈ 6,67 стандартных отклонений выше среднего
    3. Доля выше z = 6,67 равна примерно 1,3 × 10⁻¹¹ — примерно одна на десятки миллиардов
    4. При двух знаках после запятой эта доля равна 0,00 %, а доля ниже — 100,00 %

    Этот ноль в графе «выше» — единственное число на странице, которое выглядит ошибкой и ею не является: настоящая доля равна примерно 1,3 на сто миллиардов, а два знака процента такое напечатать не могут. Отсюда следуют две вещи. Читайте 0,00 % как «меньше показанной точности», а не как «невозможно», и помните, что панель несёт больше информации, чем напечатанные цифры: хвост считается по отдельному пути именно ради того, чтобы здесь вышел чистый ноль, а не 0,01 или 0,02, которые получились бы при вычитании из нижнего хвоста. Заодно заметьте, что доля внутри дошла до 100 %: полоса в 6,67 стандартных отклонения в каждую сторону накрывает теперь практически всю кривую.

  4. Одно стандартное отклонение ниже среднего

    1. Вычтем среднее: 85 − 100 = −15
    2. Разделим на стандартное отклонение: −15 / 15 = −1, значит z-оценка отрицательна
    3. Доля ниже z = −1 равна примерно 15,87 %, а доля выше — примерно 84,13 %
    4. Полоса внутри одного стандартного отклонения — те же 68,27 %, что и при z = +1, потому что полоса симметрична

    Сравнение с первым примером — самый быстрый способ увидеть, что делает знак и чего он не делает: две односторонние вероятности меняются местами, а доля внутри не сдвигается вовсе. Так и должно быть, ведь «внутри» измеряет расстояние от среднего в обе стороны и не может знать, с какой стороны лежит значение. Именно это и нужно, когда вопрос в том, какая часть распределения лежит близко к его центру, и именно поэтому панель печатает и односторонние числа, а не только полосу.

Ограничения

Каждое число здесь — свойство нормального распределения, а не ваших данных. z-оценку можно посчитать для любого набора значений, какой бы формы он ни был, но вероятности будут теми, что выше, только если распределение действительно нормальное: у распределения с длинным хвостом или с перекосом далёкие значения встречаются чаще, чем говорит нормальная кривая, и первыми страдают как раз оценки хвоста. Среднее и стандартное отклонение не делают распределение нормальным и не могут сказать, нормально ли оно. Ещё две оговорки. Очень малые вероятности не печатаются с двумя знаками, поэтому далёкое значение показывает 0,00 % там, где истина — маленькое положительное число. И введённое значение трактуется как одно наблюдение, читаемое против известного среднего и известного разброса, поэтому числа не учитывают неопределённость самих среднего и стандартного отклонения, а это важно, когда их оценили по малой выборке.

Частые вопросы

Что добавляет z-оценка, если вероятность у меня уже есть?
Это единственное из четырёх чисел, которое переносится между распределениями. Вероятность привязана к той кривой, которую вы ввели, а z-оценка 1 означает одно и то же расстояние от центра в любом нормальном распределении — и для оценок с разбросом 15, и для деталей, измеряемых в сотых долях миллиметра, и для величины в произвольных единицах. Именно поэтому одна таблица z-оценок годится всюду: сначала пересчитайте в z-оценку, а потом читайте площадь по стандартной кривой.
Почему вероятность выше показывает 0,00 % для очень большого значения?
Потому что два знака после запятой не могут напечатать, насколько это число мало. У значения в 6,67 стандартных отклонения выше среднего выше него лежит около 1,3 × 10⁻¹¹ кривой — примерно одна на десятки миллиардов, — а это настоящая и положительная доля, просто куда ниже показанной точности. Читайте 0,00 % как «меньше, чем этот вывод может показать», а не как «невозможно». Панель считает этот хвост отдельным путём, а не вычитанием из нижнего хвоста, — поэтому и выходит чистый ноль вместо малого ненулевого числа, которое дало бы вычитание.
Это то же самое, что эмпирическое правило?
Да, и таблица на этой странице — то же эмпирическое правило, записанное расстояниями, а не процентами. Эмпирическое правило говорит, что около 68 % нормального распределения лежит в одном стандартном отклонении от среднего, около 95 % — в двух и около 99,7 % — в трёх; превратить каждое из них в расстояние от центра — ровно то, что делают строки. Одно различие стоит отметить: правило обычно цитируют округлёнными процентами, а доли здесь считаются той же функцией распределения, что и в калькуляторе, поэтому значение, стоящее точно на границе, получает согласованный ответ и оттуда, и отсюда.
Что будет, если стандартное отклонение равно нулю?
Этот ввод отклоняется, а не считается. Деление на нулевой разброс — не вероятность, которая случайно оказалась равной 1, а описание распределения вообще без разброса, где каждое наблюдение равно среднему и понятие расстояния от центра теряет смысл. Панель сообщает об ошибке вместо правдоподобного на вид 0 % или 100 %. Отрицательные разбросы отклоняются по той же причине: стандартное отклонение — это расстояние, оно не может быть отрицательным, а молчаливое взятие модуля скрыло бы ошибку в данных.
Можно ли этим пользоваться на данных, которые не нормальны?
z-оценку можно посчитать для любого набора значений, потому что среднее и стандартное отклонение есть у любых данных вообще. Допущение нужно вероятностям: это площади под нормальной кривой, и распределение с перекосом или с длинным хвостом им не соответствует. Расхождение проступает сначала на хвостах, где настоящая доля за большим расстоянием обычно больше, чем обещает нормальная кривая, — поэтому 0,3 % за тремя стандартными отклонениями из эмпирического правила стоит читать как свойство нормальной модели, а не как обещание о ваших измерениях.
Почему значение считается одним наблюдением, а не средним выборки?
Потому что это и есть три вероятности: доли распределения ниже, выше и вокруг одного значения. Читать среднее выборки против тех же среднего и разброса — другой расчёт, и нужен там не разброс отдельных наблюдений, а стандартная ошибка среднего: они различаются в корень из объёма выборки раз, поэтому подстановка одного вместо другого даёт ответ, который выглядит разумным и при этом неверен. Если ваше значение само является средним, вводите в поле стандартного отклонения стандартную ошибку.

Источники

Похожие калькуляторы