Биномиальное распределение
Результат
Вероятность ровно этого числа
- Вероятность не более этого числа
- 17,19 %
- Вероятность не менее этого числа
- 94,53 %
- Среднее
- 5,00
- Стандартное отклонение
- 1,58
- Дисперсия
- 2,50
Калькулятор биномиального распределения отвечает на вопрос о повторяющихся испытаниях с двумя исходами: если проводится n независимых испытаний и каждое заканчивается успехом с вероятностью p, какова вероятность получить ровно k успехов? Он показывает эту вероятность вместе с двумя накопленными вариантами — не более k и не менее k — и тремя сводными числами, которые описывают распределение целиком: средним числом успехов, дисперсией и стандартным отклонением. Модель предполагает фиксированное число испытаний, постоянную вероятность успеха и независимость испытаний, а это покрывает всё от подбрасывания монеты и штрафных бросков до партии деталей, каждая из которых проходит проверку с одной и той же вероятностью. Накопленные строки обычно и нужны на практике, потому что реальный вопрос редко бывает об одном точном числе — он о достижении цели или о том, чтобы остаться под порогом.
Формула
P(X = k) = C(n, k) · p^k · (1 − p)^(n − k) где C(n, k) = n! / (k! (n − k)!)
- n
- Число испытаний, до 1000 — независимых повторений одного и того же события с двумя исходами. Предел здесь по производительности, а не по математике: биномиальное распределение прекрасно определено и при куда больших n, но с ростом n растут промежуточные величины, а зависшая страница хуже страницы, которая честно отказывается считать
- k
- Число успехов, о котором вы спрашиваете. Оно не может превысить n: больше успехов, чем испытаний, — не маловероятный исход, а невозможный запрос
- p
- Вероятность успеха в одном испытании, вводимая в процентах от 0 до 100. Она одна и та же для каждого испытания — именно это делает испытания равноправными, а их число биномиальным
- C(n, k)
- Биномиальный коэффициент: сколькими способами k успехов можно расставить среди n испытаний. Он и есть причина, по которой вероятнее всего средние значения: число около середины можно разложить куда большим числом способов, чем крайнее
- p^k · (1 − p)^(n − k)
- Вероятность одного конкретного расположения k успехов и n − k неудач. Умножение на число расположений превращает «одно расположение» в «любое расположение»
- np
- Среднее число успехов. Дисперсия равна np(1 − p), а стандартное отклонение — её квадратный корень; именно их показывают три последние строки панели
Берите его, когда испытания считают, а не измеряют: сколько из 20 деталей пройдут проверку, сколько из 12 штрафных бросков долетят, какова вероятность серии хотя бы из 8 орлов при 10 подбрасываниях. На практике чаще нужны две накопленные строки, потому что цель почти всегда порог — «не менее» для допуска по качеству, «не более» для удержания в бюджете, — а читать порог по строке точного числа значит складывать слагаемые вручную. Одна и та же схема с постоянной вероятностью успеха и независимыми испытаниями — это и есть биномиальное распределение. Выберите другой инструмент, когда число испытаний не фиксировано заранее (это уже другое распределение), когда вероятность успеха меняется от испытания к испытанию или когда испытания влияют друг на друга; последний случай на практике ломает допущение чаще всего.
Разобранные примеры
Десять испытаний, три успеха, шанс 50 % каждый раз
- Три успеха можно разместить среди десяти испытаний C(10, 3) = 120 способами
- Вероятность одного расположения равна 0,5³ × 0,5⁷ = 1/1024
- 120 / 1024 = 0,1171875, то есть ровно три успеха случаются в 11,72 % прогонов
- Суммирование чисел от 0 до 3 даёт 17,19 % для «не более»; среднее равно np = 10 × 0,5 = 5
Разрыв между двумя накопленными строками и есть суть этого примера: 17,19 % для «не более» и 94,53 % для «не менее» оставляют между собой 11,72 %, и этот недостающий кусок — ровно вероятность трёх, то есть того числа, о котором вы спросили. Эта арифметика и ловит распространённую ошибку — читать «не менее» как единицу минус «не более», что дало бы здесь 82,81 %. Среднее 5 при стандартном отклонении 1,58 заодно говорит, что 3 для такой схемы ничем не примечательно: это чуть больше одного стандартного отклонения ниже среднего.
Двадцать испытаний с шансом 25 % каждый раз
- Среднее равно np = 20 × 0,25 = 5 успехов
- Дисперсия равна np(1 − p) = 20 × 0,25 × 0,75 = 3,75, её квадратный корень — около 1,94
- Ровно четыре успеха имеют вероятность 18,97 % — это самое вероятное число в этой схеме
- «Не более четырёх» даёт 41,48 %, а «не менее четырёх» — 77,48 %
Четыре успеха — одновременно и число рядом со средним, и самое вероятное, поэтому две накопленные величины ложатся вокруг него так несимметрично: 41,48 % распределения находится на этом числе или ниже. Асимметрия здесь общая и её стоит запомнить: для любого числа не выше среднего вероятность «не более» больше, чем подсказывает интуиция, потому что при малом p у распределения длинный верхний хвост. Сводные строки и позволяют это увидеть без сложения слагаемых: стандартное отклонение 1,94 вокруг среднего 5 оставляет 4 вполне внутри обычного диапазона.
Сто испытаний, ни одного успеха, шанс 2 % каждый раз
- При k = 0 расположение ровно одно — ни одного успеха, — поэтому C(100, 0) = 1
- Его вероятность равна 0,98¹⁰⁰ ≈ 0,1326, то есть не получить ни одного успеха — 13,26 %
- «Не более нуля успехов» — то же самое событие, поэтому эта строка в точности совпадает с предыдущей
- «Не менее нуля успехов» включает любой возможный исход, поэтому там 100 %
Это тот случай, который и закрепляет строку «не менее». Не менее нуля успехов — не бесполезный край, а достоверность: в любом исходе успехов ноль или больше, поэтому 100 % здесь правильный ответ, а не заглушка. Прочитайте три строки вместе — и ошибка на единицу становится видна: 13,26 % для «не более» плюс 100 % для «не менее» превышают 100 %, потому что число ровно ноль входит в обе, и величина этого перекрытия как раз 13,26 %. Вторая половина примера — среднее: два ожидаемых успеха на сотню звучат безопасно, а всё же не получить ни одного — примерно один прогон из восьми.
Тысяча испытаний с шансом 50 % каждый раз
- Среднее равно 1000 × 0,5 = 500 успехов, дисперсия равна 250, значит стандартное отклонение около 15,81
- Ровно 500 успехов — самое вероятное отдельное число — имеют вероятность 2,52 %
- «Не более 500» даёт 51,26 %, и «не менее 500» даёт столько же, потому что 500 — это центр
- Здесь две накопленные величины равны, а так бывает только в среднем
Из этого примера стоит взять два наблюдения. Первое: самое вероятное число — не вероятное событие. 500 — вершина распределения, и всё же это случается примерно один прогон из сорока, потому что вероятность размазана по тысяче разных чисел. Второе: две накопленные строки равны ровно 51,26 % — удобная самопроверка, ведь в среднем распределение симметрично и любое отклонение от равенства означает, что число взято не по центру. Заметьте ещё, что вероятность 2,52 % здесь считается через биномиальные коэффициенты в сотни цифр, — вот почему инструмент ограничивает число испытаний, а не пытается быть героем.
Ограничения
Биномиальная модель опирается на три допущения, и когда одно из них нарушается, числа остаются правдоподобными, но становятся неверными. Число испытаний должно быть фиксировано заранее, а не выбрано по ходу; вероятность успеха должна быть одинаковой для каждого испытания; испытания должны быть независимы друг от друга — и именно третье нарушается на практике чаще всего, потому что испытания из одной партии, у одного человека или в один день склонны двигаться вместе. Когда успехи собираются в группы, настоящий разброс шире, чем показывает эта страница. Стоит назвать ещё два ограничения. Число испытаний ограничено тысячей, и это предел по производительности, а не по математике: модель определена и далеко за ним, но промежуточные величины растут вместе с числом испытаний, а зависшая страница никому не помогает. И таблицы вероятностей по числу успехов на этой странице нет: нужная людям таблица — это строка на каждое возможное число успехов, а она зависит от введённых вами испытаний и вероятности, которых справочная таблица здесь видеть не может; три строки на панели и есть форма такой таблицы для выбранных вами чисел.
Частые вопросы
- Почему «не менее k» — это не просто 100 % минус «не более k»?
- Потому что эти события не дополняют друг друга. «Не более k» — это от нуля до k успехов; «не менее k» — от k до n. Число ровно k входит в оба, поэтому вычитание из 100 % теряет этот общий кусок — а это и есть та вероятность, о которой вы спросили. Если нужно дополнение к «не менее k», берите строку «не более k − 1»; или читайте три строки вместе: ровно k всегда равно разрыву между двумя другими, и этот разрыв служит проверкой для всех трёх.
- Может ли вероятность успеха быть 0 % или 100 %?
- Да, и оба значения осмысленны, а не краевые. Шанс 0 % означает, что событие не происходит никогда, поэтому число успехов достоверно равно 0; шанс 100 % означает, что оно происходит всегда, и тогда число успехов достоверно равно n. Панель честно показывает получившиеся строки 0 % и 100 %. Если вы видите ровный 0 % для числа, которое ожидали малым, но возможным, проверьте поле вероятности: ноль, введённый там, где имелось в виду 10, даёт ровно такую картину.
- Почему нет таблицы с вероятностью каждого числа успехов?
- Потому что такая таблица зависит от введённых вами испытаний и вероятности успеха, а справочная таблица на этой странице этих входных данных не видит: она считается из констант, поэтому показала бы числа какой-то другой схемы под заголовком, похожим на ваш. Вместо этого три строки на панели результатов дают форму такой таблицы для того числа, о котором вы спросили: само число, всё ниже него и всё выше него. Чтобы увидеть распределение целиком, меняйте число успехов и снова читайте строку точного значения — эти значения и есть таблица, по одной строке за раз.
- Что даёт математическое ожидание такого, чего не даёт вероятность?
- Оно говорит, где расположено распределение, а это и делает число интерпретируемым. Среднее 5 успехов при стандартном отклонении 1,58 делает 3 обычным результатом, тогда как те же 3 при среднем 12 оказались бы далеко в стороне. Среднее равно np, дисперсия равна np(1 − p), а стандартное отклонение — их квадратный корень; эти три сводные строки описывают распределение через его центр и разброс, а не через одну вероятность за раз.
- Что будет, если запросить успехов больше, чем испытаний?
- Запрос будет отклонён, а не отвечен нулём. Больше успехов, чем испытаний, — не маловероятный исход, а вообще не исход, и ответ 0 % наводил бы на мысль, что модель его рассмотрела и отбросила. Панель сообщает об ошибке; то же касается числа испытаний выше 1000 — оно отклоняется как предел по производительности, а не потому, что там кончается математика.
- Обязательно ли испытания должны быть независимыми?
- Обязательно, и это допущение в реальных данных нарушается чаще всего. Если успехи собираются в группы — детали из одной производственной партии, броски одного игрока в один день, пациенты из одной клиники, — то испытания несут информацию друг о друге, и настоящий разброс числа успехов шире, чем говорит биномиальное распределение. Среднее при группировке остаётся примерно верным, а стандартное отклонение и вероятности хвостов — нет, поэтому трём сводным строкам доверять стоит в последнюю очередь. Когда известно, что испытания группируются, правильный инструмент — модель с заложенной дополнительной вариацией.
Источники
- 1.3.6.6.18. Binomial Distribution — e-Handbook of Statistical Methods (the binomial probability function, its mean np and variance np(1 − p), and the assumptions the model rests on) — National Institute of Standards and Technology (NIST)
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, and the cumulative form used by the at most and at least rows) — OpenStax, Rice University
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)