Калькулятор распределения Пуассона
Результат
Вероятность ровно этого числа
- Вероятность не более этого числа
- 43,35 %
- Вероятность не менее этого числа
- 76,19 %
- Среднее
- 4,00
- Дисперсия
- 4,00
- Стандартное отклонение
- 2,00
Этот калькулятор распределения Пуассона отвечает на вопрос о потоке событий, приходящих с постоянной средней частотой: какова за некоторый интервал вероятность ровно k из них? У модели один параметр, который записывают как λ и называют лямбда; он равен средней частоте событий, умноженной на длину интервала, то есть ожидаемому числу событий за интервал, о котором вы спрашиваете. Страница сообщает вероятность ровно k вместе с двумя накопленными формами — не более k и не менее k, — а также три числа, описывающие всё распределение: среднее, дисперсию и стандартное отклонение. Она описывает поток редких событий, которые не влияют друг на друга: звонки в службу поддержки, отказы в партии деталей, аварии на участке дороги, радиоактивные распады в фиксированном окне счёта. Его определяющая черта в том, что среднее равно дисперсии: и то и другое равно λ, поэтому счёт, разброс которого много шире или много уже его среднего, порождён не этим процессом, а стандартное отклонение — просто квадратный корень из среднего числа событий.
Формула
P(X = k) = e^(−λ) · λ^k / k! где λ = eventRate × intervalLength, и Var(X) = λ
- λ
- Ожидаемое число событий в интервале — средняя частота событий, умноженная на длину окна, и единственный параметр распределения. Всё на этой странице есть функция от него, поэтому частота и интервал и спрашиваются отдельно, а не одним числом
- k
- Число событий, о котором идёт вопрос. Это целый счёт от нуля и выше, и 0 — настоящий ответ, а не пустой: «ничего не произошло» является самым вероятным исходом всякий раз, когда λ меньше примерно 0,7
- e^(−λ)
- Вес того, что не произойдёт вообще ничего, до того как учтён счёт. Именно из-за него всё распределение сжимается по мере роста λ: чем больше ожидаемое число, тем меньше шанс не увидеть ни одного события
- λ^k / k!
- Часть, которая растёт вместе с k, а затем падает: k-я степень среднего, делённая на факториал счёта. Её пик стоит на k = λ, и в этом пике распределение и проводит большую часть своей массы
- среднее = дисперсия = λ
- Свойство, по которому это распределение и узнают. Среднее число событий и его дисперсия — одно и то же число, поэтому стандартное отклонение равно квадратному корню из среднего: √4 = 2 при среднем в четыре события, √1000 ≈ 31,6 при среднем в тысячу
Берите его, когда считают, сколько событий приходит за интервал, а приходы независимы друг от друга: сколько звонков за час, сколько дефектов на квадратном метре ткани, сколько частиц в фиксированном окне счёта. Больше всего весят два условия. События должны быть редкими относительно возможностей для них: частота настолько высокая, что счёт по существу ограничен чем-то другим, перестаёт быть пуассоновским; и они не должны собираться в группы, потому что всплеск приходов из одной причины ломает независимость, придающую распределению его форму. Обращайтесь к биномиальному распределению, когда число возможностей фиксировано и исчислимо: у пуассоновского счёта верхней границы нет, а биномиальный не может превысить число испытаний. Обращайтесь к нормальному приближению, когда λ велико: там они близки, и знакомые полосы стандартных отклонений становятся читаемыми. Равенство среднего и дисперсии — ещё и самая быстрая доступная диагностика: разделите дисперсию на среднее по набору счётов, и если отношение далеко от единицы, процесс пере- или недодиспергирован, и эта модель для него не той формы.
Разобранные примеры
Четыре события в час, спрашиваем про три
- Частота — 4 в час, интервал — 1 час, значит λ = 4
- P(X = 3) = e⁻⁴ × 4³ / 3! = 0,018316 × 64 / 6 = 0,1954, то есть 19,54 %
- Сложение счётов от 0 до 3 даёт 43,35 % «не более»; остальная масса выше 3 даёт 76,19 % «не менее»
- Среднее равно λ = 4, дисперсия тоже, поэтому стандартное отклонение равно √4 = 2
Две накопленные строки здесь перекрываются, и это не ошибка: 43,35 % плюс 76,19 % даёт 119,54 %, а превышение над 100 % — ровно 19,54 % трёх событий, которые сидят в обеих строках. Это та же предосторожность, что и с биномиальным счётом, и она ловит распространённую ошибку — считать «не менее» как единицу минус «не более», что дало бы здесь 56,65 %. Заметьте также, что три события при среднем в четыре — вещь ничем не примечательная: это на полстандартного отклонения ниже среднего.
Центр распределения
- Спрашиваем про четыре события вместо трёх: P(X = 4) = e⁻⁴ × 4⁴ / 4! = 0,018316 × 256 / 24 = 0,1954
- Точный шанс — те же 19,54 %, что и для трёх событий, потому что пик распределения стоит на k = 4 = λ, и два счёта по обе стороны от него равновероятны
- «Не более четырёх» — это 62,88 %, «не менее четырёх» — 56,65 %
- Среднее, дисперсия и стандартное отклонение не изменились, так как зависят только от λ
Два счёта с одинаковой вероятностью — самое наглядное свидетельство того, что распределение центрировано на λ: при среднем в четыре события увидеть три и увидеть четыре равновероятно, а любой другой счёт менее вероятен. Накопленные строки не симметричны даже здесь — 62,88 % против 56,65 %, — потому что строка «не более» включает целиком k = 4, и строка «не менее» включает его тоже, а ниже пика распределение тоньше, чем выше него.
Та же частота за три часа
- Частота по-прежнему 4 в час, но интервал теперь 3 часа, значит λ = 4 × 3 = 12
- P(X = 3) = e⁻¹² × 12³ / 3! = 0,0000061 × 1728 / 6 = 0,0018, то есть 0,18 %
- «Не более трёх» — это 0,23 %, «не менее трёх» — 99,95 %
- Среднее равно 12, дисперсия тоже, поэтому стандартное отклонение равно √12 = 3,46
Это тот пример, который разводит два поля ввода: не изменилось ничего, кроме длины окна, а ответ перешёл с 19,54 % на 0,18 %. Оба поля нужны, потому что параметр есть их произведение, и страница, принимающая только частоту, дала бы один и тот же ответ и за час, и за сутки. Сводные строки движутся вместе с ним: при ожидаемых двенадцати событиях три — это больше двух стандартных отклонений ниже среднего, и поэтому строка «не менее» теперь почти достоверна.
Одно событие в час, и ничего не происходит
- При λ = 1 шанс ровно нуля событий равен e⁻¹ = 0,3679, то есть 36,79 %
- «Не более нуля» задаёт тот же вопрос, поэтому эта строка повторяет то же число
- «Не менее нуля» накрывает любой возможный счёт, поэтому это ровно 100 %, а не 99,99 %
- Среднее и дисперсия равны единице, и стандартное отклонение тоже равно единице
λ равное единице — учебная отправная точка, и она даёт самое неинтуитивное число на странице: больше трети времени процесс, в среднем дающий одно событие в час, не даёт событий вовсе. Строку «не менее» тоже стоит прочитать: она равна ровно 100 %, потому что «ноль или больше» — это всё распределение, и страница, считающая её вычитанием из накопленной суммы, легко вернула бы вместо этого 99,99 %. Ноль событий — к тому же законный вопрос, и поэтому поле счёта начинается с нуля, а не с единицы.
Ограничения
Модель Пуассона опирается на два допущения, которые отказывают тихо, и оба стоит проверить, прежде чем доверять числам. События должны быть независимы друг от друга и приходить с частотой, которая не дрейфует внутри указанного вами интервала. Независимость отказывает всякий раз, когда у приходов общая причина: звонки всплеском во время аварии, дефекты, собирающиеся на одном рулоне ткани, аварии, кучкующиеся в плохую погоду, — и симптом в том, что настоящие счёты разбросаны шире, чем предсказывает страница, с большим числом пустых интервалов и большим числом очень занятых, чем модель допускает. Дрейфующая частота отказывает в другую сторону: у колл-центра с тихой ночью и занятым утром нет одной часовой частоты, и усреднение двух даёт число, не описывающее ни ту, ни другую. За пределами допущений две границы соблюдаются, а не объясняются. Длину интервала и частоту можно вводить до разумных пределов каждую по отдельности, но их произведение ограничено, потому что среднее число в миллионы обращает все вероятности на панели в ноль, и страница предпочитает отказаться, а не печатать таблицу нулей. Счёт должен быть целым. И таблицы пуассоновских вероятностей здесь нет: таблица, которую хотят видеть, — это строка на каждое значение среднего, а среднее зависит от введённых вами частоты и интервала, поэтому напечатанная таблица отвечала бы на другой вопрос, нежели панель над ней.
Частые вопросы
- Чем распределение Пуассона отличается от биномиального?
- Биномиальное считает успехи в фиксированном числе испытаний, поэтому его счёт не может превысить это число; пуассоновское считает события, приходящие сами по себе, поэтому у него нет ни верхней границы, ни числа испытаний для ввода. Биномиальному нужны два входа — сколько испытаний и какова вероятность каждого, — а этой странице нужны частота и интервал, которые перемножаются в одно ожидаемое число. Оба согласуются в узком случае, когда испытаний много, а вероятность каждого мала, и поэтому редкие события на практике описывают и так и так. Берите биномиальное, когда можете назвать возможности, и пуассоновское, когда события просто приходят.
- Почему здесь среднее равно дисперсии?
- Потому что на этом тождестве модель и построена, а не на совпадении примеров: у пуассоновского счёта среднее и дисперсия — одно и то же число, λ, поэтому стандартное отклонение всегда равно квадратному корню из среднего. Это даёт быстрый способ проверить, подходит ли модель: возьмите набор наблюдённых счётов, разделите их дисперсию на их среднее, и если отношение много больше единицы, счёты собраны в группы, а не независимы, а если отношение сильно ниже единицы, они ровнее, чем это вышло бы случайно. Ни то ни другое не исправляется вводом других чисел: это значит, что процесс не пуассоновский.
- Почему «не более k» и «не менее k» не дополняют друг друга?
- Потому что обе строки включают счёт, равный ровно k, поэтому при сложении этот исход считается дважды. В примере выше «не более трёх» — это 43,35 %, а «не менее трёх» — 76,19 %, что в сумме даёт 119,54 %; превышение над 100 % — ровно 19,54 % трёх событий. Это та же арифметика, что и с биномиальным счётом, и та же ловушка: читать «не менее» как единицу минус «не более» неверно ровно на вероятность того, о чём вы спросили. Если нужен настоящее дополнение, берите значение «не более k − 1» или читайте три строки вместе и проверяйте, что ровно k заполняет промежуток между ними.
- Когда счёт действительно пуассоновский?
- Когда события независимы, частота устойчива на протяжении интервала, а сами события редки относительно возможностей для них. Независимость — то допущение, которое делает всю работу, и то, что отказывает чаще всего, потому что группировку легко не заметить по сводным числам: завод, сообщающий один и тот же месячный итог по дефектам, может всё равно иметь плохие дни и спокойные дни, и эта группировка проявится как счёты, более изменчивые, чем предсказывает страница. Практическая проверка — та же, что в предыдущем ответе: сравните дисперсию набора счётов с их средним. Если они близки, модель хорошо описывает данные; если далеки, никакой выбор частоты этого не исправит.
- Что происходит, когда частота равна нулю?
- В интервале ничего не может произойти, поэтому счёт ноль имеет вероятность 100 %, а любой другой счёт — 0 %. Страница сообщает именно это, а не отказывает: нулевая частота или интервал нулевой длины дают λ равное нулю без ожидаемых событий, и вопрос об одном или более событиях возвращает 0 %, а вопрос ни об одном — 100 %. Полезно знать, что этот случай обработан явно, потому что формула в её записанном виде содержит множитель ноль в степени k и минус бесконечность из логарифма, и реализация, вычисляющая её наивно, выдаёт бессмыслицу вместо очевидного ответа.
- Почему на этой странице нет таблицы пуассоновских вероятностей?
- Потому что каждая строка такой таблицы принадлежит своему значению среднего, а среднее здесь есть произведение двух введённых вами чисел. Напечатанная таблица была бы верна для одной частоты и одного интервала и неверна для любой другой их комбинации, поэтому отвечала бы на другой вопрос, нежели панель, — а там, где они разошлись бы, права была бы панель. Панель и есть таблица: три строки вероятностей — это значения «ровно», «не более» и «не менее» для указанного вами среднего, и изменение частоты или интервала пересчитывает их. Справочные таблицы заслуживают своего места на страницах, чьи строки не зависят ни от какого ввода, — например, шкала оценок или набор пороговых диапазонов.
Источники
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, which is precisely the constraint a Poisson count does not have) — OpenStax, Rice University
- 1.3.6.6.1. Normal Distribution — e-Handbook of Statistical Methods (the density, the role of the mean and standard deviation, and the standard normal as the reference case a large-mean Poisson count approaches) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)