泊松分布计算器
结果
恰好这么多次的概率
- 至多这么多次的概率
- 43.35%
- 至少这么多次的概率
- 76.19%
- 平均数
- 4.00
- 方差
- 4.00
- 标准差
- 2.00
泊松分布计算器回答的是一个关于「以稳定的事件发生率到达的事件」的问题:在某个区间长度内,恰好发生 k 次的概率是多少?这个模型只有一个参数,通常写作 λ,等于事件的平均发生次数乘以区间的长度——也就是你问的那个窗口里期望发生几次。页面印出恰好 k 次的概率,同时给出两种累计形式「至多 k 次」与「至少 k 次」,以及概括整个分布的三个数:均值、方差与标准差。它描述的场景是一串稀有事件,而且彼此之间互不影响——客服台接到的来电、一批元件里的失效、一段路上的事故、固定计数窗口内的放射性衰变。它的定义性特征是均值等于方差:两者都等于 λ,所以一组计数的离散程度远大于或远小于它的平均值时,这些数据就不是这个过程产生的,而标准差恰好是平均次数的平方根。
公式
P(X = k) = e^(−λ) · λ^k / k! 其中 λ = 事件速率 × 区间长度,且 Var(X) = λ
- λ
- 区间内期望发生的事件次数——速率乘以窗口的长度,也是这个分布唯一的参数。这一页上的每个数都是它的函数,所以速率与区间长度是分开问的,而不是合成一个数来填
- k
- 你要问的事件次数。它是从 0 开始的整数,而 0 是一个真实答案而不是空答案:只要 λ 大约低于 0.7,「一次都没发生」就是最可能的结果
- e^(−λ)
- 「什么都没发生」的权重,在把次数算进去之前。它正是整个分布随着 λ 变大而收缩的原因:期望次数越大,一次都见不到的概率越小
- λ^k / k!
- 随 k 先增大再回落的那一部分:平均值的 k 次方除以次数的阶乘。它的峰值落在 k = λ 处,而那个峰值就是分布最集中的地方
- 均值 = 方差 = λ
- 让这个分布好认的那条性质。计数的均值与方差是同一个数,所以标准差就是均值的平方根——均值 4 次对应 √4 = 2,均值 1000 次对应 √1000 ≈ 31.6
在一个区间内数「来了多少次」、而且各次到达彼此独立的时候用它:一小时里接到多少通电话、一平方米织物上有多少个疵点、固定计数窗口里有多少个粒子。有两个条件分量最重。事件相对于它的机会必须足够稀有——速率高到计数其实被别的东西卡住了,那就不再是泊松;而且它们不能扎堆,因为同一个原因带来的一串到达会破坏独立性,而独立性正是这个分布形状的来源。机会次数固定且可数时改用二项分布:泊松计数没有上界,二项计数不可能超过试验次数。λ 变大以后可以改用正态近似,那时两者已经很接近,而那套熟悉的标准差区间也更好读。均值等于方差还是最快的诊断方式:把一组计数的方差除以它的均值,比值离 1 很远就说明这个过程的离散程度偏大或偏小,这个模型对它是错的形状。
算例
每小时 4 次,问发生 3 次的概率
- 速率是每小时 4 次、区间是 1 小时,所以 λ = 4
- P(X = 3) = e⁻⁴ × 4³ / 3! = 0.018316 × 64 / 6 = 0.1954,也就是 19.54%
- 把 0 到 3 次累加起来是至多 43.35%;3 次以上的那一部分给出至少 76.19%
- 均值是 λ = 4,方差也是 4,所以标准差是 √4 = 2
两行累计在这里是重叠的,而这不是错误:43.35% 加 76.19% 等于 119.54%,超出 100% 的那部分正好就是「恰好 3 次」的 19.54%,它同时落在两行里。这与二项计数那里是同一个陷阱,它也拦住了那个常见错误——把至少算成 1 减至多,那会得到 56.65%。另外注意,在平均 4 次的情况下出现 3 次毫不稀奇:它比均值低半个标准差。
分布的正中央
- 这次问 4 次而不是 3 次:P(X = 4) = e⁻⁴ × 4⁴ / 4! = 0.018316 × 256 / 24 = 0.1954
- 恰好 4 次的概率与恰好 3 次完全相同(都是 19.54%),因为分布的峰值落在 k = 4 = λ 上,峰值两侧的这两个计数一样可能
- 至多 4 次是 62.88%,至少 4 次是 56.65%
- 均值、方差与标准差没有变,因为它们只取决于 λ
两个计数概率相同,是「分布以 λ 为中心」最直观的迹象:平均 4 次的情况下,见到 3 次与见到 4 次一样可能,而其他任何次数都更低。即使在这里,两行累计也不对称——62.88% 对 56.65%——因为至多那一行把整个 k = 4 都算了进去,至少那一行同样把它算了进去,而峰值以下的分布比峰值以上更薄。
同样的速率,区间拉到 3 小时
- 速率仍然是每小时 4 次,但区间变成 3 小时,所以 λ = 4 × 3 = 12
- P(X = 3) = e⁻¹² × 12³ / 3! = 0.0000061 × 1728 / 6 = 0.0018,也就是 0.18%
- 至多 3 次是 0.23%,至少 3 次是 99.95%
- 均值是 12、方差也是 12,所以标准差是 √12 = 3.46
这一格把两个输入框分开了:除了窗口的长度什么都没变,答案却从 19.54% 变成 0.18%。两个字段都必须填,因为参数是它们的乘积,而一个只接收速率的页面会给一小时和一天给出同一个答案。汇总量那一行也跟着动——期望 12 次的时候,3 次已经比均值低两个标准差以上,这就是为什么至少那一行现在几乎是必然事件。
每小时 1 次,什么都不发生
- λ = 1 时,恰好 0 次的概率是 e⁻¹ = 0.3679,也就是 36.79%
- 问「至多 0 次」等于问同一件事,所以那一行印出同一个数
- 「至少 0 次」覆盖了所有可能的次数,所以它正好是 100%,不是 99.99%
- 均值与方差都是 1,标准差也是 1
λ 等于 1 是教科书的起点,而它给出这一页上最反直觉的一个数:一个平均每小时发生一次的过程,有超过三分之一的时间一次都不发生。至少那一行也值得读——它正好是 100%,因为「0 次或更多」就是整个分布,而一个用累计和相减来算它的实现很容易返回 99.99%。问「0 次」也是一个正当的问题,这正是计数那一格从 0 开始而不是从 1 开始的原因。
局限
泊松模型建立在两条会安静失效的前提上,而在相信这些数字之前两条都值得检查。各次事件必须彼此独立,而且在你指定的区间之内速率不能漂移。当几次到达共有同一个原因时独立性就失效了——故障期间来电暴涨、疵点扎堆出现在同一卷织物上、恶劣天气里事故集中——症状是真实计数比这一页预测的更分散,空区间与特别忙的区间都比模型允许的更多。速率漂移则以另一种方式失效:夜里清闲、早上繁忙的呼叫中心并没有一个「每小时速率」,把两者平均会得到一个两个时段都不描述的数。前提之外,还有两条限制是被拦住而不是被解释掉的。区间长度与速率各自可以填到合理的范围,但它们的乘积有上限,因为均值到了几百万次时面板上每个概率都会四舍五入成 0,页面宁可拒绝也不印一整屏的 0。次数本身必须是整数。这一页也没有泊松概率的参考表:人们想要的那种表是均值每个取值一行的表,而这里的均值取决于你填的速率与区间,所以印出来的表回答的是与上面面板不同的问题。
常见问题
- 泊松分布与二项分布有什么区别?
- 二项分布在固定的试验次数里数成功次数,所以计数不可能超过试验次数;泊松分布数的是自己到达的事件,所以没有上界,也没有可填的试验次数。二项分布要两个输入——多少次试验、每次的概率是多少——而这一页要的是一个速率与一个区间长度,两者乘起来才是那个期望次数。两者在「试验次数很大、每次概率很小」这个狭窄的情形里一致,这也是为什么稀有事件在实践中两种说法都用。能点名机会次数时用二项分布,事件只是自己到来时用泊松分布。
- 为什么这里的均值等于方差?
- 因为这条恒等式是模型的立身之本,不是这些例子凑巧:泊松计数的均值与方差是同一个数 λ,所以标准差永远是均值的平方根。它给了一个快速检验模型是否合适的方法:取一组实际计数,把它们的方差除以它们的均值,比值远大于 1 说明这些计数是扎堆出现的而不是彼此独立的,远小于 1 说明它们比随机该有的样子更均匀。这两种情况都不是靠换几个输入能修好的——它说明这个过程不是泊松过程。
- 为什么「至多 k 次」与「至少 k 次」不是互补的?
- 因为两行都把「恰好 k 次」算了进去,相加等于把这个结果数了两遍。拿上面那个例子:至多 3 次是 43.35%,至少 3 次是 76.19%,合计 119.54%——超出 100% 的部分正好是恰好 3 次的 19.54%。这与二项计数是同一套算术、也是同一个陷阱:把「至少」读成 1 减「至多」,误差正好是你问的那个概率。要真正的互补项,用「至多 k − 1 次」,或者把三行放在一起读,检查恰好 k 次正好填满两行之间的缝。
- 什么样的计数才真的是泊松计数?
- 当各次事件彼此独立、速率在区间内平稳、而且事件相对于发生它的机会足够稀有的时候。独立性是真正在起作用的那条前提,也是最常失效的一条,因为扎堆从汇总数字上很难看出来:一家工厂每个月报出的疵点总数都一样,中间仍可能有好日子与坏日子,而那种扎堆会表现为计数比这一页预测的更分散。实用的检查就是上一个回答里的那个办法——把一组计数的方差与它们的均值比一比。两者接近,模型描述得不错;差得远,换哪个速率都修不好。
- 速率为零的时候会怎样?
- 区间内不可能发生任何事件,所以「0 次」的概率是 100%,其他每一次的概率都是 0%。页面会把这个结果报出来而不是失败:速率为 0 或区间长度为 0 都会得到 λ = 0、期望发生 0 次,问「一次或更多」返回 0%,问「一次都没有」返回 100%。值得知道这件事是被显式处理过的,因为公式照字面写出来含有「0 的 k 次方」这样的因子的负数无穷的对数,一个直接照算的实现会得到一个没有意义的结果,而不是这个显而易见的答案。
- 为什么这一页没有泊松概率表?
- 因为那样一张表的每一行都属于不同的均值,而这里的均值是你填的两个数相乘得到的。印出来的一张表只会对某一个速率与某一个区间成立、对其他所有组合都是错的,于是它回答的是与面板不同的问题——两者矛盾时,正确的那一个是面板。面板就是那张表:三行概率正是你指定的那个均值下的恰好、至多与至少,改速率或改区间都会重算。参考表在那些行与输入无关的页面上才立得住,比如一套分级标准或一组分档区间。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- GB/T 4086.5-2025《数据分析与决策 统计分布数值表 第5部分:二项分布》(推荐性国家标准,现行:2025-10-05 发布 / 实施;用来对照这一页丢掉的那条前提——次数固定、每次成功概率恒定的模型,正是泊松计数所没有的约束) — 国家市场监督管理总局 国家标准全文公开系统
- Normal Distribution — NIST/SEMATECH e-Handbook of Statistical Methods, section 1.3.6.6.1(英文原版;密度、均值与标准差各自的作用,以及均值大起来之后泊松计数趋近的那个参照分布) — 美国国家标准与技术研究院(NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods(英文原版;一个计数「有分布」是什么意思,以及概率是怎么从它分配给各个取值的份数上读出来的) — 美国国家标准与技术研究院(NIST)