跳到主要内容
CalcMax

二项分布计算器

范围:0 – 1,000

最小值:0

范围:0 – 100

结果

11.72%

恰好这么多次的概率

至多这么多次的概率
17.19%
至少这么多次的概率
94.53%
平均数
5.00
标准差
1.58
方差
2.50

二项分布计算器回答的是重复的是非试验里的一个问题:n 次相互独立的试验、每次成功的概率都是 p,那么恰好成功 k 次的概率是多少?它会给出这个概率,以及它的两个累计版本——至多 k 次与至少 k 次——再加上描述整个分布的三个汇总量:成功次数的均值、方差与标准差。它描述的场景是「试验次数固定、每次成功概率相同、各次之间相互独立」,从抛硬币、罚球命中,到一批每个都以同样概率通过检验的元件,都落在这个框里。实际用到的往往是那两个累计数,因为真实的问题很少问「正好几次」,问的是「够不够到某个门槛」或者「有没有超过某个上限」。

公式

P(X = k) = C(n, k) · p^k · (1 − p)^(n − k),其中 C(n, k) = n! / (k! (n − k)!)

n
试验次数,最多 1000 次——同一个是非事件被独立重复的次数。这个上限是性能约束不是数学约束:二项分布在远大于它的 n 上完全有定义,但这一页要算的组合数随 n 增长,而一个卡住的页面比一个明确拒绝的页面糟得多
k
你要问的成功次数。它不能超过 n——成功次数比试验次数还多不是「罕见结果」,而是一个做不到的请求
p
单次试验的成功概率,按 0 到 100 的百分数填。每次试验都一样,这正是各次试验可交换、成功次数服从二项分布的前提
C(n, k)
二项系数:k 次成功在 n 次试验里有多少种排法。中间的次数之所以最常见,就是因为它——靠近中间的次数能排出的花样远多于极端的次数
p^k · (1 − p)^(n − k)
某一种具体排法的概率(k 次成功、n − k 次失败)。乘上排法数,就把「那一种排法」变成了「随便哪一种排法」
np
成功次数的均值。方差是 np(1 − p),标准差是它的平方根——面板最后三行给的就是这三个数

面对「数次数」而不是「量数值」的问题时用它:20 个元件里有几个通过检验、12 次罚球能进几个、抛 10 次里至少出现 8 次正面有多大可能。实际动手时优先看那两行累计数,因为目标几乎总是一个门槛——过质检要「至少 k 个」,控预算要「至多 k 个」——而从「恰好」那一行读门槛,就得自己把若干个次数加起来。换别的工具的时机:试验次数事先不固定、每次成功概率在变、或者各次试验互相影响;最后这一种是实践中把前提打破得最多的。

算例

  1. 10 次试验,成功 3 次,每次成功的概率 50%

    1. 把 3 次成功放进 10 次试验里,共有 C(10, 3) = 120 种排法
    2. 某一种排法的概率是 0.5³ × 0.5⁷ = 1/1024
    3. 120 / 1024 = 0.1171875,所以恰好成功 3 次的概率是 11.72%
    4. 把 0 到 3 次的概率加起来得至多 17.19%;均值是 np = 10 × 0.5 = 5

    这条算例的重点是两个累计数之间的那道缝:至多 17.19%、至少 94.53%,两者之间空出来的 11.72% 正是「恰好 3 次」——也就是你填进来的那个次数。这道缝也就是「至少 = 100% 减至多」这个常见错误会露馅的地方,那样算出来是 82.81%。均值为 5、标准差 1.58 还顺带说明 3 次这一结果在这个设置下并不稀奇:它只比平均数低了一个出头的标准差。

  2. 20 次试验,每次成功的概率 25%

    1. 均值是 np = 20 × 0.25 = 5 次成功
    2. 方差是 np(1 − p) = 20 × 0.25 × 0.75 = 3.75,开方约为 1.94
    3. 恰好成功 4 次的概率是 18.97%,是这里最可能出现的单个次数
    4. 至多 4 次是 41.48%,至少 4 次是 77.48%

    成功 4 次既靠近均值、又是单个最可能的次数,这就解释了两个累计数为何如此不对称:整个分布有 41.48% 落在「最可能的那个次数」或它以下。这种不对称是普遍现象,值得记住——p 偏小的时候分布拖着一条长长的上尾,所以任何不超过均值的次数,「至多这么多次」的概率都比直觉更大。汇总量那三行正是让你不必逐项相加就能看出这一点的东西:均值 5、标准差 1.94,4 次完全落在常见范围里。

  3. 100 次试验,一次都没成功,每次成功的概率 2%

    1. k = 0 时只有一种排法——一次成功都没有,所以 C(100, 0) = 1
    2. 它的概率是 0.98¹⁰⁰ ≈ 0.1326,也就是一次都不成功占 13.26%
    3. 「至多 0 次」与「恰好 0 次」是同一个事件,所以那一行与它完全相同
    4. 「至少 0 次」包含所有可能的结果,所以是 100%

    这条算例钉的是「至少」那一行。至少成功 0 次不是一个没有信息的边界,而是一件必然的事——任何结果的成功次数都 ≥ 0——所以 100% 是正确答案,不是占位符。三行连起来读,那个 off-by-one 就露出来了:至多 13.26% 加上至少 100% 超过了 100%,因为「恰好 0 次」被两边都算进去了,而重叠的部分正好是那 13.26%。算例的另一半在均值上:一百次里期望成功两次听起来很稳,可一次都不成功的概率仍然约为八分之一。

  4. 1000 次试验,每次成功的概率 50%

    1. 均值是 1000 × 0.5 = 500 次,方差是 250,所以标准差约为 15.81
    2. 恰好成功 500 次——单个最可能的次数——概率是 2.52%
    3. 至多 500 次是 51.26%,至少 500 次同样是 51.26%,因为 500 正好在中心
    4. 两个累计数在这里相等,这种情况只在均值处出现

    这条算例有两件事值得带走。第一,「最可能的次数」不等于「很可能发生的次数」:500 是分布的顶点,可它也只在一百次里出现两次半左右,因为一千个不同的次数要把概率摊开。第二,两个累计数在 51.26% 上完全相等,这是个好用的自检——均值处分布对称,一旦两者不等,说明这个次数偏离了中心。也顺便注意,这里那个 2.52% 是从位数上百的二项系数算出来的,正是这一页给试验次数设上限、而不是硬撑的原因。

局限

二项模型建立在三条前提上,而其中一条不成立时,数字看起来依然合理、实际却是错的。试验次数必须事先固定、而不是边做边定;每次成功的概率必须相同;各次试验必须彼此独立——第三条在实践中坏得最多,因为来自同一批、同一个人、同一天的试验往往同起同落。成功一旦扎堆,真实的离散程度就比这一页给的更宽。另外两条限制要说清楚。试验次数上限 1000 是性能约束而不是数学约束:模型在远大于它的地方照样成立,但计算量随次数增长,而一个卡住的页面对谁都没用。以及,这一页没有按次数排列的概率表:人们想要的那张表每行对应一个可能的成功次数,它取决于你填的试验次数与概率,而这一页的参考表看不到这些输入——面板上那三行,就是那张表在你选定的次数上的形状。

常见问题

为什么「至少 k 次」不等于 100% 减「至多 k 次」?
因为这两件事不是互补的。「至多 k 次」是 0 到 k 次,「至少 k 次」是 k 到 n 次,而「恰好 k 次」两边都算——用 100% 去减,正好把这一块漏掉,而它偏偏就是你问的那个概率。想要「至少 k 次」的补集,要看「至多 k − 1 次」那一行;或者把三行连起来读:恰好 k 次永远是另外两行之间的那道缝,这道缝本身就是对三个数的校验。
成功概率可以填 0% 或 100% 吗?
可以,而且两者都是有意义的情形而不是边界怪例。0% 意味着这件事不会发生,成功次数必然是 0;100% 意味着每次都会发生,成功次数必然是 n。面板会如实给出相应的 0% 与 100%。如果某个你预计「小但可能」的次数显示为平整的 0%,先回头看一眼概率那一栏——本来想填 10 却填成 0,得到的正是这个结果。
为什么没有一张列出每个成功次数对应概率的表?
因为那张表取决于你填的试验次数与成功概率,而这一页的参考表看不到这些输入——它是由常数算出来的,硬给一张就是在你的标题下印别人那套设置的数。取而代之的是结果面板上的三行,它们给出那张表在你所问次数上的形状:恰好这么多次、比它少的所有情形、比它多的所有情形。想看完整分布,就改「成功次数」再读一次「恰好」那一行——那些值连起来就是那张表。
均值给了什么概率给不了的信息?
它给出整个分布的位置,而位置是判断一个次数算不算多所需的参照。均值 5 次、标准差 1.58 时,成功 3 次很平常;同样 3 次放在均值 12 的分布里就偏得很远。均值是 np,方差是 np(1 − p),标准差是它的平方根——这三行汇总量是用「中心与离散程度」描述这个分布,而不是一次只看一个概率。
填的成功次数比试验次数还大会怎样?
会被拒绝,而不是返回 0%。成功次数比试验次数多不是「罕见结果」,它根本不是一个结果,返回 0% 会让人以为模型考虑过它、并把它排除了。面板会给出错误提示;试验次数超过 1000 时同理,那是出于性能而拒绝,不是因为数学在那里失效。
各次试验真的必须相互独立吗?
必须,而这是真实数据里最常被打破的一条。成功一旦扎堆——同一批元件、同一个人在同一天的罚球、同一家诊所的病人——各次试验之间就互相带着信息,成功次数的真实离散程度比二项分布给的更宽。扎堆时均值大致还站得住,标准差与尾部概率则不然,所以三行汇总量里最该先怀疑的就是它们。明知数据会扎堆时,该用的是把额外变异建进模型里的那类方法。

参考资料

相关计算器