贝叶斯定理计算器
结果
后验概率 P(A|E)
- A 不成立的概率 P(¬A|E)
- 84.62%
- 证据出现的概率 P(E)
- 5.85%
- 从先验到后验的变化(百分点)
- 14.38
贝叶斯定理计算器做的事,是把「看到证据之前你认为是什么样」变成「看到证据之后你应该认为是什么样」。你给它三个数:某个情况的先验概率、这个情况成立时出现该证据的可能性、以及它不成立时出现同一证据的可能性;它给出的是已知证据后这个情况的后验概率,连同它的补概率、证据本身出现的总概率,以及这一次判断被推动了几个百分点。让这件事值得算而不是凭感觉猜的,是「罕见情况 + 不完美的检测」这个组合:患病率 1%、检出率 90%、假阳性率 5% 时,一次阳性只把概率抬到 15% 左右,而不是九十。只要被测的东西本身不常见,检测改变判断的幅度就比直觉小。
公式
P(A | E) = P(E | A) · P(A) / [ P(E | A) · P(A) + P(E | ¬A) · P(¬A) ]
- P(A)
- 先验概率,按百分数填——证据到来之前你的判断。它的分量比多数人以为的重:它小的时候,要推动它需要很强的证据
- P(E | A)
- 情况成立时出现该证据的概率。放在检测上说就是检出率(灵敏度),即真病例里被抓住的那一部分
- P(E | ¬A)
- 情况不成立时出现同一证据的概率。放在检测上说就是假阳性率,它一旦不小,造成的破坏主要来自这一项
- P(¬A)
- 情况不成立的概率,等于 100% 减先验概率。分母把证据能够出现的两条路按各自情形的常见程度加权相加
- P(E)
- 证据出现的总概率,即无论情况是否成立、人群中看到这个证据的比例。它就是分母;面板单独给出它,是因为这个数小正是后验会大幅移动的原因
- P(A | E)
- 后验概率:看到证据之后的判断。面板同时给出它的补概率,因为「检测是阳性,而仍有 85% 的可能没有这个情况」往往才是把结果讲清楚的那句话
凡是检测结果必须对照「被测的东西到底有多常见」来读的场合都用得上:低患病率人群里的筛查、邮件过滤器读到一个词、罕见故障的诊断检查,以及任何把阳性结果当成定论的时刻。它也适合反过来问——一个检测要好到什么程度,阳性才算数——那个数通常比某一个先验下的后验有用得多。手里有一个说得出口的先验时用它;完全不知道先验该取多少时,诚实的回答是这个判断会被这份无知主导,而面板能让你看清主导到什么程度。
算例
患病率 1%、检出率 90%、假阳性率 5%
- 取一万人:约 100 人患病,9900 人没病
- 患病的 100 人里有 90% 检出阳性,约 90 个真阳性
- 没病的 9900 人里也有 5% 检出阳性,约 495 个假阳性
- 阳性结果因此来自 90 + 495 = 585 人,而 90 / 585 = 15.38%
这一页整个就是围绕这一格建的,而理由就在上面的步骤里。按人数数一遍,机制就露出来了:假阳性率被乘上的那个群体,比患病群体大九十九倍,于是它造出的阳性是检出率的五倍半。15.38% 不是在说这个检测很差——90% 的检出率很好——它说的是这个情况罕见到了让错误多于命中的程度。补概率 84.62% 是从另一面说同一件事,而 14.38 个百分点的位移,就是一次这种质量的检测在这里实际值多少。
患病率 2%、准确率 99% 的检测
- 取一万人:约 200 人患病,9800 人没病
- 患病的 200 人里 99% 检出阳性:约 198 个真阳性
- 没病的 9800 人里仍有 1% 检出阳性:约 98 个假阳性
- 阳性结果来自 198 + 98 = 296 人,而 198 / 296 = 66.89%
一个一百次才错一次的检测,阳性结果里仍有三分之一是错的,因为它要面对的那个群体大四十九倍。把准确率提到 99.9%、面对同样的每一万人里 452 个阳性,后验会爬过 95%——这说明两个杠杆并不能互相替代。检出率决定你抓到多少真阳性,假阳性率决定它们被埋在多厚的噪声里;改善后者通常远比改善前者划算,而这条算例是在花钱换更好的检测之前,看清这一点最便宜的方式。
指向相反方向的证据
- 从一个均等的先验出发:成立与不成立各 50%
- 这条证据在不成立时出现的可能性是成立时的十八倍(90% 对 5%)
- 分母是 0.05 × 0.5 + 0.9 × 0.5 = 0.475,所以证据本身并不罕见
- 后验是 0.025 / 0.475 = 5.26%,也就是下降了 44.74 个百分点
负的位移是最该停一下的地方,也正是「百分点」这个单位存在的理由。从 50% 落到 5.26% 是下降 44.74 个百分点;它不是下降 44.74%,那样算后验会落在 27.6% 附近。把位移读成相对变化,是误引这个面板最常见的方式,而符号本身就在告诉你证据指向了另一边。另一件值得留意的事是这条证据并不稀罕——出现概率 47.5%——却依然有很强的信息量,因为信息量来自两条似然之比,而不是来自证据罕见。
局限
后验只和你填进去的三个数一样可靠,而先验是最容易被随手编出来的那一个。情况罕见时,后验被先验与假阳性率主导,于是对这两个数任何一处乐观的臆测都会给出一个自信而错误的答案——面板没法告诉你那个先验是猜的。另外两条提醒。两个似然在这里被当成精确值,所以一个来自小样本验证研究的检出率,正被用在它达不到的精度上。以及,这里的计算只针对一条只读一次的证据:同一个检测做两遍,不等于两个独立的检测,因为同一件不完美仪器给出的第二次结果与第一次相关——把后验当作新的先验喂回去,会高估第二遍带来的信息。当证据在每一种情形下都不可能出现时——两条似然都是 0%、或者先验 0% 撞上假阳性率 0%——分母为零,没有后验可报,因为对一个不可能发生的条件做条件化,本身就不是一个有答案的问题。
常见问题
- 为什么准确率 90% 的检测,患病概率只有 15%?
- 因为「在病人身上的准确率」与「在健康人身上的准确率」是两个数,而后者要乘上的群体大得多。患病率 1% 时,没病的人是患病者的九十九倍,于是 5% 的假阳性率造出几百个假阳性,而 90% 的检出率只造出几十个真阳性。检测没有失职,只是这个情况罕见到了让它的错误多于命中。这就是基础比率在起作用,也正是先验概率必须由你填、而不是可以默认的原因。
- 位移那一行的百分点是什么意思?
- 它是先验与后验之差,单位是百分点而不是相对变化。从 50% 到 5.26% 是位移 −44.74 个百分点;它不是下降 44.74%,那样算后验会落在 27.6% 附近。位移越大,这两种读法的差距越离谱;而符号告诉你证据往哪边推——负的位移意味着这条证据反对这个情况。
- 能把后验当成下一次检测的先验吗?
- 只有在第二条证据与第一条真正独立时才可以。同一个检测做两遍并不独立:一遍出现假阳性之后,下一遍更可能也是假阳性,因为仪器前后是同一处缺陷。硬把后验当新先验喂回去,会高估第二遍结果带来的信息,有时高估很多。证据真的独立时,分两步更新与一次把两条证据一起更新结果相同,所以这条捷径成立的边界,就是独立这个前提成立的边界。
- 证据概率那一行是什么意思?
- 它是证据出现的总概率,无论情况是否成立——定理的分母,把两条似然按各自情形的常见程度加权。值得单独给出来,是因为它解释了跳跃的幅度:证据本身罕见时,后验离先验很远是意料之中的;证据常见时,就需要很强的似然比才推得动。第一条算例里证据只在 5.85% 的人身上出现,这就是一次阳性能把判断推动那么远的原因。
- 什么情况下会没有答案?
- 当证据在每一种情形下都不可能出现时,分母为零,以它为条件的概率无从定义。两条似然都是 0%、先验 0% 而假阳性率也是 0%、或者先验 100% 而检出率 0%,都会落到这里——这几种情形下证据根本不会发生,于是「已知该证据」是一个空条件。面板会给错误提示,而不是返回 0% 或 50%,因为这里是没有概率可报,而不是概率为零。
- 为什么没有给出似然比?
- 因为赔率形式在输入范围的两端会断掉。一件事的赔率是它的概率除以一减概率,先验 100% 时赔率是无穷大,印出来只会让结果面板崩掉,而不给人任何信息。位移那一行用另一种形式做同样的事,而且对每一个合法输入都成立:它说出一次证据把判断推动了多少、往哪边推——而这通常就是想要似然比的那个人真正在问的问题。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- Bayes' Theorem — Stanford Encyclopedia of Philosophy(英文原版;定理本身、含赔率形式在内的各种特殊形式,以及把概率读成「信念程度」的主体主义解释。该条目不覆盖基础率谬误,本页第一条算例讲的那件事不在它的范围内) — 斯坦福哲学百科全书(斯坦福大学)
- 3.3 Two Basic Rules of Probability — Introductory Statistics 2e(英文原版;乘法法则与条件概率,也就是后验由哪两块拼起来) — OpenStax(莱斯大学)
- 3.5 Tree and Venn Diagrams — Introductory Statistics 2e(英文原版;树形图通向同一个后验,也就是上面算例里按人数数一遍的那套算法) — OpenStax(莱斯大学)