P 值计算器
结果
P 值
P 值计算器把一个检验统计量换算成 P 值:在原假设成立的前提下,出现至少这么极端的值的概率。z、t、卡方与 F 四种统计量都支持,需要的只是统计量本身、它的自由度,以及单双侧的选择。四项里最容易弄错的是尾部:双侧检验两个方向都算,单侧检验只算事先说好的那一个方向。输出只有一个数,单位是百分数。这一页故意不替你下判断,因为显著性水平该由你带来——判成显著还是不显著,取决于你事先定的是 0.05 还是别的什么。
公式
上侧: p = P(T ≥ t) 下侧: p = P(T ≤ t) 双侧: p = 2 · min( 上侧, 下侧 ) ——仅适用于对称分布
- t
- 你已经算出来的那个检验统计量——大样本的 z、小样本的 t、数分类计数的卡方,或者两个方差之比的 F。这一页不算它,只做换算
- T
- 原假设成立时这个统计量会服从的分布。是哪一个由四选一的下拉框决定,而这个选择不是偏好问题:t 该用的地方用了正态分布,每一个 P 值都会偏小
- df
- 自由度——它是统计量怎么算出来的的属性,不是数据的属性,t、卡方与 F 三个都要。F 要两个:分子自由度是参与比较的组数或项数,分母自由度来自残差的样本量
- α
- 显著性水平,也就是 P 值将要拿去比的那个门槛。它不作为输入出现在这一页,因为它不属于计算过程:它属于你接下来要做的那个判断,而按 0.05 这个默认值印一句结论,等于替你选了这个门槛
- p
- 尾部概率,按百分数而不是小数报出。P 值 0.05 显示成 5.0000,于是屏幕上这个数可以直接和一个引用的显著性水平相比,不必先挪小数点
手上有统计量、想要它对应的概率时用它——课本习题直接给了统计量,软件只印了统计量没印 P 值,或者你自己手算完想核对一下。最要紧的那个选择是单侧还是双侧,而这条规则在看到数据之前就该定下来:只要两个方向都算「偏离原假设」就用双侧,这是绝大多数情形;只有反方向的结论你完全不关心、而且事先说清楚了,才用单侧。第二个选择是分布。按统计量怎么造出来的去配,别按你希望拿到哪个 P 值去配:比例或已知方差的均值配 z,散布与均值来自同一份小样本的配 t,数分类计数的配卡方,比较两个方差的配 F。这一处配错,是把一次正确的算术变成一个没有意义的数字最常见的方式。
算例
z = 1.96,那条经典的双侧门槛
- 上侧尾部:P(Z ≥ 1.96) = 0.025002,由标准正态分布算出
- 正态曲线对称,所以下侧尾部一样:P(Z ≤ −1.96) = 0.025002
- 双侧:2 × 0.025002 = 0.050004
- 换成百分数就是 5.0000%,正是大家挂在嘴边的那个 5%
1.96 这个值被选中,恰恰是为了让它正好落在 5% 上;看到的是 4.9996 而不是齐整的 5.0000,不是算错了——真正的分位点是 1.959964,1.96 自己就是一个四舍五入。三个自由度字段这里全都填着数,而实际只读了统计量和尾部设置,因为 z 一个自由度都不要:用不上的那两个框永远在屏幕上,里面填什么都不会改变结果。
t = 2.2281,自由度 10
- 自由度为 10 的 t 分布,尾部比正态曲线重
- 上侧尾部:P(T ≥ 2.2281) = 0.0250015
- 双侧:2 × 0.0250015 = 0.050003,也就是 5.0003%
和上面那一格的 z 一比,t 分布存在的意义就看得见了:同样 5% 的尾部面积,门槛落在 2.2281 而不是 1.96,因为小样本得走得更远,证据才算同样罕见。那段差距正是样本量在管的事——自由度到 1000 时 t 的临界值是 1.962,两个分布实际上就是同一条曲线了。
χ² = 20,自由度 3,只算上侧
- 卡方分布没有负的一半,所以这里只有上侧尾部可算
- 自由度为 3 时 P(χ² ≥ 20) = 0.00016975
- 换成百分数:0.017%
这个统计量就是卡方那一页用观测频数 30、10、20、40 配均匀期望算出来的那一个,P 值小到 0.017%,说明这四个类别并不等可能。注意这里缺了什么、得另外去问:这一页说的是这个统计量有多罕见,而最小的期望频数是多少一个字都没提——而那才是判断卡方近似在这份数据上站不站得住的依据。
局限
P 值只回答一个很窄的问题,却经常被读成在回答另外几个它回答不了的问题。它不是原假设为真的概率,不是「这个结果出于偶然」的概率,也不衡量效应有多大——样本足够大时一个微不足道的差别会变得极显著,而在 12 个样本里一个重要差别可以停在 P = 0.20。它也只和统计量背后的模型一样可靠:这四种分布都假定观测独立,而从整群抽样或重复测量里算出来的统计量,独立观测数比它的算式以为的少,于是为它报出的每个 P 值都偏小。有两处守卫是硬挡的,不交给读者:卡方与 F 拒绝负的统计量,因为这两个分布只活在正半轴,出现负值说明统计量算错了;卡方与 F 也拒绝双侧,因为这两个分布不对称,它们没有公认的单一双侧口径。
常见问题
- P 值是什么?
- 在原假设成立、统计量背后的模型也成立的前提下,拿到一个至少和你手上这个一样极端的检验统计量的概率。它描述的是数据,不是假设:P 值小,说的是如果什么都没发生,眼前这个结果会很罕见,这与「确实有事情发生」并不是一回事。从这一步走到结论,中间要过两道:一道是你事先定好的显著性水平,另一道是你对这个题目知道而数字里没有的一切。
- 该用单侧还是双侧?
- 用双侧,除非你在看到数据之前就定了单侧、并且说得出自己预测的是哪个方向。双侧检验把任一方向的结果都算作反对原假设的证据,这与大多数问题的提法相符:一种药让情况变糟,同样是一个发现。单侧检验本身是正当的,但它会把 P 值砍掉一半,而看完数据再挑尾部,是把一个不显著的结果凭空做成显著的最常见方式。拿不准就用双侧——它是保守的那个选择,也是审稿人期待看到的那个。
- P 值该拿去和多大的显著性水平比?
- 和你收数据之前定下的那个比——按惯例是 0.05,但这个惯例是习惯而不是结论。它故意不作为输入出现在这一页,页面也不印结论,因为同一个 P 值 0.04 在一种场合是发现、在另一种场合是噪声:从一万个基因里筛信号,和检验一个已有十年研究支撑的假设,该用的门槛完全不同。真正值得保留的惯例是:水平事先选定、并与 P 值一起报出来,而不是等数字出现在屏幕上之后再调整。
- 为什么卡方和 F 不能选双侧?
- 因为这两个分布不对称,把它们做成双侧没有公认的做法。通常那个配方——把较小的尾部乘二——恰好在最要紧的地方失灵:χ² 正好等于 0 时,观测与期望完全吻合,这是可能最不显著的结果,配方却会返回 0% 的 P 值。一个完美拟合被报成最高显著,不是舍入瑕疵而是一个错误答案,而它会以完全正常的样子出现在屏幕上。对称分布的两个尾部没有歧义,把其中一个乘二就是精确的;非对称分布则单看上侧,而它回答的正是实际被问的那个问题:统计量大到这个样子,有多出人意料?
- 为什么页面拒绝负的卡方或 F 统计量?
- 因为这两个统计量都不可能是负数,出现负值说明这个数不是从它被归属的那个检验里来的。两个都由平方量搭成——卡方来自计数之间差值的平方,F 来自两个方差之比——平方量不会小于零。页面当然可以返回 100%,算术上也自洽,但那样它就等于收下了一个算错的输入,还把它包装成一个真实结果。这里的拒答不花任何代价,因为不存在一个正当的负卡方会被它挡在门外。
- 为什么这一页没有临界值表?
- 因为一张 P 值表只能按检验统计量来索引,而统计量可以是任何数,那样的表需要无穷多行。教材附录里的那些表是反着排的:几行写常见的显著性水平,几列写你可能要用的自由度——它能塞进一页,只是因为显著性水平既少又事先约定好了。这一页在你实际填进去的那个统计量上精确求值,而这是表做不到的那件事:表只能告诉你,你的统计量落在它恰好列出的那几个数的哪一边。本组页面里最近的一张表在临界值那一页,那里行是显著性水平、列给出对应的 z。两页是同一个事实的两头读法,所以各自的相关工具里第一个都指向对方。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods(英文原版;尾部概率就是从这条累积曲线上读出来的,也是平时查的那张表) — 美国国家标准与技术研究院(NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e(英文原版;怎么从正态曲线上读概率,包括双侧检验要拼起来的那两个互补的尾部) — OpenStax(莱斯大学)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods(英文原版;检验统计量是在某个给定假设下才有分布的量,尾部面积之所以有意义全靠这一点) — 美国国家标准与技术研究院(NIST)