t 检验计算器
结果
t 统计量
- P 值
- 34.6594%
- 自由度
- 8
- 标准误
- 1.0000
t 检验计算器跑的是最常见的那种均值检验:把一个均值、一个标准差和一个样本量,变成 t 统计量、P 值与读数所用的自由度。单样本模式把一个均值与一个固定值相比——一个目标值、一个规格、一个历史平均。双样本模式把两组互相比较,而这一页实现的是合并方差的双样本 t 检验,它假定两组共享同一个方差:两个标准差按 n − 1 加权平均成一个合并方差,再由这一个方差推出标准误。另一种做法 Welch 检验放弃了等方差假定,在两组样本量与散布都不同的时候是更稳妥的默认,但它的自由度是分数,而且是另一处代码里的另一套计算;这一页做的是等方差检验,并把它明说出来,而不是悄悄近似。P 值是 t 分布上统计量以外的尾部面积,页面按百分数印出来。
公式
t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- 检验统计量——观测到的均值离被检验的那个值有多少个标准误。它的正负号携带方向,这也是单侧检验方向选反时会返回一个很大的 P 值而不是报错的原因:在与「大于」备择假设相对时,t 等于 −1 不是效应小,而是证据指向另一边,尾部面积如实反映了这一点
- x̄, μ₀
- 样本均值,以及单样本模式下被拿来与之比较的那个值。分子是两者之差,所以统计量度量的是以数据本身为单位的一段距离——同样的差值,在散布大或样本小时分量要小得多,而分母提供的就是这个换算
- s
- 样本标准差,从数据里估出来而不是事先已知。正是这一步估计才让 t 分布取代了正态分布:它引入的额外不确定性让尾部变重,而变重的尾部就是 t 临界值所补偿的东西。它必须大于零——一份没有任何变异的样本没有可作除数的东西
- n
- 样本量,单样本模式下给出 n − 1 个自由度。双样本检验里两组的规模相加后比任何一组单独都多一:n₁ + n₂ − 2,因为合并方差要先在每组上花掉一个自由度去定各自的均值,然后才去量围绕它的散布
- s_p²
- 合并方差——两组方差按各自自由度加权后的平均。等方差假定就是从这里进来的:两组被当成来自同一个总体散布的两份样本,所以观测更多的那一组、或者自身方差更小的那一组,按比例地贡献给同一个共享估计。两个方差差得多的时候出错的就是这一步合并,而 Welch 检验是它的修补
- P 值
- 在两个均值真的相同的前提下,出现一个至少偏离零这么远的统计量、且方向符合检验所问的概率。双侧把 |t| 以外的面积加倍;「大于」与「小于」各取一侧尾部。这里按百分数报出,所以 5% 就是熟悉的那 0.05;它说的是在假设之下数据有多稀奇,而不是在数据之下假设有多可信
手上有一个样本的均值与标准差、想知道它与一个目标值、或者与另一组的差距是不是超过了抽样噪声能解释的范围时用它。单样本模式处理比较值是一个固定数的情况——一台设定为灌装 500 克的机器、一个 5 毫米的规格、去年的平均值;双样本模式处理两个量都是测出来的、谁也不比谁更权威的情况。读答案之前有两件事值得先定下来。第一件是单侧还是双侧:双侧检验问两组是否有差异、方向不论,是合适的默认;单侧检验问的是一个带方向的问题,应当因为方向是事先指明而选它,而不是因为那样答案更好看。第二件是等方差假定,双样本模式做出了这个假定却没法替你检查。线索就在面板上:你填的两个标准差如果接近,合并它们代价很小;如果相差一倍以上,你要的是 Welch 检验。这一页算的是合并方差检验,也就是大多数教材和大多数统计工作者在等方差情形下说「t 检验」时所指的那一个,并且把你自己填的两个标准差一并印出来,好让这个假定可以被判断,而不是被默认。两行公式的区别只在标准误怎么来:单样本是一个样本的标准差除以 √n,双样本是先把两组方差合成一个,再乘上 (1/n₁ + 1/n₂);统计量的算法本身只有一条——差值除以标准误。
算例
默认情形:样本均值 6,目标值 5
- 标准误:s / √n = 3 / 3 = 1
- t 统计量:(6 − 5) / 1 = 1——样本均值落在目标值上方一个标准误处
- 自由度:n − 1 = 8
- 双侧 P 值:自由度为 8 的 t 分布上 ±1 以外的面积,也就是 34.66%
「差了整整一个单位」听起来不少,直到把标准误摆在它旁边:一个标准误完全落在抽样噪声能产生的范围之内,P 值也是这么说的。与正态曲线的比较很有启发性——同样的 t = 1 如果分布在正态曲线上会给出 31.7%,多出来的那三个百分点,就是把标准差从九个观测里估出来、而不是事先知道它的代价。
t 统计量等于 2.306 时,P 值正好是 5%
- 标准误:3 / √9 = 1,于是 t 统计量就是均值本身
- t 统计量:(2.306 − 0) / 1 = 2.306
- 自由度为 8 的 95% 双侧 t 边界就是 2.306
- 正落在边界上,意味着双侧 P 值正好是 5%
这正是临界值那一页从反方向给出的同一对数,把两者放在一起,是「它们其实是同一个事实的两头读法」最清楚的演示。向那一页要一个自由度为 8、95% 的双侧 t 边界,它返回 2.306;把 2.306 喂进这一页,P 值回来正好是 5%。中间没有任何一步被舍入——这个数就是挑出来的,因为标准差 3 与样本量 9 让标准误正好等于 1,于是统计量与边界成了同一个数。比它略小的统计量会落在 5% 以上,略大的落在 5% 以下。
两组各十个,散布相同
- 合并方差:((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4,所以合并标准差是 2
- 标准误:√(4 × (1/10 + 1/10)) = √0.8 = 0.8944
- t 统计量:(5 − 4) / 0.8944 = 1.118
- 自由度:10 + 10 − 2 = 18,给出 27.83% 的双侧 P 值
两个方差相等时合并是个空操作——合并方差正好是 4,与两组各自给的值一样——而标准误比任何一组的标准差除以自己的 √n 都要小。比较两个各含十个观测的均值,比估计单独一个含十个观测的均值更不精确——标准误 0.8944 对 0.6325——因为这里是在相减两个都不确定的量,而不是在测量一个量;只有当这个比较回答了单样本回答不了的问题时,这笔代价才值得。另外注意总体均值那个框在这个模式下摆在屏幕上却没有用到:两个量都是测出来的,谁也不是那个固定目标。
散布不等、样本量也不等,合并要盯住的情形
- 合并方差:((9 × 4.41) + (11 × 3.24)) / 20 = (39.69 + 35.64) / 20 = 3.7665
- 标准误:√(3.7665 × (1/10 + 1/12)) = √0.6905 = 0.831
- t 统计量:(5.2 − 4.1) / 0.831 = 1.3237
- 自由度:10 + 12 − 2 = 20
合并方差是 3.7665,而它不是 4.41 与 3.24 的中点——十二个观测的那一组权重更大,因为它贡献了十一个自由度,而十个观测的那一组只有九个。这个加权就是「合并」这个词的全部含义,也是这个答案没法靠把两个标准差直接平均出来复现的原因。这里两个散布足够接近,等方差假定让人放心;换成 2.1 与 0.6 配上这两组样本量就不是了,Welch 检验会给出一个看得见差别的 P 值。
900 个观测给出的 t = 1.96,t 与 z 已经合流
- 标准误:3 / √900 = 3 / 30 = 0.1
- t 统计量:(5.196 − 5) / 0.1 = 1.96
- 自由度:899
- 双侧 P 值:5.0304%——刚刚超过 5,并不是正好落在 5
那个著名的 1.96 在正态曲线上给出 5%,在这里给出 5.0304%,而这道缝就是这一例的要点。899 个自由度下 t 分布与正态几乎无从分辨,但并非完全相同——它的尾部仍然略重一点,所以同一个统计量落得略靠外。这也解释了为什么大样本里 t = 1.96 并不自动等于 5% 显著,以及为什么报 0.0499 的软件与报 0.0501 的软件会在小数点后第三位上对同一份研究给出不同的结论。
局限
双样本模式假定两组共享同一个方差,而这个假定是在真正出力的,不只是把记号整理干净。两组样本量相等时,即使方差不同,合并检验也还相当稳健;但样本量不等、方差也不同的时候,检验可能朝任何一个方向严重出错——这就是 Behrens–Fisher 问题,Welch 检验正是为解决它而存在的。两个标准差印在面板上就是为了这个:相信那个 P 值之前先比一比,如果其中一个超过另一个大约两倍而两组样本量又不相同,等方差检验就不是你要的那一个。单样本模式没有这个问题,但它假定观测之间相互独立,这在同一个对象的重复测量、以及配对或聚集数据上都不成立,那些情形需要配对检验或混合模型。两种模式都假定底层数据大致正态,而样本越大对这条假定越不敏感——中心极限定理正是「900 个偏态观测上的 t 检验说得过去、9 个偏态观测上的 t 检验值得怀疑」的原因。最后,页面报出一个统计量与一个 P 值,不给结论。它手上没有显著性水平可以比较,而 0.05 是一个约定而不是一个结果,所以这个决定留在了它该在的地方。
常见问题
- 这一页用的是合并方差还是 Welch 的双样本 t 检验?
- 合并方差那个——等方差检验,自由度是 n₁ + n₂ − 2。两组在散布和规模上都不同的时候,Welch 检验是更好的选择,而两个标准差字段就摆在面板上供你核对:如果其中一个超过另一个大约两倍、样本量又不相同,你要的是 Welch,而这一页给出的 P 值会有偏差,有时偏差还不小。这里实现等方差版本,是因为它就是教科书那一版,是参考手册里叫「Two-Sample t-Test for Equal Means」的那一个,而且它的整数自由度让这一页的算术保持精确而不是近似。
- 该用单侧检验还是双侧检验?
- 除非方向在看到数据之前就已经指明,否则用双侧。双侧检验问的是两组到底有没有差异,把显著性水平分给两端;单侧检验问的是其中一组是不是更大,把整个水平都压在那一个尾部,于是更容易达到显著——在同一个水平上正好容易一倍,因为 1.96 变成了 1.645。当问题本身确实带方向时,这是一个正当的选择;而当方向是看到差异往哪边走之后才定下来的,它就成了一种挑选结果的做法。
- t 统计量和 P 值有什么区别?
- t 统计量以标准误为单位度量差距,样本量就装在它里面;P 值则用相应自由度下的 t 分布把这个数换算成一个概率。所以 t 回答的是「这两者相差几个标准误」,P 值回答的是「光靠抽样,出现这么大差距有多频繁」。两个都报出来,是因为前者在设计相同的研究之间可以直接比,而后者才是拿来与显著性水平比较的那个。两者都不是效应大小——大样本能让一个微不足道的差距产生很大的 t 和极小的 P 值。
- 为什么 t 统计量等于 1.96 时 P 值不是正好 5%?
- 因为 1.96 是正态曲线的 5% 边界,而 t 分布在任何有限自由度下尾部都略重一点。899 个自由度时 t = 1.96 给出 5.0304%,刚刚过线;8 个自由度时同一个统计量给出 8.57%。t 分布随自由度增大收敛到正态,从头到尾都是同一条曲线,变的只是尾部的分量。这正是软件可以报出 0.0499、而拿手算对着 1.96 比的人说显著的原因,两边都没有错。
- t 统计量是负数说明什么?
- 说明样本均值落在了被比较的那个值以下,双样本模式下则是落在第二组的均值以下。正负号只是方向信息,别的什么都不是——P 值依据的是它相对于分布有多大。双侧检验里符号被丢掉,因为两头都算极端。单侧检验里它有意义,而且能提供信息:在与「大于」备择假设相对时,t = −2.5 给出的 P 值接近 99%,那不是「没有结果」,而是证据指向了另一边,把它报成「不显著」等于把这条信息丢掉。
- 做 t 检验需要多少个观测?
- 页面要求每组至少两个,因为单个观测的标准差没有定义。这是一条数学下限,不是一条实务建议——每组两个观测的 t 检验只有一个自由度,除了极大的差距之外几乎什么也检测不出来,除非两组几乎不重叠,P 值都会很大。真正有用的问题不是公式允许多少,而是「要检出你在意的那点差距需要多大的样本」,而那取决于数据的散布和你希望察觉到的效应量;那个计算住在样本量那一页上,它从一个误差范围往回推,而不是从一份数据往前算。
- t 临界值表在哪?
- 在临界值那一页上,而且本组页面里只有那一张——这一页不印,是因为那样的表除了显著性水平还要按自由度索引,等于每个显著性水平各一页书,而不是一张表。这也正是这里把答案算出来、而不是查出来的原因:表只能列出别人选择印上去的那几个自由度,而双样本检验给出的自由度 n₁ + n₂ − 2,几乎从来不在其中。唯一值得记在脑子里的边界是:t 值随样本变大收敛到 1.96,所以你要找的那张表就是正态表外带一份随自由度上升而消退的惩罚。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods(英文原版;本页实现的就是这个合并方差的双样本检验,含合并标准差与它的 n₁ + n₂ − 2 个自由度) — 美国国家标准与技术研究院(NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods(英文原版;单样本统计量所依赖的样本均值与标准误) — 美国国家标准与技术研究院(NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods(英文原版;自由度增大时 t 分布趋近的那条曲线,也是 1.96 与 5% 只是近似互为对方搭档的原因) — 美国国家标准与技术研究院(NIST)