中心极限定理计算器
结果
标准误
- 样本均值的均值
- 100.0000
- 样本均值的方差
- 6.2500
中心极限定理计算器描述样本均值的抽样分布:它落在哪里、有多宽,以及这两者如何随样本量变化。中心在哪一半最出人意料——任何样本量下,所有样本均值的均值都等于总体均值,所以多收数据并不会把它挪动。变的是宽度:标准误等于总体标准差除以 √n,样本量翻四倍标准误才减半,而方差会掉到四分之一。定理本身说的那件事——样本量变大时形状趋近正态——讲的是形状而不是宽度,这一页的算术展示不出来。
样本变大时标准误如何下降
| 样本量 n | √n | 标准误 ÷ σ |
|---|---|---|
| 1 | 1 | 1 |
| 4 | 2 | 0.5 |
| 16 | 4 | 0.25 |
| 25 | 5 | 0.2 |
| 100 | 10 | 0.1 |
| 400 | 20 | 0.05 |
| 2500 | 50 | 0.02 |
| 10000 | 100 | 0.01 |
第三列是 σ 要乘的那个系数——总体标准差 15、样本量 100 时,标准误是 0.1 × 15 = 1.5。表里没有任何一处依赖你填的均值或标准差,所以它不可能与上面的面板矛盾:它就是 1/√n 这个函数,而面板只是在某一点上取了它的值。顺着往下读,平方根定律会呈现为一个规律而不是一句断言——样本量每翻四倍,标准误就减半,八行是按四倍一档挑的,好让这个规律重复出现而不是渐渐漂移。样本量取的也是开方之后是整数的那些,所以每一行都能手算核对。
公式
E[X̄] = μ Var(X̄) = σ² / n SE = σ / √n
- μ
- 总体均值——样本所来自的那个分布的中心。它原封不动地变成抽样分布的均值,也就是三个结果里的第一个,而且是任何样本量下都成立的那一个
- σ
- 总体标准差。它的单位就是数据的单位,标准误的单位也是,所以 σ 与 SE 可以直接比——标准误 2.5 摆在 σ = 15 旁边,说的是样本量的事,不是数据的事
- n
- 一份样本里有多少个观测值——每次抽取的规模,不是抽取的次数。它一次出现在 √n 上、一次出现在 n 上,这个差别就是全部的实际信息:方差按 n 成比例下降,标准误只按它的平方根下降
- X̄
- 样本均值,这里把它当成一个随机量而不是一个数。一次抽样给出一个 X̄;把抽样重复下去就得到 X̄ 的分布,三个输出描述的是那个分布,不是任何一份具体的样本
- SE
- 标准误——样本均值的标准差,也是本页的主结果。置信区间是拿它搭的,检验统计量是拿它除的,所以它才是那个值得读的数,而不是它的平方(方差)
需要知道一个样本均值在不同样本之间会有多大起伏时用它——设计研究之前、读到报告里的一个标准误想知道它怎么来的、或者想核对一下自己对样本量的直觉。它通常要纠正的那条直觉是「样本大一倍,估计就准一倍」:并不是,因为标准误按平方根下降。从 100 个观测加到 400 个,估计的散布减半;再要减半,得花 1600 个。最上面那两个结论对任何形状的总体都成立,所以可以在对分布一无所知的时候先用。这一页给不出的是「某个 n 够不够大到让样本均值近似正态」——那取决于原分布有多偏,它是一个判断,不是一次计算。
算例
默认情形:均值 100、标准差 15 的总体,每次抽 36 个
- 样本均值的方差:σ² / n = 225 / 36 = 6.25
- 标准误:√6.25 = 2.5
- 样本均值的均值:100,等于总体均值,没有变
- 与 σ = 15 比一比:每次抽 36 个把散布缩小到 1/6,而 6 正是 √36
15 和 36 都是挑过的,好让算术能心算出来——225 除以 36 是 6.25,开方得到齐整的 2.5。第三行值得多看一眼,恰恰因为它看起来什么都没发生:所有样本均值的均值就是总体均值,任何样本量下都是,而且这是关于期望的一个事实,不是近似。看到 100 = 100 就是这一行的意义,所以哪怕它只是把输入念了回来也要印。
同一个总体,改成每次抽 9 个而不是 36 个
- 样本缩小到四分之一,方差因此变成四倍:225 / 9 = 25
- 标准误:√25 = 5
- 均值仍然是 100——缩小样本动的是散布,别的什么都没动
- 与第一格相比:n 掉到四分之一,标准误只翻了一倍
这一对把平方根定律摆成了看得见的东西:样本除以四,标准误只翻倍,因为按 n 成比例缩放的是方差。反过来读,它就是「精度很贵」的原因——四倍的样本买到两倍的改善,而再要两倍的改善,得花上最初样本的十六倍。每一个样本量的决定都是这笔交易,下面的参考表把这个规律铺到更宽的 n 范围上。
每次只抽一个观测,散布一点没动
- n = 1 时样本均值就是那一个观测值,抽样分布因此就是总体本身
- 方差:225 / 1 = 225,也就是 σ²
- 标准误:√225 = 15,也就是 σ
- 样本均值的均值仍然是 100
n = 1 这个端点值得看一眼,因为整件事是从这里锚住的:样本量为 1 就是从总体里抽一个,什么都没有被平均掉,于是标准误就是总体标准差本身。其他任何样本量都是这个起点除以 √n。页面接受 n = 1 而不要求至少两个,因为它是一个正当而且有启发的输入——抽样分布只是还没有被样本收窄而已。
局限
公式最上面那两条恒等式对任何总体、任何 n 都成立,但它们描述的只是抽样分布的前两个矩。定理的第三个主张——近似正态——才是绝大多数实际用途所依赖的,而它恰恰是这一页核不了的那一半,因为 n 要多大取决于原分布有多偏:对大致对称的总体,10 常常就够了;对长尾分布,可能要几百个观测样本均值才稳下来。大家反复引用的那个 30,请当成经验法则而不是结论。公式还假定观测之间相互独立,从小总体里不放回地抽样就违反这一条——样本量那一页会套用这个修正,并且给出比这一页更少的人数。这里没有任何东西是从数据估出来的:两个输入都是总体值,如果你手上只有样本标准差,那该去的是置信区间那一页,它知道这两者的区别。
常见问题
- 标准差和标准误有什么区别?
- 标准差描述的是单个观测值离均值有多远;标准误描述的是一个样本均值离总体均值有多远。后者是前者除以 √n,这个除法就是两者差别的全部内容:σ = 15 的总体,你抽 9 个还是抽 900 个,它都同样地散;但 900 个观测的均值落到真值附近的距离只有 100 个观测的三分之一。所以 σ 用的是数据自己的单位,而标准误会随研究规模缩小——这也是为什么进置信区间或进检验统计量的是标准误。
- 样本取得更大,样本均值的均值会变吗?
- 不会,而这正是大家最难相信的那条结论。抽样分布的均值在任何样本量下都等于总体均值,从 n = 1 起就是如此,因为取平均不会把估计往任何一个方向推——它只是让估计变得不那么起伏。样本均值的分布是绕着同一个中心变窄、变高。样本量买到的是精度,从来不是准度:它缩小估计的散布,却不移动估计的中心。对照之下,有偏差的抽样方法移动的是中心,而且多少样本量都拉不回来——这就是为什么这两种失败方式值得分开来看。
- 样本要多大,中心极限定理才适用?
- 取决于总体的形状,而且没有一个对所有分布都管用的门槛。对称的总体在 n = 10 时就已经表现良好,而偏得很厉害的总体可能要几百个观测,样本均值才接近正态。大家熟悉的那个 30 来自对轻度偏态数据的模拟研究,是一个合理的默认值,不是定理。这一页在任何形状假设都不加的情况下能给你的,是中心和宽度——均值和标准误在任何 n 下都是精确的。只有正态近似需要大样本,也只有建立在它之上的置信区间和 P 值继承这个要求。
- 为什么样本均值的方差比数据的方差小那么多?
- 因为取平均会抵消掉各个观测独立的误差,而这个抵消按样本量成比例进行——而大家平时拿来比的标准误,只按样本量的平方根成比例。σ = 15、n = 36 时,方差从 225 掉到 6.25,是 36 倍;标准差从 15 掉到 2.5,只有 6 倍。两行都印出来正是为了这件事。定理通常是用方差陈述的,而实际被使用的形式是标准误,两个倍数之间的差距就是那个平方根。
- 这一页和标准误计算器是同一个东西吗?
- 它们从不同的输入算出同一个量,要哪一个取决于你手上有什么。这一页收的是总体标准差与样本量——任何数据收集之前就存在的两个值——是规划研究、或者核对「n 如何驱动精度」这类直觉时该用的工具。标准误计算器收的是样本本身,从样本里算出标准差,那是数据到手之后、总体值未知时该用的。两者的差别正好是中间那一步估计,而到了置信区间那一页,这步差别才有后果。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods(英文原版;样本统计量本身也是一个有分布的量,而本页描述的就是那个分布) — 美国国家标准与技术研究院(NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods(英文原版;样本变大时抽样分布趋近的那条曲线,也是平时查表看的那一条) — 美国国家标准与技术研究院(NIST)
- 3.1 Terminology — Introductory Statistics 2e(英文原版;大数定律:样本均值随样本变大而向总体均值靠拢,也就是「样本均值的均值」这一行精确陈述的那个行为) — OpenStax(莱斯大学)