标准误计算器
结果
标准误
- 标准差
- 2.1381
- 平均数
- 5.0000
- 个数
- 8
标准误计算器算的是一个估计量的标准误——均值的或比例的,看你手上有哪种数据。均值模式下它收下样本本身:一串数字,然后给出标准差、个数,以及标准误,也就是标准差除以 √n。比例模式下没有列表可用,因为一个是非题的起伏完全由百分比自己决定,所以页面问的是样本量与百分比,把标准差算成 √(p(1 − p)) × 100,再除以同一个 √n。两种模式因此走同一条路到达同一个量,四行数字把整条链都摆出来而不是只给末端。样本均值也印在面板上,好让标准差那一步有个看得见的中心。页面没法告诉你手上的这个数稳不稳——那取决于样本量,而 1/√n 这条定律写在抽样分布那一页上。
公式
SE = s / √n s = √( Σ(xᵢ − x̄)² / (n − 1) ) s = √(p(1 − p)) × 100
- SE
- 标准误——估计量自身的标准差,也是这一页的主结果。它回答的是关于估计量、而不是关于数据的问题:如果重新抽样一次,样本均值通常离总体均值有多远。它是置信区间赖以搭起来的那一个数,也是检验统计量拿来作除数的那一个数,所以值得单独算一遍
- s
- 样本标准差,分母是 n − 1。均值模式下标准误就是由它推出来的,页面把它单独印一行,好让那次除法可以被核对。用 n − 1 而不是 n,是为了让这个量成为总体散布的无偏估计——用 n 会略微低估变异性,而低估得最厉害的正是样本最小的地方
- n
- 样本里有多少个观测值,也就是个数那一行。它出现在平方根底下,这就是标准误缩得慢的原因:数据多十倍,标准误只小到三分之一左右。比例模式下这一项来自样本量字段而不是从列表数出来的,因为一个百分比本身不带着列表
- x̄
- 样本均值,印出来是为了让标准差的算术有一个看得见的中心。它本身不参与标准误——标准误是散布与样本量的性质,与数据落在哪里无关——所以整份数据平移任意一个常数,标准误不变
- p
- 样本比例,公式里写成分数、面板上显示成百分数。比例模式下它整个取代了标准差:是非题的起伏是百分比的函数,平分时最大,趋近 0% 或 100% 时缩到没有。乘 100 是把结果换回百分点,好让它能和来源的那个百分比并排读
手上有数据、想要某个估计量的标准误时用它——为了手算一个置信区间、为了核对报告里的一个数、或者为了看清一个结果里有多少宽度来自数据本身的散布、多少来自样本量。把标准差与个数一起印出来就是为了让这个分工变得看得见:改数字,标准差那一行动;只改样本量,标准误那一行动而标准差不动。之所以有两种模式,是因为最常用的两个估计量需要不同的输入。均值需要样本,因为事先没有任何东西能预测这些测量会散得多开;比例不需要,因为它的散布由它自己的值决定——这也正是调查能只凭样本量报出一个误差范围的原因。两行公式里的 s 长得不一样,但标准误的算法只有一条:把散布除以 √n;均值模式先要从数据估出散布,比例模式的散布则由百分比直接给出。两种模式都不判样本够不够大到让估计量近似正态。那取决于底层分布有多偏,而比例模式另有一条关于 n·p 与 n·(1 − p) 的经验规则,页面不执行它。
算例
默认情形:八个数字,标准差约 2.14
- 个数:八个数。均值:(2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5
- 各数与 5 的离差平方和为 32,所以样本方差是 32 / 7 = 4.5714
- 标准差:√4.5714 = 2.1381
- 标准误:2.1381 / √8 = 2.1381 / 2.8284 = 0.7559
这些数在 5 的两边散开而没有一个是离群的,这正是它们适合当默认值的原因:均值是个整数、标准差不是,所以最后两行不会被看混。从上往下读面板才是重点——2.1381 是关于数据的事实,0.7559 是关于估计量的事实,两者之间只隔着一次除以 √8。这个模式下样本量与百分比两个字段摆在屏幕上却没有用到。
九个数字,特意让标准误正好等于 1
- 均值:(3 × 4 + (−3) × 4 + 0) / 9 = 0
- 离差平方:四个 9、四个 9 再加一个 0,合计 72
- 样本方差:72 / 8 = 9,所以标准差是 3
- 标准误:3 / √9 = 3 / 3 = 1
九个观测小到让 n − 1 这个分母看得见:除以 9 而不是 8 会得到方差 8、标准差 2.8284,标准误也就成了 0.9428 而不是 1。这正是那处修正在做的事——样本小的时候,观测到的散布会略微低估总体的散布,而除以比个数少一的那个数就是补偿。n = 9 与 s = 3 这一对和置信区间那一页用的是同一组,它的区间正好是 ±2.306,因为自由度为 8 的 t 值就是 2.306。
比例模式不需要数据列表
- 比例写成分数:60% = 0.6
- 以百分点计的标准差:√(0.6 × 0.4) × 100 = 0.4899 × 100 = 48.9898
- 标准误:48.9898 / √100 = 48.9898 / 10 = 4.899
- 数据列表被完全忽略——个数那一行报的是样本量字段
数据那个框还在屏幕上、里面也还躺着一串数字,而答案里没有任何一部分用到它:这个模式的起伏来自百分比,样本量来自它自己的字段。这就是标准差那一行读作 48.99 的原因,对一个是非题来说这是个陌生的数。它是把是 / 否编码成 0 与 100 之后的标准差,在这里唯一的用途就是被 √n 除。同样的结构也出现在样本量那一页上,那里用最坏情况 p = 0.5 在设计阶段就把研究规划好。
两个观测,n − 1 这个分母出力最多的地方
- 均值:5
- 离差平方:25 与 25,合计 50
- 样本方差:50 / 1 = 50,所以标准差是 √50 = 7.0711
- 标准误:7.0711 / √2 = 7.0711 / 1.4142 = 5
两个观测时标准差就是两个数之间距离的一半——n − 1 这个分母只剩下一个自由度,公式退化成一件看得见、而不是算得出来的事。标准误则是标准差除以 √2,在这里是 5。这是均值模式接受的最小样本,值得试一次,好看看两个数给出的估计到底有多宽:标准误正好落在数据极差的一半上。
局限
页面报出估计量的标准误,就在把它变成一个区间或一次检验之前停下。这条界线是有意的:区间需要一个临界值,而临界值取决于置信水平、以及散布是不是必须从样本里估出来;检验则需要另一个统计量来比较。两者都在相邻的页面上,而这里的算术是那两件事的输入,而不是它们的替代品。均值模式假定观测之间相互独立,这个假定在同一个对象上重复测量、配对数据、以及像「学校里的学生」这样的聚集数据上都不成立;这三种情况下有效样本量都小于个数,于是标准误偏小。它还假定列表里装着你本来想纳入的每一个观测值——标准误是从你实际敲进去的那些数字算出来的,不小心漏掉一个离群值就会把它压窄。比例模式另有一条附注:它的公式是大样本近似,在成功或失败的计数很小时表现很差,所以样本不大而百分比接近 0% 或 100% 时,该用精确区间而不是这个标准误。两种模式都不判估计量有没有偏,而这是任何标准误都查不出来的。
常见问题
- 标准差和标准误有什么区别?
- 标准差说的是单个观测值离它们的均值有多远;标准误说的是一个样本均值离总体均值有多远。后者是前者除以 √n,这次除法就是两者的全部关系——这也正是两行都印出来的原因。标准差是数据的性质,采集再多数据它也不变;而标准误会随样本变大一直缩小。面板上有一个好用的自查:改一改数字,两行都会动;只改个数,标准差留在原处而标准误下降。
- 为什么页面除以 n − 1 而不是 n?
- 因为衡量散布时用的中心是样本自己的均值,而它比真正的总体均值更靠近这批数据,于是那个直接算出来的平均离差平方会系统性地偏小一点。除以比个数少一的那个数就是在补偿。这个效应在样本小时最大:两个观测时它把方差翻了一倍,到一百个观测时只是一个 1% 的调整。除以 n 拿来描述你手上这份样本并不错;错在拿它去估计这份样本所来自的总体的散布,而标准误要的正是后者。
- 没有任何数据,怎么算一个比例的标准误?
- 比例自带起伏,所以不需要列表——只要样本量与那个百分比。把两种结果编码成 0 与 100,标准差就是 √(p(1 − p)) × 100,它在两边平分时最大,随百分比趋近任何一端而缩向零。100 个人里的 60% 给出 √(0.6 × 0.4) × 100 = 48.9898,再除以 √100 就得到 4.899 个百分点的标准误。这与误差范围那一页用的是同一对输入,只不过那里还要把标准误乘上一个临界值,才得到那个加减号。
- 数据越多,标准误就越小吗?
- 是,但只与样本量的平方根成正比。从 100 个观测加到 400 个,标准误减半;想再减半就要 1600 个。这就是标准误在设计研究时是最该盯住的那个数的原因,也是「样本从比较大加到非常大」的收益最容易被高估的原因。相比之下标准差那一行基本不动——数据更多不会让底层总体变得不那么散,它只是让对中心的估计更精确。
- 标准误是 0 说明什么?
- 要么样本里每个观测值都一模一样,要么比例是 0% 或 100%——两种情况公式都找不到可用的变异,于是返回零。照字面读,标准误为零是在说这个估计精确无误,而这是数据支撑不了的断言:四个相同的读数只能说明散布很小,不能证明它是零。页面返回那个零而不是报错,因为算术本身是对的,而且原因就在另外几行上看得见;但一个正好为零的标准误应当被当成一个信号:样本太小或太整齐,对变异性说明不了什么。
- 这和中心极限定理计算器是同一个东西吗?
- 两者算的是同一个量,只是输入不同,你想要哪一个取决于手上有什么。这一页收的是样本——一串数字,或者一个百分比加一个样本量——数据到手之后就用它。中心极限定理那一页收的是总体标准差与样本量,也就是任何数据被收集之前就已经存在的那些值,适合在规划研究、或者想看标准误怎么随 n 变化时用。两者的差别正好是中间那一步估计,所以当样本标准差恰好等于总体标准差时,两页的结果会一致。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods(英文原版;样本标准差与 n − 1 这个分母的来历,标准误就是由它们搭起来的) — 美国国家标准与技术研究院(NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods(英文原版;一个统计量的抽样分布,标准误度量的正是它的散布) — 美国国家标准与技术研究院(NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods(英文原版;与散布并排印出来的样本均值,以及两者为什么总是一起报) — 美国国家标准与技术研究院(NIST)