跳到主要内容
CalcMax

误差范围计算器

最小值:2

最小值:0

范围:0 – 100

结果

2.3811

误差范围

标准误
1.2000
临界值
1.9842

误差范围计算器把一份样本的散布,换算成调查结果旁边那个「加减几个百分点」。它要三样东西,而页面问的正好就是这三样:置信水平——90%、95% 还是 99%——样本量,以及被估计的那个量究竟有多起伏:估计的是均值时给标准差,估计的是百分比时给比例本身。算法是一个临界值乘一个标准误,两个因子都会印出来,因为最常见的两个错误各住在其中一个里面:该用 z 的地方用了 t 的临界值,或者除以样本量而不是它的平方根。结果与样本的中心毫无关系。误差范围说的是估计可能偏出多远,不是估计是多少——一个 60%、误差 3 个百分点的调查,完全可能来自真实值 57% 或 63% 的总体。

公式

ME = z* × SE SE = s / √n SE = √(p(1 − p) / n)

ME
误差范围——置信区间宽度的一半,单位跟着估计量走。它是半宽而不是全宽,因为区间写作「估计量 ± ME」,同一个数一边减、一边加。单位随估计量变:比例给的是百分点,均值给的是数据本身的单位
z*
临界值,而且在这个模式下取的总是自由度为 n − 1 的 t 值,不是那个人人都记得的 1.96。与调查常用的样本量相比这个差别很小,但它不是零,而且恰好在误差范围最大的地方最大:n = 2 时 t 值是 12.7062,于是标准差为 4 的两样本会给出一份 35.94 的误差范围
s
样本标准差,只在均值模式下用到。调查里这个量很少能提前知道,这也正是民意调查报比例而不是报均值的原因——是非题的可变性由百分比本身决定,不需要另外估一个量
p
样本比例,只在比例模式下用到,公式里写成分数、面板上显示成百分数。它对宽度的贡献在 50% 处取到最大:一半人同意、一半人反对是一个二分问题最不确定的状态,所以民意调查引用的误差范围通常是 p = 0.5 那个最坏情况,而不是这次调查自己的值
n
样本量,以 √n 的形式出现。这个平方根就是「样本翻倍并不能把误差范围减半」的原因——它只把误差范围除以 1.41,要把误差范围减半需要四倍的样本。它也是研究者唯一能控制的因子,因为 p 来自数据,而置信水平是一个「答案要多稳妥」的声明

数据已经收完之后想知道报出来的那个数里有多少是噪声,或者正在读别人报的一个数、想看看它是怎么拼出来的——这两种场合用它。它最有用的两样东西都不在主结果里,而在面板上:临界值,它暴露了用的是 t 还是 z,因此也暴露了分析者有没有为「散布是估出来的」这件事留出余量;以及标准误,它让平方根定律变得看得见——样本翻四倍,这一行就减半。如果是为研究做规划而不是解读研究,样本量那一页是更合适的工具,因为它把问题反过来问:要把误差压到你已经认定可接受的那个值,需要多少份回答。读调查结果时请记住,误差范围覆盖的只是抽样误差。它没说你问到的是谁、问题有没有诱导性、抽样方式是不是让总体里每个人都可能被抽中。这些问题不会随 n 缩小,而正是「大样本 + 小误差范围」让一个有偏的调查显得权威。

算例

  1. 默认情形:用 100 个观测估计一个均值

    1. 标准误:s / √n = 12 / 10 = 1.2
    2. 临界值:自由度为 99 的 t 值,1.9842——不是 1.9600
    3. 误差范围:1.9842 × 1.2 = 2.3811
    4. 估计量本身不是输入,所以答案是半宽而不是一个区间

    值得读的是临界值那一行,因为手算最容易错在这一步:100 个观测已经是大样本了,随手取 1.96 而不是 1.9842,答案会差 1.2%。在这里很小,在 n = 2 处却极大——同样的替换会把 35.94 变成 5.5,把不确定性低估到六分之一。页面把临界值印出来,正是为了让这一步可以被核对,而不是藏在一次乘法里。

  2. 1000 份回答算出的一个比例

    1. 比例写成分数:50% = 0.5
    2. 以百分点计的标准误:√(0.5 × 0.5 / 1000) × 100 = 1.5811
    3. 临界值:正态的 1.9600,因为比例模式用的是 z
    4. 误差范围:1.96 × 1.5811 = 3.099 个百分点

    这就是报纸上引用的那个形状的数,有三处细节值得分开看。这里的临界值是 1.9600,而上面那个均值例子是 1.9842,因为比例的可变性完全由 p 决定、不需要自由度。标准差字段摆在面板上却用不到——这个模式下可变性来自百分比,不来自一个单独的估计。而 p = 50% 是最坏情况,所以这个数可以推广:那次调查里任何一道题的误差范围都不会比它更大。

  3. 九个观测让误差范围正好落在临界值上

    1. 标准误:3 / √9 = 1,正好是整数
    2. 自由度为 8 的临界值:2.306
    3. 误差范围:2.306 × 1 = 2.306
    4. 三行里有两行印出同一个数,这是这组输入的巧合,不是一条规律

    这个巧合值得看一眼,免得以后把它当成某种关系:标准误正好等于 1,乘法成了空操作,临界值就直接露成了答案。九个观测配标准差 3 是一个自然的小样本设定,而这里出现的 t 值就是置信区间那一页在 n = 9 处给出的那个——两页共享整套计算,区别只在于那边还知道一个样本均值可以拿来平移。

  4. 同一批数据改用 99% 来读

    1. 标准误没有变,还是 1.2——数据本身什么都没动
    2. 99%、自由度为 99 的临界值:2.6264
    3. 误差范围:2.6264 × 1.2 = 3.1517
    4. 与 95% 那一格比:2.3811,多要的那份把握多付了 32% 的宽度

    三行里只有一行变了,而把三行都印出来正是为了这件事:置信水平只动临界值,别的什么都不碰;样本量只动标准误,别的也什么都不碰。两个旋钮互不相干,把它们弄混是误读「到底改了什么」的一条常见路径。这笔交易本身也值得点明——99% 不是更准,而是更保守。它换到一个覆盖真值更频繁的区间,代价是在任何单独一次上把估计钉得更松。

局限

误差范围只覆盖一种误差来源:因为抽的是样本、而不是把整个总体都测一遍所带来的那部分波动。它对偏差一无所知,而两者不能互换——一千个从网站上自愿来的人组成的样本,误差范围很小,却可能整整错二十个百分点,因为主动来答题的人不是随机抽出来的。它还假定观测之间相互独立。在一户人家里访问好几个人,或者对同一个对象测两次,都会把有效样本量压到远低于回答数的水平,而公式看不出来;算出来的误差范围会偏窄。均值与比例两条公式都是大样本近似:比例那一条在 n·p 或 n·(1 − p) 很小时尤其不可靠,稀有类别正是这种情况——100 份样本里 2% 的应答率,根本就不该配一个对称的加减号来报。最后,误差范围描述的是一次孤立的估计。拿它去比较两组是错的工具,那里要看的是差值的误差范围,而除非两组独立,它并不等于两个误差范围之和。

常见问题

误差范围 3% 到底是什么意思?
它的意思是:如果同样的调查重复很多次,那么大约有 95% 的「报出的数 ± 3 个百分点」这样的区间会包含真实的总体值。它不是说真值一定在 3 个百分点以内,也不是说这次调查最多错了 3 个百分点。由此有两点很容易被忽略。真值要么在区间里、要么不在,所以那个 95% 描述的是这套做法,而不是这一次结果。而且比较两组时误差是会叠加的:如果两个候选人在一份各自误差 3 个百分点的调查里相差 4 个百分点,这场比赛并不是简单意义上的「在误差范围内」——差值有它自己的误差范围,而且比任何一方都大。
为什么样本越大误差范围越小,但不成比例?
因为样本量在公式里出现在平方根底下。从 100 份加到 400 份,误差范围减半;从 400 再翻到 1600,又减半一次——每一次减半都要付四倍的样本。这是调查设计里影响最大的一条事实,也解释了为什么民意调查的样本量都收敛在几百到两千之间:头一千份买到了大部分可得的精度,再一千份只买到一半。它同时也是「误差范围没法靠更好的分析改善」的原因——唯一的杠杆是更多数据,而它按平方根起作用。
误差范围越大就越差吗?
它是更诚实,不是更差。区间越宽越可能包含真值,所以一份报着 99% 把握下 ±5 个百分点的研究,比一份报着 90% 把握下 ±3 个百分点的研究做出了更稳妥的声明——在置信水平写出来之前,两者根本不可比。真正更差的是不报误差范围,或者报的时候不带置信水平,因为那样读者就无法判断这个数有多少分量。宽误差范围透露的另一件事只是样本小,这是信息而不是缺陷:它说明这项研究分辨不了细微差别,而分辨不了的研究不该被读成分辨得了。
为什么页面拒绝 0% 或 100% 的比例?
因为公式在那里塌掉了。比例的标准误是 √(p(1 − p)/n),而在 p = 0 或 p = 1 时因子 p(1 − p) 为零,误差范围算出来正好是零。印一句「60% ± 0 个百分点」是一种任何样本都支撑不了的确定性断言——它说总体值就是 60%,而数据能说明的只是这份样本里没有人落在这个类别之外。零计数或满计数有正当的处理办法,而那些办法都要往计数里加点东西,而不是相信那个空格子;它们都不是普通的误差范围,所以页面选择拒答,而不是返回一个会被读成确定性的数。
误差范围能反映样本有偏吗?
不能,而这是整个概念最重要的一条限制。误差范围衡量的是抽样变异性——「只看总体的一部分而不是全部」所造成的那部分误差。偏差是另一类误差,由抽样方式或提问方式产生,而且不会随样本变大而缩小。一份一万人自愿参与的在线投票,误差范围可以只有 1 个百分点,却仍然偏出 15 个百分点,因为答题的人不是从总体里随机抽出来的。大样本让抽样误差变小,却让偏差显得更精确。读任何一个报出来的误差范围时,先问样本是怎么抽的。
标准误和误差范围有什么区别?
标准误是估计量本身的散布,误差范围是这个散布乘上一个取决于置信水平的临界值。所以标准误只是数据的性质,而误差范围是关于你愿意给出多少把握的一个声明。95% 之下那个乘数大约是二,这就是两个数常常只差一倍、因而容易被混为一谈的原因。面板上两个都印出来正是为此:标准误告诉你这份样本携带了多少信息,误差范围告诉你你决定拿它去声明什么。

参考资料

相关计算器