置信区间计算器
结果
下界
- 上界
- 52.3811
- 误差范围
- 2.3811
- 标准误
- 1.2000
- 临界值
- 1.9842
置信区间计算器把一份样本汇总成一个区间:要估计的那个量大概落在哪一段里。均值与比例两条路都走,输出上下界,并把误差范围、标准误与临界值分行列出来,所以区间是怎么搭起来的能看明白,而不用当成一个黑箱数字。用哪个临界值取决于是均值还是比例:均值走 t 分布,自由度是 n − 1;比例走标准正态。比例这一支的全部数字都按百分点计,与你填进去的那个百分数同一个量级。
公式
均值: x̄ ± t(α/2, n − 1) · s / √n 比例: p̂ ± z(α/2) · √( p̂ (1 − p̂) / n )
- x̄
- 样本均值——你测出来的那个数,单位就是数据的单位。区间绕着它搭,它挪多少整个区间就挪多少
- s
- 样本标准差,观测值在它们自己那个均值周围的散布。写小写 s 而不是 σ,是因为手上的只有样本;再除以样本量的平方根,它才变成标准误
- n
- 样本里有多少个观测值,至少 2 个。它进算式两次:一次在标准误里,一次通过 t 分位数的自由度 n − 1
- t(α/2, n − 1)
- 均值那一支的临界值:自由度为 n − 1 的 t 分布上,两侧各留 α/2 尾部面积的那个点。它总比正态临界值略大,小样本时大得多——那是 t 分布在为「s 是估出来的、不是已知的」这件事付代价
- p̂
- 样本比例,按百分数填。整条比例算式都留在百分点上,所以上下界、误差范围与标准误跟你敲进去的那个数同一个量级
- z(α/2)
- 比例那一支的临界值:95% 置信水平下是 1.9600,且在任何样本量下都是这个值,因为比例是按正态分布判的,不按 t。它在比例那一行里出现两次,一次在根号外,一次通过 p̂ 在根号里
手上有样本、要说清这个估计有多准时用它——几个测量值的均值,或者一次调查里的占比。它是老实报出一个数的办法:均值 50 来自 100 个观测和来自 5 个观测是两种不同的说法,而区间就是这个差别,因为样本量住在标准误的分母里。另外两个选择决定其余一切:量是长度、时长、分数这类测量值时走均值那一支,是「总共多少人里有多少人」时走比例那一支并按百分数填;置信水平 95% 是惯例,面板上给的三档能覆盖绝大多数公开数字。也要知道它不说什么:它不说真值在哪,也不说将来多少个观测会落进来——它是关于估计方法的一句话,不是关于数据的一句话。
算例
100 个测量值的均值
- 标准误:12 / √100 = 12 / 10 = 1.2
- 自由度 n − 1 = 99,95% 置信水平下查得临界值 1.9842
- 误差范围:1.9842 × 1.2 = 2.3811
- 上下界:50 − 2.3811 = 47.6189,50 + 2.3811 = 52.3811
这一格最该注意的是临界值 1.9842,而不是大家熟悉的 1.96。那点差就是 t 分布为「散布也是从这 100 个观测里估出来的」收的费,样本越大它越小——到 n = 1000 时基本看不出来了。另外注意比例那个框里还留着 60,而它什么都没做:两组输入永远同时在屏幕上,用哪一组由最上面那个下拉框决定。
1000 人调查里的比例
- 样本比例 50% 写成小数是 0.5,1 − p̂ 也是 0.5
- 标准误:√( 0.5 × 0.5 / 1000 ) = 0.015811,也就是 1.5811 个百分点
- 临界值:95% 置信水平下是 1.96,与样本量无关
- 误差范围:1.96 × 1.5811 = 3.099 个百分点,于是上下界是 46.901% 与 53.099%
这一格里的每个数都是百分点,不是小数比例:标准误是 1.58 点而不是 0.0158。这是本页对比例的记法约定,也解释了为什么这里的标准误看着比第一格大——它量的是另一个东西,是占比而不是测量值。同一套算法就是「一千人左右的调查,误差在三个点上下」那句话的出处。
同一批 100 个观测,改按 99% 置信水平报
- 标准误不变,仍是 12 / √100 = 1.2——样本本身什么都没变
- 只有临界值动了:2.6264 而不是 1.9842
- 误差范围:2.6264 × 1.2 = 3.1517
- 上下界:50 ± 3.1517,即 46.8483 到 53.1517
与第一格并排看,置信水平买到的到底是什么就清楚了:同一批数据、同一个标准误,区间宽了 32%。提高置信水平并没有多知道什么——样本里的信息一点没变,变的只是对它下的那句话。所以 95% 是惯例,而报一个 99% 的区间却不说,是误导而不只是保守。
局限
两条路都假定观测值之间互相独立。同一台仪器上连读 500 次,或者从 20 个班里抽 500 个学生,实际信息量都比算式以为的少,于是区间比它该有的窄。两条路也都假定估计量大致对称地落在真值附近:均值那一支依赖样本近似正态,或者 n 大到 t 分布不计较;比例那一支更脆——比例靠近 0% 或 100% 时,这个公式本身就不对,所以那两端的输入页面直接拒答,而不是照样给出一个自信而极窄的区间。有限总体这里不做校正:样本占了小总体很大一份时,样本量那一页会套用有限总体修正,并且会给出比这一页更少的人数。
常见问题
- 置信区间到底是什么意思?
- 它是按一套在 95% 的样本里都能盖住真值的办法搭出来的区间,不是「这一个区间有 95% 的概率包含真值」。区别在于真值是固定的、未知的:它要么在你刚算出的这对上下界里,要么不在,这件事上挂不上概率;95% 说的是这个办法本身的可靠程度。实际读的时候大家用的是另一句话:靠近区间中间的值比靠近两端的更可信,落在区间外的值则与数据有些冲突——这正是通向 p 值那一页的桥。
- 为什么均值用 t、比例用 z?
- 因为算均值时你连散布也一起估,算比例时不用。均值的标准误是 s / √n,而 s 又是从同一份样本里算出来的,区间必须为这份额外的不确定性留出余量——这正是 t 分布在做的事,也是 n = 100 时它的临界值该是 1.9842 而不是 1.96 的原因。比例没有第二个估计量:估计量的散布由比例自己通过 p̂(1 − p̂) 决定,所以任何样本量下都按正态分布算。两组输入永远都显示在屏幕上,由最上面那个下拉框决定这次读哪一组。
- 误差范围和标准误有什么区别?
- 标准误是「一个单位的不确定性」,误差范围是区间往外伸了几个单位。误差范围等于标准误乘以临界值,所以 95% 置信水平、样本又大时它大约是标准误的两倍(1.96 倍),99% 时约是两倍半(2.5758 倍)。两行都印出来正是为了让这两步看得见:想要更窄的区间,该动的是标准误那一行,因为只有它会对「多收数据」有反应;临界值只在改置信水平时才动。
- 区间会跑到 0% 以下或 100% 以上吗?
- 会,而且页面照印不误,不会悄悄替你截断。50% 配 2 个样本时上下界是 −19.3% 与 119.3%,这不是 bug:两个观测对比例几乎不提供信息,一个如实说出这件事的区间,比一个硬掰回比例该有的范围的区间更诚实。读法就是「这份样本在这里估不出任何有用的东西」,去多收点数据。页面真正拒绝的是把比例填成正好 0% 或 100%,因为这两点上公式要除以一个宽度为零的散布,会返回一个宽度为零的区间——那是这个方法给不出的确定性。
- 临界值表在哪?
- 这一页没有,这是有意的。临界值表在这里的用途已经全部做完了:你选一个置信水平,那个水平对应的唯一一个值就印在单独一行里。而且任何表都得挑一个置信水平来造,于是切到 99% 的读者面对的就是一张与上面面板打架的表——页面自己和自己矛盾,比不给表糟得多。t 分布还多一层麻烦:它的临界值同时取决于自由度和置信水平,要列就得列一整张网格而不是一张表。专门查临界值的那个工具才是该去的地方。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods(英文原版;本页乘在标准误上的那些临界值的出处,以及它们留在两侧的尾部面积) — 美国国家标准与技术研究院(NIST)
- Measures of Scale — e-Handbook of Statistical Methods, section 1.3.5.6(英文原版;标准误赖以搭起来的标准差,以及「从样本估出来的散布本身也是一个估计量」这件事) — 美国国家标准与技术研究院(NIST)
- 3.1 Terminology — Introductory Statistics 2e(英文原版;把相对频数当作概率的估计,也就是样本比例能代表总体比例的那一步) — OpenStax(莱斯大学)