跳到主要内容
CalcMax

样本量计算器

范围:0 – 100

范围:0 – 100

最小值:0

结果

385

所需样本量

临界值
1.9600

样本量计算器回答的是调查开始之前那个问题:要达到你能接受的误差范围,需要多少份回复?给出置信水平、目标误差范围,以及你对预期比例的粗略估计,它给出满足这个目标的最小样本量。公式就是误差范围调转方向——与置信区间那一页用的是同一条关系,只是解的是样本量而不是区间宽度。问卷调查覆盖的总体很小时,有限总体修正会把答案压下来,对一个公司或一所学校来说,压下来的幅度相当大。

公式

n₀ = z² · p (1 − p) / e² 总体较小时: n = n₀ / ( 1 + (n₀ − 1) / N )

z
置信水平对应的临界值——95% 是 1.9600,90% 是 1.6449,99% 是 2.5758。它单独占一行,因为它是公式里唯一由置信水平决定、而不是由你对总体的假设决定的数
p
你预计会看到的比例,写成小数。它是唯一一个靠猜的输入,而且以 p(1 − p) 的形式进入算式,这个乘积在 p = 0.5 时最大——所以填 50% 是产出最大样本量的那种假设,也是最稳妥的那一种
e
误差范围,写成小数——你愿意接受的那半个区间宽度,与比例同一个量纲。它在分母上被平方,所以把它减半大致会让样本量变成四倍
n₀
总体大到「总体有多少人」不影响答案时的样本量。总体未知时它就是答案;总体已知时它只是修正那一步的输入,不是最终答案
N
总体的人数,未知或实际上无限大时填 0。修正那一步是拿 n₀ 去除以一个比 n₀/N 稍大的数,所以修正后的样本量总落在 N 以内——问出比总人数还多的人,是这条公式产生不了的风险

在收数据之前用它,只要样本本身的成本是真实的——每份回复都要给激励的问卷、按样品收费的实验、有招募目标的临床研究。决定的顺序是:先定你能接受的误差范围,再定置信水平,然后猜一个比例,最后读样本量。这三件里只有第一件是关于这项研究的判断,另外两件是惯例或者猜测。如果算出来的答案负担不起,诚实的做法是把误差范围放宽并在报告里写明,因为一个你出不起钱的误差范围不是一个目标。总体真的不大时(几千人以内)一定要填总体人数,那里的修正相当可观,忽略它意味着你要去招募远超过研究需要的人。

算例

  1. 全国性调查,95% 置信水平、±5 个百分点

    1. 95% 置信水平下的临界值:1.96
    2. p = 0.5 时乘积 p(1 − p) = 0.25,是它可能取到的最大值
    3. n₀ = 1.96² × 0.25 / 0.05² = 3.8416 × 0.25 / 0.0025 = 384.1459
    4. 向上取整到整人:385 份回复

    385 就是「一千人左右的调查误差在三个点上下」这句话背后的数——把误差收紧到 ±3,答案变成 1068,那个说法也是从这儿来的。总体人数留在 0,因为全国性调查相对全国人口是微不足道的一份,这个比例下修正带来的差别不到一个人。

  2. 同一项调查,误差收紧到 ±3 个百分点

    1. 临界值仍是 1.96,因为置信水平没变
    2. n₀ = 1.96² × 0.25 / 0.03² = 0.9604 / 0.0009 = 1067.0719
    3. 向上取整:1068 份回复
    4. 与 385 相比:误差缩小到 1/1.667,样本量涨到 2.78 倍,正好是 1.667²

    精度是平方着买的。从 ±5 到 ±3 个百分点不是多干 67% 的活,而是多干 178%,因为误差范围在分母上被平方。实际后果是「便宜的精确度」有一个地板:对外声称的误差比 ±3 个百分点更紧,就意味着样本量得上千——而那恰好是非答复偏差开始比公式正在控制的抽样误差更重要的量级。

  3. 一千名员工的公司做员工调查

    1. 未修正的数字仍是 384.1459,这一步还不知道总体有多少人
    2. 修正:384.1459 / ( 1 + 383.1459 / 1000 ) = 384.1459 / 1.3831459 = 277.73
    3. 向上取整:278 名员工
    4. 这是全体员工的 28%,而未修正的数字意味着 38%

    有限总体修正正是让小总体调查做得起的那一步:278 而不是 385,同样的误差范围省下一百多次访谈。样本占总体比例越大,它省得越多。100 名员工时答案是 80——你不可能抽到比总数还多的人;而一百万员工时修正只值一个人,所以「总体未知就填 0」是一个合理的默认值,不是图省事。

局限

这条公式算的是「多少份回复」,不是「发多少份邀请」。如果被问到的人里有三分之一不回,385 份回复就意味着要发出去约 580 份;而如果回复的人与不回复的人系统性地不同,任何样本量都修不好由此产生的偏差,它只能让抽样误差变得比总误差小。模型还假定每份回复都是从总体里独立抽出来的,这在整群抽样下不成立:从 8 个班抽出 400 名学生,有效样本量更接近 8,用这个页面算出的数之前要先乘一个设计效应。这个估计针对单个比例;要估计均值就得有标准差,而这一页不收它;而一份要拆成子组分析的问卷,样本量该按最小的那个子组来定,不是按全体。最后,面板上给的三档置信水平都是惯例,没有一个能替你兜住一项真实分析通常会做的多次比较。

常见问题

问卷调查到底需要多少份回复?
按惯例的 95% 置信水平、±5 个百分点,答案是 385;要 ±3 个百分点就是 1068。这两个数覆盖了公开发表的调查里的绝大多数情形,它们都假定总体大到「总体有多少人」无关紧要。如果总体小到你有把握调查其中很大一份,把人数填进去,修正会把数字降下来:1000 名员工需要 278 份而不是 385 份,200 名员工需要 132 份。先把误差范围锚定下来,因为那才是读者真正会看的数。
为什么预期比例默认是 50%?
因为 p(1 − p) 在 p = 0.5 时最大,而样本量与它成正比,所以填 50% 得到的是任何比例下所需的最大样本量。这让它成为你确实不知道时的稳妥假设:调查回来是 60% 时,实际误差范围会比计划的略好一点。填得更准是有回报的——p = 90% 时这一项从 0.25 掉到 0.09,同样的误差范围只需要 36% 的样本量。只有当你手上有站得住脚的先验(比如同一项调查的上一轮)时才填别的值。
有限总体修正在做什么?
当总体小到「不放回地抽取」会实打实地减少不确定性时,它把样本量压下来。效果取决于你抽了总体的多大一份:抽 10% 时修正值百分之几的样本,抽 28% 时它值四分之一,抽到 50% 时它值接近三分之一。总体人数未知或者非常大时填 0,总体在几千人以内时填真实数字——这是最容易推翻一个已经算好的答案的那个字段。
误差范围和置信水平该定成多少?
绝大多数公开研究用 95% 置信水平配 ±5 个百分点,结论取决于细微差别的场合用 ±3 个百分点,只有大差别才要紧的探索性工作用 ±10 个百分点。置信水平这一侧,95% 是惯例,99% 要多花约 73% 的样本,换来的区间只窄三分之一。收紧任何一项之前先看答案的代价:99% 置信水平配 ±3 个百分点需要 1843 份回复,大约是默认值的五倍。如果负担不起,报一个更宽的误差范围,而不是去招募一个你招不满的样本。
为什么答案要向上取整到整人?
因为带小数的那个数是精确的算术结果,整数才是能招募到的人,而把前者变成后者的两种惯例方向相反。四舍五入可能把 384.1459 舍成 384,恰好差一点点达不到你要求的目标误差范围——而那个目标正是你要的东西。向上取整保证误差范围被满足或超额满足,最多多花一次访谈,而且与研究方案里写样本量的方式一致:385 是一个承诺,384.1459 是一个中间值。
为什么这一页没有样本量对照表?
因为这里大家想要的那张表是「置信水平 × 误差范围」的一张网格,而那张网格正是上面面板在算的东西。固定按 95% 印一张表,你一切到 99% 它就和面板打架,而页面自相矛盾比不给表糟得多——读者还得自己决定两个数里信哪一个。第二个原因是表连比例也得替你先定死,而 50% 只在它仍然是那个稳妥默认值的时候才是对的。改置信水平、误差范围、比例或总体人数,答案会重算,这正是大家在找的那张表的全部内容。

参考资料

相关计算器