跳到主要内容
CalcMax

标准差计算器

结果

2.1381

标准差

方差
4.5714
平均数
5.0000
离差平方和
32.0000
个数
8
总和
40.0000

标准差说的是这一组数离平均数大概有多远,单位与数据本身相同——按克称的一批零件,标准差也是克。把数字粘进来,一行一个,或者用分号、逗号、空格隔开,这一页会先给出个数、总和、平均数与离差平方和,再除以除数、最后开根号;开根号这一步正是把答案还原成你填进去的那个单位。除数取 n − 1 得到样本标准差,取 n 得到总体标准差,两个答案只差这一个除数。

公式

标准差 = √( Σ (xᵢ − x̄)² ÷ (n − 1) ),总体口径把同一个和除以 n

xᵢ
数据集里的一个数。每个数都是以「离平均数多远」的身份进入计算的,而把它平方,是为了让高于平均数的距离与低于平均数的距离不会互相抵消
x̄
这组数的平均数:所有数之和除以个数。它和答案一起印出来,方便逐步核对
n
这组数有几个,本页最多 200 个。样本口径除以 n − 1,总体口径除以 n,这就是两个标准差唯一的差别
Σ (xᵢ − x̄)²
离差平方和:每个数与平均数的距离先平方、再相加。它的单位是原单位的平方,这正是最后要开一次根号的原因
s
标准差,单位与原始数据相同。每个数都加上同一个常数,它不变;每个数都翻倍,它跟着翻倍

凡是需要用一个数代表一组数据的离散程度时就用它:同一个量的反复测量、考试成绩、每日营业额、一批零件的重量。手上的数只是更大总体的一份样本时用样本标准差,只有这串数本身就是全部时用总体口径。它也是把原始数值换算成 Z 分数的那一步,大多数离群值判据都建在它上面。有两件事它答不了:这组数的分布对不对称,以及某个极端值是不是敲错了——偏态的数据用四分位数与中位数描述比用标准差合适。另外,开根号这一步换来的东西值得说清:离差平方和带着平方单位,开根号才把它还原成原始数据的单位,而方差把单位平方了。

算例

  1. 八个数,样本与总体口径并排看

    1. 个数:8 个;总和:2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40
    2. 平均数:40 ÷ 8 = 5
    3. 各数与平均数的离差:−3、−1、−1、−1、0、0、2、4
    4. 离差平方和:9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32
    5. 样本方差:32 ÷ (8 − 1) = 4.5714
    6. 样本标准差:√4.5714 = 2.1381

    同一组数按总体口径算是 32 ÷ 8 = 4,标准差正好是 2。选错除数是「两个计算器给出不同标准差」最常见的原因,这里它让答案差了约 7%——数少时差得多,数多了差别就淡了。

  2. 五门课的成绩

    1. 总和:85 + 90 + 78 + 92 + 88 = 433,共 5 门
    2. 平均数:433 ÷ 5 = 86.6
    3. 离差平方和:2.56 + 11.56 + 73.96 + 29.16 + 1.96 = 119.2
    4. 样本方差:119.2 ÷ 4 = 29.8
    5. 样本标准差:√29.8 = 5.4589

    把离差与离差平方两行对着看:78 分那一门比平均数低 8.6 分,一个人就贡献了 73.96,比其余四门加起来还多。平方是远端的数获得权重的来源,也是「一门考砸」对标准差的影响大于对平均数的影响的原因。

  3. 只有三个数时,两个口径差得最远

    1. 总和:4 + 8 + 6 = 18,共 3 个数,平均数 6
    2. 离差:−2、2、0;平方:4、4、0,离差平方和为 8
    3. 总体方差:8 ÷ 3 = 2.6667
    4. 总体标准差:√2.6667 = 1.633

    三个数是这一页允许当作样本的最小规模,也正是除数最见效果的地方:样本口径把同一个 8 除以 2,给出 2 而不是 1.633,差了 20% 以上。样本标准差永远比总体标准差大,数据越多两者越接近。

局限

这是「一串数的算术标准差」,它没有加权的能力:一个数填一次就只算一次,频数表或加权调查要另换算法。它描述的是离散程度,不是形状——偏态的数据一边短一边拖着长尾,这时候标准差帮不上什么忙,四分位数与中位数更合适。每个数都算数,所以一个敲错的极端值会把答案整个抬上去。列表上限 200 个数。像 1,500 这样的写法会被拒收而不是替读者猜:夹在两个数字中间的逗号在有些国家是小数点、在另一些国家是千分位,判不了就不判,改写 1500 或 1.5 都可以。最后,这串数字在任何语言下都按同一个规则读,你用什么语言看这一页,都不会改变列表的含义。

常见问题

样本标准差与总体标准差差在哪?
只差一个除数。两者都从同一个离差平方和出发,样本口径除以 n − 1,总体口径除以 n。以 2、4、4、4、5、5、7、9 这八个数为例,离差平方和是 32,所以样本标准差是 √(32 ÷ 7) = 2.1381,总体标准差是 √(32 ÷ 8) = 2。样本的答案永远更大一些,数据越多两者越接近。
标准差怎么算?
五步。先把所有数加起来除以个数,得到平均数;再拿每个数减平均数,得到各自的离差;把每个离差平方——平方是为了让高于平均数的部分不与低于平均数的部分互相抵消;把平方加起来;最后除以 n − 1(样本)或 n(总体),再开根号。上面那个结果面板把个数、总和、平均数与离差平方和都印了出来,任何一步都可以单独核对。
为什么样本口径除的是 n − 1 而不是 n?
因为减掉的那个平均数是拿同一批数算出来的,每个数都把这个平均数往自己这边拉了一点。用「数据自己选出来的平均数」量离差,量出来的平均会比真实离散程度略小,除以 n 就会偏小;除以 n − 1 正是对这个偏差的修正。数少的时候修正最明显——三个数时差了 22%——数多了就几乎看不出来。
可以从表格里直接粘一列吗?
可以。换行、制表符、分号、空格,以及「逗号加空格」都算分隔符,所以从 Excel 粘一列、或者自己用分号敲一行都读得对。空段会被跳过而不是判错,所以末尾多一个换行没有影响。最多读 200 个数。有一种写法是故意拒收的:1,500 或 1.500 这种分隔符后面跟着三位数字的形状——它在有些国家是千分位、在另一些国家是小数点,判不了就不判,改写 1500 或 1.5 都可以。
标准差的单位是什么?
与数据本身的单位相同。按克称的一批零件,标准差也是克。这正是最后开一次根号换来的:离差平方和的单位是「克的平方」,方差也是,开了根号才回到克。用 NIST 的话说,标准差把离散程度的单位还原成原始数据的单位,而方差把单位平方了。也正因如此,标准差可以和数据摆在一起读,方差不能。
为什么我算出来和别人算的不一样?
十有八九是除数。不少计算器只给总体标准差、或者只给样本标准差,而且不写明是哪一种,先去看对方的文字里除的是 n − 1 还是 n。另外两种可能也值得排除:某个数用了小数逗号而被对方当成了分隔符;以及某个极端值一边算进去了一边没有——标准差对每一个数都敏感,多一个数就会变。

参考资料

相关计算器