跳到主要内容
CalcMax

Z 分数计算器

结果

1.001 个标准差之内

Z 分数

与平均数之差
10.00

Z 分数说的是一个数在均值以上或以下几个标准差的位置,把不同尺度的东西拉到同一把尺子上:一次考试成绩、一个测量读数、一台仪器的示值,换算到这个尺度之后就都成了一个数。输入数值、它所在那组的均值与标准差,这个 Z 分数计算器会做一次减法、一次除法,报出 Z 分数,同时给出它离均值有多远这个原始读数。面板还会说明这个 Z 分数落在哪一档——从常见,到少见,再到离群候选。

四档,以及这个大小的 Z 分数该怎么读

|z| 的取值范围怎么读
|z| ≤ 1常见。正态分布里约 68% 的数值都落在离均值这么近的地方。
1 < |z| ≤ 2仍然算常见——正态分布约 95% 落在两个标准差之内,所以不在中间的那些数值多半都在这一档。
2 < |z| ≤ 3少见:正态分布里约 5% 跑到这么远,再往外只剩约 0.3%。值得回头看一眼这个测量本身。
|z| > 3在正态分布下属罕见,因此是离群值候选——先核对测量,再决定要不要采信它。小样本的例外见下方说明。

这四档就是经验法则、也就是 68-95-99.7 法则,只是把曲线下的面积改写成了 Z 分数的区间。用之前有两点要提醒。其一,那几个百分比是正态分布的性质:Z 分数对任何形状的数据都有定义,但上面的比例只描述正态分布,所以拖着长尾的数据集会对一点也不罕见的数值算出很大的 Z 分数。其二,界值是闭的——离均值正好三个标准差的数值算在第三档之内,因为那条法则说的是「超出」三个标准差。计算器用的是同一套界值,所以结果上的徽章与这张表不可能对不上。

公式

Z = (x − μ)÷ σ

x
要定位的那个数值——那个测量值、那个分数、那个想摆到尺子上的读数
μ
这个数值所属那一组数的均值。这一次减法把「绝对数值」变成了「离中间多远」
σ
同一组数的标准差。除以它才是跨尺度可比的原因:Z 分数 1.5 在分数上和在毫米上说的是同一件事。它必须大于零
x − μ
离均差。它也会单独印出来(取绝对值),让人先按原始单位读出这个差距,再看它被换算成了什么
z
Z 分数本身:数值在均值以下时为负、以上时为正。符号带着方向,大小带着这个数值有多不寻常

要比较来自不同尺度的数值时用它,这也是这个量存在的全部理由:班级平均 75 分时考 85 分,与平均 90 分时考 85 分,不是同一回事,而两个 Z 分数直接就把这件事说清楚了。它也是把一个读数放到参照人群里去定位的标准做法,以及绝大多数离群值规则的第一步。手上只有原始数据、没有均值与标准差时,先去标准差那一页算出这两个数再回来——这一页不会替你估。还有一点要记住:那几档标签背后的百分比来自经验法则,也就是 68-95-99.7 法则,而那条法则描述的是正态分布。中文教材把这条经验法则叫「3σ 原则」,说的也是「超出三个标准差才算离群」,只是它没有交代那几个百分比其实只在正态分布下成立。任何数值都有 Z 分数,但只有正态分布才谈得上「68% 落在 1 个标准差之内」。

算例

  1. 比班级平均分高一个标准差

    1. 离均差:85 − 75 = 10 分
    2. 除以标准差:10 ÷ 10 = 1
    3. Z 分数是 1,因为 85 高于 75 所以取正号

    Z 分数正好等于 1 时落在第 1 档而不是第 2 档:经验法则说的是「落在 1 个标准差之内的比例」,所以这条界算在里面,68% 这个数就是挂在它上面的。10 分的差距与 Z 分数 1 是同一件事的两种说法,一种用考试的分数做单位、一种用离散程度做单位——这正是那次除法换来的东西。

  2. 正好三个标准差

    1. 离均差:105 − 75 = 30
    2. 除以标准差:30 ÷ 10 = 3
    3. 落在以 3 为上限的那一档,因为那条原则说的是「超出」三个标准差

    这是最要紧、也最容易被弄错的一条界。离均值正好三个标准差,与超过三个标准差,不是一回事;那 0.3% 属于「超过」的情形。实践中这个区别有点吹毛求疵——真实测量很少正好落在界上——但它就是两档之间的分界,下面那张表把每条界都写清楚了。

  3. 低于均值,符号翻转

    1. 离均差:65 − 75 = −10,所以这个数值在均值以下 10 分
    2. 除以标准差:−10 ÷ 10 = −1
    3. Z 分数为负;它的大小与第一个例子相同,因为这个数值离均值的距离一样

    符号是方向,大小才是大小。低于均值 10 分与高于均值 10 分,Z 分数分别是 −1 与 +1,两者同样不寻常——这也是分档看的是 Z 的绝对值、面板把距离印成正数的原因。两个数要一起读:符号说在哪一侧,距离说有多远。

局限

Z 分数只和喂给它的均值与标准差一样可靠:这一页把这两个数当成已知条件,无从核对,所以从错误的列里抄来的均值会让每个答案都错,而页面上没有任何异样。那几档背后的百分比描述的是正态分布,而真实数据常常不是——数据偏态时,一个很大的 Z 分数可能只说明这个分布拖着长尾,并不说明那个数值是离群值。还有一个值得知道的小样本陷阱:NIST 的 Detection of Outliers 指出,n 个数的样本里 Z 分数的最大值不超过 (n − 1) ÷ √n,所以数值少于十来个时 Z 分数根本到不了 3,以三个标准差为线的经验规则永远不会响。最后,标准差必须大于零:一组数里每个值都一样时就没有离散程度可言,这一页会报一次失败而不是给出答案。

常见问题

Z 分数的公式是什么?
Z =(x − μ)÷ σ:先拿数值减均值,再除以标准差。85 分、班级平均 75、标准差 10,就是(85 − 75)÷ 10 = 1。那次减法把这个数值放到以零为中心的尺子上,那次除法把它换算成「几个离散单位」——跨尺度可比靠的就是这一步。
我的数值离均值有几个标准差?
这正是 Z 分数报出来的东西:它的大小就是标准差的个数,符号说这个数值在均值的哪一侧。Z 分数 2.5 表示在均值以上两个半标准差,−0.4 表示在均值以下零点四个标准差。面板同时印出原始距离,所以你可以把「按原单位算的差距」与「换算后的倍数」摆在一起读。
Z 分数多大才算高?
在正态分布下,约 68% 的数值落在一个标准差之内、95% 在两个之内、99.7% 在三个之内——这就是经验法则。所以 Z 分数超过 2 就不常见,超过 3 很罕见,这也是为什么离群候选一般以三个标准差为线。把这些数当成一个读数而不是判决:它们描述的是正态分布,而偏态的分布会给普通数值算出很大的 Z 分数。
Z 分数和百分位数是一回事吗?
不是,但两者相关。Z 分数是以标准差为单位的距离,百分位数是在排好序的数值里的位置。两者互转需要知道分布的形状——正态分布下 Z 分数 1.645 对应第 95 百分位,而这个对应关系只在正态分布下成立。Z 分数本身不需要任何分布假设,这也是这一页报它而不报百分位数的原因。
标准差是 0 怎么办?
那就没有除数了,这一页会报一次失败而不是给出数字。标准差为 0 意味着这一组里每个数值都一模一样,于是没有任何数值离均值有距离,这个问题没有答案。印出一个 Infinity 或者把错误当成结果,都比直说更糟:这里的除零不会产出任何有意义的读数,页面宁愿告诉你这一点。
数据不是正态分布时还能用吗?
Z 分数本身可以用:减去均值、除以标准差,无论数据是什么形状,这样得到的都是一个有效的相对位置度量。需要小心的是那几档标签。68-95-99.7 这几个百分比是正态分布的性质,拖着长尾的数据集会对并不罕见的数值算出远超 3 的 Z 分数。把分档当成「回头看一眼这个数值」的提示,而不是对它的判决。

参考资料

相关计算器