Z 分数计算器
结果
Z 分数
- 与平均数之差
- 10.00
Z 分数说的是一个数在均值以上或以下几个标准差的位置,把不同尺度的东西拉到同一把尺子上:一次考试成绩、一个测量读数、一台仪器的示值,换算到这个尺度之后就都成了一个数。输入数值、它所在那组的均值与标准差,这个 Z 分数计算器会做一次减法、一次除法,报出 Z 分数,同时给出它离均值有多远这个原始读数。面板还会说明这个 Z 分数落在哪一档——从常见,到少见,再到离群候选。
四档,以及这个大小的 Z 分数该怎么读
| |z| 的取值范围 | 怎么读 |
|---|---|
| |z| ≤ 1 | 常见。正态分布里约 68% 的数值都落在离均值这么近的地方。 |
| 1 < |z| ≤ 2 | 仍然算常见——正态分布约 95% 落在两个标准差之内,所以不在中间的那些数值多半都在这一档。 |
| 2 < |z| ≤ 3 | 少见:正态分布里约 5% 跑到这么远,再往外只剩约 0.3%。值得回头看一眼这个测量本身。 |
| |z| > 3 | 在正态分布下属罕见,因此是离群值候选——先核对测量,再决定要不要采信它。小样本的例外见下方说明。 |
这四档就是经验法则、也就是 68-95-99.7 法则,只是把曲线下的面积改写成了 Z 分数的区间。用之前有两点要提醒。其一,那几个百分比是正态分布的性质:Z 分数对任何形状的数据都有定义,但上面的比例只描述正态分布,所以拖着长尾的数据集会对一点也不罕见的数值算出很大的 Z 分数。其二,界值是闭的——离均值正好三个标准差的数值算在第三档之内,因为那条法则说的是「超出」三个标准差。计算器用的是同一套界值,所以结果上的徽章与这张表不可能对不上。
公式
Z = (x − μ)÷ σ
- x
- 要定位的那个数值——那个测量值、那个分数、那个想摆到尺子上的读数
- μ
- 这个数值所属那一组数的均值。这一次减法把「绝对数值」变成了「离中间多远」
- σ
- 同一组数的标准差。除以它才是跨尺度可比的原因:Z 分数 1.5 在分数上和在毫米上说的是同一件事。它必须大于零
- x − μ
- 离均差。它也会单独印出来(取绝对值),让人先按原始单位读出这个差距,再看它被换算成了什么
- z
- Z 分数本身:数值在均值以下时为负、以上时为正。符号带着方向,大小带着这个数值有多不寻常
要比较来自不同尺度的数值时用它,这也是这个量存在的全部理由:班级平均 75 分时考 85 分,与平均 90 分时考 85 分,不是同一回事,而两个 Z 分数直接就把这件事说清楚了。它也是把一个读数放到参照人群里去定位的标准做法,以及绝大多数离群值规则的第一步。手上只有原始数据、没有均值与标准差时,先去标准差那一页算出这两个数再回来——这一页不会替你估。还有一点要记住:那几档标签背后的百分比来自经验法则,也就是 68-95-99.7 法则,而那条法则描述的是正态分布。中文教材把这条经验法则叫「3σ 原则」,说的也是「超出三个标准差才算离群」,只是它没有交代那几个百分比其实只在正态分布下成立。任何数值都有 Z 分数,但只有正态分布才谈得上「68% 落在 1 个标准差之内」。
算例
比班级平均分高一个标准差
- 离均差:85 − 75 = 10 分
- 除以标准差:10 ÷ 10 = 1
- Z 分数是 1,因为 85 高于 75 所以取正号
Z 分数正好等于 1 时落在第 1 档而不是第 2 档:经验法则说的是「落在 1 个标准差之内的比例」,所以这条界算在里面,68% 这个数就是挂在它上面的。10 分的差距与 Z 分数 1 是同一件事的两种说法,一种用考试的分数做单位、一种用离散程度做单位——这正是那次除法换来的东西。
正好三个标准差
- 离均差:105 − 75 = 30
- 除以标准差:30 ÷ 10 = 3
- 落在以 3 为上限的那一档,因为那条原则说的是「超出」三个标准差
这是最要紧、也最容易被弄错的一条界。离均值正好三个标准差,与超过三个标准差,不是一回事;那 0.3% 属于「超过」的情形。实践中这个区别有点吹毛求疵——真实测量很少正好落在界上——但它就是两档之间的分界,下面那张表把每条界都写清楚了。
低于均值,符号翻转
- 离均差:65 − 75 = −10,所以这个数值在均值以下 10 分
- 除以标准差:−10 ÷ 10 = −1
- Z 分数为负;它的大小与第一个例子相同,因为这个数值离均值的距离一样
符号是方向,大小才是大小。低于均值 10 分与高于均值 10 分,Z 分数分别是 −1 与 +1,两者同样不寻常——这也是分档看的是 Z 的绝对值、面板把距离印成正数的原因。两个数要一起读:符号说在哪一侧,距离说有多远。
局限
Z 分数只和喂给它的均值与标准差一样可靠:这一页把这两个数当成已知条件,无从核对,所以从错误的列里抄来的均值会让每个答案都错,而页面上没有任何异样。那几档背后的百分比描述的是正态分布,而真实数据常常不是——数据偏态时,一个很大的 Z 分数可能只说明这个分布拖着长尾,并不说明那个数值是离群值。还有一个值得知道的小样本陷阱:NIST 的 Detection of Outliers 指出,n 个数的样本里 Z 分数的最大值不超过 (n − 1) ÷ √n,所以数值少于十来个时 Z 分数根本到不了 3,以三个标准差为线的经验规则永远不会响。最后,标准差必须大于零:一组数里每个值都一样时就没有离散程度可言,这一页会报一次失败而不是给出答案。
常见问题
- Z 分数的公式是什么?
- Z =(x − μ)÷ σ:先拿数值减均值,再除以标准差。85 分、班级平均 75、标准差 10,就是(85 − 75)÷ 10 = 1。那次减法把这个数值放到以零为中心的尺子上,那次除法把它换算成「几个离散单位」——跨尺度可比靠的就是这一步。
- 我的数值离均值有几个标准差?
- 这正是 Z 分数报出来的东西:它的大小就是标准差的个数,符号说这个数值在均值的哪一侧。Z 分数 2.5 表示在均值以上两个半标准差,−0.4 表示在均值以下零点四个标准差。面板同时印出原始距离,所以你可以把「按原单位算的差距」与「换算后的倍数」摆在一起读。
- Z 分数多大才算高?
- 在正态分布下,约 68% 的数值落在一个标准差之内、95% 在两个之内、99.7% 在三个之内——这就是经验法则。所以 Z 分数超过 2 就不常见,超过 3 很罕见,这也是为什么离群候选一般以三个标准差为线。把这些数当成一个读数而不是判决:它们描述的是正态分布,而偏态的分布会给普通数值算出很大的 Z 分数。
- Z 分数和百分位数是一回事吗?
- 不是,但两者相关。Z 分数是以标准差为单位的距离,百分位数是在排好序的数值里的位置。两者互转需要知道分布的形状——正态分布下 Z 分数 1.645 对应第 95 百分位,而这个对应关系只在正态分布下成立。Z 分数本身不需要任何分布假设,这也是这一页报它而不报百分位数的原因。
- 标准差是 0 怎么办?
- 那就没有除数了,这一页会报一次失败而不是给出数字。标准差为 0 意味着这一组里每个数值都一模一样,于是没有任何数值离均值有距离,这个问题没有答案。印出一个 Infinity 或者把错误当成结果,都比直说更糟:这里的除零不会产出任何有意义的读数,页面宁愿告诉你这一点。
- 数据不是正态分布时还能用吗?
- Z 分数本身可以用:减去均值、除以标准差,无论数据是什么形状,这样得到的都是一个有效的相对位置度量。需要小心的是那几档标签。68-95-99.7 这几个百分比是正态分布的性质,拖着长尾的数据集会对并不罕见的数值算出远超 3 的 Z 分数。把分档当成「回头看一眼这个数值」的提示,而不是对它的判决。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- The Standard Normal Distribution — Introductory Statistics 2e, section 6.1(Z 分数是「离均值几个标准差」,以及经验法则:约 68% / 95% / 99.7% 落在一、二、三个标准差之内) — OpenStax(莱斯大学)
- Detection of Outliers — e-Handbook of Statistical Methods, section 1.3.5.17(基于 Z 分数的离群值规则,以及它在小样本上的失效与修正 Z 分数) — 美国国家标准与技术研究院(NIST)