极差计算器
结果
极差
- 最小值
- 2.0000
- 最大值
- 9.0000
- 个数
- 8
极差是一组数据里最远的两个点之间的距离:最大值减最小值。这个极差计算器把那个差连同它由之算出的最大值与最小值一起印出来,因为单看一个跨度说不清数据在哪儿——极差 7 既可以是 2 到 9,也可以是 1002 到 1009。它是最省事的离散程度,也是唯一只由两个数决定的那个:把中间任何一个数改掉,极差一动都不动。中文教材里它有时也叫「全距」,指的是同一个量。
公式
极差 = 最大值 − 最小值
- 最大值
- 这组数里最大的那个值。整组数里只有它与最小值参与计算,所以两点之间的数怎么打乱都不影响答案
- 最小值
- 这组数里最小的那个值。它与最大值一起框出整个跨度,这也是极差被称作「只由极端值决定」的原因
- 极差
- 装得下全部数据的那个区间的宽度,单位与数据相同。它不会是负数,而当且仅当每一个数都相同时它等于 0
- n
- 这组数有几个,本站上限 200 个。它对答案没有任何影响——印出来只是让你确认整组数据都被读进去了
只要一行就能说清跨度、而且两端本身就是重点的时候,就用极差:一天里最高与最低气温的差、同一件东西最贵与最便宜的报价之差、一场比赛里最好与最差成绩的差。它也是一些只看两端的场景里最诚实的汇总,比如公差检验——轴要么落在允许区间里,要么不落。中间那段数据要紧的时候它就不合适了。因为它只取两个值、把其余全丢掉,一个离群的读数造成的移动与整组数据真实发生的位移一样大,标准差与四分位距正是为这件事而存在的:那两个量把影响摊到更多数据上,长尾数据里也照样能用。极差与平均数并排出现通常是个警告信号(除非数据很少),而与最大值、最小值并排出现,就像上面那样,只是把两端描述了一遍。
算例
八个数的极差是 7
- 排序:2、4、4、4、5、5、7、9——最小值是 2,最大值是 9
- 极差 = 9 − 2 = 7
- 中间那六个数(4、4、4、5、5、7)完全没有参与计算
这八个数其实都挤在中间三个单位之内,极差却报出 7,因为它量的是整个跨度,不是挤在一起的那一段。「这组数铺得多开」与「这些数挨得多紧」之间的这道缝隙,正是通常还要再报一个离散程度的原因。
只挪动一个数:极差跳到 88
- 只把最大值从 9 改成 90,另外七个数与第一例完全相同
- 极差 = 90 − 2 = 88
- 同一组数的样本标准差是 30.2864,改动前是 2.1381
两个量都涨了,但涨的原因不同。极差正好移动了那个极端值移动的距离,因为决定它的就是两端那两个点,别的一概不算。标准差被八个数分摊,所以同样一次改动被另外七个数吸收、摊薄了。一个数抄错一位,就足以让极差失去意义;要让标准差动到那个程度,得是数据本身真的变了。
带负数与小数的一组
- 最小值是 −5,最大值是 10——负号是数值的一部分,所以跨度要跨过 0
- 极差 = 10 − (−5) = 10 + 5 = 15
- 负数与正数完全一样处理:减去最小值等于加上它的绝对值,两个负号抵消掉了
减去一个负数是最容易手算出错的一步,而数据跨过 0 的时候答案会明显比两个端点都大。零下的气温、海平面以下的海拔、账户余额,都是同一回事。
局限
极差只用到整组数据里的两个数,所以一个极端的读数就能完全决定它:一次打错字、一次仪器抖动、一个确实异常的日子,这个数就按误差的全额移动。它对数据中间那一段也一无所知,而多数数值通常正落在那里——最小值和最大值相同的两组数据,可以铺得很均匀,也可以全挤成一堆,极差分不出来。跨数据集比较极差只在单位可比、样本量也大致相当的时候才有意义,因为样本越大越容易撞上一个极端值。列表上限 200 个数,而 1,500 这种写法会被直接拒绝而不是猜:「数字中间一个逗号」在一些国家是小数点,在另一些国家是千位分隔符。这一页不标记离群点:极差恰恰是最不该用来做这件事的量,因为它的定义本身就建立在你要检验的那些极端值上。
常见问题
- 极差怎么算?
- 找出这组数里最大的那个和最小的那个,然后相减:极差 = 最大值 − 最小值。对 2、4、4、4、5、5、7、9 这组数就是 9 − 2 = 7。其余的数一个都不参与,所以你既不必排序,也不必先数一共有几个——只是数据多的时候,排一下序是找出两端最稳妥的办法。上面的计算器照你粘贴进去的数字直接算,并把最大值与最小值一起印出来,方便核对那一步减法。
- 为什么一个数就能把极差带偏?
- 因为它的定义只用到最远的两个点,其余全部忽略。把上面例子里的 9 换成 90,极差就从 7 变成 88——涨了 81,正好是那个数移动的距离。同一组数据的样本标准差只是从 2.1381 涨到 30.2864,因为八个数各占一份。这不是公式的缺陷,这正是「这组数铺了多宽」这句话的意思。但它意味着报极差时应当一并说明这组数有多少个。
- 极差和四分位距是一回事吗?
- 不是,两者回答的是不同的问题。极差是数据的整个宽度,从最小值到最大值。四分位距是中间那一半的宽度,从第一四分位数到第三四分位数。四分位距有意对尾部不敏感,极差有意对尾部敏感,所以两个都报出来,读者就用两个数同时拿到了整体宽度与中间密集区的宽度。只能报一个的时候,先问问自己:这组数据里那个极端的读数是真有意义,还是一个错误?
- 极差和「样本还是总体」有关系吗?
- 没有关系,这也正是这一页没有那个下拉框的原因。那个选择只影响要除数的量——方差与标准差——因为它们的分母在样本与总体之间不同。极差是一次减法,没有分母可以分歧。方差与标准差那两页都带那个下拉框;放在这一页什么都不会改变,反而会让人以为它改变了什么。
- 极差会是负数或者 0 吗?
- 永远不会是负数:最大值按定义不会小于最小值,所以相减的结果是 0 或者正数。当且仅当每一个数都相同时它等于 0,其中也包括只有一个数的情况——那时最大值与最小值都是那个数,极差为 0。这里的 0 是算得出来的真答案,不是失败信号,它说的是这组数据完全没有离散。一个数也照样能算,因为这条算式本来就不需要第二个观测值。
- 这一页会告诉我哪些数是离群值吗?
- 不会。判断可疑离群点的通行规则是建立在四分位距之上的——某个值比第一四分位数低出 1.5 × IQR 以上,或者比第三四分位数高出 1.5 × IQR 以上——那是一个单独的计算器。用极差来做这件事会陷入循环:极差正是由你要检验的那些极端值定义的,任何一组数据的最小值与最大值按定义就是它最极端的两个点。这一页只描述这组数有多宽,判断留给为判断而做的那个工具。
参考资料
- Measures of Scale — NIST/SEMATECH e-Handbook of Statistical Methods, section 1.3.5.6(把极差定义为最大值减最小值,并指出数据中心附近的离散程度完全没有被它捕捉到) — National Institute of Standards and Technology(美国国家标准与技术研究院)
- GB/T 3358.1-2009 统计学词汇及符号 第 1 部分:一般统计术语与用于概率的术语(覆盖极差及其他离散程度的术语标准;记录页注明不提供在线全文) — 国家市场监督管理总局