中程数计算器
结果
中程数
- 平均数
- 5.0000
- 最小值
- 2.0000
- 最大值
- 9.0000
- 个数
- 8
中程数是一组数据里最远的两个点的中点:最小值加最大值再除以二。这个中程数计算器把它与平均数并排印出来,而这两个数的差距正是这一页要说的事。它是一个位置量——回答的是「这组数据大致落在哪儿」,与平均数、中位数回答的是同一个问题,不是离散程度。因为它只由最外面的两个值决定、中间的数一个都不看,它是三个位置量里最不稳健的一个:普通的一组数给它 5.5、给平均数 5,而改动一个数就能让它从 5.5 跳到 46,平均数却几乎不动。
公式
中程数 = (最小值 + 最大值) / 2
- 最小值
- 这组数里最小的那个。只有它与最大值进入算式,所以中间那些数怎么变都不会影响结果
- 最大值
- 这组数里最大的那个。算之前值得先核对这两个极值,因为抄错一位数会直接落进结果里
- 中程数
- 两个极值的中点,单位与数据相同。它总是落在最小值与最大值之间;一组数只有一个观测值时,它与那个值重合
- 平均数
- 算术平均,印在中程数旁边作对照。两者的差距说明有多少数据偏离了两端的中间位置
两端本身就是主题的时候,中程数是最合适的汇总:一天里最高与最低气温的中点、一年里河流最高与最低水位的中点、一场比赛最好与最差成绩的中点、一个报价与一个要价的中点。这些场景里两个端点就是数据本身——你不是从更大的总体里抽样,而是在描述一个有两个端点的区间。数据内部要紧的时候它就不合适,因为它把两个点之外的全部丢掉,在任何真实样本上它的方差都比平均数和中位数大。它也不等于中位数:对于 2、4、4、4、5、5、7、9,中位数是 4.5 而中程数是 5.5,两者只在数据关于中心对称时才重合。手边只有一张最高最低值表、又只需要一个大概的中心位置时,它是最省事的选择——不需要再做任何计算。
算例
八个数的中程数是 5.5,平均数是 5
- 最小值是 2,最大值是 9
- 中程数 = (2 + 9) / 2 = 5.5
- 同一组数的平均数是 40 / 8 = 5——低了半个单位,因为八个数里有六个落在它或它以下
两个数不一致,而这正是有用的地方。中程数只看得见这组数从 2 起、到 9 止;平均数还看得见数据是往小的那头挤的。两个都没错,它们回答的是不同的问题,一起印出来就能一眼看出:这组数是在两个端点之间铺得挺匀,还是偏向了一边。
改动一个数:中程数涨了一倍还多
- 只把最大值从 9 改成 90,另外七个数与第一例完全相同
- 中程数 = (2 + 90) / 2 = 46
- 同一组数的平均数是 121 / 8 = 15.125,改动前是 5
中程数移动了四十多个单位,平均数只移动了十个。极端值每变化一点,中程数就吃进一半,没有任何东西替它摊薄;平均数则把同样的变化分摊到每一个数上。如果你这组数据里有一个读数不可靠,中程数就会错掉那个误差的一半——这也正是它只该用在「两端就是重点」的场合的原因。
跨过零点的气温
- 最冷的读数是 −10,最暖的是 40
- 中程数 = (−10 + 40) / 2 = 30 / 2 = 15
- 负数不需要特殊处理:它们是加在最大值上的,所以跨零点的数据与不跨零点的完全一样算
气象服务报的「日中程温度」就是这个数:当天最低温与最高温的中点,而不是逐小时读数的平均值。这个约定值得知道,因为只要气温停留在区间某一端的时间更长,这两个数就会不一样。
局限
中程数不稳健,而且原因是结构性的、不是程度问题:它由最远的两个点算出来,所以面对抄错的一位数字、仪器的一次抖动、一个确实异常的观测,它没有任何抵御能力。它通常只在「两端的行为本身才是重点」的场合才用。它也不是中位数——中位数是排序后落在中间的那个值,中程数是两端的中点,两者只在数据关于中心对称时才重合。一组数只有一个观测值时,中程数、平均数、最小值、最大值都是那一个数。列表上限 200 个数,而 1,500 这种写法会被直接拒绝而不是猜:「数字中间一个逗号」在一些国家是小数点,在另一些国家是千位分隔符。这一页不标记离群点:定义中程数的那两个极值,恰恰是这种规则要去检验的值。
常见问题
- 中程数怎么算?
- 把最小的那个数与最大的那个数相加,再除以二:中程数 = (最小值 + 最大值) / 2。对 2、4、4、4、5、5、7、9 这组数就是 (2 + 9) / 2 = 5.5。其余的数一个都不参与,所以你不需要排序,只要找出两端——数据不多时扫一眼就够了。上面的计算器会把用到的最大值与最小值一起印出来,方便核对那一步加法。
- 中程数是一个位置量还是离散程度?
- 它是位置量——和平均数、中位数一样,用来说数据大致落在哪儿。它很容易被当成离散程度,因为定义它的那两个极值同时也是极差的定义者,而且两条公式只差一个运算:极差是最大值减最小值,中程数是(最大值加最小值)除以二。它们回答的是不同的问题:极差说这组数有多宽,中程数说它的中间在哪儿。权威来源把它列在位置量那一条清单里,而不在离散程度那一条里。
- 为什么说中程数不稳健?
- 因为它由样本里最远的两个值算出来,别的一概不算,所以这两个值里任何一个出错都会直接进结果,而且只被吸收掉一半。把例子里的 9 换成 90,中程数就从 5.5 跳到 46,而平均数只从 5 变成 15.125。这个敏感性在「两端就是你要测的东西」时是优点——比如当天最高最低气温;在其他场合就是负担。
- 中程数和中位数是一回事吗?
- 不是。中位数是排序后落在中间的那个值,八个数的中位数是第四、第五个的平均:(4 + 5) / 2 = 4.5。中程数是两端的中点:(2 + 9) / 2 = 5.5。两者只在数据关于中心对称时才相等,而它们的差距本身就有信息——这里中程数高于中位数,说明上半部分的数据离中心比下半部分更远。
- 什么场合真的会用中程数?
- 两个端点就是数据本身、而不是从更大总体里抽出来的样本的时候。气象里报当天最高最低温的那份摘要描述的正是中程数;制造业的公差检验也是——规格给了一个下限和一个上限,你要的是它们的中心。手边只记了极值的时候它也很好用:一张表上只有最便宜与最贵的报价,中程数就是那个区间的中点,不需要知道中间那些价格是多少。
- 所有数都相同、或者只有一个数时会怎样?
- 两种情况都算得出来,而且都给那个相同的值。只有一个数 42 时,最小值与最大值都是 42,于是中程数、平均数、最小值、最大值全是 42——这条算式本来就不需要第二个观测值。3、3、3、3 同理:两端相等,中程数是 3。这里没有「至少几个数」的限制,与方差和标准差不同,那两个要除数、因此需要不止一个观测。
参考资料
- Measures of Location — NIST/SEMATECH e-Handbook of Statistical Methods, section 1.3.5.1(把中程数列在备选的位置量里,写作 (smallest + largest)/2;并指出它由两个最远的点决定、因此不稳健,通常只在两端本身有意义时使用) — National Institute of Standards and Technology(美国国家标准与技术研究院)
- Measures of Scale — NIST/SEMATECH e-Handbook of Statistical Methods, section 1.3.5.6(同一手册里离散程度的清单,中程数不在其中——这一页把它当位置量的依据) — National Institute of Standards and Technology(美国国家标准与技术研究院)
- GB/T 3358.1-2009 统计学词汇及符号 第 1 部分:一般统计术语与用于概率的术语(覆盖位置统计量的术语标准;记录页注明不提供在线全文) — 国家市场监督管理总局