中位数计算器
结果
中位数
- 中间两个值中较小的那个
- 4.0000
- 中间两个值中较大的那个
- 5.0000
- 个数
- 8
中位数是把数据从小到大排好之后站在正中间的那个值,它下面一半、上面一半。它也是唯一一个不会被单个极端值推动的中心:把最大的那个数改成原来的十倍,中位数纹丝不动。把数字粘进来,一行一个,或者用分号、逗号、空格隔开,这个中位数计算器会先排序,再给出正中间的值;个数是偶数时,它还会把用来取平均的那两个数一起印出来。这里不除以 n − 1 也不除以 n,所以没有「样本还是总体」要选。
公式
中位数 = 排序后正中间的那个值;个数是偶数时取中间两个的平均
- xᵢ
- 数据集里的一个数。只有它在排序后的位置参与计算,它离别的数多远完全不影响结果——这正是极端值动不了中位数的原因
- n
- 这组数有几个,本页最多 200 个。奇数个时正中间只有一个值,偶数个时有两个,取它们的平均
- Y₍ₖ₎
- 排序后第 k 个位置上的值。NIST 把偶数情形写成 (Y(N/2) + Y(N/2+1)) / 2,也就是这一页印在答案下面的那一对观测值
- Y₍ₙ/₂₎ 与 Y₍ₙ/₂₊₁₎
- 中间那两个值。把它们印出来是为了让上面那一步除法能用眼睛核对;奇数个数据时它们是同一个数——正中间确实只有一个值
- M
- 中位数本身。它的单位就是数据的单位;给每个数都加上同一个数,它跟着加同一个数,别的什么都不变
只要一个读数可能离谱、而你仍然想要一个典型值,就该用中位数:房价、收入、等待时间,凡是拖着一条长尾的都算。它数的是位置而不是大小,所以最大的那个数再离谱也推不动它——这正是它与平均数并存的理由。对于有序的等级(评分档、尺码)它也是更自然的中心,因为相邻两档之间的距离本来就没有意义,算不了平均。两件它答不了的事:离散程度,以及中间以外那些值的分布。数据的形状要紧时把它与四分位数一起报;另外在对称的数据上中位数与平均数会几乎重合,所以两者之间看得出来有距离,本身就是偏态的信号。
算例
偶数个数据:中间两个是 4 与 5
- 排序:2、4、4、4、5、5、7、9
- 共 8 个数,没有单独一个「正中间」,中间那一对是第 4 个与第 5 个
- 第 4 个是 4,第 5 个是 5
- 中位数:(4 + 5) ÷ 2 = 4.5
4.5 不是这组数里的任何一个,偶数个数据时这是常态。面板把 4 与 5 印在旁边就是为了这件事:没有这两个数,读者无法判断它取的是不是正确的那一对,也无从知道它有没有偷偷只取了其中一个。
奇数个数据,其中有一个离得很远
- 排序:3、7、9、12、40
- 共 5 个数,正中间是第 3 个
- 中位数:9——没有除法,因为正中间只有一个值
这五个数的平均数是 14.2,被 40 拽了上去;中位数是 9,对此毫不在意。把 40 换成 4000,平均数变成 806.2,而中位数仍然是 9。这就是偏态数据要报中位数的全部理由,而它不多花一点计算。
四个数,中位数根本不是数据里的值
- 排序:1、2、3、4
- 中间那一对是第 2 个与第 3 个:2 与 3
- 中位数:(2 + 3) ÷ 2 = 2.5
这一点上另有两种写法流传:取下面那个(2)或取上面那个(3),三种都能在教材里找到。这一页按 NIST 与 GB/T 3358.1 的一致做法取平均,与四分位数、百分位数两页同一条规则——所以这里的 2.5 在那两页上就是第二四分位数与第 50 百分位。
局限
中位数只有一个位置,因此几乎丢掉了数据其余的全部信息。两组数据可以有同一个中位数而形状完全两样——一组紧紧挤在它附近,一组从头到尾散开——所以中位数通常要与四分位数一起报,而不是单独出现。它必须先把数据排序,也就是要把每个数都读一遍才有答案。它也不说明数据里有哪些值:中位数是 9 只意味着中间站着一个 9 附近的数,不意味着 9 出现过。尺码、评分这类有序等级照样能算,但得到的答案是中间那一档,而不是一个可以相加的数。列表上限 200 个数。像 1,500 这样的写法会被拒收而不是替读者猜:夹在两个数字中间的逗号在有些国家是小数点,在另一些国家是千分位,改写 1500 或 1.5 都可以。分隔符规则在每种语言下都相同:数字按输入的原样读,语言不影响列表的含义。
常见问题
- 中位数怎么算?
- 把数字从小到大排好,再数个数。奇数个数据正中间只有一个——7 个数就是第 4 个;偶数个数据正中间有两个,取它们的平均:1、2、3、4 的中间一对是 2 与 3,中位数就是 2.5。整个方法就这两步。面板上印着个数、中间那两个值与答案,每一步都能单独核对,不必重排一遍。
- 为什么中位数有时候不在我的数据里?
- 因为偶数个数据没有单独一个正中间,中位数是夹在中间那两个数的平均。上面的 4.5 不是那八个数里的任何一个,却正是正确答案——它下面一半、上面一半。中间那两个值就印在结果旁边,为的就是让这件事看起来不像出错。
- 什么时候该用中位数而不是平均数?
- 当某个极端读数可能把画面带偏的时候:收入、房价、等待时间,凡是某一侧拖着长尾的都算。平均数把每个数都加了进去,所以离群的那个会把它拽走;中位数只数两侧各有多少个数,同一个数对它毫无影响。数据对称时两者几乎重合,所以它们之间看得出差距,本身就是数据偏态的线索。
- 可以从表格里直接粘一列吗?
- 可以。换行、制表符、分号、空格,以及「逗号加空格」都算分隔符,从 Excel 粘一列直接就能读,空段会被跳过而不是判错。最多读 200 个数。像 1,500 或 1.500 这样的写法是故意拒收的:分隔符后面跟着三位数字,在有些国家是千分位、在另一些国家是小数点,改写 1500 或 1.5 都可以。
- 中位数分样本与总体吗?
- 不分,这一页也故意没有那个下拉框。n − 1 那个修正属于离散程度——它是对离差平方和除以个数时做的修正;中位数什么都不除,它取的是位置。一串数是样本还是全部,中间那个值都是中间那个值。需要区分这两个口径的是标准差与方差那两页,在那里除数确实会改变答案。
- 同一组数据在别的工具里算出的中位数为什么不一样?
- 几乎总是偶数个数据时的规则不同。流传的写法有三种:取中间两个的平均、取下面那个、取上面那个。1、2、3、4 在这三种写法下分别是 2.5、2、3。这一页按 NIST 给出的定义与 GB/T 3358.1 的做法取平均,并把中间那两个值印出来,用的是哪一对一眼就能看到。另一个少见得多的原因是某个数写成了小数逗号,而那个工具把它当成了分隔符。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1(中位数的定义,偶数情形写作 (Y(N/2) + Y(N/2+1)) / 2) — 美国国家标准与技术研究院(NIST)
- Measures of the Center of the Data — Introductory Statistics 2e, section 2.5(中位数在有极端值时比平均数更合适) — OpenStax(莱斯大学)