跳到主要内容
CalcMax

中位数计算器

结果

4.5000

中位数

中间两个值中较小的那个
4.0000
中间两个值中较大的那个
5.0000
个数
8

中位数是把数据从小到大排好之后站在正中间的那个值,它下面一半、上面一半。它也是唯一一个不会被单个极端值推动的中心:把最大的那个数改成原来的十倍,中位数纹丝不动。把数字粘进来,一行一个,或者用分号、逗号、空格隔开,这个中位数计算器会先排序,再给出正中间的值;个数是偶数时,它还会把用来取平均的那两个数一起印出来。这里不除以 n − 1 也不除以 n,所以没有「样本还是总体」要选。

公式

中位数 = 排序后正中间的那个值;个数是偶数时取中间两个的平均

xᵢ
数据集里的一个数。只有它在排序后的位置参与计算,它离别的数多远完全不影响结果——这正是极端值动不了中位数的原因
n
这组数有几个,本页最多 200 个。奇数个时正中间只有一个值,偶数个时有两个,取它们的平均
Y₍ₖ₎
排序后第 k 个位置上的值。NIST 把偶数情形写成 (Y(N/2) + Y(N/2+1)) / 2,也就是这一页印在答案下面的那一对观测值
Y₍ₙ/₂₎ 与 Y₍ₙ/₂₊₁₎
中间那两个值。把它们印出来是为了让上面那一步除法能用眼睛核对;奇数个数据时它们是同一个数——正中间确实只有一个值
M
中位数本身。它的单位就是数据的单位;给每个数都加上同一个数,它跟着加同一个数,别的什么都不变

只要一个读数可能离谱、而你仍然想要一个典型值,就该用中位数:房价、收入、等待时间,凡是拖着一条长尾的都算。它数的是位置而不是大小,所以最大的那个数再离谱也推不动它——这正是它与平均数并存的理由。对于有序的等级(评分档、尺码)它也是更自然的中心,因为相邻两档之间的距离本来就没有意义,算不了平均。两件它答不了的事:离散程度,以及中间以外那些值的分布。数据的形状要紧时把它与四分位数一起报;另外在对称的数据上中位数与平均数会几乎重合,所以两者之间看得出来有距离,本身就是偏态的信号。

算例

  1. 偶数个数据:中间两个是 4 与 5

    1. 排序:2、4、4、4、5、5、7、9
    2. 共 8 个数,没有单独一个「正中间」,中间那一对是第 4 个与第 5 个
    3. 第 4 个是 4,第 5 个是 5
    4. 中位数:(4 + 5) ÷ 2 = 4.5

    4.5 不是这组数里的任何一个,偶数个数据时这是常态。面板把 4 与 5 印在旁边就是为了这件事:没有这两个数,读者无法判断它取的是不是正确的那一对,也无从知道它有没有偷偷只取了其中一个。

  2. 奇数个数据,其中有一个离得很远

    1. 排序:3、7、9、12、40
    2. 共 5 个数,正中间是第 3 个
    3. 中位数:9——没有除法,因为正中间只有一个值

    这五个数的平均数是 14.2,被 40 拽了上去;中位数是 9,对此毫不在意。把 40 换成 4000,平均数变成 806.2,而中位数仍然是 9。这就是偏态数据要报中位数的全部理由,而它不多花一点计算。

  3. 四个数,中位数根本不是数据里的值

    1. 排序:1、2、3、4
    2. 中间那一对是第 2 个与第 3 个:2 与 3
    3. 中位数:(2 + 3) ÷ 2 = 2.5

    这一点上另有两种写法流传:取下面那个(2)或取上面那个(3),三种都能在教材里找到。这一页按 NIST 与 GB/T 3358.1 的一致做法取平均,与四分位数、百分位数两页同一条规则——所以这里的 2.5 在那两页上就是第二四分位数与第 50 百分位。

局限

中位数只有一个位置,因此几乎丢掉了数据其余的全部信息。两组数据可以有同一个中位数而形状完全两样——一组紧紧挤在它附近,一组从头到尾散开——所以中位数通常要与四分位数一起报,而不是单独出现。它必须先把数据排序,也就是要把每个数都读一遍才有答案。它也不说明数据里有哪些值:中位数是 9 只意味着中间站着一个 9 附近的数,不意味着 9 出现过。尺码、评分这类有序等级照样能算,但得到的答案是中间那一档,而不是一个可以相加的数。列表上限 200 个数。像 1,500 这样的写法会被拒收而不是替读者猜:夹在两个数字中间的逗号在有些国家是小数点,在另一些国家是千分位,改写 1500 或 1.5 都可以。分隔符规则在每种语言下都相同:数字按输入的原样读,语言不影响列表的含义。

常见问题

中位数怎么算?
把数字从小到大排好,再数个数。奇数个数据正中间只有一个——7 个数就是第 4 个;偶数个数据正中间有两个,取它们的平均:1、2、3、4 的中间一对是 2 与 3,中位数就是 2.5。整个方法就这两步。面板上印着个数、中间那两个值与答案,每一步都能单独核对,不必重排一遍。
为什么中位数有时候不在我的数据里?
因为偶数个数据没有单独一个正中间,中位数是夹在中间那两个数的平均。上面的 4.5 不是那八个数里的任何一个,却正是正确答案——它下面一半、上面一半。中间那两个值就印在结果旁边,为的就是让这件事看起来不像出错。
什么时候该用中位数而不是平均数?
当某个极端读数可能把画面带偏的时候:收入、房价、等待时间,凡是某一侧拖着长尾的都算。平均数把每个数都加了进去,所以离群的那个会把它拽走;中位数只数两侧各有多少个数,同一个数对它毫无影响。数据对称时两者几乎重合,所以它们之间看得出差距,本身就是数据偏态的线索。
可以从表格里直接粘一列吗?
可以。换行、制表符、分号、空格,以及「逗号加空格」都算分隔符,从 Excel 粘一列直接就能读,空段会被跳过而不是判错。最多读 200 个数。像 1,500 或 1.500 这样的写法是故意拒收的:分隔符后面跟着三位数字,在有些国家是千分位、在另一些国家是小数点,改写 1500 或 1.5 都可以。
中位数分样本与总体吗?
不分,这一页也故意没有那个下拉框。n − 1 那个修正属于离散程度——它是对离差平方和除以个数时做的修正;中位数什么都不除,它取的是位置。一串数是样本还是全部,中间那个值都是中间那个值。需要区分这两个口径的是标准差与方差那两页,在那里除数确实会改变答案。
同一组数据在别的工具里算出的中位数为什么不一样?
几乎总是偶数个数据时的规则不同。流传的写法有三种:取中间两个的平均、取下面那个、取上面那个。1、2、3、4 在这三种写法下分别是 2.5、2、3。这一页按 NIST 给出的定义与 GB/T 3358.1 的做法取平均,并把中间那两个值印出来,用的是哪一对一眼就能看到。另一个少见得多的原因是某个数写成了小数逗号,而那个工具把它当成了分隔符。

参考资料

相关计算器