众数计算器
结果
众数
- 众数出现的次数
- 3
- 众数的个数
- 1
- 个数
- 8
众数是一组数据里出现次数最多的那个值——它是唯一一个不用做任何算术、只要数一数就能得到的中心。也正因为如此,它是唯一能用在分类数据上的中心:最常卖的尺码、最常报的故障码、得票最多的选项。把数字粘进来,这个众数计算器会给出出现次数最多的值、它出现了几次,以及并列第一的值一共有几个——因为一组数据可以只有一个众数,也可以有好几个,还可以一个都没有。这里不求和、不排序,所以任何一步除法都不会发生,也就没有「样本还是总体」要选。
公式
众数 = 出现次数最多的那个值;同时给出它的频数与并列第一的值有几个
- xᵢ
- 数据集里的一个值。它的大小完全不影响结果,只有它重复了几次参与计算——这正是众数能用在无法相加、无法取平均的分类数据上的原因
- f
- 频数:被报出的那个值出现了几次。频数为 1 意味着没有任何值重复过,此时列表里每一个值都并列第一
- mode
- 出现次数最多的值。若有好几个值的频数并列最高,印出的是其中最小的那个,并列的个数另给一格——一个数说不清「2 与 5 一样常见」
- 并列数
- 频数最高的值一共有几个。2 个叫双峰,3 个及以上叫多峰,而它等于数据个数时就是「没有众数」
- n
- 这组数有几个,本页最多 200 个。它决定了频数的上限,把它与并列数放在一起看,才能认出「没有众数」那种情形
当手里的值是类别而不是测量值时就该用众数:尺码、颜色、型号、错误码、大家最常选的那一项。平均数与中位数都要么需要加法、要么需要排序,而「蓝色」没有平均可言——但有一个最常见的,它回答的是很实际的问题,比如该备哪个尺码、先修哪个故障。数值数据也值得看一眼:众数离平均数、中位数都很远时,说明那里有一簇值得深究的值。它做不到的是概括一个连续测量——温度测得足够精细,每个读数都只出现一次,众数就无话可说,而这正是「并列数等于数据个数」的含义。它还会忽略除胜出者以外的全部数据,所以对剩下的部分一言不发。
算例
只有一个众数:4 出现了三次
- 数每个值出现了几次:2 一次、4 三次、5 两次、7 一次、9 一次
- 最高的频数是 3,只有 4 达到
- 众数:4,频数 3,并列第一的值有 1 个——所以这组数据是单峰
频数一定要与并列数一起读,否则答案是有歧义的:频数 3 配并列数 1 是干干净净的单一众数,而频数 3 配并列数 3 意味着有三个不同的值各出现了三次。这两组数据的频数一模一样,形状却完全不同。
两个众数:2 与 5 一样常见
- 数一下:2 出现两次、5 出现两次、9 出现一次
- 最高的频数是 2,而达到它的有两个不同的值
- 众数:印出 2——并列两个里较小的那个——频数 2,并列数 2
这样的数据叫双峰,它往往意味着两组数据被不小心混在了一起——一簇挤在 2 附近、一簇挤在 5 附近,画成直方图就是两个鼓包。工具印较小的那个值,只是为了那一行不至于空着,诚实的读法却是「2 与 5,各两次」,而说出这件事的正是并列数那一格。
没有众数,因为每个值都不一样
- 每个值都只出现了一次
- 所以最高的频数是 1
- 有三个值共享这个频数——也就是全部
- 面板给出频数 1、并列数 3,这就是这一页说「没有众数」的方式
频数为 1、且并列数等于数据个数,就是「没有任何值重复」的特征。对连续测量来说这是常态而不是故障。印出来的那个值只是列表里最小的一个——那一格总得有个数,旁边那两个计数才是告诉你别把它当成胜出者的东西。
局限
众数只用到胜出的那个值,其余一概不管,所以它是三个中心里信息量最小的一个:两组数据可以有同一个众数,而其它方面毫无共同之处。用在连续数据上它几乎没有意义——量得足够细就没有值会重复,于是无话可说;量得粗一点,又会凭空造出一个其实是取整边界造成的众数。它还不稳定:改动一个数就可能换一个胜出者,所以小样本上算出来的众数不该太当真。一组数据可以有多个众数,也可以没有,这正是这一页要另给频数与并列数的原因,也是结果里没有频数表的原因:频数表必须由你的数据现算,而这一页在你输入之前看不到你的数据。列表上限 200 个数,值按输入的原样计数——2.5 与 2.50 是同一个数,但不会为了让相近的读数合并而做任何取整。
常见问题
- 众数怎么算?
- 数每个值出现了几次,取次数最多的那个。2、4、4、4、5、5、7、9 里各值分别出现 1、3、2、1、1 次,所以众数是 4,频数是 3。整个过程不求和、不排序,所以尺码、颜色这类标签也能算众数——那里取平均是没有意义的。面板上把频数与并列数一起印出来,就是为了让「只有一个众数」与「好几个并列」分得开。
- 一组数据能有多个众数吗?
- 能,而且很常见。两个值的频数并列最高就叫双峰,三个及以上叫多峰。2、2、5、5、9 有两个众数,因为 2 与 5 都出现了两次;双峰的形状通常意味着两组数据被混在了一起——每个众数周围各有一簇。面板印出并列中较小的那个值,并在旁边给出并列的个数,因为只报其中一个会误导人。
- 没有众数是什么意思?
- 意思是每个值出现的次数都一样,谁也没有比谁更频繁。这一页不会把那一格留空,而是给出频数 1、并列数等于数据个数,所以 1、2、3 得到的并列数是 3。对没有重复值的短列表来说这是意料之中的答案,对连续测量来说更是常态——量得足够细,就不会有两个读数完全相同。
- 既然没有众数,为什么那一格还有值?
- 因为一格数字配上两句解释,比一格空白好读。全都并列时,印出来的是列表里最小的那个值,频数是 1,并列数等于数据个数。三个数一起读,答案是「没有任何值重复」;只看那一个值,会以为 1 赢了——旁边那两个计数就是为此存在的。
- 众数对连续测量有用吗?
- 很少有用。量得足够精确时每个读数都不一样,没有重复可报——频数 1、并列数等于数据个数、没有众数。把同一批读数粗略地取整,又会冒出一个其实是取整边界造成的众数。众数的用武之地是分类数据,以及真的会重复的数值,比如五个选项各有多少人选择。
- 众数分样本与总体吗?
- 不分,这一页也故意没有那个下拉框。众数数的是重复次数,没有除数可以调整;n − 1 那个修正属于离散程度,它出现在离差平方和除以个数的那一步。一串数是样本还是全部,众数都是同一个。
参考资料
- GB/T 3358.1-2009《统计学词汇及符号 第1部分:一般统计术语与用于概率的术语》(推荐性国家标准,现行:2009-10-15 发布 / 2010-02-01 实施,采标;该站注明因涉及国际版权不提供在线阅读,全文需另寻) — 国家市场监督管理总局 国家标准全文公开系统
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1(众数的定义;原文写明众数不一定唯一) — 美国国家标准与技术研究院(NIST)
- Measures of the Center of the Data — Introductory Statistics 2e, section 2.5(众数用在分类数据上的例子,以及「没有众数」与「多个众数」两种情形) — OpenStax(莱斯大学)