最頻値計算
計算結果
最頻値
- 最頻値の度数
- 3
- 最頻値の個数
- 1
- 件数
- 8
最頻値は、他のどの値よりも多く現れる値です。「ここで普通なのは何か」という問いへの、計算をまったく要さない唯一の答えで、数えるだけで出ます。だからこそラベルにも使える唯一の中心の尺度になります。いちばん多い靴のサイズ、いちばん多く報告された故障コード、選挙の当選者などです。数値を貼り付けると、この計算ツールは最も多く出てくる値、それが何回現れたか、そしていくつの値が同率で並んでいるかを報告します。データセットには最頻値が1つのもの、複数のもの、まったくないものがあるからです。値を足し合わせもせず、並べ替えもしないので、何かで割ることもありません。
公式
最頻値 = 出現回数が最も多い値(度数と、同率で並んだ値の個数をあわせて表示)
- xᵢ
- データセットの中の1つの値です。大きさは関係なく、何回繰り返されたかだけがものを言うので、足し算も平均もできないラベルにも最頻値を求められます
- f
- 度数、つまり報告された値が何回現れたかです。度数が1ならどの値も重複しておらず、そのときはすべての値が同率で1位に並びます
- 最頻値
- 最も多く出てくる値です。複数の値が同じ度数で並んだときは、その中でいちばん小さいものを印字し、並んだ個数は別に報告します。1つの数では「2と5が同じくらい多い」と言えないからです
- 同率の個数
- 同じ最高度数を分け合っている値がいくつあるかです。2なら二峰性、3以上なら多峰性で、値の個数と等しければ最頻値はありません
- n
- リストの値の個数で、ここでは最大200です。度数の上限を決めており、この数と同率の個数を比べることで、最頻値がない場合を見分けます
値が測定値ではなくカテゴリであるときに使います。サイズ、色、型番、エラーコード、いちばん多く選ばれた選択肢などです。平均や中央値は計算と順序を必要とし、「青」に意味のある平均はありませんが、いちばん多い「青」ならあります。どのサイズを仕入れるか、どの故障から直すか、といった実際の問いに答えてくれます。同じ値が繰り返し出てくる数値データでも一見の価値があります。平均や中央値から遠く離れた最頻値は、調べてみる価値のある塊を指しているからです。できないのは連続量の要約です。気温を細かく測ればどの値も1回しか出てこないので、最頻値は報告することがありません。同率の個数がリストの長さと等しい、というのがその状態です。また、当選した値以外をすべて無視するので、残りのデータについては何も言いません。
計算例
1つだけはっきりした勝者:4が3回出る
- それぞれの値が何回出るか数える:2が1回、4が3回、5が2回、7が1回、9が1回
- 最も多い回数は3で、そこに届いているのは4だけ
- 最頻値:4、度数3、同率の個数1。つまりこのデータセットは単峰性
度数は同率の個数と一緒に読んでください。そうしないと答えが曖昧になります。度数3で同率1ならきれいな単一の最頻値ですが、度数3で同率3なら、3つの別々の値がそれぞれ3回ずつ出ていることになります。この2つのデータセットは同じ度数を持ちながら、形はまったく違います。
最頻値が2つ:2と5が同じくらい多い
- 回数を数える:2が2回、5が2回、9が1回
- 最も多い回数は2で、そこに2つの別々の値が届いている
- 最頻値:2が印字される。並んだ2つのうち小さいほうで、度数は2、同率の個数も2
こういうデータセットは二峰性と呼ばれ、大きさの違う2つの集団がうっかり混ざった結果であることがよくあります。ここでは2の塊と5の塊で、ヒストグラムにすれば2つの山として見えるはずです。このツールが小さいほうを印字するのは、1行に何か入れておくためですが、正直な読み方は「2と5がどちらも2回」であり、そう言っているのが同率の個数のほうです。
どの値も違うので最頻値がない
- どの値も1回ずつしか出てこない
- したがって最も多い回数は1
- その度数を分け合っている値は3つ、つまり全部
- パネルは度数1、同率の個数3と報告する。これがこのページの「最頻値はない」の言い方
度数1で同率の個数が値の個数と等しい、というのは重複のないデータセットの印であり、何かが失敗した合図ではなく、連続量の測定では普通の結果です。表示されている値は単にリストの最小値です。その行に何かが入る必要があり、それを勝者として読まないようにさせるのが隣の2つの数の役目です。
適用限界
最頻値は当選した値だけを使い、他をすべて無視するので、3つの中心の尺度の中ではいちばん情報が少ないものです。最頻値が同じでも他のあらゆる点で違う2つのデータセットがあり得ます。連続量ではほとんど役に立ちません。測定値を細かく丸めればどの値も重複せず、報告することがなくなり、逆に粗く丸めれば丸め方が最頻値を作り出してしまいます。不安定でもあります。1つの値が変われば勝者が変わり得るので、短いリストから出した最頻値はあまり信用しないでください。データセットには最頻値が複数あることも、まったくないこともあり、それだからこのページは1つの数ではなく度数と同率の個数を報告します。結果に度数分布表が出ないのも同じ理由です。その表はあなたのデータから作らなければならず、このページは入力される前にデータを見ることができません。リストは200個までで、値は打ち込まれたとおりに数えます。2.5と2.50は同じ数ですが、近い値を一致させるための丸めは行いません。
よくある質問
- 最頻値の求め方を教えてください
- 入力されたそれぞれの値が何回出てくるかを数え、いちばん多いものを取ります。2、4、4、4、5、5、7、9では回数が1、3、2、1、1なので、最頻値は4で度数は3です。足し算も並べ替えもしないので、平均が意味を持たないラベル、たとえば最も多いサイズや最も多い色にも最頻値を求められます。
- 最頻値が複数あることはありますか
- ありますし、よくあります。2つの値が同じ最高度数で並べばそのデータは二峰性で、3つ以上なら多峰性です。2、2、5、5、9は2も5も2回出るので最頻値が2つあり、二峰性の形は普通、2つの集団が混ざったことを意味します。それぞれの最頻値の周りに塊があるはずです。パネルは並んだ値のうち小さいほうを印字し、その隣に同率の個数を報告します。片方だけを名乗るのは誤解を招くからです。
- 最頻値がないとはどういうことですか
- どの値も同じ回数しか出ておらず、他より多い値がないという意味です。このページはその行を空にせず、度数1、同率の個数は値の個数と同じ、と報告します。1、2、3なら最頻値が3つ、という答えになります。重複のない短いリストではこれが期待どおりの答えで、連続量の測定では普通の結果です。細かく測れば2つとして同じ値にならないからです。
- 最頻値がないのに値が表示されるのはなぜですか
- 空の行は読みにくく、数が入った行とそれを説明する2つの数のほうが読みやすいからです。すべての値が同率のとき、表示されるのはリストの最小値で、度数は1、同率の個数は値の個数と同じになります。3つをそろえて読めば「何も重複していない」という答えになり、値を単独で読むと1が勝ったように見えます。2つの数を隣に置いているのはそのためです。
- 連続量の測定に最頻値は役に立ちますか
- ほとんど役に立ちません。何かを十分細かく測ればどの値も違うので、報告できる重複がありません。度数1、同率の個数はリストの長さと同じ、最頻値なし、となります。同じ測定値を粗く丸めると、丸めの境界がたまたまどこに来たかという産物である見かけの最頻値が現れます。最頻値が本領を発揮するのはカテゴリと、本当に値が繰り返される数値データです。たとえば5つの選択肢をそれぞれ何人が選んだか、といったものです。
- 最頻値にも標本と母集団の版がありますか
- ありません。最頻値は繰り返しの回数を数えたものなので、調整すべき除数がなく、このページにもその切り替えがありません。n − 1の補正は散らばりの尺度の話で、偏差の二乗和を個数で割る量に付いてきます。リストが標本でも全体でも、最頻値は同じです。
参考文献
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1:位置の尺度の一覧と、最頻値を最も多く現れる値として挙げている節 — 米国標準技術研究所(NIST)
- データの中心の尺度(Introductory Statistics 2e, §2.5)— 最頻値の求め方と、度数分布が要る理由 — OpenStax(ライス大学)
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1:最頻値を含む位置の尺度を定めた、統計の用語と記号に関する中国の国家規格。規格の記録ページには、オンライン全文の提供がない旨が記されています — State Administration for Market Regulation, China