中央値計算
計算結果
中央値
- 中央2つのうち小さい方
- 4.0000
- 中央2つのうち大きい方
- 5.0000
- 件数
- 8
中央値は、リストを小さい順に並べたときにちょうど真ん中に来る値です。その下にデータの半分、上に半分が来ます。1つの極端な値では動かない唯一の要約値で、いちばん大きい値を10倍にしても中央値はまったく同じ場所にとどまります。数値を入力するか貼り付けると、この計算ツールが並べ替えて真ん中の値を返し、個数が偶数個のときは平均した中央の2つの値も見せます。区切りは1行に1つでも、セミコロン・コンマ・空白でもかまいません。ここではn − 1でもnでも割らないので、標本か母集団かを選ぶ切り替えはありません。
公式
中央値 = 並べ替えたリストの真ん中の値(個数が偶数個のときは中央の2つの平均)
- xᵢ
- データセットの中の1つの値です。効いてくるのは並べ替えたときの位置だけで、他の値からどれだけ離れているかは計算に入りません。極端な値が答えを動かさないのは、まさにこのためです
- n
- リストの値の個数で、ここでは最大200です。奇数個なら真ん中の値が1つに決まり、偶数個なら2つになるので、その平均が中央値になります
- Y₍ₖ₎
- 小さい順に並べ替えたあとのk番目の値です。NISTは偶数個の場合を (Y(N/2) + Y(N/2+1)) / 2と書いており、このページが答えの下に印字するのと同じ2つの観測値です
- Y₍ₙ/₂₎ and Y₍ₙ/₂₊₁₎
- 中央の2つの値です。目で割り算を確かめられるように印字してあり、奇数個のときは同じ数が2つ並びます。真ん中に値が1つしかない、という意味です
- M
- 中央値です。もとのデータの単位をそのまま持ち、すべての値に同じ定数を足すと、中央値もその定数だけずれて、それ以外は何も変わりません
1つの測定値が大きく外れていそうで、それでも典型的な値が欲しいときは中央値です。住宅価格、所得、待ち時間など、片側に長い裾を引くものです。大きさではなく順番を数えるので、リストのいちばん大きい値が桁外れでも中央値はびくともしません。平均の隣にこれが並んでいる理由がそこにあります。順序のあるラベル、たとえば評価段階やサイズ区分にも自然な中心です。隣り合う区分の間隔に意味がなく、平均を取れないからです。中央値が答えてくれないことは2つあります。散らばりについては何も言いませんし、真ん中から離れた値についても何も言いません。データの形が大事なときは四分位数と組にして読んでください。左右対称なデータでは中央値と平均値がほぼ重なるので、両者に目に見える開きがあること自体が、偏りの読みになります。
計算例
偶数個:中央の2つは4と5
- 並べ替えると2、4、4、4、5、5、7、9
- 個数は8なので真ん中は1つに決まらない。中央の組は4番目と5番目
- 4番目の値は4、5番目の値は5
- 中央値:(4 + 5) ÷ 2 = 4.5
4.5はリストの中にある数ではなく、偶数個ではそれが普通です。パネルが4と5を答えの隣に印字するのはそのためです。これがないと、正しい組を平均したのか、どちらか片方を黙って選んだのかを外から見分けられません。
奇数個で、1つだけ遠く離れた値がある
- 並べ替えると3、7、9、12、40
- 個数は5なので真ん中は3番目
- 中央値:9。真ん中が1つしかないので割り算はしない
この5つの平均は14.2で、40に引き上げられています。中央値は9のままで、気にしていません。40を4,000に置き換えると平均は806.2になりますが、中央値はやはり9です。偏ったデータで中央値を報告すべき理由がここにあり、計算の手間は増えません。
値が4つで、真ん中が値ですらない場合
- 並べ替えると1、2、3、4
- 中央の組は2番目と3番目で、2と3
- 中央値:(2 + 3) ÷ 2 = 2.5
この場合の書き方には、中央の2つのうち小さいほうを取る(2)と大きいほうを取る(3)という別の流儀もあり、3つとも教科書に出てきます。このページはNISTとGB/Tの用語規格がどちらも採っている平均を取ります。四分位数とパーセンタイルのページも同じ規則なので、ここの2.5はそちらの第2四分位数でもあります。
適用限界
中央値は1つの位置なので、データについての他のほとんどを捨てています。中央値が同じでも中身がまるで違う2つのリストがあり得ます。片方はその周りにぎゅっと固まり、もう片方は端から端まで広がっている、というものです。だから中央値は単独ではなく四分位数と組にして報告するのが普通です。並べ替えが必要なので、答えを出す前にすべての値を読まなければなりません。値そのものについては何も言いません。中央値が9というのは、9のあたりの数が真ん中にあるという意味であって、9がどこかに出てくるという意味ではありません。サイズや評価のような順序のあるラベルでも計算はできますが、答えは足し算できる数ではなく真ん中のラベルになります。リストは200個までで、桁の間にコンマを入れた入力は推測せずに拒否します。数字の間のコンマは、多くの国では小数点、別の国では桁区切りを意味するからです。コンマを外して書くか、小数で書き直してください。区切りの規則はどの言語でも同じで、入力したとおりに読み取ります。
よくある質問
- 中央値の求め方を教えてください
- 数値を小さい順に並べて、個数を数えます。奇数個なら真ん中の値が1つに決まり、7個なら4番目です。偶数個なら2つになるので、その平均が中央値になります。1、2、3、4なら中央の組は2と3なので、中央値は2.5です。方法はこれだけです。上のパネルは個数と中央の2つの値と答えを印字するので、もう一度並べ替えなくても各段を確かめられます。
- 中央値がリストにない数になるのはなぜですか
- 偶数個には真ん中の値が1つもないので、中央を挟む2つの平均を取るからです。上の4.5は8個の中にはありませんが、正しい答えです。その下に値の半分、上に半分が来ます。中央の2つの値が結果の隣に印字してあるのは、これが間違いに見えないようにするためです。
- 平均値ではなく中央値を使うのはどんなときですか
- 1つの極端な測定値が全体の見え方を歪めかねないときです。所得、住宅価格、待ち時間など、片側に長い裾を引くものでは、外れ値の影響を中央値だけが受け流します。平均はどの値も足し合わせるので、遠く離れた1つの数に引っ張られます。中央値は両側にいくつの値があるかしか数えないので、同じ数でも何も変わりません。左右対称なデータでは2つの答えはほぼ重なるので、両者に開きがあること自体が偏りの手がかりになります。
- 表計算ソフトの列をそのまま貼り付けられますか
- 貼り付けられます。改行、タブ、セミコロン、空白、そしてコンマの後の空白が区切りとして働くので、列をそのまま貼っても、セミコロンで打った1行でもかまいません。空の部分は拒否せずに読み飛ばします。読み込むのは200個までです。1つだけ意図的に拒否する形があります。区切りの後に3桁の数字が続く形です。国によって桁区切りだったり小数点だったりして決められないので、コンマを外して書くか、小数で書き直してください。
- 中央値にも標本と母集団の版がありますか
- ありませんし、このページに切り替えもありません。n − 1の補正は散らばりの尺度の話で、偏差の二乗和を個数で割る量に付いてきます。中央値は何も割らず、位置を取るだけです。リストが標本でも全体でも、真ん中の値は真ん中の値です。その選択が要るのは標準偏差と分散のページで、そちらでは除数が本当に答えを変えます。
- 同じリストなのに別のツールでは中央値が違うのはなぜですか
- ほとんどは偶数個のときの流儀の違いです。中央の2つを平均する、小さいほうを取る、大きいほうを取る、の3つが流通していて、1、2、3、4ならそれぞれ2.5、2、3になります。このページはNISTの定義とGB/Tの用語規格に従って平均を取り、中央の2つの値を印字するので、どちらの組を使ったかが分かります。まれに、小数のコンマで打った値をもう一方のツールが区切りとして読んだ、という原因もあります。
参考文献
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1:位置の尺度の一覧と、中央値を並べ替えたリストの真ん中の値として定義している節 — 米国標準技術研究所(NIST)
- データの中心の尺度(Introductory Statistics 2e, §2.5)— 中央値の求め方と、極端な値に動かされない理由 — OpenStax(ライス大学)
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1:中央値を含む位置の尺度を定めた、統計の用語と記号に関する中国の国家規格。規格の記録ページには、オンライン全文の提供がない旨が記されています — State Administration for Market Regulation, China