四分位数計算
計算結果
四分位範囲(IQR)
- 第1四分位数(Q1)
- 4.0000
- 第2四分位数(Q2)
- 4.5000
- 第3四分位数(Q3)
- 5.5000
- 最小
- 2.0000
- 最大
- 9.0000
- 件数
- 8
四分位数は、並べ替えたリストを4つに区切ります。データの4分の1がQ1以下、半分がQ2以下、4分の3がQ3以下に来ます。最小値と最大値を加えると五数要約になり、数を一切足し合わせずにデータセットの位置と散らばりを述べられます。この四分位数計算ツールはその5つをすべて印字し、真ん中の半分の幅である四分位範囲(Q3 − Q1)を結果のいちばん上に置きます。真ん中が詰まっているのか引き伸ばされているのかを教えてくれるのが、この1つの数だからです。Q2も並べて表示します。これは中央値なので、2つのページは偶然ではなく作りとして同じ答えになります。
公式
Q1 = 位置(n − 1) × 0.25の値、Q2 = (n − 1) × 0.5の値、Q3 = (n − 1) × 0.75の値(隣り合う値の間を補間)。IQR = Q3 − Q1
- xᵢ
- データセットの中の1つの値です。四分位数は並べ替えたリストの位置なので、効くのは値の順序であって大きさではありません。極端な観測値が1つあると外側の目印は少し動きますが、真ん中の半分はほとんど動きません
- n
- リストの値の個数で、ここでは最大200です。位置は0から数え、最後の位置がn − 1なので、3つの四分位数の位置はその範囲に散らばります
- Q1
- 第1四分位数で、データのおよそ25%がこれ以下に来ます。並べ替えたリストの下位4分の1が終わる場所を示し、必ずしもデータに出てくる値ではありません
- Q2
- 第2四分位数で、これはちょうど中央値です。データの半分がこれ以下に来ます。比較のために印字しており、中央値の専用ページも同じ規則から同じ数を計算します
- Q3
- 第3四分位数で、データのおよそ75%がこれ以下に来ます。Q1とともにデータの真ん中の半分を挟み、箱ひげ図が箱として描く部分です
- IQR
- 四分位範囲、Q3 − Q1で、真ん中の半分の散らばりです。データと同じ単位を持ち、標準偏差と違って外れ値の影響をほとんど受けません。外側の4分の1を完全に無視するからです
データが偏っていたり、外れ値があったり、足し合わせることに意味がない尺度で測られていたりするとき、四分位数が正しい要約になります。所得、住宅価格、応答時間、試験の点数などです。平均と標準偏差が左右対称な釣り鐘を述べるのに対し、五数要約はどんな形の分布でも述べられます。中央値が中心の位置を、Q1とQ3が真ん中の半分の広がりを、最小値と最大値が全体の端を言います。四分位範囲が中央値の相棒になるのは、標準偏差が平均に付き添うのと同じ理由で、1つの突飛な観測値では膨らまない散らばりが欲しいときに人が引用する数です。箱ひげ図と、外れ値の候補に印を付ける1.5 × IQRの規則の土台でもあります。フェンスはここでも引けますが、印を付けるのは別の仕事です。できるだけヒストグラムと並べて使ってください。4つの区切りではデータに山が2つあるかを示せず、二峰性のデータセットも完全に普通に見える五数要約を平気で出します。
計算例
8つの値:Q1 = 4、Q3 = 5.5、IQR = 1.5
- 並べ替えると2、4、4、4、5、5、7、9。8個なのでn − 1 = 7
- Q1:位置7 × 0.25 = 1.75で、位置1の4と位置2の4の間なので、Q1 = 4
- Q2:位置7 × 0.50 = 3.5で、4と5の間なので、Q2 = 4.5。中央値のページが出すのと同じ中央値です
- Q3:位置7 × 0.75 = 5.25で、位置5の5と位置6の7の間:5 + 0.25 × 2 = 5.5
- IQR:5.5 − 4 = 1.5。真ん中の半分は幅1.5に収まっています
ここでの真ん中の半分は4から5.5までの4つの値で、IQRはその帯の幅です。Q1はちょうどデータ点に乗り、Q3は乗っていないことに注目してください。どの四分位数が観測値と一致するかは個数だけで決まり、五数要約はデータの部分集合ではなく位置の記述です。
4つの値:どの四分位数も補間になる
- 並べ替えると1、2、3、4。4個なのでn − 1 = 3
- Q1:位置3 × 0.25 = 0.75で、1から2へ4分の3進んだところなので、Q1 = 1.75
- Q2:位置3 × 0.50 = 1.5で、2と3の中間なので、Q2 = 2.5
- Q3:位置3 × 0.75 = 2.25で、3から4へ4分の1進んだところなので、Q3 = 3.25
- IQR:3.25 − 1.75 = 1.5
流儀の違いが出るのはこの場合なので、もう一方が何を返すか知っておく価値があります。OpenStaxと多くの教科書が使う方法はデータを中央値で2つに分け、それぞれの半分の真ん中を取ります。下半分は1と2なのでQ1 = 1.5、上半分は3と4なのでQ3 = 3.5、IQRは2になります。このページは代わりに隣り合う値の間を補間し、これはRとNumPyの既定で、Q1とQ3を印字するのでどの流儀で出たかが分かります。
教科書自身の14個の値を、もう一方の流儀で
- 並べ替えると1、1、2、2、4、6、6.8、7.2、8、8.3、9、10、10、11.5。14個なのでn − 1 = 13
- Q2:位置13 × 0.50 = 6.5で、6.8と7.2の中間なので、Q2 = 7。教科書が報告するのとちょうど同じ中央値です
- Q1:位置13 × 0.25 = 3.25で、位置3の2から位置4の4へ4分の1進んだところなので、Q1 = 2.5
- Q3:位置13 × 0.75 = 9.75で、8.3から9へ4分の3進んだところなので、Q3 = 8.825
- IQR:8.825 − 2.5 = 6.325
同じ14個の数がOpenStaxの位置の尺度の節に出ており、あちらは半分に分ける方法を使ってQ1 = 2、Q3 = 9、IQR = 7と報告します。どちらの答えも文書化された教えられる規則から出ていて、同じ観測値の間を違うふうに補間するために食い違います。中央値はぴたりと一致し、そこが心強いところです。流儀が何であれ、データの真ん中はデータの真ん中です。
適用限界
4つの区切りだけでは分布を述べ尽くせません。すべての四分位数が同じでも見た目がまるで違う2つのデータセットがあり得ます。片方は固まり、片方は山が2つです。形が大事なときは、五数要約をヒストグラムの隣で読んでください。四分位数も事実ではなく流儀です。このページはハイドマン・ファン7型に従って隣り合う値の間を補間し、多くの教科書が使う半分に分ける方法は、個数が4の倍数でないときはいつでも違う数を返します。個数は別の意味でも効きます。4つ未満の値ではどの四分位数も補間になり、値が1つだけなら5つの数はすべてその値で、測る散らばりがないのでIQRは0になります。リストは200個までで、桁の間にコンマを入れた入力は推測せずに拒否します。数字の間のコンマは多くの国では小数点、別の国では桁区切りを意味するからです。コンマを外して書くか、小数で書き直してください。このページは外れ値に印を付けません。そのための標準的な規則は1.5 × IQRのフェンスで、適用するのは別のツールの仕事です。
よくある質問
- 四分位数の求め方を教えてください
- リストを並べ替えてから、3つの位置を読み取ります。Q1は(n − 1) × 0.25、Q2は(n − 1) × 0.50、Q3は(n − 1) × 0.75で、位置が2つの値の間に来るときは補間します。8つの値なら位置は1.75、3.5、5.25で、Q1 = 4、Q2 = 4.5、Q3 = 5.5になります。四分位範囲はQ3 − Q1なので、ここでは1.5です。3つの四分位数と最小値・最大値はすべて上に印字されるので、要約全体が1画面に収まります。
- Q1が別の計算ツールと違うのはなぜですか
- 四分位数は事実ではなく流儀で、よく使う2つの流儀は個数が4の倍数でないときはいつでも食い違うからです。このページはハイドマン・ファン7型に従って隣り合う値の間を補間し、これはRとNumPyの既定です。OpenStaxを含む多くの教科書は、代わりにデータを中央値で2つに分けてそれぞれの半分の真ん中を取ります。その14個の値ではQ1 = 2、Q3 = 9になりますが、このページは2.5と8.825を返します。どちらも文書化された規則です。Q2、つまり中央値はどちらでも同じになります。
- 四分位範囲は何を教えてくれますか
- データの真ん中の半分の幅、つまりQ1とQ3の間にある50%の値が収まる範囲です。データの単位をそのまま持ち、IQRが1.5なら真ん中の半分が測ったものの1.5の幅に収まっているという意味です。上下の4分の1を捨てるので、極端な観測値が1つあってもほとんど動きません。中央値と並べて引用する慣例の散らばりがこれなのは、そのためです。IQRが0というのは、真ん中の半分が1つの同じ値である、つまりデータの半分以上が同一という意味で、何かが壊れたという意味ではありません。
- 五数要約とは何ですか
- 最小値、Q1、中央値、Q3、最大値の5つで、このページが印字している数そのものです。通常はこの順序で書きます。どんな形も仮定せずにデータセットを述べる標準的な方法で、箱ひげ図が描いているものとちょうど同じです。Q1からQ3までの箱と、中央値の線、両端までのひげになります。上に出ているIQRは5つのうちの1つではなく、箱の幅であるQ3 − Q1です。
- 四分位数がデータにない値になることはありますか
- ありますし、短いリストでは普通そうです。四分位数はデータの目盛り上の位置なので、1、2、3、4の4つの値に対する1.75は、リストに1.75という値が1つも出てこなくても、まったく普通の第1四分位数です。位置がちょうど整数に乗るときは、代わりに観測値と一致します。どちらの場合も個数と一緒に印字されるので、どちらを見ているかが分かります。
- このページは外れ値に印を付けますか
- いいえ。標準的な規則の入力になる四分位範囲を与えます。Q1より1.5 × IQRを超えて下、またはQ3より上にある値は、外れ値の候補として扱われます。そのフェンスを当てはめるのは意図的に別のツールの仕事で、このページはどの点を捨てるかの判定ではなく、データについての正直な記述にとどまります。上の8つの値なら1.5 × IQRは2.25なので、フェンスは1.75から7.75までになります。
参考文献
- Measures of the Location of the Data — Introductory Statistics 2e, section 2.3:四分位数と四分位範囲を真ん中の半分の散らばりとして定義し、14個の値の例を解いている節。半分に分ける方法は、ここで使う補間とは異なります — OpenStax(ライス大学)
- quantile — R stats package reference:9種類の分位型を説明しており、既定である7型がここで3つの四分位数すべてに使っている流儀です — The R Project for Statistical Computing
- numpy.quantile — NumPy reference:linear法の既定は、このページとまったく同じに補間します — NumPy
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1:四分位数と四分位範囲を定めた、統計の用語と記号に関する中国の国家規格。規格の記録ページには、オンライン全文の提供がない旨が記されています — State Administration for Market Regulation, China