カイ二乗計算
計算結果
カイ二乗統計量
- p値
- 0.0170%
- 自由度
- 3
- 最小の期待度数
- 25.0000
カイ二乗検定の計算機は、数え上げたカテゴリを、期待した度数と比べ、統計量・自由度・それに対応するp値を報告します。適合度検定は「これらのグループは同じ大きさか」という形のあらゆる問いの背後にあります。サイコロが公正か、4つの選択肢が同じ頻度で選ばれたか、各カテゴリの観測度数が、予測する理由のあった期待度数と一致するか、といった問いです。期待度数を空欄にすると、このページはどのカテゴリも等確率だと仮定します。それは最もよくある場合であり、先に計算をしておく必要がない場合でもあります。最小の期待度数も併記されます。検定自身の条件が照合されるのがその数だからです。
公式
χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )
- O
- 各カテゴリの観測度数——測定値ではなく個数なので、数は整数で、その合計が標本サイズになります。0という観測は許されます。そのカテゴリが一度も現れなかったという意味で、それは誤りではなく結果です
- E
- 各カテゴリの期待度数で、見たいものではなく帰無仮説が予測するものです。空欄にすると、合計をカテゴリ数で割った値になり、検定はカテゴリが等確率かどうかを問うことになります
- k
- カテゴリ数で、入力した一覧の長さから読み取ります。これが自由度を決め、空欄のときに期待度数を平均する相手にもなるので、1つの度数の一覧が両方を決めます
- df
- 自由度で、kではなくk − 1です。忘れられがちなのはこの引き算のほうです。合計と最後の1つを除くすべての度数が決まれば、最後の度数は決まってしまうので、カテゴリはその個数より1つ少ない情報しか運びません
- χ²₀
- このページが計算した統計量を、それ自身の帰無分布に入れて裾の面積を求めたものです。正規曲線から値を読むのと同じ操作で、正規の代わりにカイ二乗曲線を使っているだけです。p値が統計量だけでなく自由度も必要とするのはそのためです
データがカテゴリに落ちる度数の集まりで、問いが「その度数はある予測と整合するか」であるときに使います。度数であることが、平均や比率のページとの違いです。観測は尺度で測られておらず、効いてくるのは各バケツにいくつ落ちたかであって、どれがどれだけ大きかったかではありません。予測は等分割でもよく、以前のデータから組み立てた期待度数の組でもかまいません。全国の比率を地域の人口に当てはめたもの、メンデルの比、モデルの出力などです。検定の良し悪しはその期待度数次第です。数えたものと述べたものを比べるだけで、期待そのものが間違っていたことには気づきません。p値を信じる前に確かめる価値のある条件が2つあり、このページはその1つ目を印字します。最小の期待度数が、よく使われる経験則の対象だからです。
計算例
4つのカテゴリを不均等に数え、期待度数は空欄
- 合計は100で、期待度数が空欄なので、4つのカテゴリはそれぞれ100 / 4 = 25を持つと期待されます
- 25からの差の二乗:(30 − 25)² = 25、(10 − 25)² = 225、(20 − 25)² = 25、(40 − 25)² = 225
- それぞれを期待度数25で割って足します:1 + 9 + 1 + 9 = 20
- 自由度:k − 1 = 3。20を超える上側の裾は0.017%です
これがこのページの既定値で、目に見えて不均等になるように選んであります。期待度数25に対して40と10です。p値は0.017%になるので、度数は等分割から遠く離れており、最小の期待度数25はよく使われるしきい値のどれよりも十分に上です。だからp値の背後にある近似はここでは堅い地面の上にあります。期待度数を一度も打ち込まなくてよかったことに注目してください。欄を空欄にすることが等分割の表し方で、この欄が任意なのはそのためです。
3つのカテゴリを、以前の調査から取った期待度数と比べる
- 2つの一覧はどちらも合計が100なので、期待度数は度数の側と整合していて、検定を進められます
- 差の二乗:(50 − 60)² = 100、(30 − 30)² = 0、(20 − 10)² = 100
- それぞれの期待度数で割って足します:100/60 + 0/30 + 100/10 = 1.6667 + 0 + 10 = 11.6667
- 自由度:3 − 1 = 2。11.6667を超える上側の裾は0.2928%です
2つの一覧は同じ数の観測を記述していなければならず、ここではどちらも100になります。だからこそ2つ目の一覧は、別の実験ではなく1つ目の一覧についての仮説になるのです。項を1つずつ読むと勉強になります。真ん中のカテゴリは期待度数と完全に一致して何も寄与せず、3つ目のカテゴリは最小でありながら統計量11.6667のうち10を寄与しています。期待度数を100%外したからです。最小の期待度数10は、ふつう要求される水準よりはまだ上です。
コインを20回投げ、等分割と比べる
- 期待度数:20回のコイントスを2つの結果に等しく分けると10と10になります
- 差の二乗:(12 − 10)² = 4、(8 − 10)² = 4
- 割って足します:4/10 + 4/10 = 0.8
- 自由度:2 − 1 = 1。0.8を超える上側の裾は37.1093%です
20回中12回が表というのは、裾の確率を読むまでは偏ったコインに見えます。公正なコインの37%は少なくともこれくらい偏った分かれ方をするので、この結果は取り立てて言うほどのものではありません。最初の例と同じ算術を、意味のある最小の表で行ったもので、統計量を単独で読んではいけない理由も示しています。0.8と20は比べられる数ではなく、両方を同じ物差しに載せるのはp値だけです。2カテゴリの場合には知っておく価値のある近道もあります。カイ二乗統計量は、2比率検定が使うzの二乗に等しくなります。
適用限界
p値は、期待度数がそこそこ大きいことを必要とする近似に乗っています。照合すべき数は印字された最小の期待度数です。線をどこに引くかは教科書によって違い、「どのカテゴリも少なくとも5」と「どのカテゴリも少なくとも1、かつ大半で5以上」の両方が広く使われています。期待度数が小さすぎると近似は静かに破綻し、ふつうに見えるp値を返します。度数は独立であることも前提にしており、対応のある測定や反復測定、集まった標本の抽出ではこれが崩れ、いずれの場合も統計量が大きく出ます。期待度数そのものは与えられたものとして扱われるので、間違った予測に対する検定は、意図したものとは別の問いに答えることになります。最後に、p値が小さいと言えるのは度数が期待と整合しないということであって、その理由ではありません。どのカテゴリが責任を負っているかは言いませんし、カテゴリが複数あるときは統計量を駆動している差を別々に調べる価値があります。
よくある質問
- カイ二乗検定は結局何を教えてくれるのか
- 観測した度数が、観測数を与えられたもとで期待度数と整合するかどうかです。統計量は観測と期待のずれの二乗を合計し、各期待度数の大きさで割ったものなので、同じ割合のずれでも期待度数が小さいほうが重く数えられます。p値は、公正な世界が少なくともそれくらいのずれをどれくらいの頻度で生むかを述べます。これは表全体についての検定であって、個々のカテゴリについてのものではありません。1つのカテゴリが明らかに浮いているとき、この2つは混同しやすくなります。
- 期待度数を空欄にするとどうなるのか
- このページはどのカテゴリも等確率だと仮定し、期待度数を合計をカテゴリ数で割った値として計算します。これがこの検定の最もよくある使い方です。サイコロ、ルーレット、同じだけ押されるはずの4つのボタンなどで、値がどれも同じ一覧を打ち込む手間も省けます。事前のデータがなく分割を予測できないときの唯一の読み方でもあります。本当に検定したい予測があるときは期待度数を入力してください。昨年の分布や理論上の比などです。等分割に対する検定と特定のモデルに対する検定は別の問いに答えるもので、すでに持っている情報を使うのは2つ目だけです。
- 2つの一覧の合計を同じにしなければならないのはなぜか
- 適合度検定の期待度数は、選んだ自由な値ではなく、観測の合計から導かれるものだからです。仮説が正しければ、同じ観測がどう分布していたかを述べています。合計の違う2つの一覧は別々の実験を記述しており、そこから計算した統計量は何の検定にもなりません。期待度数をすべて整数で書くとき、意図を変えずに最大0.5まではずれられます。そこでこのページはカテゴリごとに0.5の許容を設けています。合計60に対して20.5・20.5・20.5は受け付けます。20ずつに等しく分けた正確な値を丸めたものだからです。
- カテゴリの度数が0でもよいのか
- 観測度数なら0でもよく、期待度数では0にできません。この非対称は式からそのまま出てきます。観測の0はふつうの結果——一度も現れなかったカテゴリ——で、差の二乗は大きくなるだけですが、そうなるべきです。期待の0は割る側なので使えず、その項は無限になります。あるカテゴリが決して起こらないという予測は、度数と突き合わせられる予測ではありません。本当の期待値が0ではなく非常に小さいならこの検定は受け付けますし、それが問題かどうかは結果の下に印字される最小の期待度数で見られます。
- カイ二乗の臨界値表はどこにあるのか
- このページにはありません。p値のページと同じ理由で、意味のある値はすでに印字されています。統計量と自由度が裾の面積を直接決めるからです。表を作るなら特定の有意水準に固定せざるを得ず、1%で仕事をしている読者はパネルと矛盾する表を見ることになります。調べる場所は臨界値のページです。このページが原理的に表を示せない理由はもう1つあり、自由度がk − 1で、kは読者が入力したカテゴリ数なので、どの行が当てはまるかは度数が決まるまで分かりません。
参考文献
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods:帰無仮説のもとでそれ自身の分布を持つ量としての検定統計量。裾の面積が計算できるのはそのおかげです — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e:確率の推定値としての相対度数。カテゴリの確率を観測数の期待値に変えるのがこの手順です — OpenStax, Rice University
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods:累積曲線から裾の面積を読む手順。このページは正規ではなくカイ二乗曲線で同じことをしています — National Institute of Standards and Technology (NIST)