メインコンテンツへスキップ
CalcMax

中心極限定理計算

下限:0

下限:1

計算結果

2.5000

標準誤差

標本平均の平均
100.0000
標本平均の分散
6.2500

中心極限定理の計算機は、標本平均の標本分布を記述します。どこを中心にしているか、どれくらい広がっているか、そしてその両方が標本サイズにどう応答するかです。中心のほうが意外な部分です。標本平均をすべて平均すると、どの標本サイズでも母平均に等しくなります。だからデータを増やしても中心は動きません。変わるのは広がりのほうです。標準誤差は母標準偏差を√nで割ったものなので、標本を4倍にすると標準誤差は半分になり、分散はその代わり4分の1になります。定理自身の主張——nが大きくなるにつれて形が正規分布に近づくこと——は広がりではなく形の話で、このページの算術では示せません。

標本が大きくなるにつれて標準誤差がどう下がるか

標本サイズ(n)√n標準誤差 ÷ σ
111
420.5
1640.25
2550.2
100100.1
400200.05
2500500.02
100001000.01

3列目はσに掛ける係数です。母標準偏差が15で標本が100なら、標準誤差は0.1 × 15 = 1.5になります。この表のどこにもあなたの平均や標準偏差は入っていないので、上のパネルと矛盾しようがありません。中身は関数1/√nそのもので、パネルはその関数を1点で評価しているだけです。行を下へ読んでいくと、平方根の法則が主張ではなく模様として見えてきます。標本サイズが4倍になるたびに標準誤差は半分になり、8つの行は4倍刻みで選んであるので、模様は流れずに繰り返します。標本サイズは平方根が整数になるものを選んであるので、どの行も手で確かめられます。

公式

E[X̄] = μ Var(X̄) = σ² / n SE = σ / √n

μ
母平均。標本を取り出してくるもとになった分布の中心です。標本分布の平均としてそのまま戻ってきます。3つの結果のうちの1つ目で、どの標本サイズでも成り立つ唯一のものです
σ
母標準偏差。その単位はデータの単位で、標準誤差の単位でもあります。だからσとSEは直接比べられます。σが15のとなりで標準誤差が2.5というのは、データについてではなく標本サイズについての記述です
n
1つの標本にいくつの観測が入っているか——1回の取り出しの大きさで、取り出しの回数ではありません。割り算の下に√nとして現れ、別の割り算の下にnとして現れます。その違いが実務上のメッセージそのものです。分散はnに比例して小さくなり、標準誤差はその平方根にしか比例しません
X̄
標本平均。数を1つではなく確率変数として扱ったものです。1つの標本は1つのX̄を与え、標本抽出を繰り返せばそれらの分布が得られます。3つの出力が記述するのはその分布であって、個々の標本ではありません
SE
標準誤差——標本平均の標準偏差で、このページの主結果です。信頼区間はこれで組み立てられ、検定統計量はこれで割ります。だから平方根を取る前の分散ではなく、読む価値のある数がこちらなのです

標本平均が標本ごとにどれくらい動く見込みかを、研究を設計する前に知りたいときに使います。報告書から標準誤差を読み取って、それがどこから来たのかを見たいとき、標本サイズについての直感が正しいか確かめたいときにも使います。その直感がたいてい直すべきものは、標本を大きくすれば推定が比例して良くなるという思い込みです。そうはなりません。標準誤差は平方根でしか下がらないからです。100個から400個に増やすと推定の広がりは半分になり、もう一度半分にするには1,600個が要ります。上の2つの結果はどんな形の母集団でも成り立つので、分布について何も知らないうちから使えます。このページが答えられないのは、与えられたnが標本平均をほぼ正規と見なせるほど大きいかどうかです。それはもとの分布がどれだけ歪んでいるかで決まり、計算ではなく判断です。

計算例

  1. 既定値:平均100・標準偏差15の母集団から36個ずつ抽出

    1. 標本平均の分散:σ² / n = 225 / 36 = 6.25
    2. 標準誤差:√6.25 = 2.5
    3. 標本平均の平均:100。母平均がそのまま変わらずに出ます
    4. σ = 15と比べると:36個ずつ取ると広がりは6分の1になります。それが√36です

    15と36はどちらも暗算できるように選んであります。225 ÷ 36は6.25で、その平方根はきりのいい2.5です。3行目は何も起きていないように見えるからこそ、もう一度見る価値があります。すべての標本平均の平均は母平均であり、それはどの標本サイズでも成り立ち、近似ではなく期待値についての事実です。100 = 100を見ることがこの行の狙いで、入力のおうむ返しに見えても印字しているのはそのためです。

  2. 同じ母集団を36個ではなく9個ずつ抽出

    1. 標本は4分の1の大きさなので、分散は4倍になります:225 / 9 = 25
    2. 標準誤差:√25 = 5
    3. 平均はやはり100です。標本を小さくして変わったのは広がりだけで、ほかは何も変わりません
    4. 最初の例と比べると、nは4分の1になったのに標準誤差は2倍になっただけです

    この2つは平方根の法則を具体化したものです。標本を4分の1にすると標準誤差は2倍にしかなりません。nに比例して変わるのは分散のほうだからです。逆に読むと、精度がなぜ高くつくかの説明になります。4倍の標本が買うのは2倍の改善で、次の2倍の改善にはもとの標本の16倍がかかります。どんな標本サイズの決定もこの交換であり、下の参考表はそれをより広いnの範囲で示しています。

  3. 1個ずつ抽出すると広がりは変わらない

    1. n = 1では標本平均はその1つの観測そのものなので、標本分布は母集団自身になります
    2. 分散:225 / 1 = 225。これはσ²です
    3. 標準誤差:√225 = 15。これはσです
    4. 標本平均の平均はやはり100です

    n = 1という範囲の端は、考え方全体の錨なので見ておく価値があります。1つの標本は母集団からの1回の取り出しなので、平均で打ち消されたものは何もなく、標準誤差は母標準偏差そのものです。ほかのどんな標本サイズも、この出発点を√nで割ったものです。このページが2以上を要求せずn = 1を受け付けるのは、それが正当で示唆に富む入力だからです。標本分布が標本によって狭められていない、というだけのことです。

適用限界

上の2つの等式はどんな母集団でもどんなnでも成り立ちますが、記述しているのは標本分布の最初の2つのモーメントだけです。定理の3つ目の主張——近似的な正規性——こそが実務上の用途のほとんどを支えている部分で、このページが確かめられないのもそこです。nがどれくらい大きければよいかは、もとの分布がどれだけ歪んでいるかで決まるからです。ほぼ対称な母集団なら10で十分なことが多く、裾の長い分布では標本平均が落ち着くまでに数百個が要ることがあります。広く繰り返される30というしきい値は、結果ではなく経験則として扱ってください。この式は観測が独立であることも前提にしています。小さな母集団から非復元抽出をするとそれが破られ、標本サイズのページはその補正を適用して、ここが示すより少ない人数を求めます。ここにあるものはデータから推定した値ではありません。2つの入力はどちらも母集団の値で、手元にあるのが標本標準偏差だけなら、その違いを知っているのは信頼区間のページです。

よくある質問

標準偏差と標準誤差の違いは何か
標準偏差は個々の観測が平均からどれだけ離れているかを記述し、標準誤差は標本平均が母平均からどれだけ離れているかを記述します。2つ目は1つ目を√nで割ったもので、その割り算が違いのすべてです。σ = 15の母集団は、9個取っても900個取っても同じだけ散らばっていますが、900個の平均は100個の平均より3倍真実に近づきます。だからσはデータ自身の単位で表され、標準誤差は研究を大きくするほど縮みます。信頼区間や検定統計量に入るのが標準誤差なのも同じ理由です。
標本を大きくすると標本平均の平均は変わるのか
変わりません。これが最も信じにくい結果です。標本分布の平均は、n = 1から上までどの標本サイズでも母平均に等しくなります。平均を取ることは推定をどちらかへ押すのではなく、ばらつきを小さくするだけだからです。標本平均の分布は同じ中心のまわりで細く高くなります。標本サイズが買うのは精度であって正確さではありません。推定がどこを中心にしているかは動かさず、広がりだけを縮めます。一方で偏った抽出方法は中心そのものを動かし、どんな標本サイズでも戻せません。2つの失敗の型は分けて考えておく価値があります。
中心極限定理が成り立つには標本はどれくらい大きく必要か
母集団の形しだいで、すべてに効くしきい値はありません。対称な母集団はn = 10でよく振る舞い、強く歪んだ母集団では標本平均が正規に近づくまでに数百個の観測が要ることがあります。よく知られた30という経験則は、軽度に歪んだデータのシミュレーション研究から来たもので、定理ではなく妥当な既定値です。このページが形について何も仮定せずに与えるのは中心と広がりです。平均と標準誤差はどのnでも厳密です。大きな標本を必要とするのは正規近似のほうだけで、その上に載る信頼区間とp値がその要求を受け継ぎます。
標本平均の分散がデータの分散よりずっと小さいのはなぜか
平均を取ることが個々の観測の独立な誤差を打ち消し合うからで、打ち消しは標本サイズに比例して進みます。一方、人がふつうに比べる標準誤差はその平方根にしか比例しません。σ = 15でn = 36なら、分散は225から6.25へ36分の1になり、標準偏差は15から2.5へ6分の1にしかなりません。両方の行を印字しているのはそのためです。定理がふつう述べられるのは分散の形で、実際に使われるのは標準誤差の形で、2つの係数の開きが平方根です。
標準誤差のページと同じものか
同じ量を違う入力から計算しており、どちらが欲しいかは手元にあるもので決まります。このページは母標準偏差と標本サイズ——データを集める前に存在する値——を取り、研究を計画したり、nが精度をどう動かすかの直感を確かめたりするのに適しています。標準誤差のページは標本そのものを取り、そこから標準偏差を計算します。データが手元にあり母集団の値が分からないときに使うものです。2つは真ん中の推定の手順だけが違い、その違いが結果に響くのが信頼区間のページです。

参考文献

関連する計算ツール