t検定計算
計算結果
t統計量
- p値
- 34.6594%
- 自由度
- 8
- 標準誤差
- 1.0000
t検定の計算機は、平均についての最もよくある検定を走らせます。標本平均・標準偏差・標本サイズを、t統計量・p値・そして残り2つが読まれる自由度に変えます。1標本モードは平均を固定の値——目標、仕様、過去の平均——と比べます。2標本モードは2つの群を互いに比べ、ここで実装されているのは等分散を前提するプールした2標本t検定です。2つの標準偏差はn − 1の重みで平均され、その単一のプールした分散が標準誤差を駆動します。代わりのWelchの検定は等分散の前提を落とし、群の大きさと広がりが違うときにより安全な既定ですが、自由度が小数になり、コードの別の場所での別の計算になります。このページは等分散の検定を行い、黙って近似するのではなくそう述べます。p値は統計量を超えるt分布の裾の面積で、百分率で印字されます。
公式
1標本:t = (x̄ − μ₀) / (s / √n) 2標本:t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- 検定統計量——観測された平均が検定される値から標準誤差いくつ分離れているかです。符号が向きを運ぶので、逆向きの片側検定はエラーではなく大きなp値を返します。「より大きい」を対立仮説としてtが−1なのは小さな効果ではなく、反対向きを指す証拠で、裾の面積はそう言っています
- x̄, μ₀
- 標本平均と、それと比べられる値で、1標本モードのものです。分子はその差なので、統計量はデータの単位での距離を測ります。同じ差でも、広がりが大きいか標本が小さいときはるかに小さく数えられることで、分母がそれを供給します
- s
- 標本標準偏差で、あらかじめ知られているのではなくデータから推定されます。t分布が正規分布の代わりに使われる理由はこの推定そのものです。それが持ち込む余分な不確かさが裾を重くし、tの臨界値が会計処理しているのはその重い裾です。ゼロより大きい必要があります。変動のない標本には割る分母がないからです
- n
- 標本サイズで、1標本モードでは自由度n − 1を与えます。2標本検定では2つの大きさが合わさってどちらか一方より1つ多くなります。n₁ + n₂ − 2です。プールした分散が、広がりを測る前に各群の平均に自由度を1つずつ使うからです
- s_p²
- プールした分散——2つの群の分散の重み付き平均で、それぞれが自分の自由度で重み付けられます。等分散の前提が入ってくるのはここです。2つの群は単一の母集団の広がりからの2つの標本として扱われるので、観測が多い群、あるいは自分の分散が小さい群が、単一の共有された推定に比例して寄与します。2つの分散が大きく違うなら、このプールこそが悪さをするところで、Welchの検定がその修理です
- p-value
- 2つの平均が本当に同じだったとき、検定が問う向きで、少なくともこれだけゼロから離れた統計量が得られる確率です。両側は|t|を超える面積を2倍にし、以上と未満の対立仮説はそれぞれ片側を取ります。ここでは百分率で報告されるので、5%がおなじみの0.05で、仮説が与えられたときのデータについての言明であって、データが与えられたときの仮説についての言明ではありません
標本から平均と標準偏差が手元にあって、目標との差、または別の群との差が、標本のばらつきが説明するより大きいかどうかを知りたいときに使います。1標本モードは比較する値が固定の数である場合——500グラムを充填するよう設定された機械、5ミリの仕様、昨年の平均——を扱い、2標本モードはどちらの量も測定され、どちらも特権的でない場合を扱います。答えを読む前に決めておく価値のあることが2つあります。1つ目は片側か両側かです。両側検定は2つの群がどちらかの向きに違うかを問い、正しい既定です。片側検定は向きのある問いを立てるもので、答えがより好都合になるからではなく、向きが前もって指定されていたから選ぶべきです。2つ目は等分散の前提で、2標本モードはこれを行い、あなたの代わりに確かめることはできません。手がかりはパネルにあります。入力した2つの標準偏差が近ければプールする代価は小さく、2倍以上違うなら欲しいのはWelchの検定です。このページはプールした検定を計算します。等分散の場合に、ほとんどの教科書とほとんどの統計家が「t検定」で意味するものであり、入力した2つの標準偏差を報告するので、前提は仮定されるのではなく判断できます。
計算例
既定:標本平均6を目標5と比べる
- 標準誤差:s / √n = 3 / 3 = 1
- t統計量:(6 − 5) / 1 = 1——標本平均は目標の標準誤差1つ分上にあります
- 自由度:n − 1 = 8
- 両側p値:自由度8のt分布で±1を超える面積で、34.66%です
1単位まるまるの差は、標準誤差をその隣に置くまでは大きく聞こえます。標準誤差1つ分は標本のばらつきが生む範囲に十分収まっており、p値もそう言っています。正規曲線との比較は示唆に富みます。tが同じ1でも、分布が正規なら31.7%になり、余分な3ポイントは、標準偏差を知っているのではなく9つの観測から推定したことの代価です。
t統計量2.306がちょうど5%を与える
- 標準誤差:3 / √9 = 1なので、t統計量は平均そのものです
- t統計量:(2.306 − 0) / 1 = 2.306
- 自由度8での95%両側t境界は2.306です
- 境界にちょうど座るということは、両側p値がちょうど5%ということです
これは臨界値のページが反対側から出す組で、2つを並べると、それらが1つの事実を両端から読んだものだと最も明快に示せます。あのページに自由度8で95%両側のt境界を求めれば2.306が返り、2.306をこのページに入れればp値はちょうど5%で返ってきます。間で何も丸められていません。標準偏差3と標本サイズ9が標準誤差をちょうど1にするので、統計量と境界が同じ数になるように選ばれた値だからです。すぐ下の統計量は5%を上回り、すぐ上は5%を下回ります。
同じ広がりを持つ10人ずつの2群
- プールした分散:((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4なので、プールした標準偏差は2
- 標準誤差:√(4 × (1/10 + 1/10)) = √0.8 = 0.8944
- t統計量:(5 − 4) / 0.8944 = 1.118
- 自由度:10 + 10 − 2 = 18で、両側p値は27.83%です
2つの分散が等しいとき、プールは何もしません。プールした分散は4になり、両方の群が供給した値とちょうど同じです。そして標準誤差は、どちらの群の標準偏差を自分の√nで割ったものより小さくなります。10人ずつの2つの平均を比べることは、10人の単一の平均を推定することより不精密です。標準誤差0.8944対0.6325で、1つを測るのではなく2つの不確かな量を引いているからで、単一の標本では答えられない問いに答えるときだけこの代価を払う価値があります。母平均の欄がこのモードで画面に出ていて使われていないことに注意してください。どちらの量も測定されているので、どちらも固定の目標ではありません。
広がりも大きさも違う2群、プールをよく見るべき場合
- プールした分散:((9 × 4.41) + (11 × 3.24)) / 20 = (39.69 + 35.64) / 20 = 3.7665
- 標準誤差:√(3.7665 × (1/10 + 1/12)) = √0.6905 = 0.831
- t統計量:(5.2 − 4.1) / 0.831 = 1.3237
- 自由度:10 + 12 − 2 = 20
プールした分散は3.7665で、4.41と3.24の中点ではありません。12の群のほうが重く重み付けられており、10の群の9に対して自由度を11寄与するからです。その重み付けが「プール」という言葉の中身のすべてで、2つの標準偏差を平均しても答えを再現できない理由です。ここでの2つの広がりは等分散の前提が心地よいほど近いものです。2.1と0.6のような組でこの群の大きさならそうはならず、Welchの検定は目に見えて違うp値を返します。
900の観測からのt = 1.96、tとzが収束したところ
- 標準誤差:3 / √900 = 3 / 30 = 0.1
- t統計量:(5.196 − 5) / 0.1 = 1.96
- 自由度:899
- 両側p値:5.0304%——ちょうど5ではなく、それをわずかに超えています
有名な1.96は正規曲線では5%を与え、ここでは5.0304%を与えます。その差がこの例の要点です。自由度899ではt分布は正規とほとんど見分けがつきませんが、正確には同じではありません。裾がまだわずかに重いので、同じ統計量がわずかに外側に座ります。これが、大きな標本でt = 1.96が自動的に5%で有意にならない理由であり、0.0499と報告するソフトと0.0501と報告するソフトが、同じ研究について小数第3位で食い違いうる理由でもあります。
適用限界
2標本モードは2つの群が分散を共有することを前提にしており、その前提は表記を整えるのではなく実際に働いています。群の大きさが等しいときは分散が違ってもプールした検定はかなり頑健ですが、大きさが不等で分散も違うときは、検定はどちらの向きにも深刻に誤りえます。これがベーレンス=フィッシャー問題で、Welchの検定はそれを解くためにあります。2つの標準偏差がパネルにあるのはそのためです。p値を信じる前に比べてください。一方が他方のおよそ2倍を超え、しかも群の大きさが違うなら、欲しいのは等分散の検定ではありません。1標本モードにこの問題はありませんが、観測が独立であることを前提にしており、1つの対象への反復測定や、対応のあるデータ・集まったデータでは成り立ちません。そこでは対応のある検定や混合モデルが要ります。どちらのモードももとのデータがほぼ正規であることを前提にし、どちらも標本が大きくなるにつれてそれに鈍くなります。自由度900の歪んだ観測でのt検定が妥当で、9つの歪んだ観測でのt検定が疑わしいのは、中心極限定理のおかげです。最後に、このページは統計量とp値を報告し、結論は出しません。比べる有意水準を持たず、0.05という数は結果ではなく慣例なので、判断はそれが属する場所に残されます。
よくある質問
- このページはプールとWelchのどちらの2標本t検定を使うか
- プールのほう——等分散の検定で、自由度はn₁ + n₂ − 2です。Welchの検定は2つの群が広がりと大きさで違うときにより良い選択で、2つの標準偏差の欄は確かめられるようにパネルにあります。一方が他方のおおよそ2倍を超え、標本サイズが違うなら、欲しいのはWelchで、このページは時には大幅にずれたp値を与えます。等分散版をここで実装しているのは、それが教科書の検定で、リファレンスマニュアルが等平均の2標本t検定と呼ぶもので、その整数の自由度がこのページの算術を近似ではなく厳密に保つからです。
- 片側検定と両側検定のどちらを使うべきか
- データを見る前に向きが指定されていなければ両側です。両側検定は2つの群がそもそも違うかを問い、有意水準を両端に分けます。片側検定は一方の群が大きいかを問い、水準の全体をその裾に置くので、有意に到達しやすくなります。同じ水準でちょうど2倍で、1.96が1.645になるからです。問いが本当に向きを持つときは正当な選択で、差がどちら向きに出たかを見てから向きを選んだときは結果を追いかける一形態です。
- t統計量とp値の違いは何か
- t統計量は差を標準誤差で測り、標本サイズをその中に含んでいます。p値はその数値を、対応する自由度でのt分布を使って確率に変換します。つまりtは「これらは標準誤差いくつ分離れているか」に答え、p値は「標本のばらつきだけでこれだけの隔たりがどれくらいの頻度で生じるか」に答えます。両方を報告するのは、1つ目が同じデザインの研究をまたいで比較でき、2つ目が有意水準と比べられるものだからです。どちらも効果の大きさではありません。大きな標本は取るに足らない差から大きなtとごく小さなp値を生みえます。
- t統計量1.96がちょうど5%にならないのはなぜか
- 1.96は正規曲線の5%境界で、t分布は有限の自由度で裾がわずかに重いからです。自由度899ではt = 1.96は5.0304%を与え、線をわずかに超えます。自由度8では同じ統計量が8.57%を与えます。t分布は自由度が増えるにつれて正規に収束し、曲線はどこまでも同じものです。変わるのは裾の重さだけです。0.0499というp値を報告するソフトと、1.96に対する手計算が有意と言うことがありうる理由で、どちらも誤りではありません。
- 負のt統計量は何を意味するのか
- 標本平均が、比べている値より下に出た、または2標本モードで2つ目の群の平均より下に出たということです。符号は向きの情報でそれ以上ではありません。分布に対するその大きさがp値の計算もとです。両側検定ではどちらの極端も数えるので符号は捨てられます。片側検定では符号が意味を持ち、情報を与ええます。「以上」の対立仮説に対してtが−2.5ならp値は99%近くになり、これは帰無の結果ではなく反対向きを指す証拠で、それを「有意でない」と報告するのはその情報を捨てることになります。
- t検定には観測がいくつ必要か
- このページは群ごとに少なくとも2つを要求します。1つの観測の標準偏差が定義されないからです。それは実際的な推奨ではなく数学上の下限です。群ごとに2つの観測でのt検定は自由度が1つで、莫大な差以外を検出する力がほとんどなく、2つの群がほとんど重ならなければp値は大きくなります。有用な問いは式が許す最小値ではなく、気にかける差を検出するのに必要な標本サイズで、それはデータの広がりと気づきたい効果量で決まります。その計算が住んでいるのは標本サイズのページで、そこではデータセットから前向きにではなく、誤差範囲から逆向きに働きます。
- tの臨界値の表はどこにあるのか
- 臨界値のページにあり、この集合ではそこにしかありません。このページが表を印字しないのは、有意水準だけでなく自由度でも索引しなければならず、有意水準ごとに本の1ページになってしまうからです。答えを調べるのではなくここで計算する理由でもあります。表は誰かが印字しようと選んだ自由度しか並べられず、2標本検定が生む自由度n₁ + n₂ − 2はほとんどいつもその中にありません。頭に置く価値のある境界は1つで、tの値は標本が大きくなるにつれて1.96に収束します。だから探している表は、自由度が上がるにつれて縮む罰則の付いた正規の表です。
参考文献
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods:このページが実装しているプールした2標本検定。プールした標準偏差とそのn₁ + n₂ − 2の自由度を含みます — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods:標本平均と、1標本の統計量が組み立てられるもとになる標準誤差 — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods:自由度が増えるにつれてt分布が近づく曲線。1.96と5%が互いの相手になるのが近似的でしかない理由です — National Institute of Standards and Technology (NIST)