メインコンテンツへスキップ
CalcMax

p値計算

下限:1

下限:1

計算結果

4.9996%

p値

p値の計算機は、検定統計量を、帰無仮説が真であるときに少なくともそれくらい極端な値を見る確率に変換します。応用統計の大半を運ぶ4つの統計量——z・t・カイ二乗・F——を扱い、必要とするのは統計量、その自由度、そして裾の選択だけです。最もよく間違えられるのが裾の設定です。両側検定は両方向を数え、片側検定は予測した側だけを数えます。出力は百分率で表された1つの数です。このページが意図的にしないのは判定です。有意水準はあなたが持ち込むものだからです。

公式

上側の裾:p = P(T ≥ t)  下側の裾:p = P(T ≤ t)  両側:p = 2 · min( upper, lower )(対称な分布のみ)

t
すでに計算した検定統計量——大標本からのz、小標本からのt、数え上げたカテゴリからのカイ二乗、2つの分散の比からのFです。このページはそれを計算せず、変換します
T
帰無仮説が真なら統計量が従ったであろう分布です。どれかは4択の選択器から来て、選択は好みではありません。tのところで正規分布を使うと、すべてのp値が小さくなりすぎます
df
自由度——データの性質ではなく統計量の計算のされ方の性質で、t・カイ二乗・Fが必要とします。Fは2つ要ります。分子の自由度は比べている群や項の数、分母の自由度は残差の標本サイズから来ます
α
有意水準で、p値が比べられるしきい値です。このページの入力ではないのは、計算の一部ではないからです。これから下す判断に属するもので、既定の0.05に対して判定を印字すれば、そのしきい値をあなたの代わりに選んだことになります
p
裾の確率で、小数ではなく百分率で報告されます。p値0.05は5.0000と表示されるので、画面上の数の小数点を動かさずに、引用された有意水準と直接比べられます

すでに統計量があって、それに付く確率が欲しいときに使います。統計量が与えられた教科書の練習問題、統計量は印字したがp値は印字しなかったソフト、自分で確かめたい手計算などです。最も効く選択は裾の設定で、その規則はデータを見た後ではなく前に固定されます。どちらの向きも帰無仮説からの逸脱として数えるなら両側を選びます。これがふつうの場合です。片側は、反対向きの結果がまったく興味の対象にならず、そう前もって述べたときにだけ選びます。2つ目の選択は分布です。どのp値が欲しいかではなく、統計量がどう作られたかに合わせてください。zは比率や分散既知の平均、tは広がりが同じ小標本から来た平均、カイ二乗は数え上げたカテゴリ、Fは分散の比較です。この組み合わせを間違えるのが、正しい算術が無意味な数を生む最もよくある経路です。

計算例

  1. z = 1.96、古典的な両側のしきい値

    1. 上側の裾:P(Z ≥ 1.96) = 0.025002、標準正規分布から計算
    2. 正規曲線は対称なので下側の裾も同じ:P(Z ≤ −1.96) = 0.025002
    3. 両側:2 × 0.025002 = 0.050004
    4. 百分率で:5.0000%。これがみんなが引用する5%です

    1.96は、ちょうど5%になるように選ばれた値です。きりのいい5.0000ではなく4.9996と出るのは誤りではありません。真の分位点は1.959964なので、1.96自体が丸めです。自由度の欄は3つとも埋まっていますが、読まれるのは統計量と裾の設定だけです。zは自由度を必要としないからです。使われない2つの欄は常に画面にあり、そこが空でも値が入っていても何も変わりません。

  2. 自由度10のt = 2.2281

    1. 自由度10のt分布は正規曲線より裾が重い
    2. 上側の裾:P(T ≥ 2.2281) = 0.0250015
    3. 両側:2 × 0.0250015 = 0.050003、つまり5.0003%

    これをzの例と比べると、t分布の意味が見えます。同じ5%という裾の面積が、1.96ではなく2.2281に座っています。小さな標本は、証拠が同じだけ珍しくなるまでにより遠くまで届かなければならないからです。その開きを決めているのが標本サイズそのものです。自由度1,000ではtの臨界値は1.962で、2つの分布は実質同じ曲線になります。

  3. 自由度3のカイ二乗20、上側の裾のみ

    1. カイ二乗分布に負の半分はないので、ここでは上側の裾しか使えません
    2. 自由度3でP(χ² ≥ 20) = 0.00016975
    3. 百分率で:0.017%

    これはカイ二乗のページが、度数30・10・20・40を等しい期待度数と比べて出す統計量です。p値は小さく出たので——0.017%——4つのカテゴリは等確率ではありません。欠けていて別に尋ねなければならないものに注目してください。このページは統計量がどれだけ珍しいかを言い、最小の期待度数のことには何も言いません。カイ二乗の近似がそもそも適切だったかを決めるのはその確認です。

適用限界

p値は1つの狭い問いに答え、それでは答えられないいくつかの問いに答えたものとして日常的に読まれます。帰無仮説が真である確率ではなく、結果が偶然起きた確率でもなく、効果の大きさの尺度でもありません。取るに足らない差も、標本が十分大きければ圧倒的に有意になり、重要な差も12人の標本ではp = 0.20に座ることがあります。また、統計量の背後のモデル次第でもあります。ここにある4つの分布は観測が独立であることを前提にしており、集まった標本や反復測定から計算した統計量は、式が思っているより少ない独立な観測しか運んでいません。そのため、それに対して報告されるp値はすべて小さくなりすぎます。2つの門は読者に任せず強制されます。カイ二乗とFでは負の統計量が拒否されます。これらの分布は正の半直線に住んでおり、負の値は統計量が誤って計算されたことを意味するからです。そしてカイ二乗とFの両側も拒否されます。これらの分布は非対称で、認められた両側の流儀が1つもないからです。

よくある質問

p値とは何か
帰無仮説が真で、統計量の背後のモデルが正しいと仮定したとき、手元のものと同じかそれ以上に極端な検定統計量が得られる確率です。p値は仮説ではなくデータを記述します。小さいp値は、何も起きていなければ観測された結果は珍しいと言っているだけで、何かが起きていると言っているのとは違います。そこから結論への一歩は、前もって選ぶ有意水準と、数値に入っていないその分野について知っていることすべてを通ります。
片側と両側のどちらを使うべきか
データを見る前に別の判断をしていて、どちらの向きを予測したかを言えるのでなければ、両側です。両側検定はどちらの向きの結果も帰無仮説への証拠として数えます。これはほとんどの問いが実際に立てられる仕方に合っています。物事を悪くする薬も所見です。片側検定は正当ですがp値を半分にしますし、データを見てから裾を選ぶのは、何もないところから有意な結果をねつ造する最もよくある方法です。迷ったら両側を使ってください。保守的な選択で、査読者が期待するものです。
p値はどの有意水準と比べればよいのか
データを集める前に自分で固定した水準です。慣例では0.05ですが、その慣例は結果ではなく習慣です。ここで意図的に入力にしていないのはそのためで、判定も印字しません。同じ0.04というp値が、ある場面では発見で別の場面では雑音だからです。1万個の遺伝子を信号について走査するのと、10年の先行研究が支える1つの仮説を検定するのとでは、まったく違うしきい値が求められます。保つ価値のある慣例は、水準を前もって選び、p値と並べて報告することです。数が画面に出てから調整するのではありません。
カイ二乗やFで両側を選べないのはなぜか
その2つの分布が非対称で、両側にする認められた方法が1つもないからです。よくある手順——小さいほうの裾を2倍する——は、最も効くところで悪く振る舞います。カイ二乗がちょうど0のとき、つまり観測と期待が完全に一致していて最も有意でない結果のときに、p値0%を返します。完全な一致が最大の有意性として報告されるのは丸めの産物ではなく誤った答えで、しかも画面にはまったく普通に見える形で現れます。対称な分布では2つの裾は曖昧さがなく、片方を2倍すれば厳密です。非対称な分布では上側の裾だけが、実際に問われていること——これだけ大きな統計量はどれくらい意外か——に答えます。
負のカイ二乗やFの統計量をこのページが拒否するのはなぜか
どちらの統計量も負になり得ないので、負の値はその数が帰属先の検定以外のどこかから来たことを意味します。どちらも二乗された量から作られています。カイ二乗は度数の間の差の二乗から、Fは2つの分散の比からです。二乗された量が0を下回ることはありません。このページは100%を返すこともでき、算術的には整合しますが、それは誤って計算された入力をそのまま受け入れて本物の結果に仕立てることでもあります。ここでは拒否に何の代償もありません。拒否が止めるべき正当な負のカイ二乗が存在しないからです。
このページに臨界値の表がないのはなぜか
p値の表は検定統計量で索引するしかなく、統計量はどんな数にもなり得るので、その表は無限に行が必要になるからです。教科書の巻末に載っている表は逆向きで、慣例的な有意水準の数行と、必要になりそうな自由度の列です。1ページに収まるのは、有意水準が少なく前もって合意されているからです。このページは入力された統計量のところで裾の面積を評価します。表にできないのはまさにそれで、表はたまたま載っている値の上か下かしか言えません。この集合で最も近い表は臨界値のページにあり、行が有意水準で、列が対応するzです。2つのページは同じ事実を反対側から読んだもので、関連ツールの中で互いを最初に挙げているのはそのためです。

参考文献

関連する計算ツール