二項分布計算
計算結果
ちょうどこの回数の確率
- この回数以下の確率
- 17.19%
- この回数以上の確率
- 94.53%
- 平均
- 5.00
- 標準偏差
- 1.58
- 分散
- 2.50
二項分布計算は、繰り返されるはい・いいえの試行について答えます。それぞれ確率pで成功する独立な試行をn回行うとき、ちょうどk回成功する確率はどれくらいでしょうか。この計算機はその確率と、累積確率の2つ(k回以下とk回以上)、そして分布全体を要約する3つの数(成功回数の平均、分散、標準偏差)を表示します。想定している設定は、試行回数があらかじめ固定されていて、成功確率が一定で、試行どうしが独立していることです。コイン投げやフリースローから、同じ確率で検査に通る部品の山まで、幅広く当てはまります。ふつう本当に必要なのは累積確率の2つです。現実の問いは、あるちょうど1つの回数ではなく、目標に届くか上限に収まるかであることがほとんどだからです。
公式
P(X = k) = C(n, k) · p^k · (1 − p)^(n − k)、ただしC(n, k) = n! / (k! (n − k)!)
- n
- 試行回数で、最大1,000回です。同じはい・いいえの事象を独立に繰り返した回数にあたります。この上限は数学的なものではなく性能のものです。二項分布はずっと大きなnでも完全に定義できますが、このページの計算量はnとともに増えるので、固まってしまうページは答えを出さないページより悪いのです
- k
- 尋ねている成功の回数です。nを超えることはできません。試行回数より多い成功は起こりにくい結果ではなく、実行できない要求だからです
- p
- 1回の試行の成功確率で、0から100までのパーセントで入力します。どの試行でも同じ値であることが、試行を交換可能にし、回数を二項分布にします
- C(n, k)
- 二項係数で、n回の試行のうちk回の成功を並べる方法が何通りあるかを表します。真ん中あたりの回数が出やすいのはこれが理由です。真ん中に近い回数は、極端な回数よりはるかに多くの並べ方を持つからです
- p^k · (1 − p)^(n − k)
- k回の成功とn − k回の失敗からなる、ある1つの並べ方の確率です。並べ方の数を掛けることで、「1つの並べ方」が「どの並べ方でも」になります
- np
- 成功回数の平均です。分散はnp(1 − p)で、標準偏差はその平方根にあたり、パネルの最後の3行が報告しているのはこれです
試行を数える場面で使います。20個の部品のうち何個が検査に通るか、12本のフリースローのうち何本が入るか、10回のコイントスで表が8回以上続く確率はどれくらいか。実際に手を伸ばすのは累積の2行のほうです。目標はほとんどいつもしきい値だからです。品質ゲートを通るにはk回以上、予算に収まるにはk回以下、という形になります。しきい値をちょうどの行から読むと、回数を手で足し合わせることになります。別の道具を選ぶべきなのは、試行回数が前もって決まっていないとき(それは別の分布です)、成功確率が試行ごとに変わるとき、試行どうしが影響し合うときです。3つ目が現実にいちばんよく仮定を壊します。
計算例
10回試行・3回成功・毎回50%
- 10回の試行に3回の成功を置く並べ方はC(10, 3) = 120通り
- 1つの並べ方の確率は0.5³ × 0.5⁷ = 1/1,024
- 120 / 1,024 = 0.1171875。ちょうど3回成功するのは11.72%
- 0から3までの回数を足すとk回以下は17.19%、平均はnp = 10 × 0.5 = 5
2つの累積の行の間の隙間がこの例の要点です。k回以下17.19%とk回以上94.53%の間に11.72%が残り、その欠けた一切れがちょうど3回の確率、つまり尋ねた回数そのものです。k回以上を100%からk回以下を引いたものと読むよくある間違いを、この算術が捕まえます。そう読むとここでは82.81%になってしまいます。平均5、標準偏差1.58という要約も、この設定で3が珍しくないことを教えてくれます。平均より1標準偏差ちょっと下にあるだけです。
20回試行・毎回25%
- 平均はnp = 20 × 0.25 = 5回
- 分散はnp(1 − p) = 20 × 0.25 × 0.75 = 3.75、その平方根がおよそ1.94
- ちょうど4回成功する確率は18.97%で、ここでは最も出やすい回数
- k回以下は41.48%、k回以上は77.48%
4回成功は平均に近い回数であり、同時に最も出やすい回数でもあります。だから2つの累積の数が左右にこれほど非対称に分かれます。分布の41.48%が、最も出やすい回数以下にあるのです。この非対称は一般的で、覚えておく価値があります。pが小さいとき分布は上に長い裾を引くので、平均以下の回数については、その回数以下になる確率が直感より大きくなります。要約の行があると、項を足し合わせなくてもこれが見えます。平均5のまわりの標準偏差1.94なら、4は十分ありふれた範囲の内側です。
100回試行・成功0回・毎回2%
- k = 0のとき並べ方は1通りだけ(成功が1つもない)なのでC(100, 0) = 1
- その確率は0.98¹⁰⁰ ≈ 0.1326。1つも出ないのは13.26%
- 0回以下は同じ事象なので、その行と完全に一致する
- 「0回以上」は起こり得るすべての場合を含むので100%
この例がk回以上の行を確定させます。0回以上は情報のない端ではなく確実な事象です。どの結果も成功回数は0以上なので、100%が正しい答えであって仮の値ではありません。3つの行をまとめて読むと、行のあいだの1つずれが見えてきます。k回以下13.26%とk回以上100%を足すと100%を超えます。ちょうど0回という回数が両方の中に入っていて、重なっている分がその13.26%だからです。もう半分は平均についてです。100回で2回成功が見込みなら安全に聞こえますが、それでも1つも出ないことがおよそ8回に1回あります。
1,000回試行・毎回50%
- 平均は1,000 × 0.5 = 500回、分散は250なので標準偏差はおよそ15.81
- ちょうど500回(最も出やすい回数)の確率は2.52%
- k回以下は51.26%、k回以上も51.26%。500が中心だから
- 2つの累積が等しくなるのは平均のところだけ
ここから持ち帰るべきことが2つあります。1つ目は、最も出やすい回数は出やすい事象ではないということです。500は分布の山ですが、それでもおよそ40回に1回しか起きません。1,000通りの回数に確率を配り分けているからです。2つ目は、2つの累積の行がちょうど51.26%で等しいことです。これは役に立つ自己点検になります。平均のところでは分布が対称なので、等しくならないのは回数が中心からずれている証拠です。ここでの2.52%という確率が、何百桁にもなる二項係数から計算されていることにも注意してください。このツールが試行回数に上限を置いているのは、勇気を出して計算するのではなく、そういう理由です。
適用限界
二項モデルは3つの仮定の上に立っていて、どれか1つが崩れると、数はもっともらしいまま誤ります。試行回数は途中で決めるのではなく前もって固定されていること、成功確率はどの試行でも同じであること、試行どうしが独立であることです。現実にいちばんよく壊れるのは3つ目で、同じロット・同じ人・同じ日から取った試行は一緒に動きがちです。成功が固まって起きるとき、本当の広がりはこのページが報告するより大きくなります。さらに2つの限界を挙げておきます。試行回数の上限は1,000で、これは数学的なものではなく性能のものです。モデルはそのはるか先まで定義されていますが、計算量は試行回数とともに増え、固まったページは誰の役にも立ちません。もう1つ、このページには回数ごとの確率の表がありません。欲しくなる表は成功回数ごとに1行の表で、それは入力する試行回数と確率によって決まりますが、ここにある参考表はその入力を見ることができません。パネルの3つの行が、選んだ数に対するその表の形です。
よくある質問
- 「k回以上」とは、100%から「k回以下」を引いたものではないのですか
- 2つの事象が補事象ではないからです。k回以下は0回からk回まで、k回以上はk回からn回までを指します。ちょうどk回はどちらにも入っているので、100%から片方を引くとその重なった部分が抜け落ちます。そしてそれは、尋ねた確率そのものです。k回以上の補集合が欲しいときはk − 1回以下の行を使ってください。あるいは3つの行をまとめて読んでください。ちょうどk回はいつも残りの2つの間の隙間で、その隙間は3つ全部の点検に使えます。
- 成功確率は0%や100%でもよいのですか
- はい。どちらも端の例外ではなく、意味のある入力です。0%ならその事象は決して起きないので、成功回数は確実に0回になります。100%なら必ず起きるので、回数は確実にn回です。パネルは結果としての0%と100%の行をそのまま表示します。小さくても起こり得ると思っていた回数がすべて0%になっているときは、成功確率の欄を確認してください。10と入れるつもりで0を入れると、まさにそうなります。
- 成功回数ごとの確率を並べた表がないのはなぜですか
- そのような表は、入力する試行回数と成功確率によって決まるもので、このページの参考表はその入力を見ることができません。参考表は定数から計算されるので、あなたの設定と似た見出しの下に、別の設定の数が並ぶことになります。代わりに結果パネルの3つの行が、尋ねた回数のところでのその表の形を与えます。ちょうどの回数、それ以下すべて、それ以上すべてです。分布全体を見たいときは成功回数を変えて、ちょうどの行をもう一度読んでください。それらの値が、1行ずつではありますが、その表です。
- 平均は、確率が教えてくれない何を教えてくれますか
- 分布がどこに位置しているかを教えてくれます。それが回数を解釈できるものにします。平均5回・標準偏差1.58なら3回はありふれた結果ですが、同じ3回でも平均12に対してならかなり外れです。平均はnp、分散はnp(1 − p)、標準偏差はその平方根です。3つの要約の行は、1つずつの確率ではなく、中心と広がりによって分布を表したものです。
- 試行回数より多い成功を求めたらどうなりますか
- 0%として答えず、拒否します。試行回数より多い成功は起こりにくい結果ではなく、そもそも結果になりません。0%と報告すると、モデルがそれを検討して除外したかのように見えてしまいます。パネルはエラーを報告します。試行回数が1,000を超える場合も同じで、こちらは数学が成り立たなくなるからではなく、性能の上限として拒否されます。
- 試行は本当に独立でなければならないのですか
- はい。そしてこれが、現実のデータでいちばんよく破れる仮定です。成功が固まって起きるなら、つまり同じ生産ロットの部品、同じ選手が同じ日に打ったシュート、同じ医院の患者なら、試行どうしが互いの情報を持ち、回数の本当の広がりは二項分布が言うより大きくなります。固まりがあるとき、平均はおおよそ正しいままですが、標準偏差と裾の確率はそうではありません。まず疑うべきは3つの要約の行です。試行が固まると分かっているときは、余分なばらつきを組み込んだモデルが適切な道具になります。
参考文献
- 1.3.6.6.18. Binomial Distribution — e-Handbook of Statistical Methods: 二項確率関数、その平均npと分散np(1 − p)、そしてこのモデルが置いている仮定 — National Institute of Standards and Technology (NIST)
- 二項分布(Introductory Statistics 2e, §4.3)— 試行回数が固定され、成功確率が一定で、試行が独立であること。そしてk回以下・k回以上の行が使う累積の形 — OpenStax(ライス大学)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods: 回数が分布を持つとはどういうことか、そして割り当てられた結果から確率をどう読むか — National Institute of Standards and Technology (NIST)