본문으로 건너뛰기
CalcMax

이항분포 계산기

범위: 0 – 1,000

최솟값: 0

범위: 0 – 100

계산 결과

11.72%

정확히 이 횟수일 확률

이 횟수 이하일 확률
17.19%
이 횟수 이상일 확률
94.53%
평균
5.00
표준편차
1.58
분산
2.50

이항분포 계산기는 되풀이되는 예 또는 아니오 시행에 대한 질문에 답합니다. 각각 확률 p로 성공하는 독립 시행 n번에서 성공이 정확히 k번 나올 확률은 얼마인가 하는 질문입니다. 그 확률과 함께 두 가지 누적값, 즉 k번 이하와 k번 이상을 보고하고, 분포 전체를 요약하는 세 수인 성공 횟수의 평균, 분산, 표준편차도 함께 보여 줍니다. 이 모형이 서술하는 상황은 시행 횟수가 고정되어 있고, 성공 확률이 일정하며, 시행끼리 독립인 경우입니다. 동전 던지기와 자유투부터, 각 부품이 같은 확률로 검사를 통과하는 부품 묶음까지 모두 여기에 들어갑니다. 실제로 사람들이 필요로 하는 것은 대개 누적값입니다. 진짜 질문은 특정한 한 횟수에 관한 것이 아니라 목표에 닿는지 한계 아래로 머무는지에 관한 것이기 때문입니다.

공식

P(X = k) = C(n, k) · p^k · (1 − p)^(n − k) 여기서 C(n, k) = n! / (k! (n − k)!)

n
시행 횟수이며 최대 1000입니다. 같은 예 또는 아니오 사건을 독립적으로 되풀이한 횟수입니다. 이 상한은 수학적인 한계가 아니라 성능상의 한계입니다. 이항분포는 훨씬 큰 n에서도 문제없이 정의되지만, 이 페이지의 조합수는 n과 함께 커지고, 멈추는 페이지는 거절하는 페이지보다 나쁩니다
k
묻고 있는 성공 횟수입니다. n을 넘을 수 없습니다. 시행보다 많은 성공은 일어나기 어려운 결과가 아니라 불가능한 요청이기 때문입니다
p
시행 한 번의 성공 확률이며 0에서 100까지의 퍼센트로 넣습니다. 모든 시행에서 같은 값이며, 그래서 시행들이 서로 교환 가능하고 그 횟수가 이항분포를 따릅니다
C(n, k)
이항계수입니다. n번의 시행 가운데 성공 k번을 배치할 수 있는 방법의 수입니다. 가운데쪽 횟수가 가장 그럴듯한 이유가 여기 있습니다. 가운데 가까운 횟수는 극단적인 횟수보다 훨씬 많은 방식으로 배치됩니다
p^k · (1 − p)^(n − k)
성공 k번과 실패 n − k번의 한 가지 특정 배치가 나올 확률입니다. 여기에 배치의 수를 곱하면 한 가지 배치가 어떤 배치로든 넓어집니다
np
성공 횟수의 평균입니다. 분산은 np(1 − p)이고 표준편차는 그 제곱근이며, 패널의 마지막 세 행이 이것을 보고합니다

시행을 재는 것이 아니라 세는 상황에 씁니다. 부품 20개 가운데 몇 개가 검사를 통과하는지, 자유투 12개 가운데 몇 개가 들어가는지, 동전 10번에서 앞면이 적어도 8번 나올 확률이 얼마인지 같은 질문입니다. 실전에서 손을 뻗을 곳은 두 개의 누적 행입니다. 목표는 거의 언제나 문턱이기 때문입니다. 품질 관문을 통과하려면 k번 이상, 예산 안에 머물려면 k번 이하입니다. 문턱을 정확히 k번 행에서 읽으려면 횟수를 손으로 더해야 합니다. 시행 횟수가 미리 정해지지 않았을 때, 시행마다 성공 확률이 달라질 때, 시행끼리 서로 영향을 줄 때는 다른 도구를 고르세요. 세 번째가 실제 데이터에서 가정을 가장 자주 깨뜨립니다.

계산 예시

  1. 시행 10번, 성공 3번, 매번 확률 50%

    1. 시행 10번 가운데 성공 3번을 놓는 방법이 C(10, 3) = 120가지입니다
    2. 한 배치의 확률은 0.5³ × 0.5⁷ = 1/1024입니다
    3. 120 / 1024 = 0.1171875이므로 정확히 3번 성공은 11.72% 나옵니다
    4. 0번부터 3번까지를 더하면 3번 이하가 17.19%이고, 평균은 np = 10 × 0.5 = 5입니다

    두 누적 행 사이의 틈이 이 사례의 요점입니다. 3번 이하 17.19%와 3번 이상 94.53% 사이에 11.72%가 남고, 그 빠진 조각이 정확히 3번의 확률, 즉 물어본 그 횟수입니다. 3번 이상을 1에서 3번 이하를 뺀 값으로 읽는 흔한 실수를 잡아내는 셈이 바로 이것이며, 그렇게 읽으면 여기서 82.81%가 됩니다. 평균 5에 표준편차 1.58이라는 사실도 3이 이 설정에서 특별할 것이 없다는 것을 알려 줍니다. 평균보다 1 표준편차 조금 넘게 아래에 있을 뿐입니다.

  2. 시행 20번, 매번 확률 25%

    1. 평균은 np = 20 × 0.25 = 5번입니다
    2. 분산은 np(1 − p) = 20 × 0.25 × 0.75 = 3.75이고 그 제곱근은 약 1.94입니다
    3. 정확히 4번 성공의 확률은 18.97%이며 여기서 가장 그럴듯한 한 횟수입니다
    4. 4번 이하는 41.48%, 4번 이상은 77.48%입니다

    성공 4번은 평균에 가까운 횟수이면서 동시에 가장 그럴듯한 한 횟수이고, 그래서 두 누적값이 그 양옆에 그렇게 비대칭으로 놓입니다. 분포의 41.48%가 가장 그럴듯한 횟수 이하에 있습니다. 이 비대칭은 일반적이며 기억해 둘 만합니다. 평균 이하의 어떤 횟수든 그 횟수 이하일 확률은 직관보다 큽니다. p가 작을 때 분포가 위쪽으로 긴 꼬리를 갖기 때문입니다. 요약 행이 있으면 항을 더하지 않고도 이것을 볼 수 있습니다. 평균 5 주위의 표준편차 1.94는 4를 평범한 범위 안에 넣습니다.

  3. 시행 100번, 성공 0번, 매번 확률 2%

    1. k = 0이면 배치가 하나뿐입니다. 성공이 하나도 없는 경우이므로 C(100, 0) = 1입니다
    2. 그 확률은 0.98¹⁰⁰ ≈ 0.1326이므로 하나도 얻지 못할 확률이 13.26%입니다
    3. 0번 이하는 같은 사건이므로 그 행이 정확히 일치합니다
    4. 0번 이상은 가능한 모든 결과를 포함하므로 100%입니다

    이 사례가 0번 이상 행을 못 박습니다. 0번 이상은 정보가 없는 경계가 아니라 확실성입니다. 모든 결과는 성공이 0번 이상이기 때문이며, 그래서 100%는 자리 표시자가 아니라 정답입니다. 세 행을 함께 읽으면 어긋난 하나가 눈에 보입니다. 0번 이하 13.26%와 0번 이상 100%를 더하면 100%를 넘는데, 정확히 0번이라는 횟수가 양쪽에 다 들어 있기 때문이고, 겹치는 양이 그 13.26%입니다. 나머지 절반은 평균에 관한 것입니다. 100번 가운데 성공이 두 번 기대된다는 것은 안전해 보이지만, 하나도 얻지 못하는 일은 여전히 여덟 번에 한 번꼴로 일어납니다.

  4. 시행 1000번, 매번 확률 50%

    1. 평균은 1000 × 0.5 = 500번이고 분산은 250이므로 표준편차는 약 15.81입니다
    2. 가장 그럴듯한 한 횟수인 정확히 500번의 확률은 2.52%입니다
    3. 500번 이하는 51.26%이고 500번 이상도 51.26%입니다. 500이 중심이기 때문입니다
    4. 여기서 두 누적값이 같아지는데, 이는 평균에서만 일어납니다

    여기서 가져갈 것이 두 가지 있습니다. 첫째, 가장 그럴듯한 한 횟수는 그럴듯한 사건이 아닙니다. 500은 분포의 봉우리인데도 마흔 번에 한 번꼴로만 일어납니다. 확률을 나눠 가질 횟수가 1000가지나 되기 때문입니다. 둘째, 두 누적 행이 정확히 51.26%로 같다는 점은 쓸모 있는 자기 점검입니다. 평균에서는 분포가 대칭이므로 두 값이 어긋나면 그 횟수가 중심에서 벗어나 있다는 뜻입니다. 여기서 2.52%라는 확률은 수백 자리 이항계수로 계산되며, 이 도구가 시행 횟수에 상한을 두고 무작정 버티지 않는 이유가 그것입니다.

한계

이항 모형은 세 가지 가정 위에 서 있고, 그중 하나가 깨지면 수는 그럴듯해 보이면서 틀립니다. 시행 횟수는 진행하면서 정하는 것이 아니라 미리 고정되어야 하고, 성공 확률은 모든 시행에서 같아야 하며, 시행끼리 서로 독립이어야 합니다. 실제 데이터에서 가장 자주 깨지는 것은 세 번째입니다. 같은 묶음, 같은 사람, 같은 날에서 뽑은 시행은 함께 움직이는 경향이 있기 때문입니다. 성공이 몰려서 나오면 실제 퍼짐은 이 페이지가 보고하는 것보다 넓습니다. 두 가지 한계를 더 밝혀 둡니다. 시행 횟수는 1000으로 제한되는데, 이는 수학적인 한계가 아니라 성능상의 한계입니다. 모형은 그보다 훨씬 너머에서도 정의되지만 조합수가 시행 횟수와 함께 커지고, 멈추는 페이지는 누구에게도 도움이 되지 않습니다. 그리고 이 페이지에는 성공 횟수별 확률표가 없습니다. 사람들이 원하는 그 표는 가능한 성공 횟수마다 한 행씩 있어야 하는데, 그것은 입력한 시행 횟수와 확률에 달려 있고 이 페이지의 참조표는 그 입력을 볼 수 없습니다. 패널의 세 행이 고른 수에 대한 그 표의 모양입니다.

자주 묻는 질문

k번 이상이 왜 100%에서 k번 이하를 뺀 값이 아닌가요?
두 사건이 여집합이 아니기 때문입니다. k번 이하는 성공 0번부터 k번까지이고, k번 이상은 k번부터 n번까지입니다. 정확히 k번이라는 횟수가 양쪽에 다 들어 있으므로 한쪽을 100%에서 빼면 그 겹치는 조각이 빠집니다. 그 조각이 바로 물어본 확률입니다. k번 이상의 여집합을 원하면 k − 1번 이하 행을 보세요. 또는 세 행을 함께 읽으세요. 정확히 k번은 언제나 나머지 두 행 사이의 틈이고, 그 틈은 세 값 모두를 점검하는 데 쓸모가 있습니다.
성공 확률이 0%나 100%여도 되나요?
됩니다. 둘 다 경계 사례가 아니라 의미 있는 값입니다. 0%는 그 사건이 절대 일어나지 않는다는 뜻이므로 성공 횟수는 확실히 0번이고, 100%는 언제나 일어난다는 뜻이므로 확실히 n번입니다. 패널은 그 결과인 0%와 100% 행을 그대로 보고합니다. 작지만 가능하다고 생각한 횟수에 0%가 평평하게 나온다면 확률 필드를 확인하세요. 10을 넣으려던 자리에 0이 들어가면 정확히 그런 결과가 나옵니다.
성공 횟수마다의 확률을 보여 주는 표는 왜 없나요?
그런 표는 입력한 시행 횟수와 성공 확률에 달려 있는데, 이 페이지의 참조표는 그 입력을 볼 수 없기 때문입니다. 참조표는 상수로 계산되므로 여러분의 설정처럼 보이는 제목 아래에 다른 설정의 수를 늘어놓게 됩니다. 대신 결과 패널의 세 행이 물어본 횟수에서 그 표의 모양을 알려 줍니다. 정확한 횟수, 그 아래 전부, 그 위 전부입니다. 분포 전체를 보려면 성공 횟수를 바꿔 가며 정확히 행을 다시 읽으세요. 그 값들이 한 행씩 본 그 표입니다.
평균은 확률이 알려 주지 않는 무엇을 알려 주나요?
분포가 어디에 놓여 있는지를 알려 주고, 그것이 횟수를 해석 가능하게 만듭니다. 평균 5번에 표준편차 1.58이면 3은 평범한 결과이고, 같은 3이 평균 12에 대해서는 아주 먼 값입니다. 평균과 분산, 표준편차는 각각 np, np(1 − p), 그 제곱근입니다. 세 요약 행은 분포를 한 번에 하나의 확률로 서술하는 대신 중심과 퍼짐으로 서술한 것입니다.
시행 횟수보다 많은 성공을 물으면 어떻게 되나요?
0%로 답하는 대신 거절합니다. 시행보다 많은 성공은 일어나기 어려운 결과가 아니라 아예 결과가 아니며, 0%를 보고하면 모형이 그것을 검토한 뒤 배제한 것처럼 보이기 때문입니다. 패널은 오류를 보고합니다. 시행 횟수가 1000을 넘을 때도 마찬가지인데, 그것은 수학이 거기서 멈추기 때문이 아니라 성능상의 한계로 거절하는 것입니다.
시행은 정말 독립이어야 하나요?
그래야 합니다. 그리고 이것이 실제 데이터에서 가장 자주 깨지는 가정입니다. 성공이 몰려서 나온다면, 즉 같은 생산 묶음의 부품, 같은 날 같은 선수의 슛, 같은 병원의 환자라면 시행들이 서로에 대한 정보를 담게 되고, 횟수의 실제 퍼짐은 이항분포가 말하는 것보다 넓어집니다. 몰림이 있어도 평균은 대체로 맞게 남지만 표준편차와 꼬리 확률은 그렇지 않습니다. 그래서 세 요약 행을 가장 먼저 의심하세요. 시행이 몰린다는 것을 알고 있다면 추가 변동을 모형에 넣은 도구가 맞습니다.

참고 문헌

관련 계산기