본문으로 건너뛰기
CalcMax

푸아송 분포 계산기

범위: 0 – 1,000

최솟값: 0

범위: 0 – 1,000

계산 결과

19.54%

정확히 이 횟수일 확률

이 횟수 이하일 확률
43.35%
이 횟수 이상일 확률
76.19%
평균
4.00
분산
4.00
표준편차
2.00

푸아송 분포 계산기는 일정한 평균 발생률로 도착하는 사건에 대한 질문에 답합니다. 어떤 구간에서 그것이 정확히 k번 일어날 확률은 얼마인가 하는 질문입니다. 이 모형의 모수는 하나이고 보통 람다라고 쓰며, 사건의 평균 발생률에 구간 길이를 곱한 값과 같습니다. 곧 물어보는 창 안에서 기대되는 사건의 수입니다. 페이지는 정확히 k번일 확률과 함께 두 가지 누적 형태인 k번 이하와 k번 이상을 보고하고, 분포 전체를 요약하는 세 수인 평균, 분산, 표준편차도 함께 보고합니다. 이 모형이 서술하는 상황은 서로에게 영향을 주지 않는 드문 사건의 흐름입니다. 고객센터에 걸려 오는 전화, 부품 한 묶음의 고장, 도로 한 구간의 사고, 정해진 계수 창 안의 방사성 붕괴가 그렇습니다. 이 분포를 규정하는 특징은 평균과 분산이 같다는 것입니다. 둘 다 람다이므로, 퍼짐이 평균보다 훨씬 넓거나 훨씬 좁은 계수는 이 과정에서 나온 것이 아니고, 표준편차는 평균 계수의 제곱근일 뿐입니다.

공식

P(X = k) = e^(−λ) · λ^k / k! 단 λ = 발생률 × 구간 길이이고, Var(X) = λ

λ
구간 안에서 기대되는 사건의 수입니다. 발생률에 창의 길이를 곱한 값이고 분포의 유일한 모수입니다. 이 페이지의 모든 것이 그것의 함수라서, 발생률과 구간을 하나의 수가 아니라 따로 묻습니다
k
물어보는 사건의 수입니다. 0부터 위로 가는 정수 계수이고, 0도 빈칸이 아니라 진짜 답입니다. 람다가 약 0.7보다 작으면 아무 일도 없었다가 가장 그럴듯한 결과입니다
e^(−λ)
계수를 넣기 전에 아무 일도 일어나지 않을 무게입니다. 람다가 커질수록 분포 전체가 줄어드는 이유가 이것입니다. 기대되는 수가 클수록 하나도 못 보게 될 가능성이 작아집니다
λ^k / k!
k를 따라 커졌다가 다시 작아지는 부분입니다. 평균의 k제곱을 계수의 계승으로 나눈 값입니다. 봉우리가 k = λ에 있고, 분포는 그 봉우리에 질량을 가장 많이 씁니다
mean = variance = λ
이 분포를 알아보게 만드는 성질입니다. 평균 계수와 그 분산이 같은 수라서 표준편차는 평균의 제곱근입니다. 평균이 네 건이면 √4 = 2이고, 평균이 천 건이면 √1000 ≈ 31.6입니다

구간마다 몇 건이 도착하는지를 세고 그 도착들이 서로 독립일 때 쓰세요. 한 시간에 전화가 몇 건 오는지, 천 한 제곱미터에 결함이 몇 개 있는지, 정해진 계수 창에 입자가 몇 개 들어오는지가 그렇습니다. 두 조건이 무게의 대부분을 집니다. 사건은 그것이 일어날 기회에 비해 드물어야 하고(다른 무언가가 계수를 사실상 묶어 버릴 만큼 발생률이 높으면 더 이상 푸아송이 아닙니다), 뭉치면 안 됩니다. 한 가지 원인에서 나온 도착의 폭주는 분포에 모양을 주는 독립성을 깨뜨립니다. 기회의 수가 정해져 있고 셀 수 있을 때는 이항분포 쪽으로 가세요. 푸아송 계수에는 위쪽 한계가 없지만 이항 계수는 시행 횟수를 넘을 수 없습니다. 람다가 커지면 정규 근사로 가세요. 둘이 가까워지고 익숙한 표준편차 띠를 읽을 수 있게 됩니다. 평균과 분산이 같다는 것도 가장 빠른 진단입니다. 계수 묶음의 분산을 평균으로 나누어 그 비가 1에서 멀면 그 과정은 과대 산포이거나 과소 산포이고, 이 모형은 그에 맞지 않는 모양입니다.

계산 예시

  1. 한 시간에 네 건, 세 건을 물을 때

    1. 발생률이 한 시간에 4건이고 구간이 1시간이므로 람다는 4입니다
    2. P(X = 3) = e⁻⁴ × 4³ / 3! = 0.018316 × 64 / 6 = 0.1954이므로 19.54%입니다
    3. 0부터 3까지의 계수를 더하면 이하가 43.35%이고, 3 위에 남은 질량이 이상으로 76.19%입니다
    4. 평균은 람다 = 4이고 분산도 4라서 표준편차는 √4 = 2입니다

    여기서 두 누적 행이 겹치는데 그것은 실수가 아닙니다. 43.35%에 76.19%를 더하면 119.54%가 되고, 100%를 넘는 그 초과분이 정확히 세 건의 19.54%이며 두 행 모두에 들어 있습니다. 이항 계수에서와 같은 주의이고, 이상을 1에서 이하를 빼서 구하는 흔한 실수를 잡아 줍니다. 그러면 여기서는 56.65%가 나옵니다. 세 건이라는 것도 평균이 넷일 때는 특별할 것이 없습니다. 평균에서 표준편차의 절반만큼 아래입니다.

  2. 분포의 중심

    1. 세 건 대신 네 건을 물어봅니다. P(X = 4) = e⁻⁴ × 4⁴ / 4! = 0.018316 × 256 / 24 = 0.1954
    2. 확률이 세 건과 같은 19.54%입니다. 분포의 봉우리가 k = 4 = 람다에 있고 그 양옆의 두 계수가 똑같이 그럴듯하기 때문입니다
    3. 이하는 62.88%이고 이상은 56.65%입니다
    4. 평균과 분산, 표준편차는 람다에만 달려 있으므로 그대로입니다

    확률이 같은 두 계수는 분포가 람다에 중심을 둔다는 가장 분명한 표시입니다. 평균이 네 건이면 세 건을 보는 것과 네 건을 보는 것이 똑같이 그럴듯하고 나머지 계수는 그보다 덜합니다. 여기서도 누적 행은 대칭이 아닙니다. 62.88% 대 56.65%인데, 이하 행은 k = 4를 통째로 담고 이상 행도 그것을 담으며, 봉우리 아래쪽이 위쪽보다 얇기 때문입니다.

  3. 같은 발생률을 세 시간 동안

    1. 발생률은 여전히 한 시간에 4건이지만 구간이 3시간이므로 람다 = 4 × 3 = 12입니다
    2. P(X = 3) = e⁻¹² × 12³ / 3! = 0.0000061 × 1728 / 6 = 0.0018이므로 0.18%입니다
    3. 이하는 0.23%이고 이상은 99.95%입니다
    4. 평균이 12이고 분산도 12라서 표준편차는 √12 = 3.46입니다

    두 입력 칸을 갈라 놓는 예가 이것입니다. 창의 길이 말고는 아무것도 바뀌지 않았는데 답이 19.54%에서 0.18%로 옮겨 갔습니다. 모수가 두 값의 곱이라서 두 칸이 모두 필요하고, 발생률만 받는 페이지라면 한 시간과 하루에 같은 답을 줄 것입니다. 요약 행도 함께 움직입니다. 열두 건이 기대되면 세 건은 평균에서 표준편차 두 개보다 더 아래이고, 그래서 이상 행이 이제 거의 확실해집니다.

  4. 한 시간에 한 건, 그리고 아무 일도 없음

    1. 람다 = 1일 때 정확히 0건일 확률은 e⁻¹ = 0.3679이므로 36.79%입니다
    2. 0 이하를 묻는 것은 같은 질문이라서 그 행은 같은 수를 되풀이합니다
    3. 0 이상은 가능한 모든 계수를 덮으므로 정확히 100%입니다. 99.99%가 아닙니다
    4. 평균과 분산이 둘 다 1이고 표준편차도 1입니다

    람다가 1인 것은 교과서의 출발점이고, 이 페이지에서 가장 반직관적인 수를 만들어 냅니다. 한 시간에 평균 한 건인 과정이 세 번에 한 번 넘게 아무 일도 일어나지 않습니다. 이상 행도 읽어 볼 만합니다. 0 이상은 전체 분포라서 정확히 100%이고, 누적 합에서 빼서 구하는 페이지라면 99.99%를 돌려주기 십상입니다. 0건도 물어볼 만한 정당한 답이라서 계수 칸이 1이 아니라 0에서 시작합니다.

한계

푸아송 모형은 조용히 깨지는 두 가정 위에 서 있고, 둘 다 수를 믿기 전에 점검할 값어치가 있습니다. 사건들이 서로 독립이어야 하고, 지정한 구간 안에서 발생률이 흔들리지 않아야 합니다. 독립성은 도착들이 원인을 공유할 때마다 깨집니다. 정전 중에 전화가 몰리고, 결함이 천 한 롤에 몰리고, 사고가 악천후에 몰리는 식입니다. 증상은 실제 계수가 페이지가 예측한 것보다 더 퍼져 있다는 것이고, 모형이 허용하는 것보다 빈 구간도, 아주 바쁜 구간도 더 많습니다. 발생률이 흔들리는 쪽은 반대로 깨집니다. 밤은 조용하고 아침은 바쁜 콜센터에는 한 시간 단위 발생률이 하나가 아니고, 둘을 평균 내면 어느 쪽도 서술하지 못하는 수가 나옵니다. 가정을 넘어서면 두 가지 한계가 설명되는 대신 강제됩니다. 구간 길이와 발생률은 각각 합리적인 범위까지 넣을 수 있지만 그 곱에는 상한이 있습니다. 평균 계수가 수백만이면 패널의 모든 확률이 0으로 반올림되고, 페이지는 0만 늘어놓느니 답하기를 물러나기 때문입니다. 계수 자체는 정수여야 합니다. 그리고 여기에는 푸아송 확률표가 없습니다. 사람들이 원하는 표는 평균값마다 한 행인데, 그 평균이 여러분이 넣은 발생률과 구간에 달려 있어서 인쇄된 표는 위 패널과 다른 질문에 답하게 됩니다.

자주 묻는 질문

푸아송 분포와 이항분포는 어떻게 다른가요?
이항분포는 정해진 시행 횟수 안의 성공을 세우므로 계수가 그 수를 넘을 수 없고, 푸아송은 저절로 도착하는 사건을 세우므로 위쪽 한계도 시행 횟수도 없습니다. 이항분포는 시행이 몇 번인지와 각각의 확률이라는 두 입력이 필요하지만, 이 페이지는 발생률과 구간이 필요하고 둘이 합쳐져 하나의 기대 계수가 됩니다. 둘은 시행 횟수가 크고 각각의 확률이 작은 좁은 경우에 일치하고, 그래서 실제로 드문 사건은 어느 쪽으로도 서술됩니다. 기회를 이름 붙일 수 있을 때는 이항분포를, 사건이 그냥 도착할 때는 푸아송을 쓰세요.
여기서는 왜 평균과 분산이 같나요?
그 항등식이 예제의 우연이 아니라 모형이 세워진 바탕이기 때문입니다. 푸아송 계수에서 평균과 분산은 같은 수인 람다이고, 그래서 표준편차는 언제나 평균의 제곱근입니다. 모형이 맞는지 시험하는 빠른 방법도 줍니다. 관측한 계수 묶음을 잡아 그 분산을 평균으로 나누어, 비가 1보다 훨씬 크면 계수들이 독립이 아니라 뭉쳐 있는 것이고, 1보다 훨씬 작으면 우연이 만들 수 있는 것보다 고르다는 뜻입니다. 어느 쪽도 다른 수를 넣어서 고쳐지지 않습니다. 그 과정이 푸아송이 아니라는 뜻입니다.
k번 이하와 k번 이상은 왜 여사건이 아닌가요?
두 행 모두 정확히 k라는 계수를 포함하므로, 더하면 그 결과를 두 번 세기 때문입니다. 위의 예에서 3 이하는 43.35%이고 3 이상은 76.19%라서 합이 119.54%인데, 100%를 넘는 그 초과분이 정확히 세 건의 19.54%입니다. 이항 계수에서와 같은 산수이고 같은 함정입니다. 이상을 1에서 이하를 뺀 값으로 읽으면 물어본 확률만큼 틀립니다. 진짜 여사건이 필요하면 k − 1 이하를 쓰거나, 세 행을 함께 읽어 정확히 k가 그 사이의 틈을 메우는지 확인하세요.
계수가 실제로 푸아송인 때는 언제인가요?
사건들이 독립이고, 구간 안에서 발생률이 일정하며, 사건이 그것이 일어날 기회에 비해 드물 때입니다. 일을 하는 가정은 독립성이고 가장 자주 깨지는 것도 그것입니다. 뭉침은 요약 수에서 놓치기 쉬워서, 매달 같은 결함 총계를 보고하는 공장도 나쁜 날과 조용한 날이 있을 수 있고, 그 뭉침은 이 페이지가 예측하는 것보다 변동이 큰 계수로 드러납니다. 실제 점검은 앞 답에 있는 것입니다. 계수 묶음의 분산과 평균을 견주어 보세요. 가까우면 모형이 좋은 서술이고, 멀면 어떤 발생률을 골라도 고쳐지지 않습니다.
발생률이 0이면 어떻게 되나요?
구간 안에서 아무 일도 일어날 수 없으므로 0건의 확률이 100%이고 다른 모든 계수의 확률이 0%입니다. 페이지는 실패하는 대신 그것을 보고합니다. 발생률 0이나 길이 0인 구간은 둘 다 기대 사건이 없는 람다 0을 주고, 한 건 이상을 물으면 0%를, 하나도 없음을 물으면 100%를 돌려줍니다. 이것이 명시적으로 처리된다는 것을 알아 둘 만합니다. 적힌 그대로의 공식에는 0의 k제곱 인수와 로그에서 나오는 음의 무한대가 들어 있어서, 순진하게 계산하는 구현은 뻔한 답 대신 의미 없는 결과를 내놓습니다.
이 페이지에는 왜 푸아송 확률표가 없나요?
그런 표의 모든 행이 서로 다른 평균값에 속하고, 여기서 평균은 여러분이 넣은 두 수의 곱이기 때문입니다. 인쇄된 표는 한 발생률과 한 구간에만 맞고 다른 모든 조합에는 틀려서, 패널과 다른 질문에 답하게 되고, 둘이 어긋나는 자리에서는 패널이 맞습니다. 패널이 곧 그 표입니다. 세 확률 행이 여러분이 지정한 평균에 대한 정확히·이하·이상 값이고, 발생률이나 구간을 바꾸면 다시 계산됩니다. 참조표가 제자리를 얻는 것은 등급 기준이나 구간 경계처럼 행이 어떤 입력에도 달려 있지 않은 페이지입니다.

참고 문헌

관련 계산기