본문으로 건너뛰기
CalcMax

베이즈 정리 계산기

범위: 0 – 100

범위: 0 – 100

범위: 0 – 100

계산 결과

15.38%

사후확률 P(A|E)

A가 거짓일 확률 P(¬A|E)
84.62%
증거의 확률 P(E)
5.85%
사전확률에서 사후확률로의 변화(퍼센트포인트)
14.38

베이즈 정리 계산기는 무엇인가를 보기 전에 품고 있던 믿음을, 그것을 본 뒤에 가져야 할 믿음으로 바꿔 줍니다. 어떤 조건의 사전확률, 그 조건이 있을 때 증거가 나타날 확률, 그 조건이 없을 때 같은 증거가 나타날 확률을 넣으면 증거가 주어진 조건의 사후확률을 돌려줍니다. 여기에 여집합 확률, 그 증거를 아예 보게 될 전체 확률, 그리고 믿음이 몇 퍼센트포인트 움직였는지가 함께 붙습니다. 이 값을 어림하지 않고 계산할 만하게 만드는 상황은 드문 조건과 완벽하지 않은 검사입니다. 유병률 1%, 탐지율 90%, 거짓 양성률 5%라면 양성 판정 하나는 그 조건의 확률을 90%가 아니라 약 15%로 올립니다. 찾으려는 것이 드물 때에는 검사가 믿음을 바꾸는 폭이 직관보다 언제나 작습니다.

공식

P(A | E) = P(E | A) · P(A) / [ P(E | A) · P(A) + P(E | ¬A) · P(¬A) ]

P(A)
조건의 사전확률이며 퍼센트로 넣습니다. 증거가 도착하기 전에 품고 있던 믿음입니다. 사람들이 짐작하는 것보다 무게가 큽니다. 이 값이 작으면 멀리 움직이는 데 아주 많은 증거가 필요합니다
P(E | A)
조건이 있을 때 그 증거를 보게 될 확률입니다. 검사에서는 탐지율, 즉 민감도라고 부릅니다. 참인 사례 가운데 검사가 잡아내는 비율입니다
P(E | ¬A)
조건이 없을 때 같은 증거를 보게 될 확률입니다. 검사에서는 거짓 양성률이며, 이 값이 작지 않을 때 가장 큰 피해를 내는 항입니다
P(¬A)
조건이 없을 확률이며 100%에서 사전확률을 뺀 값입니다. 분모는 증거가 나타날 수 있는 두 경로를 각 상태가 흔한 정도로 가중해 더한 것입니다
P(E)
조건의 성립 여부와 상관없이 전체에서 그 증거가 나타날 확률입니다. 분모이며, 결과 패널이 이것을 따로 인쇄하는 이유는 이 값이 작을 때 사후확률이 크게 움직이기 때문입니다
P(A | E)
증거를 본 뒤의 믿음인 사후확률입니다. 결과 패널은 그 여집합도 함께 인쇄합니다. 검사는 양성인데 아직 그 조건이 아닐 확률이 85%라는 문장이 실제로는 그 수를 가장 잘 전달하기 때문입니다

검사 결과를, 찾으려는 것이 실제로 얼마나 흔한지에 비추어 읽어야 할 때마다 씁니다. 유병률이 낮은 집단의 선별 검사, 단어 하나를 읽는 스팸 필터, 드문 고장에 대한 진단, 양성 판정을 곧 증명으로 다루는 모든 자리가 그렇습니다. 반대 방향의 질문에도 이 도구가 맞습니다. 양성 판정이 의미를 가지려면 검사가 얼마나 좋아야 하는지를 거꾸로 구하는 일인데, 보통은 어떤 특정한 사전확률에 대한 사후확률보다 이 수가 훨씬 쓸모 있습니다. 진술할 만한 사전확률이 있을 때 손을 뻗으세요. 사전확률이 얼마여야 하는지 전혀 모르겠다면 정직한 답은 사후확률이 그 무지에 휘둘린다는 것이고, 패널은 그 정도를 정확히 보여 줄 수 있습니다.

계산 예시

  1. 유병률 1%, 탐지율 90%, 거짓 양성률 5%

    1. 10000명을 잡으면 그 조건이 있는 사람이 약 100명, 없는 사람이 9900명입니다
    2. 있는 100명 가운데 90%가 양성이라 참 양성이 약 90건입니다
    3. 없는 9900명 가운데 5%도 양성이라 거짓 양성이 약 495건입니다
    4. 따라서 양성은 90 + 495 = 585명에서 나오고, 90 / 585 = 15.38%입니다

    이 페이지 전체가 이 사례를 중심으로 세워졌고, 단계에 적힌 셈이 그 이유입니다. 사람 수로 세면 구조가 눈에 보입니다. 거짓 양성률은 그 조건이 있는 집단보다 99배 큰 집단에 적용되므로, 탐지율이 만들어 내는 양성보다 5.5배 많은 양성을 만들어 냅니다. 사후확률 15.38%는 이 검사가 나쁘다는 뜻이 아닙니다. 탐지율 90%는 좋은 값입니다. 다만 그 조건이 충분히 드물어서 오류가 적중보다 많아졌다는 뜻입니다. 여집합인 84.62%는 같은 사실을 반대쪽에서 말하고, 14.38퍼센트포인트의 이동은 이 정도 품질의 검사 한 번이 여기서 실제로 갖는 값입니다.

  2. 유병률 2%와 정확도 99% 검사

    1. 10000명을 잡으면 그 조건이 있는 사람이 약 200명, 없는 사람이 9800명입니다
    2. 있는 200명 가운데 99%가 양성이라 참 양성이 약 198건입니다
    3. 없는 9800명 가운데 1%도 양성이라 거짓 양성이 약 98건입니다
    4. 양성은 198 + 98 = 296명에서 나오고, 198 / 296 = 66.89%입니다

    백 번에 한 번만 틀리는 검사도 양성의 3분의 1을 틀린 채로 남깁니다. 49배 큰 집단에 적용되기 때문입니다. 같은 조건에서 정확도를 99.9%로 올리면 사후확률은 95%를 넘어섭니다. 두 손잡이가 서로 바꿔 쓸 수 있는 것이 아니라는 뜻입니다. 탐지율은 참 양성이 얼마나 나오는지를 정하고, 거짓 양성률은 그것이 얼마나 많은 잡음에 파묻히는지를 정합니다. 보통은 두 번째를 개선하는 쪽이 훨씬 많은 것을 사 주며, 더 좋은 검사를 도입하기 전에 그것을 가장 싸게 확인하는 방법이 이 사례입니다.

  3. 조건에 반대하는 증거

    1. 반반인 사전확률에서 출발합니다. 조건이 있을 확률 50%, 없을 확률 50%입니다
    2. 그 증거는 조건이 없을 때 5배 더 잘 나타납니다(90% 대 5%)
    3. 분모는 0.05 × 0.5 + 0.9 × 0.5 = 0.475이므로 증거 자체는 꽤 흔합니다
    4. 사후확률은 0.025 / 0.475 = 5.26%이고, 44.74퍼센트포인트 떨어집니다

    음수 이동이 잠깐 멈춰 볼 부분이고, 퍼센트포인트라는 단위가 존재하는 이유이기도 합니다. 50%에서 5.26%로의 하락은 44.74퍼센트포인트의 하락입니다. 44.74%의 하락이 아닙니다. 후자로 읽으면 사후확률이 약 27.6%에 도착했다는 뜻이 됩니다. 이동을 상대 변화로 읽는 것이 이 패널을 잘못 인용하는 가장 흔한 방식이고, 부호가 증거가 어느 쪽을 가리켰는지를 알려 줍니다. 여기서 증거는 전체의 47.5%에서 나타나는, 별로 특별하지 않은 사건인데도 강하게 정보를 줍니다. 정보량은 증거가 드문 데서가 아니라 두 가능도의 비에서 나오기 때문입니다.

한계

사후확률은 넣은 세 수만큼만 좋습니다. 그리고 사람들이 가장 쉽게 지어내는 것이 사전확률입니다. 조건이 드물면 사후확률은 사전확률과 거짓 양성률이 좌우하므로, 둘 중 하나를 낙관적으로 짐작하면 확신에 찬 틀린 답이 나옵니다. 패널은 그 사전확률이 짐작이었다는 사실을 알려 줄 수 없습니다. 두 가지를 더 덧붙입니다. 두 가능도는 정확한 값으로 취급되므로 규모가 작은 검증 연구에서 인용한 탐지율은 그 값이 갖지 못한 정밀도로 쓰이고 있습니다. 그리고 이 계산은 증거 하나를 한 번 읽는 경우입니다. 같은 검사를 두 번 하는 것은 서로 독립인 두 검사를 하는 것과 다릅니다. 같은 불완전한 도구에서 나온 두 번째 결과는 첫 번째와 상관되어 있으므로, 사후확률을 새 사전확률로 되먹이면 두 번째 검사가 더하는 몫을 과대평가합니다. 모든 상태에서 증거가 불가능할 때, 즉 두 가능도가 모두 0%이거나 거짓 양성률 0%에 사전확률 0%일 때는 분모가 0이 되어 보고할 사후확률이 없습니다. 일어날 수 없는 것에 조건을 거는 일은 답이 있는 질문이 아니기 때문입니다.

자주 묻는 질문

정확도 90%인 검사가 왜 조건이 있을 확률을 15%밖에 못 올리나요?
그 조건이 있는 사람에 대한 정확도와 없는 사람에 대한 정확도는 서로 다른 수이고, 두 번째 수에는 훨씬 큰 집단이 곱해지기 때문입니다. 유병률 1%이면 그 조건이 없는 사람이 있는 사람보다 99대 1로 많으므로, 거짓 양성률 5%는 참 양성을 수십 건 만드는 동안 거짓 양성을 수백 건 만들어 냅니다. 검사는 제 몫을 하고 있고, 다만 그 조건이 드물어서 오류가 적중보다 많아진 것입니다. 기저율이 하는 일이 이것이며, 사전확률이 나중에 덧붙이는 값이 아니라 필수 입력인 이유입니다.
이동 행의 퍼센트포인트는 무엇인가요?
사전확률과 사후확률의 차이를 상대 변화가 아니라 퍼센트포인트로 잰 값입니다. 50%에서 5.26%로 가는 것은 −44.74퍼센트포인트의 이동입니다. 44.74%의 하락이 아닙니다. 후자라면 사후확률이 27.6% 근처에 도착했다는 뜻이 됩니다. 이 구분은 이동이 클수록 중요해지는데, 상대값으로 읽으면 크게 틀어지기 때문입니다. 부호는 증거가 어느 쪽으로 밀었는지를 알려 줍니다. 음수 이동은 증거가 그 조건에 반대했다는 뜻입니다.
사후확률을 다음 검사의 사전확률로 써도 되나요?
두 번째 증거가 첫 번째와 정말 독립일 때만 그렇습니다. 같은 검사의 두 결과는 독립이 아닙니다. 한 번의 거짓 양성은 다음 번 거짓 양성을 더 그럴듯하게 만듭니다. 도구가 두 번 모두 같은 결함을 갖고 있기 때문입니다. 그런데도 사후확률을 새 사전확률로 되먹이면 두 번째 결과가 더하는 몫을 과대평가하며, 그 폭이 큰 경우도 있습니다. 증거가 정말 독립이라면 두 단계로 갱신한 값이 두 증거를 한꺼번에 넣어 한 번에 갱신한 값과 같으므로, 이 지름길은 독립 가정이 성립할 때만 안전합니다.
증거 확률 행은 무엇을 뜻하나요?
그 조건의 성립 여부와 상관없이 그 증거를 아예 보게 될 전체 확률입니다. 정리의 분모이며, 각 가능도에 그 상태가 얼마나 흔한지를 곱해 더한 값입니다. 이 값을 인쇄하는 이유는 도약의 크기를 설명해 주기 때문입니다. 증거가 전체적으로 드물면 사후확률이 사전확률에서 멀어지는 것이 당연하고, 증거가 흔하면 가능도비가 아주 강해야 무언가가 움직입니다. 첫 번째 예에서 증거는 사람의 5.85%에서 나타나며, 그래서 양성 하나가 믿음을 그렇게 멀리 옮길 수 있습니다.
답이 아예 없는 경우는 언제인가요?
모든 상태에서 증거가 불가능해 분모가 0이 되고, 그 증거에 조건을 거는 일이 정의되지 않을 때입니다. 두 가능도가 모두 0%일 때, 사전확률이 0%인데 거짓 양성률도 0%일 때, 사전확률이 100%인데 탐지율이 0%일 때가 그렇습니다. 어느 경우든 그 증거는 일어날 수 없으므로 증거가 주어졌다는 조건은 빈 조건입니다. 패널은 0%나 50%를 돌려주는 대신 오류를 보고합니다. 확률이 0인 것이 아니라 보고할 확률 자체가 없기 때문입니다.
계산기가 우도비도 함께 주나요?
주지 않습니다. 이유는 오즈 형태가 입력 범위의 양 끝에서 깨지기 때문입니다. 어떤 사건의 오즈는 그 확률을 1에서 그 확률을 뺀 값으로 나눈 것이므로, 사전확률 100%는 무한대 오즈를 만듭니다. 그것을 인쇄하면 결과 패널이 망가질 뿐 아무에게도 도움이 되지 않습니다. 이동 행이 모든 합법적인 입력에서 살아남는 형태로 같은 일을 합니다. 증거 하나가 믿음을 얼마나, 어느 방향으로 옮겼는지를 말해 주며, 우도비를 달라고 하는 요청의 배후에는 보통 이 질문이 있습니다.

참고 문헌

관련 계산기