본문으로 건너뛰기
CalcMax

정규분포 계산기

계산 결과

1.00

z점수

이 값 미만일 확률
84.13%
이 값 초과일 확률
15.87%
평균에서 이 거리 이내일 확률
68.27%

정규분포 계산기는 값 하나와, 그 값이 속한 분포의 평균 및 표준편차를 받아 그 값이 평균에서 얼마나 떨어져 있는지를 퍼짐을 걷어낸 뒤 보고합니다. 표준편차 단위로 잰 이 거리가 z점수이고, 여기에 확률 셋이 따라옵니다. 분포 가운데 그 값 아래에 얼마가 있는지, 위에 얼마가 있는지, 그리고 평균에서 같은 거리 안에 얼마가 있는지입니다. 굳이 환산하는 이유는 그러면 수 하나가 모든 정규 곡선을 덮기 때문입니다. z점수 1은 퍼짐이 15인 시험 점수에서도, 0.1밀리미터 단위로 재는 기계 부품에서도 같은 뜻입니다. 평균보다 큰 값은 양의 z점수를, 작은 값은 음의 z점수를 주고, 양쪽 꼬리는 언제나 서로의 거울상입니다.

정규분포 곡선에서 평균의 표준편차 1개·2개·3개 안에 드는 비율

범위비율 (%)
±1σ (|z| ≤ 1)68.27
±2σ (|z| ≤ 2)95.45
±3σ (|z| ≤ 3)99.73

세 비율은 계산기가 쓰는 것과 같은 누적함수로 계산되므로, 결과 패널의 띠와 이 표가 어긋날 수 없습니다. 같은 수를 다른 거리에서 읽은 것이기 때문입니다. 인용하기 전에 두 가지를 짚어 둡니다. 이것들은 여러분 데이터가 아니라 정규분포의 성질입니다. 쏠렸거나 꼬리가 긴 퍼짐은 세 번째 띠 밖에 0.3%보다 많은 값을 놓을 것이고, 이 표는 그것을 경고해 주지 못합니다. 그리고 각 행은 조각이 아니라 누적이라서 행을 더해도 100%가 되지 않습니다. 두 번째 행이 이미 첫 번째를 품고 있고, 세 번째 행 밖에 남은 것이 0.27%입니다. 이것은 경험적 법칙을 곡선 아래의 면적이 아니라 평균에서의 거리로 적은 것이고, 둘은 같은 진술입니다.

공식

z = (값 − 평균) / 표준편차 → 미만 = Φ(z), 초과 = 1 − Φ(z), 이내 = 2Φ(|z|) − 1

value
묻고 있는 측정값 하나이며, 여러 개의 평균이 아닙니다. 그 값이 견주어지는 분포의 평균과 표준편차에 맞대어 읽힙니다
mean
정규분포의 중심이며 μ로 씁니다. 패널의 모든 확률이 이 값을 기준으로 진술되므로, 평균이 0이고 퍼짐이 1이면 값 자체가 곧 z점수가 됩니다
standardDeviation
분포의 퍼짐이며 σ로 씁니다. 0보다 커야 합니다. 거리를 재는 단위이고, 그래서 z점수 표 하나가 어떤 크기의 분포에도 쓰일 수 있습니다
z
그 값이 평균에서 표준편차 몇 개만큼 떨어져 있는지입니다. 평균보다 크면 양수, 작으면 음수이고, 값이 평균 그 자체면 0입니다
Φ
표준정규분포의 누적분포함수입니다. 주어진 z 왼쪽에 놓이는 곡선의 몫입니다. 초등함수로 닫힌 꼴이 없어서, 표에서 찾는 대신 계산합니다

물음이 원래 수가 아니라 위치에 관한 것일 때 쓰세요. 어떤 측정값이 그것을 만들어 낸 공정에 대해 얼마나 드문지, 모집단의 몇 %가 어떤 기준 위에 있는지, 중심이 맞은 공정이 규격 구간의 몇 할을 덮는지가 그렇습니다. 정규표로 들어가는 표준 경로이기도 합니다. 먼저 z점수로 환산하는 것이 표 하나를 모든 분포에 적용되게 만듭니다. z점수 자체가 요점이고 확률이 필요 없을 때는 옆의 z점수 계산기로 가고, 면적이 필요할 때는 이쪽으로 오세요. z점수만으로는 값이 얼마나 밖에 있는지는 알 수 있어도 곡선의 얼마가 함께 밖에 있는지는 알 수 없습니다.

계산 예시

  1. 평균보다 표준편차 하나 위

    1. 평균을 뺍니다. 115 − 100 = 15
    2. 표준편차로 나눕니다. 15 / 15 = 1이므로 z점수는 1입니다
    3. 정규 곡선에서 z = 1 아래의 몫은 약 84.13%이고, 위에는 15.87%가 남습니다
    4. 표준편차 하나 안쪽 양방향의 몫은 약 68.27%이고, 두 단측 수는 각 끝에서 남은 것에 지나지 않습니다

    세 수는 같은 사실을 세 가지로 말한 것이고, 사람들이 잘못 읽는 것은 가운데 것입니다. 미만이 84.13%라는 것은 평균보다 표준편차 하나 위인 값이 분포의 약 6분의 5를 앞선다는 뜻이고, 그 위에 아직 15.87%가 남아 있습니다. 이내는 두 단측 확률의 합이 아니라 가운데 띠만이라는 점도 눈여겨보세요. 그래서 평균 근처의 값에서는 셋 가운데 가장 작고, 값이 꼬리로 나갈수록 100% 쪽으로 자랍니다.

  2. 값이 정확히 평균에 있을 때

    1. 평균을 뺍니다. 100 − 100 = 0
    2. 양수인 퍼짐으로 나누면 0이므로 z점수는 0입니다
    3. 정규 곡선은 대칭이므로 정확히 절반이 평균 아래에, 절반이 위에 있습니다
    4. 평균 주위의 폭 0인 띠에는 분포가 하나도 들어 있지 않으므로 이내는 0%입니다

    이내가 0%라는 것은 작은 값의 반올림이 아니라 정확한 값이고, 띠의 폭이 정말로 없는 유일한 경우입니다. 그래서 띠의 방향을 점검하기에 가장 깔끔한 예입니다. 이내는 값까지의 거리를 양쪽으로 재므로, 평균에서는 잴 거리가 아예 없습니다. 패널의 나머지가 기대고 있는 대칭성도 여기서 드러납니다. 두 단측 확률이 정확히 반으로 갈리기 때문입니다.

  3. 위쪽 꼬리 멀리 있는 값

    1. 평균을 뺍니다. 200 − 100 = 100
    2. 표준편차로 나눕니다. 100 / 15 ≈ 6.67이므로 평균보다 6.67 표준편차 위입니다
    3. z = 6.67 위의 몫은 약 1.3 × 10⁻¹¹, 수백억 분의 일입니다
    4. 소수 둘째 자리에서는 그 몫이 0.00%이고, 아래의 몫은 100.00%입니다

    위가 0.00%라는 것은 이 페이지에서 버그처럼 보이지만 버그가 아닌 유일한 수입니다. 참값이 약 1,000억 분의 1.3이어서 백분율 소수 둘째 자리로는 찍을 수 없습니다. 여기서 두 가지가 따라옵니다. 0.00%는 불가능이 아니라 표시되는 정밀도보다 작다는 뜻으로 읽고, 패널이 찍힌 자릿수보다 많은 정보를 지니고 있다는 것도 기억하세요. 이 경우에 아래쪽 꼬리에서 빼면 0.01이나 0.02가 나올 자리에서 깨끗한 0이 나오는 것은 꼬리를 일부러 자기 경로로 계산하기 때문입니다. 이내가 100%에 도달한 것도 눈여겨보세요. 양쪽으로 6.67 표준편차까지 뻗은 띠는 이제 사실상 곡선 전체를 덮습니다.

  4. 평균보다 표준편차 하나 아래

    1. 평균을 뺍니다. 85 − 100 = −15
    2. 표준편차로 나눕니다. −15 / 15 = −1이므로 z점수가 음수입니다
    3. z = −1 아래의 몫은 약 15.87%이고, 위의 몫은 약 84.13%입니다
    4. 표준편차 하나 안쪽의 띠는 z = +1일 때와 같은 68.27%입니다. 띠가 대칭이기 때문입니다

    이것을 첫 번째 예와 견주는 것이 부호가 하는 일과 하지 않는 일을 가장 빨리 보는 방법입니다. 두 단측 확률은 자리를 바꾸고, 이내는 아예 움직이지 않습니다. 이내가 평균에서 양방향으로의 거리를 재므로 값이 어느 쪽에 있는지 알 수 없기 때문이고, 그것이 분포의 얼마가 중심 가까이에 있는지를 물을 때 바라는 바로 그 성질입니다. 패널이 띠만이 아니라 단측 수까지 함께 찍는 이유도 정확히 그것입니다.

한계

여기 모든 수는 정규분포의 성질이지 여러분 데이터의 성질이 아닙니다. z점수는 모양이 어떻든 어떤 값의 집합에든 계산할 수 있지만, 확률은 그 분포가 정말 정규일 때만 위의 값이 됩니다. 꼬리가 길거나 쏠린 퍼짐에서는 멀리 있는 값이 정규 곡선이 말하는 것보다 흔하고, 꼬리 추정이 가장 먼저 상합니다. 평균과 표준편차가 분포를 정규로 만들어 주지는 않고, 정규인지 알려 주지도 못합니다. 두 가지를 더 짚어 둡니다. 아주 작은 확률은 소수 둘째 자리로 찍을 수 없어서, 꼬리 멀리 있는 값은 참값이 작은 양수인 자리에 0.00%를 보여 줍니다. 그리고 입력한 값은 알려진 평균과 퍼짐에 맞대어 읽는 관측값 하나로 다루어지므로, 평균이나 표준편차의 불확실성은 셈에 들어가지 않습니다. 그 둘을 작은 표본에서 추정했다면 이것이 문제가 됩니다.

자주 묻는 질문

확률이 이미 있는데 z점수가 무엇을 더해 주나요?
네 수 가운데 분포 사이를 옮겨 다닐 수 있는 것은 z점수뿐입니다. 확률은 여러분이 넣은 그 곡선에 매여 있지만, z점수 1은 모든 정규분포에서 중심에서 같은 거리를 뜻합니다. 퍼짐이 15인 시험 점수, 0.01밀리미터 단위로 재는 기계 부품, 임의 단위를 쓰는 측정값에서 모두 마찬가지입니다. 그래서 z표 하나를 어디에나 쓸 수 있습니다. 먼저 z점수로 환산하고, 표준 곡선에서 면적을 읽으면 됩니다.
아주 큰 값에서 초과 확률이 왜 0.00%로 나오나요?
그 수가 실제로 얼마나 작은지를 백분율 소수 둘째 자리로는 찍을 수 없기 때문입니다. 평균에서 6.67 표준편차 위에 있는 값은 곡선의 약 1.3 × 10⁻¹¹을 위에 두는데, 수백억 분의 일꼴이고, 이것은 실제로 양수인 몫이며 다만 표시되는 정밀도보다 훨씬 아래일 뿐입니다. 0.00%는 불가능이 아니라 이 표시로는 보여 줄 수 있는 것보다 작다는 뜻으로 읽으세요. 패널은 그 꼬리 확률을 아래쪽 꼬리에서 빼는 대신 자기 경로로 따로 계산합니다. 그래서 빼기로 나왔을 작은 양수 대신 깨끗한 0이 나옵니다.
경험적 법칙과 같은 것인가요?
그렇습니다. 이 페이지의 표가 그 법칙을 백분율이 아니라 거리로 적은 것입니다. 경험적 법칙은 정규분포의 약 68%가 평균에서 표준편차 하나 안에, 약 95%가 둘 안에, 약 99.7%가 셋 안에 있다고 말하는데, 그것들을 각각 중심에서의 거리로 뒤집은 것이 이 표의 행입니다. 다른 점 하나는 짚어 둘 만합니다. 법칙은 보통 반올림한 세 백분율로 인용되는 반면, 여기 비율은 계산기가 쓰는 것과 같은 누적함수로 계산되므로 경계에 정확히 놓인 값도 양쪽에서 일관된 답을 얻습니다.
표준편차가 0이면 어떻게 되나요?
답하는 대신 거부합니다. 퍼짐 0으로 나누는 것은 우연히 1이 나오는 확률이 아니라 퍼짐이 아예 없는 분포를 서술하는 것이고, 거기서는 모든 관측값이 평균이고 중심에서의 거리라는 개념 자체가 뜻을 잃습니다. 패널은 그럴듯해 보이는 0%나 100%를 돌려주는 대신 오류를 보고합니다. 음의 퍼짐도 같은 이유로 거부합니다. 표준편차는 거리이므로 음수일 수 없고, 조용히 절댓값을 쓰면 데이터 오류를 덮어 버립니다.
정규분포가 아닌 데이터에도 쓸 수 있나요?
z점수는 어떤 값의 집합에든 계산할 수 있습니다. 평균과 표준편차는 어떤 데이터에도 존재하기 때문입니다. 가정이 필요한 쪽은 확률입니다. 그것들은 정규 곡선 아래의 면적이고, 쏠렸거나 꼬리가 긴 분포는 그것과 맞지 않습니다. 어긋남은 꼬리에서 가장 먼저 드러나는데, 큰 거리 밖의 실제 몫이 보통 정규 곡선이 말하는 것보다 크고, 그래서 경험적 법칙의 표준편차 셋 밖 0.3%는 여러분의 측정값에 대한 약속이 아니라 정규 모형의 성질로 다루어야 합니다.
값을 표본 평균이 아니라 관측값 하나로 다루는 이유는 무엇인가요?
세 확률이 바로 그것이기 때문입니다. 값 하나의 아래, 위, 주위에 놓이는 분포의 몫입니다. 표본 평균을 같은 평균과 퍼짐에 맞대어 읽는 것은 다른 계산이고, 그때 필요한 퍼짐은 개별 관측값의 퍼짐이 아니라 평균의 표준오차입니다. 둘은 표본 크기의 제곱근만큼 다르므로, 하나를 다른 하나 대신 쓰면 그럴듯해 보이지만 틀린 답이 나옵니다. 여러분의 값 자체가 평균이라면 표준오차를 표준편차 칸에 넣으세요.

참고 문헌

관련 계산기