본문으로 건너뛰기
CalcMax

신뢰구간 계산기

최솟값: 2

최솟값: 0

범위: 0 – 100

계산 결과

47.6189

하한

상한
52.3811
오차 범위
2.3811
표준오차
1.2000
임계값
1.9842

신뢰구간 계산기는 표본 하나를, 추정하려는 양 — 모집단 평균이든 비율이든 — 이 가질 법한 값의 범위로 바꿔 줍니다. 하한과 상한을 모두 인쇄하고, 그 범위를 만든 오차 범위, 추정값의 표준오차, 그리고 거기에 곱한 임계값까지 함께 보여 주므로 구간을 인용만 하는 대신 뜯어볼 수 있습니다. 어떤 임계값이 쓰이는지는 무엇을 추정하느냐에 달려 있습니다. 평균은 자유도 n − 1의 t 분포를 쓰고, 비율은 정규분포를 씁니다.

공식

평균: x̄ ± t(α/2, n − 1) · s / √n 비율: p̂ ± z(α/2) · √( p̂ (1 − p̂) / n )

x̄
표본평균입니다. 데이터가 어떤 단위로 재어졌든 그 단위 그대로 넣습니다. 구간은 이 값을 중심으로 만들어지므로 이 값이 움직이면 범위 전체가 같이 움직입니다
s
표본표준편차, 즉 관측값들이 자기들끼리의 평균 둘레에 얼마나 흩어져 있는지입니다. σ가 아니라 s인 이유는 손에 있는 것이 표본뿐이기 때문이고, 이것을 표본 크기의 제곱근으로 나누는 순간 표준오차가 됩니다
n
표본에 들어 있는 관측값의 개수이며 최소 2입니다. 계산에 두 번 들어갑니다. 한 번은 표준오차 안에, 또 한 번은 t 분위수의 자유도 n − 1을 통해 들어갑니다
t(α/2, n − 1)
평균일 때의 임계값입니다. 자유도 n − 1인 t 분포에서 양쪽 꼬리에 α의 절반씩을 남기는 지점입니다. 정규분포의 임계값보다 항상 조금 크고, 표본이 작을 때는 훨씬 큽니다. s를 아는 값이 아니라 추정한 값으로 쓴 대가를 t 분포가 받는 셈입니다
p̂
표본비율이며 퍼센트로 넣습니다. 비율 쪽 계산은 처음부터 끝까지 퍼센트포인트로 진행되므로, 하한과 상한, 오차 범위, 표준오차가 모두 입력한 숫자와 같은 눈금 위에 놓입니다
z(α/2)
비율일 때의 임계값입니다. 신뢰수준 95%에서 1.9600이고 표본 크기가 어떻든 같은 값입니다. 비율은 t가 아니라 정규분포로 판정하기 때문입니다. 비율 식에는 이 값이 두 번 나옵니다. 근호 밖에 한 번, 그리고 p̂를 통해 근호 안에 한 번입니다

표본이 있고 그 추정이 얼마나 정밀한지 말하고 싶을 때 씁니다. 측정 몇 번에서 얻은 평균이든, 설문에서 얻은 비율이든 마찬가지입니다. 숫자 하나를 정직하게 보고하는 방법이 이것입니다. 관측값 100개에서 나온 평균 50과 관측값 5개에서 나온 평균 50은 서로 다른 주장이고, 그 차이를 만들어 내는 것이 이 구간입니다. 표본 크기가 표준오차의 분모에 앉아 있기 때문입니다. 나머지는 두 가지 설정이 결정합니다. 추정하려는 양이 길이, 시간, 점수처럼 재어 낸 값이면 평균 쪽을, 전체 인원 중 몇 명인지를 나타내는 값이면 비율 쪽을 고르고 퍼센트로 넣습니다. 그다음 신뢰수준을 고릅니다. 95%가 관례이고, 여기서 제공하는 세 단계면 발표된 수치의 거의 전부를 덮습니다. 이 구간이 하지 않는 일도 알아 두세요. 참값이 어디 있는지도 말하지 않고, 앞으로 나올 관측값 중 몇 퍼센트가 이 안에 들지도 말하지 않습니다. 이것은 추정 절차에 대한 진술이지 데이터에 대한 진술이 아닙니다.

계산 예시

  1. 관측값 100개에서 얻은 평균

    1. 표준오차: 12 / √100 = 12 / 10 = 1.2
    2. 자유도: n − 1 = 99, 95% 신뢰수준에서 임계값은 1.9842
    3. 오차 범위: 1.9842 × 1.2 = 2.3811
    4. 구간: 50 − 2.3811 = 47.6189, 50 + 2.3811 = 52.3811

    여기서 눈여겨볼 숫자는 임계값입니다. 익숙한 1.96이 아니라 1.9842입니다. 이 차이는 같은 100개의 관측값에서 흩어짐까지 추정한 대가를 t 분포가 청구한 것이고, 표본이 커지면 줄어듭니다. n = 1,000이면 거의 사라집니다. 비율 칸에 60이 그대로 남아 아무 일도 하지 않는 것도 보세요. 두 입력 묶음은 항상 화면에 함께 있고, 맨 위의 선택 상자가 어느 쪽을 쓸지 정합니다.

  2. 1,000명을 조사한 여론조사의 비율

    1. 표본비율 50%는 소수로 0.5이고 1 − p̂ 역시 0.5
    2. 표준오차: √( 0.5 × 0.5 / 1000 ) = 0.015811, 퍼센트포인트로는 1.5811
    3. 임계값: 95%에서 1.96, 표본 크기가 어떻든 같은 값
    4. 오차 범위: 1.96 × 1.5811 = 3.099 퍼센트포인트, 구간은 46.901%에서 53.099%

    이 예시의 모든 숫자는 비율이 아니라 퍼센트포인트입니다. 표준오차가 0.0158이 아니라 1.58포인트인 것이 그렇습니다. 이것이 이 페이지가 비율에 대해 쓰는 눈금이고, 첫 번째 예시 옆에서 이 표준오차가 커 보이는 이유이기도 합니다. 재어 낸 양이 아니라 몫을 재고 있기 때문입니다. 1,000명쯤 조사하면 오차 범위가 대략 3포인트라는 익숙한 말도 같은 계산에서 나옵니다.

  3. 같은 관측값 100개를 99% 신뢰수준으로 보고하면

    1. 표본이 달라진 것이 없으므로 표준오차는 12 / √100 = 1.2 그대로
    2. 움직이는 것은 임계값 하나뿐: 1.9842 대신 2.6264
    3. 오차 범위: 2.6264 × 1.2 = 3.1517
    4. 구간: 50 ± 3.1517, 즉 46.8483에서 53.1517

    첫 번째 예시와 견주면 신뢰수준이 사 주는 것이 정확히 무엇인지 드러납니다. 같은 데이터, 같은 표준오차인데 구간은 32% 넓어졌습니다. 수준을 올려서 새로 알아낸 것은 없습니다. 표본이 담고 있는 정보는 그대로이고 그 정보에 대해 하는 주장만 달라졌습니다. 95%가 관례인 이유가 이것이고, 99% 구간을 그렇다고 말하지 않고 인용하는 것이 신중한 게 아니라 오해를 부르는 이유도 이것입니다.

한계

두 갈래 모두 관측값이 서로 독립이라고 가정합니다. 같은 기계에서 읽은 500개의 값, 또는 20개 학급에서 모은 500명의 학생은 산수가 믿는 것보다 정보가 적고, 구간은 실제보다 좁게 나옵니다. 또 두 갈래 모두 추정값이 참값 둘레에서 대략 대칭이라고 가정합니다. 평균 쪽은 표본이 거의 정규분포이거나 n이 커서 t 분포가 너그러워지기를 기대하고, 비율 쪽이 둘 중 더 약합니다. 0%나 100% 근처에서는 식 자체가 틀린 식이라, 이 페이지는 그 두 값을 거절합니다. 그렇게 추정할 수 없는 비율 둘레에 자신 있게 좁은 구간을 돌려주는 것보다 낫기 때문입니다. 유한모집단 수정은 여기서 하지 않습니다. 표본이 작은 모집단의 큰 몫이라면 표본 크기 페이지가 그 수정을 적용해, 이 페이지가 시사하는 것보다 적은 인원을 요구할 것입니다.

자주 묻는 질문

신뢰구간은 실제로 무엇을 뜻하나요?
95% 설정에서, 같은 절차로 만든 구간 중 95%가 참값을 담는다는 뜻입니다. 이 특정한 구간이 참값을 담을 확률이 95%라는 말이 아닙니다. 참값은 고정되어 있고 알려지지 않았으므로 방금 계산한 두 경계 안에 있거나 밖에 있거나 둘 중 하나이고, 거기에 확률이 붙지 않습니다. 이 숫자가 설명하는 것은 방법의 신뢰성입니다. 실무에서 사람들이 하는 읽기는 구간 가운데에 가까운 값이 양 끝의 값보다 그럴듯하고, 구간 밖의 값은 데이터와 다소 어긋난다는 것이며, 이 다리가 p값 페이지의 가설검정으로 이어집니다.
평균에는 왜 t를 쓰고 비율에는 왜 z를 쓰나요?
평균에서는 중심뿐 아니라 흩어짐까지 추정하지만 비율에서는 그러지 않기 때문입니다. 평균의 표준오차는 s / √n이고 s는 같은 표본에서 계산되므로, 구간은 그만큼의 추가 불확실성을 감안해야 합니다. t 분포가 하는 일이 정확히 그것이고, n = 100에서 임계값이 1.96이 아니라 1.9842인 이유도 그것입니다. 비율에는 그런 두 번째 추정이 없습니다. 추정값의 흩어짐이 p̂(1 − p̂)를 통해 비율 자체에서 따라 나오므로 표본 크기와 무관하게 정규분포가 적용됩니다. 두 입력 묶음은 항상 화면에 함께 보이고, 맨 위의 선택 상자가 계산이 어느 쪽을 읽을지 정합니다.
오차 범위와 표준오차는 무엇이 다른가요?
표준오차는 불확실성 한 단위이고, 오차 범위는 구간이 몇 단위까지 뻗어 나가는지입니다. 오차 범위는 표준오차에 임계값을 곱한 값이라, 표본이 큰 95% 신뢰구간에서는 표준오차의 약 두 배이고 99%에서는 약 두 배 반입니다. 두 줄을 모두 인쇄하는 이유는 두 단계 구조가 보이게 하기 위해서입니다. 더 좁은 구간을 원한다면 공략할 줄은 표준오차입니다. 데이터를 더 모으는 데 반응하는 줄이 그것뿐이기 때문입니다. 임계값은 신뢰수준을 바꿀 때만 움직입니다.
구간이 0% 아래나 100% 위로 나올 수 있나요?
그럴 수 있고, 이 페이지는 그것을 몰래 잘라 내지 않고 그대로 인쇄합니다. 표본이 2인데 비율이 50%이면 경계가 −19.3%와 119.3%로 나오는데, 이것은 결함이 아닙니다. 관측값이 둘뿐이면 비율에 대해 아는 것이 정말로 거의 없고, 그 사실을 말해 주는 구간이 비율이 가질 수 있는 범위로 잘라 낸 구간보다 정직합니다. 이 표본으로는 여기서 유용한 것을 추정할 수 없다고 읽고 데이터를 더 모으세요. 다만 비율을 정확히 0%나 100%로 넣으면 거절합니다. 그 두 점에서는 넓이가 0인 흩어짐으로 나누게 되어 폭이 0인 구간이 나오는데, 이 방법이 감당할 수 없는 확실성 주장이기 때문입니다.
임계값 표는 어디에 있나요?
이 페이지에는 없고, 그건 의도한 것입니다. 임계값 표가 여기서 하는 일은 이미 다 끝나 있습니다. 수준을 고르면 그 수준이 함의하는 값 하나가 자기 줄에 인쇄됩니다. 표를 만들려면 신뢰수준을 하나 정해야 하므로, 99%로 바꾼 독자는 위 패널과 어긋나는 표를 들여다보게 됩니다. 페이지가 자기 자신과 모순되는 실패입니다. t 분포는 문제가 하나 더 있습니다. 임계값이 수준뿐 아니라 자유도에도 달려 있어서, 표 하나가 아니라 격자 하나가 필요합니다. 수준과 자유도를 입력으로 받는 임계값 도구가 그 조회를 할 자리입니다.

참고 문헌

관련 계산기