본문으로 건너뛰기
CalcMax

오차 범위 계산기

최솟값: 2

최솟값: 0

범위: 0 – 100

계산 결과

2.3811

오차 범위

표준오차
1.2000
임계값
1.9842

오차 범위 계산기는 표본의 흩어짐을, 설문 결과와 함께 인용되는 플러스마이너스 수치로 바꿔 줍니다. 필요한 것은 셋이고 페이지도 정확히 그 셋을 묻습니다. 신뢰수준 — 90, 95, 99% — 과 표본 크기, 그리고 추정하려는 양이 얼마나 변동이 컸는지인데, 추정 대상이 평균이면 표준편차이고 퍼센트면 비율 자체입니다. 산수는 임계값에 표준오차를 곱한 것이고 두 인수를 모두 인쇄하는데, 가장 흔한 두 실수가 하나씩 여기 살기 때문입니다. z가 들어갈 자리에 t 임계값을 쓰는 것, 그리고 표본 크기의 제곱근이 아니라 표본 크기로 나누는 것입니다. 결과는 표본의 중심과 아무 관계가 없습니다. 오차 범위는 추정값이 얼마나 빗나갈 수 있는지를 말하지 그 값이 무엇인지를 말하지 않습니다. 60%에 오차 3포인트가 붙은 여론조사는 모집단이 57%였어도 63%였어도 똑같이 나올 수 있습니다.

공식

ME = z* × SE SE = s / √n SE = √(p(1 − p) / n)

ME
오차 범위이며 신뢰구간 너비의 절반으로, 추정값과 같은 단위로 표시됩니다. 너비가 아니라 반너비인 이유는 구간을 추정값 ± ME로 적기 때문입니다. 같은 수를 한쪽에서는 빼고 다른 쪽에서는 더합니다. 단위는 추정값을 따라갑니다. 비율이면 퍼센트포인트이고, 평균이면 데이터를 재어 넣은 단위입니다
z*
임계값이며 이 모드에서는 익숙한 1.96이 아니라 언제나 자유도 n − 1에서 취한 t 값입니다. 설문이 보통 가지는 표본 크기 앞에서는 차이가 작지만 0은 아니고, 오차 범위가 가장 클 때 정확히 가장 커집니다. n = 2에서 t 값은 12.7062라서, 표준편차가 4인 두 명짜리 표본은 오차 범위가 35.94가 됩니다
s
표본표준편차이며 평균 모드에서만 씁니다. 설문에서는 이것을 미리 아는 경우가 드물고, 그래서 여론조사가 비율을 보고합니다. 예/아니오 질문이면 변동이 퍼센트 자체에서 따라 나와서 따로 추정할 것이 없습니다
p
표본비율이며 식에서는 소수로, 패널에서는 퍼센트로 적습니다. 너비에 보태는 몫은 50%에서 최대입니다. 절반이 찬성하고 절반이 반대하는 것이 이분형 질문이 가질 수 있는 가장 큰 불확실성이고, 그래서 여론조사에 인용되는 오차 범위는 그 조사의 실제 수치가 아니라 p = 0.5의 최악의 경우인 경우가 많습니다
n
표본 크기이며 √n으로 들어갑니다. 그 제곱근이 표본을 두 배로 늘려도 오차 범위가 절반이 되지 않는 이유입니다. 1.41로 나눌 뿐이라서, 오차 범위를 절반으로 만들려면 표본이 네 배 필요합니다. 그리고 연구자가 통제하는 유일한 인수이기도 합니다. p는 데이터에서 나오고 신뢰수준은 답이 얼마나 신중해야 하는지에 대한 진술이기 때문입니다

이미 데이터를 모았고 보고된 수치 가운데 얼마가 잡음인지 알고 싶을 때, 또는 남이 보고한 숫자를 읽으면서 그것이 무엇으로 만들어졌는지 보고 싶을 때 씁니다. 가장 쓸모 있는 두 가지는 둘 다 주 결과가 아니라 패널에 있습니다. 임계값은 t를 썼는지 z를 썼는지, 따라서 분석자가 흩어짐을 추정한 대가를 셈했는지를 드러냅니다. 표준오차는 제곱근 법칙을 눈에 보이게 합니다. 표본을 네 배로 늘리면 이 값이 절반이 됩니다. 연구를 해석하는 것이 아니라 계획하는 중이라면 표본 크기 페이지가 더 나은 도구입니다. 이미 괜찮다고 정한 오차에 응답이 몇 건 필요한지로 질문을 뒤집어 주기 때문입니다. 설문 결과를 읽을 때는 오차 범위가 표집오차만 덮는다는 것을 기억하세요. 누가 답했는지, 질문이 유도적이었는지, 모집단의 모든 사람이 뽑힐 수 있게 표본을 뽑았는지에 대해서는 아무 말도 하지 않습니다. 그런 문제들은 n이 커져도 줄지 않고, 표본이 크고 오차 범위가 작은 편향된 여론조사가 권위 있어 보이게 되는 방식이 정확히 그것입니다.

계산 예시

  1. 기본값: 관측값 100개에서 추정한 평균

    1. 표준오차: s / √n = 12 / 10 = 1.2
    2. 임계값: 자유도 99에서 t 값 1.9842이며 1.9600이 아님
    3. 오차 범위: 1.9842 × 1.2 = 2.3811
    4. 추정값 자체는 입력이 아니므로 답은 구간이 아니라 반너비

    읽을 만한 줄은 임계값입니다. 손 계산이 보통 여기서 틀어지기 때문입니다. 관측값 100개는 큰 표본이고, 1.9842 대신 1.96을 집어 드는 것은 답을 1.2% 바꿉니다. 여기서는 작지만 n = 2에서는 어마어마합니다. 같은 대입이 35.9포인트를 5.5로 만들어, 불확실성을 여섯 배나 적게 말하게 됩니다. 페이지가 임계값을 인쇄하는 이유는 이 단계가 곱셈 안에 숨지 않고 확인 가능하게 하기 위해서입니다.

  2. 응답 1000건에서 나온 비율

    1. 비율을 소수로: 50% = 0.5
    2. 퍼센트포인트 단위의 표준오차: √(0.5 × 0.5 / 1000) × 100 = 1.5811
    3. 임계값: 비율 모드는 z를 쓰므로 정규분포의 값 1.9600
    4. 오차 범위: 1.96 × 1.5811 = 3.099 퍼센트포인트

    신문이 인용하는 수치의 모양이고, 세 가지를 갈라 볼 만합니다. 임계값이 여기서는 1.9600인데 위의 평균 예시는 1.9842를 썼습니다. 비율의 변동은 p가 완전히 정해 주고 자유도가 필요 없기 때문입니다. 표준편차 칸은 쓰이지 않은 채 패널에 남아 있습니다. 이 모드에서 변동은 별도의 추정이 아니라 퍼센트에서 나옵니다. 그리고 p = 50%는 최악의 경우라서 이 수가 일반화됩니다. 그 설문의 어떤 질문도 이보다 큰 오차 범위를 갖지 않습니다.

  3. 관측값 9개라 오차 범위가 임계값과 겹치는 경우

    1. 표준오차: 3 / √9 = 1, 정확히
    2. 자유도 8에서 임계값: 2.306
    3. 오차 범위: 2.306 × 1 = 2.306
    4. 세 줄 가운데 두 줄이 같은 수를 인쇄하는데, 이는 규칙이 아니라 입력을 이렇게 고른 우연

    이 우연은 한 번 봐 두는 것이 좋습니다. 나중에 관계로 오해하지 않기 위해서입니다. 표준오차가 정확히 1로 나와서 곱셈이 아무 일도 하지 않았고, 임계값이 답으로 그대로 보입니다. 관측값 9개에 표준편차 3은 자연스러운 소표본 설정이고, 신뢰구간 페이지가 n = 9에서 내는 것과 같은 t 값입니다. 두 페이지는 계산 전체를 공유하고, 표본평균이 주어져 구간을 옮길 수 있는지에서만 갈립니다.

  4. 같은 데이터를 95% 대신 99%로 읽기

    1. 표준오차는 1.2 그대로 — 데이터에 대해 움직인 것이 없음
    2. 99%에서 자유도 99의 임계값: 2.6264
    3. 오차 범위: 2.6264 × 1.2 = 3.1517
    4. 95% 경우 2.3811과 비교하면, 늘어난 확신의 값은 너비 32%

    세 줄 가운데 하나만 바뀌고, 그것이 셋을 다 인쇄하는 요점입니다. 신뢰수준은 임계값만 건드리고 다른 것은 건드리지 않으며, 표본 크기는 표준오차만 건드립니다. 두 손잡이는 독립이고, 둘을 헷갈리는 것이 무엇이 바뀌었는지 잘못 읽는 흔한 경로입니다. 맞바꿈 자체에도 이름을 붙일 만합니다. 99% 신뢰는 더 정확한 것이 아니라 더 신중한 것입니다. 참값을 더 자주 담는 넓은 구간을 사는 대신, 한 번의 기회에서 추정값을 더 느슨하게 붙잡습니다.

한계

오차 범위는 한 가지 오차 원천만 덮습니다. 모집단 전체를 재지 않고 표본을 뽑아서 생기는 변동입니다. 편향에 대해서는 아무 말도 하지 않고, 둘은 서로 바꿔 쓸 수 있는 것이 아닙니다. 웹사이트에서 자원한 천 명의 표본은 오차 범위가 작으면서도 스무 포인트나 틀릴 수 있습니다. 답하기로 선택한 사람들이 무작위 추출이 아니기 때문입니다. 관측값이 독립이라고도 가정합니다. 한 가구에서 여러 명을 조사하거나 같은 대상을 두 번 재면 유효 표본 크기가 응답 수보다 훨씬 아래로 떨어지는데, 식은 그것을 알 방법이 없어 오차 범위가 너무 좁게 나옵니다. 평균 식과 비율 식 모두 큰 표본 근사입니다. 비율 쪽은 특히 n·p나 n·(1 − p)가 작을 때 믿을 수 없는데, 드문 범주에서 그렇게 됩니다. 표본 100에서 2%의 응답률은 대칭적인 플러스마이너스로 보고해서는 안 됩니다. 그리고 오차 범위는 한 추정값을 홀로 서술합니다. 두 집단을 견주는 데는 틀린 도구입니다. 거기서 중요한 것은 차이의 오차 범위이고, 두 집단이 독립이 아니면 각각의 오차 범위를 더한 값이 아닙니다.

자주 묻는 질문

오차 범위 3%는 실제로 무엇을 뜻하나요?
같은 설문을 여러 번 반복하면, 그렇게 나온 구간 — 보고된 수치에 3포인트를 더하고 뺀 것 — 의 약 95%가 모집단의 참값을 담는다는 뜻입니다. 참값이 확실히 3포인트 안에 있다는 뜻도 아니고, 설문이 최대 3포인트까지 틀렸다는 뜻도 아닙니다. 놓치기 쉬운 두 가지가 따라옵니다. 참값은 구간 안에 있거나 밖에 있거나 둘 중 하나라서, 95%는 이 결과 하나가 아니라 절차를 서술합니다. 그리고 집단을 견줄 때는 오차가 겹칩니다. 각각 3포인트의 오차를 가진 조사에서 두 후보가 4포인트 차이로 벌어져 있다면, 그 경합은 단순한 의미에서 “오차 범위 안”이 아닙니다. 그 차이에는 자기만의 오차 범위가 있고, 그것은 둘 중 어느 것보다 큽니다.
표본이 크면 오차 범위가 왜 줄지만 비례해서 줄지는 않나요?
표본 크기가 식에 제곱근으로 들어가기 때문입니다. 응답이 100에서 400으로 가면 오차 범위가 절반이 되고, 400에서 1,600으로 가면 다시 절반이 됩니다. 절반이 될 때마다 표본은 네 배가 듭니다. 설문 설계에서 가장 결과가 큰 사실이고, 여론조사가 수백에서 수천 명 선에 모이는 이유를 설명합니다. 처음 천 명이 얻을 수 있는 정밀도의 대부분을 사 주고, 다음 천 명은 그 절반만 사 줍니다. 더 나은 분석으로 오차 범위를 개선할 수 없는 이유이기도 합니다. 유일한 손잡이는 데이터를 더 모으는 것이고, 그것도 제곱근으로 작동합니다.
오차 범위가 큰 쪽이 더 나쁜 건가요?
더 나쁜 것이 아니라 더 정직한 것입니다. 넓은 구간이 참값을 담을 가능성이 크므로, 99% 신뢰수준에서 ±5포인트를 보고한 연구는 90%에서 ±3을 보고한 연구보다 안전한 주장을 하고 있습니다. 신뢰수준을 밝히기 전에는 둘을 견줄 수 없습니다. 정말로 나쁜 것은 오차 범위를 밝히지 않거나 신뢰수준 없이 인용하는 것입니다. 그러면 독자가 그 수에 얼마만큼 무게를 실어야 할지 알 수 없습니다. 넓은 오차가 신호하는 나머지 하나는 표본이 작았다는 것뿐이고, 그것은 결함이 아니라 정보입니다. 그 연구가 미세한 차이를 가려낼 수 없다는 뜻이고, 가려내지 못하는 연구는 가려낸 것처럼 읽혀서는 안 됩니다.
비율이 0%나 100%면 왜 거절하나요?
거기서 식이 무너지기 때문입니다. 비율의 표준오차는 √(p(1 − p)/n)인데, p = 0이나 p = 1에서 p(1 − p)가 0이라서 오차 범위가 정확히 0으로 나옵니다. “60% ± 0포인트”를 인쇄하는 것은 어떤 표본도 지탱할 수 없는 확실성 주장입니다. 모집단 값이 60%라고 말하는 셈인데, 데이터가 보여 주는 것은 이 표본에서 아무도 그 범주 밖으로 나오지 않았다는 것뿐입니다. 도수가 0이거나 전부인 경우를 다루는 제대로 된 방법들이 있고, 그 방법들은 모두 빈 칸을 믿는 대신 도수에 무엇인가를 더합니다. 어느 것도 순수한 오차 범위가 아니라서, 확실성으로 읽힐 수를 돌려주는 대신 페이지가 물러섭니다.
오차 범위가 편향된 표본까지 감안하나요?
아니요. 그리고 이것이 이 개념 전체의 가장 중요한 한계입니다. 오차 범위는 표집 변동을 잽니다. 모집단 전체 대신 일부를 봐서 생기는 오차의 몫입니다. 편향은 다른 종류의 오차이고, 표본을 고른 방식이나 질문을 한 방식에서 생기며, 표본이 커져도 줄지 않습니다. 만 명을 대상으로 한 자발적 온라인 투표는 오차 범위가 1퍼센트포인트여도 15포인트나 틀릴 수 있습니다. 답한 사람들이 모집단에서 무작위로 뽑힌 이들이 아니기 때문입니다. 큰 표본은 표집오차를 작게 만들고, 편향은 더 정밀해 보이게 만듭니다. 보고된 오차 범위를 읽을 때는 먼저 표본을 어떻게 뽑았는지 물으세요.
오차 범위와 표준오차는 무엇이 다른가요?
표준오차는 추정값의 날것의 흩어짐이고, 오차 범위는 그 흩어짐에 신뢰수준에 따라 정해지는 임계값을 곱한 것입니다. 그래서 표준오차는 데이터만의 성질이고, 오차 범위는 거기에 얼마만큼의 확신을 두기로 했는지에 대한 진술입니다. 95% 구간의 곱하는 수는 대략 2라서 두 수가 흔히 두 배 안쪽에서 붙어 있고, 그래서 뒤섞입니다. 패널에 둘 다 인쇄하는 이유가 그것입니다. 표준오차는 표본이 얼마만큼의 정보를 나르는지 알려 주고, 오차 범위는 그것으로 무엇을 주장하기로 했는지 알려 줍니다.

참고 문헌

관련 계산기