본문으로 건너뛰기
CalcMax

중심극한정리 계산기

최솟값: 0

최솟값: 1

계산 결과

2.5000

표준오차

표본평균의 평균
100.0000
표본평균의 분산
6.2500

중심극한정리 계산기는 표본평균의 표본 분포를 설명합니다. 그 분포가 어디에 놓이는지, 얼마나 넓은지, 그리고 둘이 표본 크기에 어떻게 반응하는지입니다. 놀라운 쪽은 중심입니다. 모든 표본평균의 평균은 표본 크기가 어떻든 모집단 평균과 같아서, 데이터를 더 모아도 중심은 움직이지 않습니다. 달라지는 것은 너비입니다. 표준오차는 모집단 표준편차를 √n으로 나눈 값이라 표본을 네 배로 늘리면 절반이 되고, 분산은 그 대신 4분의 1로 줄어듭니다. 정리 자체의 주장 — n이 커지면 모양이 정규분포에 가까워진다 — 은 너비가 아니라 형태에 관한 결론이고, 이 페이지의 어떤 산수로도 그것을 보여 줄 수는 없습니다. 대신 이 페이지는 표본 크기를 여러 값으로 바꿔 보며 표준오차가 어떻게 줄어드는지 확인하는 자리입니다.

표본이 커질수록 표준오차가 줄어드는 모습

표본 크기, n√nσ에 곱할 계수
111
420.5
1640.25
2550.2
100100.1
400200.05
2500500.02
100001000.01

세 번째 열은 σ에 곱하는 계수입니다. 표준편차가 15인 모집단에서 표본 100개를 뽑으면 표준오차가 0.1 × 15 = 1.5가 됩니다. 표 안의 어떤 값도 입력한 평균이나 표준편차에 달려 있지 않아서, 위 패널과 어긋날 수가 없습니다. 표 자체가 함수 1/√n이고, 패널은 그 함수를 한 점에서 계산한 것입니다. 행을 따라 내려가면 제곱근 법칙이 주장이 아니라 무늬로 보입니다. 표본 크기가 네 배가 될 때마다 표준오차가 절반이 되고, 여덟 행이 네 배 간격으로 놓여 있어 그 무늬가 흐트러지지 않고 반복됩니다. 표본 크기는 제곱근이 정수가 되는 값들이라, 각 행을 손으로 검산할 수 있습니다.

공식

E[X̄] = μ Var(X̄) = σ² / n SE = σ / √n

μ
모집단 평균, 즉 표본을 뽑아 오는 분포의 중심입니다. 이것이 표본 분포의 평균으로 그대로 나옵니다. 세 결과 가운데 첫째이고, 표본 크기가 어떻든 참인 유일한 결과입니다
σ
모집단 표준편차입니다. 단위가 데이터의 단위이고 표준오차의 단위도 같아서, σ와 표준오차를 바로 견줄 수 있습니다. σ가 15일 때 표준오차가 2.5라는 것은 데이터에 대한 진술이 아니라 표본 크기에 대한 진술입니다
n
표본 하나에 들어 있는 관측값의 개수입니다. 몇 번 뽑았는지가 아니라 한 번에 몇 개를 뽑았는지입니다. 어떤 자리에서는 √n으로, 다른 자리에서는 n으로 들어가는데, 그 차이가 실무적인 메시지 전부입니다. 분산은 n에 비례해 줄지만 표준오차는 그 제곱근에 비례해 줄어듭니다
X̄
숫자 하나가 아니라 확률변수로 다루는 표본평균입니다. 표본 하나를 뽑으면 X̄ 하나가 나오고, 뽑기를 반복하면 그것들의 분포가 생깁니다. 세 출력은 어느 한 표본이 아니라 그 분포를 설명합니다
SE
표준오차, 즉 표본평균들의 표준편차이며 이 페이지의 주 결과입니다. 신뢰구간을 만들 때 쓰이는 값이고 검정 통계량이 나누는 값이기도 합니다. 그래서 제곱근을 벗겨 낸 분산이 아니라 이 값을 읽는 것이 낫습니다

표본평균이 표본마다 얼마나 움직일 것으로 기대되는지 알아야 할 때 씁니다. 연구를 설계하기 전에, 보고서에서 표준오차를 읽다가 그것이 어디서 나왔는지 보고 싶을 때, 또는 표본 크기에 대한 직관이 맞는지 확인할 때입니다. 이 페이지가 보통 바로잡는 직관은 표본이 크면 추정이 그만큼 좋아진다는 것이고, 그렇지 않습니다. 표준오차가 제곱근에 비례해 줄어들기 때문입니다. 관측값 100개에서 400개로 가면 추정값의 흩어짐이 절반이 되고, 한 번 더 절반으로 만들려면 1,600개가 필요합니다. 위의 두 결과는 어떤 모양의 모집단에서도 성립하므로 분포에 대해 아무것도 모르는 상태에서도 쓸 수 있습니다. 이 페이지가 말해 주지 못하는 것은 주어진 n이 표본평균을 대략 정규분포로 만들 만큼 큰지 여부입니다. 그것은 원래 분포가 얼마나 치우쳤는지에 달려 있고, 계산이 아니라 판단입니다.

계산 예시

  1. 기본값: 평균 100, 표준편차 15인 모집단에서 36개씩 뽑기

    1. 표본평균의 분산: σ² / n = 225 / 36 = 6.25
    2. 표준오차: √6.25 = 2.5
    3. 표본평균의 평균: 100, 모집단 평균 그대로
    4. σ = 15와 비교: 36개씩 뽑으면 흩어짐이 6분의 1이 되는데, 6은 √36

    15와 36은 암산이 되도록 고른 수입니다. 36분의 225는 6.25이고 그 제곱근은 딱 2.5입니다. 세 번째 줄은 아무 일도 일어나지 않은 것처럼 보여서 오히려 한 번 더 볼 만합니다. 모든 표본평균의 평균은 표본 크기와 무관하게 모집단 평균이고, 이것은 근사가 아니라 기댓값에 관한 사실입니다. 100 = 100이 보이는 것이 그 줄의 요점이고, 입력을 그대로 되읽는 줄인데도 인쇄되는 이유입니다.

  2. 같은 모집단에서 36개 대신 9개씩 뽑기

    1. 표본이 4분의 1로 줄었으므로 분산은 네 배: 225 / 9 = 25
    2. 표준오차: √25 = 5
    3. 평균은 여전히 100 — 표본을 줄여서 바뀐 것은 흩어짐뿐
    4. 첫 번째 예시와 비교: n이 4분의 1이 되었는데 표준오차는 두 배만 되었음

    이 두 예시가 제곱근 법칙을 구체적으로 보여 줍니다. 표본을 4분의 1로 줄여도 표준오차는 두 배가 될 뿐입니다. n에 비례해 줄어드는 것은 분산 쪽이기 때문입니다. 반대 방향으로 읽으면 정밀도가 왜 비싼지가 됩니다. 표본 네 배가 두 배의 개선을 사 주고, 그다음 두 배의 개선에는 원래 표본의 열여섯 배가 듭니다. 모든 표본 크기 결정이 이 맞바꿈이고, 아래 참고표가 더 넓은 n 범위에서 그것을 보여 줍니다.

  3. 한 번에 하나씩 뽑으면 흩어짐이 줄지 않음

    1. n = 1이면 표본평균이 그 관측값 하나이므로 표본 분포가 모집단 그 자체
    2. 분산: 225 / 1 = 225, 즉 σ²
    3. 표준오차: √225 = 15, 즉 σ
    4. 표본평균의 평균은 여전히 100

    범위의 n = 1 끝은 전체 아이디어를 붙잡아 주므로 한 번은 볼 만합니다. 하나짜리 표본은 모집단에서 뽑은 값 하나이므로 평균으로 지워진 것이 아무것도 없고, 표준오차가 모집단 표준편차 그 자체입니다. 다른 모든 표본 크기는 이 출발점을 √n으로 나눈 것입니다. 이 페이지가 최소 2를 요구하지 않고 n = 1을 받아들이는 이유는 그것이 정당하고 또 가르쳐 주는 바가 있는 입력이기 때문입니다. 표본 때문에 표본 분포가 좁아지지 않았을 뿐입니다.

한계

식 위쪽의 두 항등식은 어떤 모집단과 어떤 n에서도 성립하지만, 표본 분포의 처음 두 적률만 설명합니다. 실무적 쓰임의 대부분이 기대는 것은 세 번째 주장인 정규분포 근사이고, 이 페이지가 점검할 수 없는 부분이 바로 그것입니다. n이 얼마나 커야 하는지는 원래 분포가 얼마나 치우쳤는지에 달려 있어서입니다. 대략 대칭인 모집단에서는 10이면 충분한 경우가 많고, 꼬리가 긴 분포는 표본평균이 자리를 잡기까지 수백 개가 필요할 수 있습니다. 널리 반복되는 30이라는 문턱은 결과가 아니라 경험법칙으로 다루세요. 이 식은 또 관측값이 독립이라고 가정하는데, 작은 모집단에서 되돌려 놓지 않고 뽑으면 그것이 깨집니다. 표본 크기 페이지가 그 수정을 적용해, 이 페이지가 시사하는 것보다 적은 인원을 요구할 것입니다. 여기서 데이터로 추정하는 값은 하나도 없습니다. 두 입력 모두 모집단의 값이고, 표본표준편차만 가지고 있다면 그 차이를 아는 쪽은 신뢰구간 페이지입니다.

자주 묻는 질문

표준편차와 표준오차는 무엇이 다른가요?
표준편차는 개별 관측값이 평균에서 얼마나 떨어져 있는지를 설명하고, 표준오차는 표본평균이 모집단 평균에서 얼마나 떨어져 있는지를 설명합니다. 뒤엣것은 앞엣것을 √n으로 나눈 값이고, 그 나눗셈이 차이의 내용 전부입니다. σ = 15인 모집단은 9개를 뽑든 900개를 뽑든 똑같이 퍼져 있지만, 관측값 900개의 평균은 100개의 평균보다 참값에 세 배 가까이 붙습니다. σ가 데이터 자신의 단위로 표시되는 반면 표준오차는 연구가 커질수록 줄어드는 이유가 이것이고, 신뢰구간이나 검정 통계량에 들어가는 값이 표준오차인 이유도 이것입니다.
표본을 크게 뽑으면 표본평균의 평균이 달라지나요?
아니요. 그리고 이것이 사람들이 가장 믿기 어려워하는 결과입니다. 표본 분포의 평균은 n = 1부터 시작해 어떤 표본 크기에서도 모집단 평균과 같습니다. 평균을 내는 일이 추정값을 어느 방향으로도 밀지 않고 덜 변하게만 만들기 때문입니다. 표본평균의 분포는 같은 중심 둘레에서 좁아지고 높아집니다. 표본 크기는 정밀도를 살 뿐 정확도를 사지 않습니다. 추정값의 흩어짐을 줄이면서 추정값이 놓인 자리는 옮기지 않습니다. 반대로 편향된 표집 방법은 중심을 옮기고, 어떤 표본 크기도 그것을 되돌리지 못합니다. 두 실패 방식은 구분해 두는 것이 좋습니다.
중심극한정리가 적용되려면 표본이 얼마나 커야 하나요?
모집단의 모양에 달려 있고, 모든 경우에 통하는 문턱은 없습니다. 대칭인 모집단은 n = 10에서 잘 작동하고, 심하게 치우친 분포는 표본평균이 정규분포에 가까워지기까지 관측값 수백 개가 필요할 수 있습니다. 익숙한 30이라는 경험법칙은 완만하게 치우친 데이터를 시뮬레이션한 연구에서 나온 것으로, 정리가 아니라 합리적인 기본값입니다. 모양에 대한 가정 없이 이 페이지가 주는 것은 중심과 흩어짐입니다. 평균과 표준오차는 어떤 n에서도 정확합니다. 큰 표본이 필요한 것은 정규근사뿐이고, 그 위에 세워진 신뢰구간과 p값만 그 요구를 물려받습니다.
표본평균의 분산이 데이터의 분산보다 왜 이렇게 작나요?
평균을 내면 개별 관측값의 독립적인 오차가 상쇄되고, 그 상쇄가 표본 크기에 비례해서 진행되기 때문입니다. 반면 사람들이 보통 견주는 표준오차는 그 제곱근에 비례해 줄어듭니다. σ = 15, n = 36이면 분산은 225에서 6.25로, 36분의 1이 되지만 표준편차는 15에서 2.5로 6분의 1이 될 뿐입니다. 두 줄을 다 인쇄하는 이유가 이것입니다. 정리가 보통 진술되는 형태는 분산이고, 실제로 쓰이는 형태는 표준오차이며, 두 배율 사이의 간격이 제곱근입니다.
이것은 표준오차 계산기와 같은 건가요?
같은 양을 서로 다른 입력에서 계산하고, 어느 쪽이 필요한지는 무엇을 가지고 있느냐에 달려 있습니다. 이 페이지는 모집단 표준편차와 표본 크기, 즉 데이터를 모으기 전에 존재하는 값을 받습니다. 연구를 계획하거나 n이 정밀도를 어떻게 끌고 가는지 직관을 확인할 때 맞는 도구입니다. 표준오차 계산기는 표본 자체를 받아 그 표준편차를 계산합니다. 데이터가 손에 들어왔고 모집단 값을 모를 때 쓰는 쪽입니다. 둘의 차이는 정확히 가운데의 추정 단계 하나이고, 그 차이가 결과에 영향을 주는 자리는 신뢰구간 페이지입니다.

참고 문헌

관련 계산기