중심극한정리 계산기
계산 결과
표준오차
- 표본평균의 평균
- 100.0000
- 표본평균의 분산
- 6.2500
중심극한정리 계산기는 표본평균의 표본 분포를 설명합니다. 그 분포가 어디에 놓이는지, 얼마나 넓은지, 그리고 둘이 표본 크기에 어떻게 반응하는지입니다. 놀라운 쪽은 중심입니다. 모든 표본평균의 평균은 표본 크기가 어떻든 모집단 평균과 같아서, 데이터를 더 모아도 중심은 움직이지 않습니다. 달라지는 것은 너비입니다. 표준오차는 모집단 표준편차를 √n으로 나눈 값이라 표본을 네 배로 늘리면 절반이 되고, 분산은 그 대신 4분의 1로 줄어듭니다. 정리 자체의 주장 — n이 커지면 모양이 정규분포에 가까워진다 — 은 너비가 아니라 형태에 관한 결론이고, 이 페이지의 어떤 산수로도 그것을 보여 줄 수는 없습니다. 대신 이 페이지는 표본 크기를 여러 값으로 바꿔 보며 표준오차가 어떻게 줄어드는지 확인하는 자리입니다.
표본이 커질수록 표준오차가 줄어드는 모습
| 표본 크기, n | √n | σ에 곱할 계수 |
|---|---|---|
| 1 | 1 | 1 |
| 4 | 2 | 0.5 |
| 16 | 4 | 0.25 |
| 25 | 5 | 0.2 |
| 100 | 10 | 0.1 |
| 400 | 20 | 0.05 |
| 2500 | 50 | 0.02 |
| 10000 | 100 | 0.01 |
세 번째 열은 σ에 곱하는 계수입니다. 표준편차가 15인 모집단에서 표본 100개를 뽑으면 표준오차가 0.1 × 15 = 1.5가 됩니다. 표 안의 어떤 값도 입력한 평균이나 표준편차에 달려 있지 않아서, 위 패널과 어긋날 수가 없습니다. 표 자체가 함수 1/√n이고, 패널은 그 함수를 한 점에서 계산한 것입니다. 행을 따라 내려가면 제곱근 법칙이 주장이 아니라 무늬로 보입니다. 표본 크기가 네 배가 될 때마다 표준오차가 절반이 되고, 여덟 행이 네 배 간격으로 놓여 있어 그 무늬가 흐트러지지 않고 반복됩니다. 표본 크기는 제곱근이 정수가 되는 값들이라, 각 행을 손으로 검산할 수 있습니다.
공식
E[X̄] = μ Var(X̄) = σ² / n SE = σ / √n
- μ
- 모집단 평균, 즉 표본을 뽑아 오는 분포의 중심입니다. 이것이 표본 분포의 평균으로 그대로 나옵니다. 세 결과 가운데 첫째이고, 표본 크기가 어떻든 참인 유일한 결과입니다
- σ
- 모집단 표준편차입니다. 단위가 데이터의 단위이고 표준오차의 단위도 같아서, σ와 표준오차를 바로 견줄 수 있습니다. σ가 15일 때 표준오차가 2.5라는 것은 데이터에 대한 진술이 아니라 표본 크기에 대한 진술입니다
- n
- 표본 하나에 들어 있는 관측값의 개수입니다. 몇 번 뽑았는지가 아니라 한 번에 몇 개를 뽑았는지입니다. 어떤 자리에서는 √n으로, 다른 자리에서는 n으로 들어가는데, 그 차이가 실무적인 메시지 전부입니다. 분산은 n에 비례해 줄지만 표준오차는 그 제곱근에 비례해 줄어듭니다
- X̄
- 숫자 하나가 아니라 확률변수로 다루는 표본평균입니다. 표본 하나를 뽑으면 X̄ 하나가 나오고, 뽑기를 반복하면 그것들의 분포가 생깁니다. 세 출력은 어느 한 표본이 아니라 그 분포를 설명합니다
- SE
- 표준오차, 즉 표본평균들의 표준편차이며 이 페이지의 주 결과입니다. 신뢰구간을 만들 때 쓰이는 값이고 검정 통계량이 나누는 값이기도 합니다. 그래서 제곱근을 벗겨 낸 분산이 아니라 이 값을 읽는 것이 낫습니다
표본평균이 표본마다 얼마나 움직일 것으로 기대되는지 알아야 할 때 씁니다. 연구를 설계하기 전에, 보고서에서 표준오차를 읽다가 그것이 어디서 나왔는지 보고 싶을 때, 또는 표본 크기에 대한 직관이 맞는지 확인할 때입니다. 이 페이지가 보통 바로잡는 직관은 표본이 크면 추정이 그만큼 좋아진다는 것이고, 그렇지 않습니다. 표준오차가 제곱근에 비례해 줄어들기 때문입니다. 관측값 100개에서 400개로 가면 추정값의 흩어짐이 절반이 되고, 한 번 더 절반으로 만들려면 1,600개가 필요합니다. 위의 두 결과는 어떤 모양의 모집단에서도 성립하므로 분포에 대해 아무것도 모르는 상태에서도 쓸 수 있습니다. 이 페이지가 말해 주지 못하는 것은 주어진 n이 표본평균을 대략 정규분포로 만들 만큼 큰지 여부입니다. 그것은 원래 분포가 얼마나 치우쳤는지에 달려 있고, 계산이 아니라 판단입니다.
계산 예시
기본값: 평균 100, 표준편차 15인 모집단에서 36개씩 뽑기
- 표본평균의 분산: σ² / n = 225 / 36 = 6.25
- 표준오차: √6.25 = 2.5
- 표본평균의 평균: 100, 모집단 평균 그대로
- σ = 15와 비교: 36개씩 뽑으면 흩어짐이 6분의 1이 되는데, 6은 √36
15와 36은 암산이 되도록 고른 수입니다. 36분의 225는 6.25이고 그 제곱근은 딱 2.5입니다. 세 번째 줄은 아무 일도 일어나지 않은 것처럼 보여서 오히려 한 번 더 볼 만합니다. 모든 표본평균의 평균은 표본 크기와 무관하게 모집단 평균이고, 이것은 근사가 아니라 기댓값에 관한 사실입니다. 100 = 100이 보이는 것이 그 줄의 요점이고, 입력을 그대로 되읽는 줄인데도 인쇄되는 이유입니다.
같은 모집단에서 36개 대신 9개씩 뽑기
- 표본이 4분의 1로 줄었으므로 분산은 네 배: 225 / 9 = 25
- 표준오차: √25 = 5
- 평균은 여전히 100 — 표본을 줄여서 바뀐 것은 흩어짐뿐
- 첫 번째 예시와 비교: n이 4분의 1이 되었는데 표준오차는 두 배만 되었음
이 두 예시가 제곱근 법칙을 구체적으로 보여 줍니다. 표본을 4분의 1로 줄여도 표준오차는 두 배가 될 뿐입니다. n에 비례해 줄어드는 것은 분산 쪽이기 때문입니다. 반대 방향으로 읽으면 정밀도가 왜 비싼지가 됩니다. 표본 네 배가 두 배의 개선을 사 주고, 그다음 두 배의 개선에는 원래 표본의 열여섯 배가 듭니다. 모든 표본 크기 결정이 이 맞바꿈이고, 아래 참고표가 더 넓은 n 범위에서 그것을 보여 줍니다.
한 번에 하나씩 뽑으면 흩어짐이 줄지 않음
- n = 1이면 표본평균이 그 관측값 하나이므로 표본 분포가 모집단 그 자체
- 분산: 225 / 1 = 225, 즉 σ²
- 표준오차: √225 = 15, 즉 σ
- 표본평균의 평균은 여전히 100
범위의 n = 1 끝은 전체 아이디어를 붙잡아 주므로 한 번은 볼 만합니다. 하나짜리 표본은 모집단에서 뽑은 값 하나이므로 평균으로 지워진 것이 아무것도 없고, 표준오차가 모집단 표준편차 그 자체입니다. 다른 모든 표본 크기는 이 출발점을 √n으로 나눈 것입니다. 이 페이지가 최소 2를 요구하지 않고 n = 1을 받아들이는 이유는 그것이 정당하고 또 가르쳐 주는 바가 있는 입력이기 때문입니다. 표본 때문에 표본 분포가 좁아지지 않았을 뿐입니다.
한계
식 위쪽의 두 항등식은 어떤 모집단과 어떤 n에서도 성립하지만, 표본 분포의 처음 두 적률만 설명합니다. 실무적 쓰임의 대부분이 기대는 것은 세 번째 주장인 정규분포 근사이고, 이 페이지가 점검할 수 없는 부분이 바로 그것입니다. n이 얼마나 커야 하는지는 원래 분포가 얼마나 치우쳤는지에 달려 있어서입니다. 대략 대칭인 모집단에서는 10이면 충분한 경우가 많고, 꼬리가 긴 분포는 표본평균이 자리를 잡기까지 수백 개가 필요할 수 있습니다. 널리 반복되는 30이라는 문턱은 결과가 아니라 경험법칙으로 다루세요. 이 식은 또 관측값이 독립이라고 가정하는데, 작은 모집단에서 되돌려 놓지 않고 뽑으면 그것이 깨집니다. 표본 크기 페이지가 그 수정을 적용해, 이 페이지가 시사하는 것보다 적은 인원을 요구할 것입니다. 여기서 데이터로 추정하는 값은 하나도 없습니다. 두 입력 모두 모집단의 값이고, 표본표준편차만 가지고 있다면 그 차이를 아는 쪽은 신뢰구간 페이지입니다.
자주 묻는 질문
- 표준편차와 표준오차는 무엇이 다른가요?
- 표준편차는 개별 관측값이 평균에서 얼마나 떨어져 있는지를 설명하고, 표준오차는 표본평균이 모집단 평균에서 얼마나 떨어져 있는지를 설명합니다. 뒤엣것은 앞엣것을 √n으로 나눈 값이고, 그 나눗셈이 차이의 내용 전부입니다. σ = 15인 모집단은 9개를 뽑든 900개를 뽑든 똑같이 퍼져 있지만, 관측값 900개의 평균은 100개의 평균보다 참값에 세 배 가까이 붙습니다. σ가 데이터 자신의 단위로 표시되는 반면 표준오차는 연구가 커질수록 줄어드는 이유가 이것이고, 신뢰구간이나 검정 통계량에 들어가는 값이 표준오차인 이유도 이것입니다.
- 표본을 크게 뽑으면 표본평균의 평균이 달라지나요?
- 아니요. 그리고 이것이 사람들이 가장 믿기 어려워하는 결과입니다. 표본 분포의 평균은 n = 1부터 시작해 어떤 표본 크기에서도 모집단 평균과 같습니다. 평균을 내는 일이 추정값을 어느 방향으로도 밀지 않고 덜 변하게만 만들기 때문입니다. 표본평균의 분포는 같은 중심 둘레에서 좁아지고 높아집니다. 표본 크기는 정밀도를 살 뿐 정확도를 사지 않습니다. 추정값의 흩어짐을 줄이면서 추정값이 놓인 자리는 옮기지 않습니다. 반대로 편향된 표집 방법은 중심을 옮기고, 어떤 표본 크기도 그것을 되돌리지 못합니다. 두 실패 방식은 구분해 두는 것이 좋습니다.
- 중심극한정리가 적용되려면 표본이 얼마나 커야 하나요?
- 모집단의 모양에 달려 있고, 모든 경우에 통하는 문턱은 없습니다. 대칭인 모집단은 n = 10에서 잘 작동하고, 심하게 치우친 분포는 표본평균이 정규분포에 가까워지기까지 관측값 수백 개가 필요할 수 있습니다. 익숙한 30이라는 경험법칙은 완만하게 치우친 데이터를 시뮬레이션한 연구에서 나온 것으로, 정리가 아니라 합리적인 기본값입니다. 모양에 대한 가정 없이 이 페이지가 주는 것은 중심과 흩어짐입니다. 평균과 표준오차는 어떤 n에서도 정확합니다. 큰 표본이 필요한 것은 정규근사뿐이고, 그 위에 세워진 신뢰구간과 p값만 그 요구를 물려받습니다.
- 표본평균의 분산이 데이터의 분산보다 왜 이렇게 작나요?
- 평균을 내면 개별 관측값의 독립적인 오차가 상쇄되고, 그 상쇄가 표본 크기에 비례해서 진행되기 때문입니다. 반면 사람들이 보통 견주는 표준오차는 그 제곱근에 비례해 줄어듭니다. σ = 15, n = 36이면 분산은 225에서 6.25로, 36분의 1이 되지만 표준편차는 15에서 2.5로 6분의 1이 될 뿐입니다. 두 줄을 다 인쇄하는 이유가 이것입니다. 정리가 보통 진술되는 형태는 분산이고, 실제로 쓰이는 형태는 표준오차이며, 두 배율 사이의 간격이 제곱근입니다.
- 이것은 표준오차 계산기와 같은 건가요?
- 같은 양을 서로 다른 입력에서 계산하고, 어느 쪽이 필요한지는 무엇을 가지고 있느냐에 달려 있습니다. 이 페이지는 모집단 표준편차와 표본 크기, 즉 데이터를 모으기 전에 존재하는 값을 받습니다. 연구를 계획하거나 n이 정밀도를 어떻게 끌고 가는지 직관을 확인할 때 맞는 도구입니다. 표준오차 계산기는 표본 자체를 받아 그 표준편차를 계산합니다. 데이터가 손에 들어왔고 모집단 값을 모를 때 쓰는 쪽입니다. 둘의 차이는 정확히 가운데의 추정 단계 하나이고, 그 차이가 결과에 영향을 주는 자리는 신뢰구간 페이지입니다.
참고 문헌
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods — 자기 분포를 가진 양으로서의 표본 통계량이며, 이 페이지가 설명하는 대상 — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods — 표본이 커질수록 표본 분포가 다가가는 곡선이며, 그것을 읽는 표의 출처 — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e — 큰 수의 법칙, 즉 표본이 커지면서 표본평균이 모집단 평균 쪽으로 자리를 잡는 성질이며, 표본평균의 평균이 정확히 말하는 바 — OpenStax (Rice University)