표준오차 계산기
계산 결과
표준오차
- 표준편차
- 2.1381
- 평균
- 5.0000
- 개수
- 8
표준오차 계산기는 평균이든 비율이든, 자료가 있는 쪽의 표준오차를 구합니다. 평균 모드에서는 표본 자체, 즉 숫자 목록을 받아 표준편차와 개수, 그리고 표준편차를 √n으로 나눈 표준오차를 돌려줍니다. 비율 모드에서는 꺼낼 목록이 없습니다. 예/아니오 질문의 변동은 퍼센트만으로 따라 나오므로, 페이지가 표본 크기와 퍼센트를 받아 표준편차를 √(p(1 − p)) × 100으로 계산하고 같은 √n으로 나눕니다. 그래서 두 모드가 같은 경로로 같은 양에 도달하고, 네 줄이 끝값만이 아니라 사슬 전체를 보여 줍니다. 이 페이지가 말해 주지 못하는 것은 지금 보는 수가 안정적인지입니다. 그것은 표본 크기에 달려 있고, 1/√n 법칙을 펼쳐 놓은 곳은 표본 분포를 다루는 참고 페이지입니다.
공식
SE = s / √n s = √( Σ(xᵢ − x̄)² / (n − 1) ) s = √(p(1 − p)) × 100
- SE
- 표준오차이며 추정값의 표준편차이고 이 페이지의 주 결과입니다. 데이터가 아니라 추정값에 대한 질문에 답합니다. 표집을 반복하면 표본평균이 모집단 평균에서 보통 얼마나 떨어져 앉을지입니다. 신뢰구간을 만드는 재료이고 검정 통계량이 나누는 값이라서, 따로 계산해 둘 만합니다
- s
- 표본의 표준편차이며 n − 1 분모를 씁니다. 평균 모드에서 표준오차가 여기서 유도되고, 나눗셈을 확인할 수 있도록 자기 줄로 인쇄됩니다. n이 아니라 n − 1인 것이 이것을 모집단 흩어짐의 비편향 추정값으로 만듭니다. n을 쓰면 변동을 조금 적게 말하게 되고, 그 과소평가가 표본이 가장 작을 때 정확히 가장 큽니다
- n
- 표본이 담은 관측값의 개수이며, 개수라는 이름으로 역시 자기 줄로 인쇄됩니다. 제곱근 아래에 들어가므로 표준오차가 천천히 줄어듭니다. 데이터가 열 배가 되어도 표준오차는 세 배쯤 작아질 뿐입니다. 비율 모드에서는 목록에서 유도한 개수가 아니라 표본 크기 필드이고, 퍼센트는 목록을 데리고 다니지 않기 때문입니다
- x̄
- 표본평균이며, 표준편차의 산수에 눈에 보이는 중심을 주려고 인쇄됩니다. 표준오차 자체에는 아무 역할도 하지 않습니다. 표준오차는 흩어짐과 표본 크기의 성질이지 데이터가 어디 앉아 있는지의 성질이 아니고, 그래서 데이터셋을 어떤 상수만큼 옮겨도 표준오차는 그대로입니다
- p
- 표본비율이며 식에서는 소수로, 패널에서는 퍼센트로 적습니다. 비율 모드에서는 표준편차를 통째로 대신합니다. 예/아니오 질문의 변동은 퍼센트의 함수이고, 갈림이 고를 때 최대이며 퍼센트가 0이나 100에 다가가면 0으로 줄어듭니다. 곱하는 100은 결과를 다시 퍼센트포인트로 되돌려, 그것이 나온 퍼센트 옆에서 읽히게 합니다
데이터가 손에 있고 추정값의 표준오차를 원할 때 씁니다. 신뢰구간을 손으로 만들거나, 보고서의 수를 확인하거나, 어떤 결과의 너비 가운데 얼마가 데이터의 흩어짐에서 오고 얼마가 표본 크기에서 오는지 보고 싶을 때입니다. 표준편차와 개수를 함께 인쇄하면 그 역할 분담이 보입니다. 데이터를 바꾸면 표준편차 줄이 움직이고, 표본 크기만 바꾸면 표준편차는 그대로인 채 표준오차 줄이 움직입니다. 두 모드가 있는 이유는 가장 흔한 두 추정값이 서로 다른 입력을 필요로 하기 때문입니다. 평균은 표본이 필요합니다. 측정값이 얼마나 흩어질지 예측해 주는 것이 없기 때문입니다. 비율은 필요하지 않습니다. 흩어짐이 자기 값에서 따라 나오고, 그래서 설문이 표본 크기만으로 오차 범위를 인용할 수 있습니다. 어느 모드도 표본이 추정값을 대략 정규분포로 만들 만큼 큰지 점검하지 않습니다. 그것은 원래 분포가 얼마나 치우쳤는지에 달려 있고, 비율 모드에는 n·p와 n·(1 − p)에 대한 더 구체적인 경험법칙이 있지만 페이지는 그것을 강제하지 않습니다.
계산 예시
기본값: 표준편차가 약 2.14인 숫자 여덟 개
- 개수: 여덟 개. 평균: (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5
- 5에서 뺀 차의 제곱의 합이 32이므로 표본분산은 32 / 7 = 4.5714
- 표준편차: √4.5714 = 2.1381
- 표준오차: 2.1381 / √8 = 2.1381 / 2.8284 = 0.7559
숫자가 5를 사이에 두고 퍼져 있고 어느 것도 멀리 벗어나지 않아서 쓸 만한 기본값이 됩니다. 평균은 둥근 수인데 표준편차는 아니어서 마지막 두 줄을 서로 혼동할 수 없습니다. 패널을 위에서 아래로 읽는 것이 요점입니다. 2.1381은 데이터에 대한 사실이고 0.7559는 추정값에 대한 사실이며, 둘 사이에 있는 것은 √8로 나누는 일뿐입니다. 표본 크기와 퍼센트 칸은 이 모드에서 쓰이지 않은 채 남아 있습니다.
표준오차가 정확히 1이 되도록 고른 숫자 아홉 개
- 평균: (3 × 4 + (−3) × 4 + 0) / 9 = 0
- 차의 제곱: 9가 넷, 9가 넷, 0이 하나로 합이 72
- 표본분산: 72 / 8 = 9이므로 표준편차는 3
- 표준오차: 3 / √9 = 3 / 3 = 1
관측값 아홉 개는 n − 1 분모가 눈에 띄게 중요해질 만큼 작습니다. 8 대신 9로 나누면 분산이 8, 표준편차가 2.8284가 되고 표준오차는 1이 아니라 0.9428로 나옵니다. 그것이 보정이 하는 일입니다. 표본이 작으면 관측된 흩어짐이 모집단의 것을 조금 과소평가하고, 개수보다 하나 적은 수로 나누면 그것이 바로잡힙니다. n = 9에 s = 3인 짝은 신뢰구간 페이지가 쓰는 것과 같고, 그쪽 구간이 정확히 ±2.306이 되는 것은 자유도 8에서 t 값이 2.306이기 때문입니다.
비율에는 데이터 목록이 필요 없음
- 비율을 소수로: 60% = 0.6
- 퍼센트포인트 단위의 표준편차: √(0.6 × 0.4) × 100 = 0.4899 × 100 = 48.9898
- 표준오차: 48.9898 / √100 = 48.9898 / 10 = 4.899
- 데이터 목록은 완전히 무시됨 — 개수 줄이 표본 크기 필드를 대신 보고함
데이터 칸은 여전히 화면에 있고 여전히 목록을 담고 있지만, 답에서는 아무것도 쓰이지 않습니다. 이 모드에서 변동은 퍼센트에서 오고 표본 크기는 자기 칸에서 옵니다. 표준편차 줄이 48.99로 읽히는 이유가 그것이고, 이분형 질문에 어울리지 않아 보이는 수입니다. 0과 100으로 부호화한 예/아니오 변수의 표준편차이고, 여기서의 유일한 목적은 √n으로 나뉘는 것입니다. 같은 구조가 표본 크기 페이지에도 나오는데, 거기서는 퍼센트를 알기 전에 연구를 계획하려고 최악의 경우인 p = 0.5를 씁니다.
n − 1 분모가 가장 크게 일하는 관측값 두 개
- 평균: 5
- 차의 제곱: 25와 25로 합이 50
- 표본분산: 50 / 1 = 50이므로 표준편차는 √50 = 7.0711
- 표준오차: 7.0711 / √2 = 7.0711 / 1.4142 = 5
관측값이 둘이면 표준편차가 그냥 두 값 사이 거리의 절반입니다. n − 1 분모가 자유도를 하나만 남기고, 식이 계산할 것이 아니라 눈으로 보이는 것으로 줄어듭니다. 표준오차는 그 표준편차를 √2로 나눈 값이고 여기서는 5입니다. 평균 모드에서 페이지가 받아들이는 가장 작은 표본이고, 숫자 둘에서 나온 추정값이 정말 얼마나 넓은지 한 번 확인해 볼 만합니다. 표준오차가 데이터 범위의 절반으로 나옵니다.
한계
페이지는 추정값의 표준오차를 보고하고, 그것을 구간이나 검정으로 바꾸기 전에 멈춥니다. 그 경계는 의도한 것입니다. 구간은 임계값이 필요하고, 그 임계값은 신뢰수준과 흩어짐을 표본에서 추정해야 했는지에 달려 있습니다. 검정은 견줄 두 번째 통계량이 필요합니다. 둘 다 이웃 페이지에 있고, 여기의 산수는 둘 중 어느 것도 대신하지 않고 둘 모두의 입력입니다. 평균 모드는 관측값이 독립이라고 가정하는데, 같은 대상에 대한 반복 측정, 짝지은 쌍, 학교 안의 학생처럼 군집을 이룬 자료에서 이것이 깨집니다. 세 경우 모두 유효 표본 크기가 개수보다 작아서 표준오차가 너무 작게 나옵니다. 입력한 목록이 넣으려던 관측값을 모두 담고 있다고도 가정합니다. 표준오차는 입력된 것에서 계산되고, 실수로 이상값 하나를 빠뜨리면 좁아집니다. 비율 모드에는 별도의 주의가 따릅니다. 그 식은 큰 표본 근사라서 성공이나 실패의 도수가 작을 때 나쁘게 작동하므로, 작은 표본에서 0이나 100에 가까운 퍼센트는 이 표준오차보다 정확한 구간으로 다루는 편이 낫습니다. 어느 모드도 추정값이 편향되었는지 판단하지 않고, 어떤 표준오차도 그것을 탐지할 수 없습니다.
자주 묻는 질문
- 표준편차와 표준오차는 무엇이 다른가요?
- 표준편차는 개별 값이 자기 평균에서 얼마나 떨어져 있는지를 서술하고, 표준오차는 표본평균이 모집단 평균에서 얼마나 떨어져 있는지를 서술합니다. 뒤엣것은 앞엣것을 √n으로 나눈 값이고 그 나눗셈이 관계의 전부라서, 둘을 함께 인쇄합니다. 표준편차는 데이터의 성질이고 더 모아도 변하지 않으며, 표준오차는 표본이 커질수록 계속 줄어듭니다. 패널에서 쓸 만한 확인법이 하나 있습니다. 숫자를 고치면 두 줄이 다 움직이고, 개수만 바꾸면 표준편차는 있던 자리에 그대로 있고 표준오차만 내려갑니다.
- n 대신 n − 1로 나누는 이유는 무엇인가요?
- 흩어짐을 잴 때 중심으로 표본 자신의 평균을 쓰는데, 그 평균이 참 모집단 평균보다 데이터에 더 가까이 앉기 때문에, 순진하게 평균 낸 제곱 편차가 체계적으로 조금 작기 때문입니다. 개수보다 하나 적은 수로 나누면 그것이 바로잡힙니다. 효과는 작은 표본에서 가장 큽니다. 관측값이 둘이면 분산이 두 배가 되고, 백 개쯤 되면 1% 조정입니다. n으로 나누는 것이 가지고 있는 표본을 서술하는 데는 틀리지 않았습니다. 그 표본이 나온 모집단의 흩어짐을 추정하는 데 틀렸고, 표준오차가 하려는 일이 그것입니다.
- 자료 없이 비율의 표준오차를 어떻게 구하나요?
- 비율이 자기 변동을 스스로 공급하므로 목록이 필요 없습니다. 표본 크기와 퍼센트만 있으면 됩니다. 두 결과를 0과 100으로 부호화하면 표준편차가 √(p(1 − p)) × 100으로 나오고, 이 값은 갈림이 고를 때 가장 크며 퍼센트가 양 끝에 다가가면 0으로 줄어듭니다. 100명 중 60%면 √(0.6 × 0.4) × 100 = 48.9898이고, √100으로 나누면 표준오차가 4.899 퍼센트포인트입니다. 오차 범위 페이지가 쓰는 것과 같은 입력 짝이고, 거기서는 표준오차에 임계값을 곱해 플러스마이너스를 만듭니다.
- 데이터를 더 넣으면 표준오차가 작아지나요?
- 그렇지만 표본 크기의 제곱근에 비례해서만 작아집니다. 관측값 100개에서 400개로 가면 표준오차가 절반이 되고, 한 번 더 절반으로 만들려면 1,600개가 듭니다. 표본 크기를 정할 때 지켜봐야 할 수가 표준오차인 이유이고, 아주 큰 표본이 그저 큰 표본보다 얼마나 나은지 쉽게 과대평가하는 이유이기도 합니다. 반면 표준편차 줄은 대략 있던 자리에 머뭅니다. 데이터가 많아진다고 모집단 자체가 덜 변동적이 되는 것이 아니라, 그 중심에 대한 추정이 더 정밀해질 뿐입니다.
- 표준오차가 0이면 무슨 뜻인가요?
- 표본의 모든 관측값이 같았거나, 비율이 0%나 100%였다는 뜻입니다. 두 경우 모두 식이 다룰 변동을 찾지 못하고 0을 돌려줍니다. 문자 그대로 읽으면 표준오차 0은 추정값이 정확하다고 말하는 것인데, 그것은 데이터가 지탱할 수 없는 주장입니다. 똑같은 값 네 개짜리 표본은 흩어짐이 작다는 증거이지 0이라는 증명이 아닙니다. 페이지는 오류 대신 0을 돌려주는데, 산수가 맞고 이유가 다른 줄에 보이기 때문입니다. 다만 정확히 0인 표준오차는 표본이 너무 작거나 너무 균일해서 변동에 대해 아무 말도 할 수 없다는 신호로 다루세요.
- 중심극한정리 계산기와 같은 건가요?
- 서로 다른 입력에서 같은 양을 계산하고, 어느 쪽이 필요한지는 무엇을 가지고 있느냐에 달려 있습니다. 이 페이지는 표본, 즉 숫자 목록이나 퍼센트와 크기를 받고, 데이터가 손에 들어온 뒤에 쓰는 쪽입니다. 중심극한정리 페이지는 모집단 표준편차와 표본 크기, 즉 아무것도 모으기 전에 존재하는 값을 받고, 연구를 계획하거나 표준오차가 n에 어떻게 반응하는지 알아볼 때 쓰는 쪽입니다. 둘은 가운데의 추정 단계 하나만큼 다르고, 표본표준편차가 우연히 모집단 값과 같을 때마다 두 결과가 일치하는 이유가 그것입니다.
참고 문헌
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods — 표본표준편차와, 표준오차를 만드는 n − 1 분모 — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods — 통계량의 표본 분포이며, 그 흩어짐을 재는 것이 표준오차 — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods — 흩어짐과 나란히 인쇄되는 표본평균과, 둘을 함께 보고하는 이유 — National Institute of Standards and Technology (NIST)