본문으로 건너뛰기
CalcMax

분산 계산기

계산 결과

4.5714

분산

표준편차
2.1381
편차 제곱합
32.0000
평균
5.0000
개수
8

분산은 평균에서 떨어진 거리를 제곱해 평균 낸 값이라, 표준편차와 같은 질문에 제곱 단위로 답합니다. 숫자를 한 줄에 하나씩 넣거나 세미콜론, 쉼표, 공백으로 구분해 붙여 넣으면 개수와 합계, 평균, 편차 제곱합을 인쇄한 뒤 그 합을 표본이면 n − 1로, 모집단이면 n으로 나눕니다. 원래 단위를 되찾은 표준편차가 옆에 함께 표시되며, 두 값의 차이는 제곱근 하나뿐입니다.

공식

분산 = Σ(xᵢ − x̄)² ÷ (n − 1) (표본). 모집단은 같은 합을 n으로 나눕니다

xᵢ
데이터에 들어 있는 값 하나하나입니다. 평균에서 떨어진 거리의 형태로 들어가고, 그 거리는 더하기 전에 먼저 제곱됩니다
x̄
데이터의 평균, 즉 모든 값을 더해 개수로 나눈 값입니다. 결과 옆에 인쇄되므로 셈을 되짚어 볼 수 있습니다
n
데이터에 들어 있는 값의 개수이며 여기서는 최대 200개까지 받습니다. 제수는 표본이면 n − 1, 모집단이면 n이고, 두 분산의 차이는 그것뿐입니다
Σ(xᵢ − x̄)²
편차 제곱합입니다. 평균에서 떨어진 거리를 하나씩 제곱해 더한 값입니다. 제곱하는 순간 평균에서 멀리 있는 값의 무게가 커집니다. 10만큼 떨어진 값은 이 합에 100을 보태고, 2만큼 떨어진 값은 4를 보탭니다
σ²
분산 자체입니다. 단위가 제곱이라 더하기에는 맞는 양이고 그대로 읽기에는 틀린 양입니다

제곱된 양이 정말로 필요할 때 분산을 씁니다. 독립인 원인들의 분산은 서로 더해지므로 전체의 분산은 각 부분의 분산을 더한 값이 되지만, 표준편차는 그렇게 더해지지 않습니다. 분산 분석(ANOVA)과 회귀를 비롯해 그 위에 세워진 대부분의 도구가 입력으로 받는 것도 표준편차가 아니라 분산입니다. 반대로 사람이 읽어야 하는 자리에서는 표준편차를 쓰세요. 4.5714점의 제곱은 아무 뜻도 없지만 2.1381점은 점수들과 바로 견줄 수 있습니다. 패널이 둘 다 보여 주므로 고르는 일은 어느 쪽을 인용하느냐의 문제입니다. 다만 분산은 극단값 하나에 표준편차보다 훨씬 민감합니다. 그 값의 거리가 세어지기 전에 제곱되기 때문입니다.

계산 예시

  1. 여덟 개의 값, 표본 분산

    1. 합계: 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40, 값이 8개이므로 평균은 5
    2. 편차: −3, −1, −1, −1, 0, 0, 2, 4
    3. 편차의 제곱: 9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32
    4. 표본 분산: 32 ÷ (8 − 1) = 4.5714
    5. 비교용 표준편차: √4.5714 = 2.1381

    분산이 4.5714이고 표준편차가 2.1381인 것은 우연이 아닙니다. 한쪽이 다른 쪽의 제곱입니다. 답을 믿기 전에 가운데 두 단계를 먼저 읽어 보세요. 편차 제곱합은 이 계산에서 눈으로 가늠하기 어려운 유일한 수이고, 패널이 그것을 인쇄하는 이유가 바로 그것을 믿으라고 요구하지 않기 위해서입니다.

  2. 같은 여덟 값을 모집단으로

    1. 편차 제곱합은 그대로 32
    2. 모집단 분산: 32 ÷ 8 = 4
    3. 모집단 표준편차: √4 = 2

    한 데이터에서 분산이 4.5714와 4로 갈리는데, 제수만 다릅니다. 자기 숫자로 한 번은 직접 바꿔 보세요. 스프레드시트와 이 페이지가 어긋난다면 원인은 거의 항상 제수입니다. 분산은 제곱근으로 줄어들지 않았기 때문에 그 선택에 더 민감한 쪽입니다.

  3. 값이 모두 같은 네 번의 측정, 흩어짐이 정확히 0

    1. 값이 모두 3이므로 평균은 3이고 편차는 모두 0
    2. 편차 제곱합: 0
    3. 모집단 분산: 0 ÷ 4 = 0
    4. 모집단 표준편차: √0 = 0

    분산이 0이라는 것은 값들이 흩어짐을 전혀 갖지 않는다는 뜻이고, 0이 실패가 아니라 진짜 답이 되는 유일한 자리입니다. 변동계수가 조건으로 삼는 것이 0이 아닌 분산이 아니라 양의 평균인 이유도 여기 있습니다. 흩어짐이 0인 것을 양의 평균으로 나누면 0%라는 멀쩡한 답이 나옵니다.

한계

이 페이지는 숫자 목록의 평범한 비가중 분산입니다. 값 하나는 한 번만 세어지므로 도수분포표나 가중 표본은 다른 계산이 필요합니다. 단위가 제곱이라 그램은 제곱 그램이 되고, 그래서 이 수는 그것이 나온 데이터와 견줄 수 없습니다. 그 자리를 옆에 표시되는 표준편차가 메웁니다. 편차마다 제곱이 붙으므로 값 하나가 지배할 수 있습니다. 열 배로 잘못 적은 값 하나는 평소보다 두 배 멀리 떨어진 값보다 백 배를 보탭니다. 한쪽으로 치우친 데이터는 분산이나 표준편차보다 사분위수로 설명하는 편이 낫습니다. 목록은 200개까지이며, 1,500 같은 표기는 추측하지 않고 거부합니다. 자릿수 사이의 쉼표가 여러 나라에서 소수 쉼표이기 때문입니다. 1500 이나 1.5 로 쓰세요.

자주 묻는 질문

분산은 어떻게 계산하나요?
네 단계입니다. 값을 모두 더해 개수로 나누어 평균을 구합니다. 각 값에서 평균을 뺍니다. 그 차이를 하나씩 제곱해 모두 더합니다. 그 합이 편차 제곱합입니다. 표본이면 n − 1로, 모집단이면 n으로 나눕니다. 2, 4, 4, 4, 5, 5, 7, 9 에서 편차 제곱합은 32이므로 표본 분산은 32 ÷ 7 = 4.5714, 모집단 분산은 32 ÷ 8 = 4입니다.
분산과 표준편차는 무엇이 다른가요?
제곱근 하나입니다. 표준편차는 분산의 제곱근이고, 그래서 둘은 서로의 제곱입니다. 여기서 분산은 4.5714, 표준편차는 2.1381입니다. 더하기에 맞는 쪽은 분산입니다. 독립인 원인들의 분산은 서로 더해지지만 표준편차는 그렇지 않습니다. 읽기에 맞는 쪽은 표준편차입니다. 제곱 단위가 아니라 데이터의 단위로 돌아오기 때문입니다.
모든 값에 같은 수를 더해도 분산이 그대로인 이유는 무엇인가요?
분산은 평균에서의 거리만 보는데, 모든 값을 같은 만큼 옮기면 평균도 똑같이 옮겨 가기 때문입니다. 2, 4, 4, 4, 5, 5, 7, 9 에 100을 더하면 평균은 5에서 105로 올라가지만 편차는 하나도 변하지 않으므로 편차 제곱합은 여전히 32입니다. 모든 값에 상수를 곱하는 것은 반대 경우입니다. 분산은 그 상수의 제곱만큼, 표준편차는 상수만큼 커집니다.
분산이 음수가 될 수 있나요?
아닙니다. 편차 제곱합의 모든 항이 제곱이므로 합은 음수가 될 수 없고, 제수도 양의 개수입니다. 분산의 최솟값은 0이고, 그것은 모든 값이 같을 때만 일어납니다. 3을 네 번 재면 분산은 0입니다. 화면에 음수 분산이 보인다면 데이터가 특이한 것이 아니라 계산이 어긋난 것입니다.
스프레드시트의 열을 그대로 붙여 넣어도 되나요?
됩니다. 줄바꿈과 탭, 세미콜론, 공백, 그리고 쉼표 뒤에 온 공백이 모두 값을 갈라 주므로 붙여 넣은 열이 그대로 작동하고, 빈 조각은 거부하지 않고 건너뜁니다. 값은 최대 200개까지 읽습니다. 다만 1,500 이나 1.500 처럼 구분 기호 뒤에 숫자가 세 자리 붙은 모양은 일부러 거부합니다. 어떤 나라에서는 천 단위 구분 기호이고 다른 나라에서는 소수점이기 때문입니다. 대신 1500 이나 1.5 로 쓰세요.

참고 문헌

관련 계산기