중앙값 계산기
계산 결과
중앙값
- 가운데 두 값 중 작은 값
- 4.0000
- 가운데 두 값 중 큰 값
- 5.0000
- 개수
- 8
중앙값은 목록을 정렬했을 때 한가운데에 놓이는 값입니다. 그 아래에 숫자의 절반이, 위에 절반이 놓입니다. 데이터 세트를 요약하는 값 가운데 극단적인 측정값 하나로는 움직이지 않는 유일한 값이기도 합니다. 가장 큰 값을 열 배로 키워도 중앙값은 있던 자리에 그대로 있습니다. 숫자를 붙여 넣으세요. 한 줄에 하나씩 넣거나 세미콜론, 공백, 또는 뒤에 공백이 오는 쉼표로 구분하면 됩니다. 이 중앙값 계산기는 목록을 정렬해 가운데 값을 돌려주고, 개수가 짝수일 때는 평균을 낸 가운데 두 값도 함께 보여 줍니다. 여기서는 n − 1 로도 n 으로도 나누지 않으므로 표본이나 모집단을 고르는 스위치가 없습니다.
공식
중앙값 = 정렬한 목록의 가운데 값; 개수가 짝수면 가운데 두 값의 평균
- xᵢ
- 데이터 세트에 있는 값 하나입니다. 정렬한 목록에서의 위치만 중요하고, 다른 값에서 얼마나 떨어져 있는지는 계산에 들어가지 않습니다. 극단적인 측정값 하나가 답을 건드리지 못하는 이유가 바로 이것입니다
- n
- 목록에 담긴 값의 개수이며 여기서는 200개까지입니다. 홀수면 가운데 값이 하나이고, 짝수면 둘이며 그 평균이 중앙값입니다
- Y₍ₖ₎
- 목록을 작은 것부터 큰 것까지 정렬한 뒤의 k번째 값입니다. NIST는 짝수인 경우를 (Y(N/2) + Y(N/2+1)) / 2로 적는데, 이것이 이 페이지가 답 아래에 인쇄하는 그 두 관측값입니다
- Y₍ₙ/₂₎ and Y₍ₙ/₂₊₁₎
- 가운데 두 값입니다. 나눗셈을 눈으로 검산할 수 있도록 인쇄되며, 개수가 홀수일 때는 같은 수가 두 번 나옵니다. 가운데에 값이 정말 하나뿐이기 때문입니다
- M
- 중앙값입니다. 데이터의 원래 단위를 그대로 가지고, 모든 값에 같은 상수를 더하면 그 상수만큼만 옮겨집니다
측정값 하나가 크게 어긋날 수 있는데도 대표값이 필요할 때는 중앙값을 찾으세요. 집값, 소득, 대기 시간처럼 한쪽으로 긴 꼬리가 있는 데이터가 그렇습니다. 크기가 아니라 위치를 세므로 목록에서 가장 큰 수가 아무리 커도 중앙값은 꿈쩍하지 않고, 그 강인함이 평균 옆에 중앙값이 따로 존재하는 이유 전부입니다. 순서가 있는 라벨, 예를 들어 평점 척도나 사이즈 등급에서도 자연스러운 중심입니다. 이웃한 두 범주의 간격에 뜻이 없어 평균을 낼 수 없기 때문입니다. 중앙값이 알려 주지 않는 것도 두 가지 있습니다. 퍼짐에 대해서는 아무 말도 하지 않고, 가운데에서 떨어진 값들에 대해서도 아무 말도 하지 않습니다. 데이터의 모양이 중요할 때는 사분위수와 함께 보세요. 대칭인 데이터 세트에서는 중앙값과 평균이 거의 겹치므로, 둘 사이에 눈에 띄는 틈이 있다는 것 자체가 치우침에 대한 하나의 읽기입니다.
계산 예시
짝수 개: 가운데 두 값이 4와 5
- 정렬: 2, 4, 4, 4, 5, 5, 7, 9
- 개수: 값이 8개이므로 가운데 하나가 없고, 가운데 짝은 네 번째와 다섯 번째입니다
- 네 번째 값은 4이고 다섯 번째 값은 5입니다
- 중앙값: (4 + 5) ÷ 2 = 4.5
4.5는 목록에 있는 수가 아니고, 짝수 개에서는 그것이 정상입니다. 패널이 옆에 4와 5를 인쇄하는 이유가 바로 이것입니다. 그것들이 없으면 이 도구가 맞는 짝을 평균 냈는지, 아니면 조용히 둘 중 하나를 골랐는지 알 방법이 없습니다.
홀수 개, 값 하나가 나머지에서 멀리 떨어져 있음
- 정렬: 3, 7, 9, 12, 40
- 개수: 값이 5개이므로 가운데는 세 번째입니다
- 중앙값: 9 — 가운데 값이 하나뿐이므로 나눗셈이 없습니다
이 다섯 수의 평균은 14.2이고 40이 끌어올린 값입니다. 중앙값은 9이고 그런 것에 관심이 없습니다. 40을 4000으로 바꾸면 평균은 806.2가 되지만 중앙값은 여전히 9입니다. 치우친 데이터에 중앙값을 보고해야 하는 이유가 이 한 줄에 다 있고, 계산 비용은 들지 않습니다.
값이 넷, 가운데가 값이 아닌 경우
- 정렬: 1, 2, 3, 4
- 가운데 짝은 두 번째와 세 번째 값인 2와 3입니다
- 중앙값: (2 + 3) ÷ 2 = 2.5
이 경우에 다른 관례가 둘 더 있습니다. 짝에서 아래쪽(2)을 잡거나 위쪽(3)을 잡는 것입니다. 교과서에는 세 가지가 모두 나옵니다. 이 페이지는 NIST와 GB/T 어휘 표준이 그렇게 하듯 평균을 냅니다. 사분위수와 백분위수 페이지가 따르는 규칙도 같아서, 여기서 2.5는 그쪽에서 제2사분위수이기도 합니다.
한계
중앙값은 위치 하나이므로 데이터에 대한 나머지 거의 전부를 버립니다. 두 목록이 중앙값을 공유하면서도 전혀 닮지 않을 수 있습니다. 하나는 그 주위에 빽빽하게 모여 있고 다른 하나는 양 끝으로 퍼져 있을 수 있습니다. 그래서 중앙값은 보통 혼자보다 사분위수와 함께 보고됩니다. 정렬이 필요하므로 답이 나오기 전에 모든 값을 읽어야 합니다. 값 자체에 대해서도 아무 말도 하지 않습니다. 중앙값이 9라는 것은 9쯤 되는 수가 가운데에 있다는 뜻이지, 9가 어딘가에 나온다는 뜻이 아닙니다. 사이즈나 평점 같은 순서형 라벨에서도 셈은 되지만, 답은 더할 수 있는 수가 아니라 가운데 라벨입니다. 목록은 200개까지입니다. 구분 기호 뒤에 숫자 세 자리가 이어지는 형태의 토큰은 추측하지 않고 거부합니다. 숫자 사이의 쉼표는 세계 여러 곳에서 소수점을 뜻하기 때문입니다. 쉼표를 빼고 쓰거나 소수로 다시 쓰세요. 구분 기호 규칙은 어느 언어에서나 같습니다. 숫자는 적힌 그대로 읽힙니다.
자주 묻는 질문
- 숫자 목록의 중앙값 구하기는 어떻게 하나요?
- 숫자를 작은 것부터 큰 것까지 정렬하고 개수를 세면 됩니다. 홀수면 가운데 값이 하나이고, 일곱 개라면 네 번째입니다. 짝수면 둘이고 그 평균이 중앙값입니다. 1, 2, 3, 4는 가운데 짝이 2와 3이므로 중앙값이 2.5입니다. 방법은 이것이 전부입니다. 위 패널이 개수와 가운데 두 값, 답을 인쇄하므로 다시 정렬하지 않고도 각 단계를 확인할 수 있습니다.
- 중앙값이 목록에 없는 수일 때가 있는 이유는 무엇인가요?
- 개수가 짝수면 가운데 값이 하나가 아니므로, 가운데를 사이에 둔 두 값의 평균이 중앙값이 되기 때문입니다. 위의 4.5는 여덟 수 가운데 하나가 아니지만 정답입니다. 값의 절반이 그 아래에, 절반이 위에 있습니다. 가운데 두 값을 결과 옆에 인쇄하는 것은 이것이 실수처럼 보이지 않게 하기 위해서입니다.
- 평균 대신 중앙값을 언제 써야 하나요?
- 극단적인 측정값 하나가 그림을 왜곡할 수 있을 때입니다. 소득, 집값, 대기 시간처럼 한쪽으로 긴 꼬리가 있는 데이터가 그렇습니다. 평균은 모든 값을 더하므로 나머지에서 멀리 떨어진 수 하나가 그것을 끌어당깁니다. 중앙값은 양쪽에 값이 몇 개 있는지만 세므로 같은 수가 아무것도 바꾸지 못합니다. 대칭인 집합에서는 두 답이 거의 겹치므로, 둘 사이의 틈 자체가 데이터가 치우쳤다는 단서입니다.
- 스프레드시트에서 열을 그대로 붙여 넣어도 되나요?
- 됩니다. 줄바꿈, 탭, 세미콜론, 공백, 그리고 뒤에 공백이 오는 쉼표가 모두 값을 구분하므로 붙여 넣은 열도 세미콜론으로 친 줄도 그대로 동작합니다. 빈 구간은 거부되지 않고 건너뜁니다. 값은 200개까지 읽습니다. 한 가지 형태는 일부러 거부합니다. 구분 기호 뒤에 숫자 세 자리가 이어지는 토큰인데, 어떤 나라에서는 천 단위 구분 기호이고 다른 나라에서는 소수점이기 때문입니다. 쉼표를 빼고 쓰거나 소수로 다시 쓰세요.
- 중앙값에도 표본 버전과 모집단 버전이 있나요?
- 없고, 이 페이지에는 그 스위치도 없습니다. n − 1 보정은 제곱 편차의 합을 개수로 나누는 퍼짐 측도의 것이고, 중앙값은 아무것도 나누지 않고 위치를 잡습니다. 목록이 표본이든 집단 전체이든 가운데 값은 가운데 값입니다. 그 선택이 필요한 페이지는 표준편차와 분산이고, 그쪽에서는 제수가 실제로 답을 바꿉니다.
- 같은 목록인데 다른 도구에서 중앙값이 다르게 나오는 이유는 무엇인가요?
- 거의 항상 짝수일 때의 규칙 때문입니다. 세 가지 관례가 돌아다닙니다. 가운데 두 값의 평균을 내거나, 아래쪽을 잡거나, 위쪽을 잡는 것입니다. 1, 2, 3, 4에서 그것들은 각각 2.5와 2와 3이 됩니다. 이 페이지는 NIST의 정의와 GB/T 어휘 표준을 따라 평균을 내고, 어느 짝을 썼는지 볼 수 있도록 가운데 두 값을 인쇄합니다. 두 번째로 드문 원인은 다른 도구가 구분 기호로 읽은 소수 쉼표입니다.
참고 문헌
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1 — 중앙값을 위치 측도로 정의하고, 짝수일 때 (Y(N/2) + Y(N/2+1)) / 2 로 적는 절 — National Institute of Standards and Technology (NIST)
- Measures of the Center of the Data — Introductory Statistics 2e, section 2.5 — 평균과 중앙값, 최빈값을 정의하고 어느 것을 언제 쓰는지 다루는 절 — OpenStax, Rice University
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1 — 중국 국가 통계 어휘 표준이며 중앙값과 다른 위치 측도를 포함한다(기록 페이지에 온라인 전문을 제공하지 않는다고 적혀 있어, 공식이 아니라 용어를 위해 인용한다) — State Administration for Market Regulation, China