사분위수 계산기
계산 결과
사분위 범위(IQR)
- 제1사분위수(Q1)
- 4.0000
- 제2사분위수(Q2)
- 4.5000
- 제3사분위수(Q3)
- 5.5000
- 최솟값
- 2.0000
- 최댓값
- 9.0000
- 개수
- 8
사분위수는 정렬된 목록을 네 토막으로 자릅니다. 데이터의 4분의 1이 Q1 이하에, 절반이 Q2 이하에, 4분의 3이 Q3 이하에 놓입니다. 여기에 최솟값과 최댓값을 더하면 다섯 수 요약이 되는데, 이는 숫자를 하나도 더하지 않고도 데이터의 위치와 흩어짐을 설명하는 방법입니다. 이 사분위수 계산기는 그 다섯 수를 모두 인쇄하고, 결과 맨 위에는 사분위 범위, 즉 Q3에서 Q1을 뺀 값이자 데이터 가운데 절반의 폭을 놓습니다. 분포의 가운데가 팽팽한지 늘어났는지를 알려 주는 것이 바로 그 한 수이기 때문입니다. 중앙값인 Q2도 나란히 보여 주므로 두 페이지는 우연이 아니라 구조적으로 같은 답을 냅니다.
공식
Q1 = 위치 (n − 1) × 0.25의 값, Q2 = (n − 1) × 0.5, Q3 = (n − 1) × 0.75 (이웃 값 사이를 보간). IQR = Q3 − Q1
- xᵢ
- 데이터에 들어 있는 값 하나입니다. 사분위수는 정렬된 목록에서의 위치이므로 값의 크기가 아니라 순서가 중요합니다. 극단값 하나가 바깥쪽 표시를 조금 밀어낼 뿐 가운데 절반은 거의 건드리지 않습니다
- n
- 목록에 들어 있는 값의 개수이며 여기서는 최대 200개까지 받습니다. 위치는 0부터 세고 마지막이 n − 1이므로, 세 사분위수 위치가 그 범위에 흩어져 있습니다
- Q1
- 제1사분위수이고 데이터의 약 25%가 그 값 이하에 놓입니다. 정렬된 목록에서 아래쪽 4분의 1이 끝나는 자리를 표시하며, 반드시 데이터에 나오는 값일 필요는 없습니다
- Q2
- 제2사분위수이고 정확히 중앙값입니다. 데이터의 절반이 그 값 이하에 놓입니다. 비교용으로 여기에 인쇄되며, 중앙값 전용 페이지도 같은 규칙으로 같은 수를 계산합니다
- Q3
- 제3사분위수이고 데이터의 약 75%가 그 값 이하에 놓입니다. Q1과 함께 데이터 가운데 절반을 감싸며, 상자 그림이 상자로 그리는 부분이 바로 그곳입니다
- IQR
- 사분위 범위, 즉 Q3 − Q1입니다. 가운데 절반이 흩어진 폭이고 데이터의 단위를 가지며, 바깥쪽 4분의 1을 통째로 무시하기 때문에 표준편차와 달리 이상치에 거의 흔들리지 않습니다
데이터가 한쪽으로 치우쳤거나 이상치가 있거나, 더하기가 의미를 갖지 않는 척도로 재어졌을 때 사분위수가 맞는 요약입니다. 소득, 집값, 응답 시간, 시험 성적이 그렇습니다. 평균과 표준편차가 좌우 대칭인 종 모양을 설명한다면, 다섯 수 요약은 모양에 상관없이 분포를 설명합니다. 중앙값은 중심이 어디인지 말하고, Q1과 Q3는 가운데 절반이 얼마나 늘어났는지 말하며, 최솟값과 최댓값은 전체가 어디까지인지 묶어 줍니다. 사분위 범위가 중앙값의 짝으로 쓰이는 이유는 표준편차가 평균의 짝으로 쓰이는 이유와 같습니다. 값 하나가 부풀리지 못하는 흩어짐을 인용하고 싶을 때 사람들이 꺼내 드는 수가 이것입니다. 상자 그림의 바탕이고, 이상치 후보를 표시하는 1.5 × IQR 규칙의 바탕이기도 합니다. 다만 여기서는 그 울타리까지 그리고, 표시하는 일은 다른 도구의 몫입니다. 가능하면 히스토그램과 나란히 보세요. 자르는 점 네 개로는 데이터에 봉우리가 둘인지 알 수 없고, 봉우리가 둘인 데이터도 다섯 수 요약은 지극히 평범하게 내놓습니다.
계산 예시
여덟 개의 값: Q1 = 4, Q3 = 5.5, IQR = 1.5
- 정렬: 2, 4, 4, 4, 5, 5, 7, 9 — 값이 8개이므로 n − 1 = 7
- Q1: 위치 7 × 0.25 = 1.75, 1번 자리의 4와 2번 자리의 4 사이이므로 Q1 = 4
- Q2: 위치 7 × 0.50 = 3.5, 4와 5 사이이므로 Q2 = 4.5 — 중앙값 페이지가 보고하는 그 중앙값
- Q3: 위치 7 × 0.75 = 5.25, 5번 자리의 5와 6번 자리의 7 사이: 5 + 0.25 × 2 = 5.5
- IQR: 5.5 − 4 = 1.5, 즉 데이터 가운데 절반은 폭 1.5에 걸쳐 있습니다
여기서 가운데 절반은 4부터 5.5까지의 네 값이고, IQR은 그 띠가 얼마나 넓은지입니다. Q1은 데이터 점 위에 정확히 떨어졌는데 Q3는 그렇지 않았다는 점을 눈여겨보세요. 어느 사분위수가 관측값과 겹치는지는 전적으로 개수가 정하고, 다섯 수 요약은 데이터의 부분집합이 아니라 위치에 대한 설명입니다.
값이 넷뿐이라 모든 사분위수가 보간되는 경우
- 정렬: 1, 2, 3, 4 — 값이 4개이므로 n − 1 = 3
- Q1: 위치 3 × 0.25 = 0.75, 1에서 2 쪽으로 4분의 3이므로 Q1 = 1.75
- Q2: 위치 3 × 0.50 = 1.5, 2와 3의 한가운데이므로 Q2 = 2.5
- Q3: 위치 3 × 0.75 = 2.25, 3에서 4 쪽으로 4분의 1이므로 Q3 = 3.25
- IQR: 3.25 − 1.75 = 1.5
약속이 갈리는 자리이므로 다른 방식이 무엇을 내놓는지 알아 둘 만합니다. OpenStax와 많은 교재가 쓰는 방법은 중앙값에서 데이터를 반으로 가르고 각 반의 가운데를 잡습니다. 아래쪽 반이 1과 2이므로 Q1 = 1.5, 위쪽 반이 3과 4이므로 Q3 = 3.5가 되고 IQR은 2가 됩니다. 이 페이지는 대신 이웃 값 사이를 보간하며, 이는 R과 NumPy의 기본값입니다. Q1과 Q3를 함께 인쇄하는 이유는 어느 약속이 그 값들을 만들었는지 볼 수 있게 하기 위해서입니다.
그 교재의 14개 값, 다른 방식으로 계산하면
- 정렬: 1, 1, 2, 2, 4, 6, 6.8, 7.2, 8, 8.3, 9, 10, 10, 11.5 — 값이 14개이므로 n − 1 = 13
- Q2: 위치 13 × 0.50 = 6.5, 6.8과 7.2의 한가운데이므로 Q2 = 7 — 교재가 보고하는 그 중앙값
- Q1: 위치 13 × 0.25 = 3.25, 3번 자리의 2에서 4번 자리의 4 쪽으로 4분의 1이므로 Q1 = 2.5
- Q3: 위치 13 × 0.75 = 9.75, 8.3에서 9 쪽으로 4분의 3이므로 Q3 = 8.825
- IQR: 8.825 − 2.5 = 6.325
같은 열네 수가 OpenStax의 위치 측도 절에 나오는데, 그쪽은 반으로 가르는 방법을 써서 Q1 = 2, Q3 = 9, IQR = 7을 보고합니다. 두 답 모두 문서화된, 가르칠 수 있는 규칙에서 나왔습니다. 같은 관측값 사이를 다르게 보간하기 때문에 갈리는 것입니다. 중앙값은 정확히 일치하는데, 이 부분이 마음을 놓이게 합니다. 어떤 약속을 쓰든 데이터의 한가운데는 데이터의 한가운데입니다.
한계
자르는 점 네 개만으로는 분포를 설명할 수 없습니다. 두 데이터가 모든 사분위수를 공유하면서도 전혀 다르게 생길 수 있습니다. 한쪽은 빽빽하고 다른 쪽은 봉우리가 둘일 수 있으므로, 모양이 중요할 때는 다섯 수 요약을 히스토그램 옆에 놓고 읽으세요. 사분위수는 사실이 아니라 약속이기도 합니다. 이 페이지는 Hyndman–Fan type 7을 따라 이웃 값 사이를 보간하고, 많은 교재가 쓰는 반으로 가르는 방법은 개수가 4의 배수가 아닐 때마다 다른 수를 내놓습니다. 개수는 또 다른 방식으로도 중요합니다. 값이 넷보다 적으면 모든 사분위수가 보간이고, 값이 하나면 다섯 수가 전부 그 값이며 흩어짐이 없으므로 IQR은 0입니다. 목록은 200개까지이며, 1,500 같은 표기는 추측하지 않고 거부합니다. 자릿수 사이의 쉼표가 어떤 나라에서는 소수점이고 다른 나라에서는 천 단위 구분 기호이기 때문입니다. 이 페이지는 이상치를 표시하지 않습니다. 표준적인 규칙인 1.5 × IQR 울타리를 적용하는 일은 별개 도구의 몫입니다.
자주 묻는 질문
- 데이터의 사분위수는 어떻게 구하나요?
- 목록을 정렬한 뒤 세 위치를 읽습니다. Q1은 (n − 1) × 0.25, Q2는 (n − 1) × 0.50, Q3는 (n − 1) × 0.75이고, 위치가 두 값 사이에 떨어지면 보간합니다. 값이 여덟 개면 위치가 1.75, 3.5, 5.25이고 Q1 = 4, Q2 = 4.5, Q3 = 5.5가 됩니다. 사분위 범위는 Q3 − Q1이므로 여기서는 1.5입니다. 세 사분위수와 최솟값, 최댓값이 위에 모두 인쇄되므로 요약 전체가 한 화면에 있습니다.
- 제 Q1이 다른 계산기와 다른 이유는 무엇인가요?
- 사분위수는 사실이 아니라 약속이고, 널리 쓰이는 두 약속이 개수가 4의 배수가 아닐 때마다 갈리기 때문입니다. 이 페이지는 Hyndman–Fan type 7을 따라 이웃 값 사이를 보간합니다. R과 NumPy의 기본값입니다. OpenStax를 비롯한 많은 교재는 대신 중앙값에서 데이터를 반으로 가르고 각 반의 가운데를 잡습니다. 그 교재의 열네 값에 대해 그쪽은 Q1 = 2, Q3 = 9를 내놓지만 이 페이지는 2.5와 8.825를 돌려줍니다. 둘 다 문서화된 규칙입니다. 중앙값인 Q2는 어느 쪽이든 똑같이 나옵니다.
- 사분위 범위는 무엇을 알려 주나요?
- 데이터 가운데 절반의 폭입니다. Q1과 Q3 사이에 있는 50%의 값이 들어 있는 구간입니다. 데이터의 단위를 그대로 가지므로 IQR이 1.5라면 가운데 절반이 측정 단위로 1.5만큼 펼쳐져 있다는 뜻입니다. 위아래 4분의 1을 버리기 때문에 극단값 하나로는 거의 움직이지 않고, 그래서 중앙값과 함께 인용하는 관례가 된 흩어짐입니다. IQR이 0이면 가운데 절반이 같은 값 하나라는 뜻, 즉 데이터의 절반 이상이 동일하다는 뜻이고 무언가 잘못됐다는 신호가 아닙니다.
- 다섯 수 요약이 무엇인가요?
- 최솟값, Q1, 중앙값, Q3, 최댓값입니다. 이 페이지가 인쇄하는 다섯 수이고 보통 이 순서로 씁니다. 어떤 모양도 가정하지 않고 데이터를 설명하는 표준적인 방법이며, 상자 그림이 그리는 것이 정확히 이것입니다. Q1에서 Q3까지 상자를 그리고 중앙값 자리에 선을 그은 뒤 수염을 양 끝까지 뻗습니다. 맨 위에 표시되는 IQR은 그 다섯 수 가운데 하나가 아니라 Q3 − Q1, 즉 상자의 폭입니다.
- 사분위수가 제 데이터에 없는 값일 수 있나요?
- 그럴 수 있고, 목록이 짧으면 대개 그렇습니다. 사분위수는 데이터의 눈금 위에 있는 위치이므로, 1, 2, 3, 4 네 값에 대한 1.75는 목록에 1.75가 없어도 지극히 평범한 제1사분위수입니다. 위치가 정수로 떨어지면 그때는 사분위수가 관측값과 겹칩니다. 두 경우 모두 개수와 함께 인쇄되므로 지금 어느 쪽을 보고 있는지 확인할 수 있습니다.
- 이 페이지가 이상치를 표시해 주나요?
- 아니요. 사분위 범위를 줍니다. 그 값이 표준적인 규칙의 입력입니다. 값이 Q1보다 1.5 × IQR 넘게 아래에 있거나 Q3보다 그만큼 위에 있으면 이상치 후보로 봅니다. 그 울타리를 적용하는 일은 일부러 별개 도구의 몫으로 두었습니다. 그래야 이 페이지가 어떤 점을 버릴지 판정하는 도구가 아니라 데이터에 대한 정직한 설명으로 남습니다. 위의 여덟 값이라면 1.5 × IQR이 2.25이므로 울타리는 1.75부터 7.75까지입니다.
참고 문헌
- Measures of the Location of the Data — Introductory Statistics 2e, section 2.3 — 사분위수와 사분위 범위를 가운데 절반의 흩어짐으로 정의하고 14개 값 예제를 직접 풀어 보이는 절. 그쪽의 반으로 가르는 방법은 여기서 쓰는 보간과 다르다 — OpenStax, Rice University
- quantile — R stats package reference — 아홉 가지 분위수 유형을 문서화한 참조 문서. 기본값인 type 7이 이 페이지가 세 사분위수 모두에 쓰는 약속이다 — The R Project for Statistical Computing
- numpy.quantile — NumPy reference — 기본값인 method=“linear”가 이 페이지와 똑같이 보간한다 — NumPy
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1 — 사분위수와 사분위 범위를 다루는 중국 국가 어휘 표준(기록 페이지에 온라인 전문을 제공하지 않는다고 적혀 있음) — State Administration for Market Regulation, China