최빈값 계산기
계산 결과
최빈값
- 최빈값의 도수
- 3
- 최빈값 개수
- 1
- 개수
- 8
최빈값은 다른 어떤 값보다 자주 나오는 값입니다. 여기서 전형적인 값이 무엇인가라는 질문에 셈이 전혀 필요 없이 답하는 유일한 방법이고, 세는 것만 하면 됩니다. 그래서 라벨에도 쓸 수 있는 유일한 중심 측도입니다. 가장 흔한 신발 사이즈, 가장 자주 보고되는 고장 코드, 선거의 당선자가 그렇습니다. 숫자는 한 줄에 하나씩 넣거나 세미콜론, 공백, 또는 뒤에 공백이 오는 쉼표로 구분해 붙여 넣으세요. 그러면 이 최빈값 계산기가 가장 자주 나온 값과 그것이 몇 번 나왔는지, 그리고 가장 높은 자리를 함께 차지한 값이 몇 개인지를 보고합니다. 데이터 세트는 최빈값이 하나일 수도, 여럿일 수도, 아예 없을 수도 있기 때문입니다. 값을 더하지도 정렬하지도 않으므로 무엇으로도 나누지 않습니다.
공식
최빈값 = 도수가 가장 높은 값; 도수와 동점인 값의 개수를 함께 보고합니다
- xᵢ
- 데이터 세트에 있는 값 하나입니다. 크기는 상관없고 몇 번 겹치는지만 중요합니다. 그래서 더하거나 평균 낼 수 없는 라벨에서도 최빈값을 구할 수 있습니다
- f
- 도수, 즉 보고된 값이 몇 번 나왔는지입니다. 도수가 1이면 겹치는 값이 전혀 없다는 뜻이고, 그러면 목록의 모든 값이 1등 자리를 함께 차지합니다
- mode
- 가장 자주 나온 값입니다. 여러 값이 가장 높은 도수에서 동점이면 그중 가장 작은 값을 인쇄하고 동점의 개수는 따로 알려 줍니다. 수 하나로는 2와 5가 똑같이 흔하다는 것을 말할 수 없습니다
- ties
- 가장 높은 도수를 함께 가진 서로 다른 값이 몇 개인지입니다. 둘이면 두 봉우리 데이터 세트, 셋 이상이면 여러 봉우리이며, 개수가 값의 개수와 같으면 최빈값이 없습니다
- n
- 목록에 담긴 값의 개수이며 여기서는 200개까지입니다. 도수의 상한을 정하고, 이것을 동점 개수와 견주는 것이 최빈값이 없는 경우를 가려냅니다
값이 측정값이 아니라 범주일 때 최빈값을 쓰세요. 사이즈, 색, 모델, 오류 코드, 사람들이 가장 많이 고른 선택지가 그렇습니다. 평균과 중앙값은 셈과 순서를 필요로 하고 파란색에는 뜻 있는 평균이 없습니다. 하지만 가장 흔한 색은 있고, 그것이 어떤 사이즈를 준비할지, 어떤 고장을 먼저 고칠지 같은 실제 질문에 답합니다. 값이 겹치는 숫자 데이터에서도 살펴볼 만합니다. 평균과 중앙값에서 멀리 떨어진 최빈값은 들여다볼 만한 무리를 가리키기 때문입니다. 최빈값이 하지 못하는 일은 연속적인 측정값을 요약하는 것입니다. 온도를 충분히 많이 재면 모든 값이 한 번씩만 나오므로 최빈값이 보고할 것이 없어지고, 동점 개수가 목록 길이와 같아지는 것이 바로 그 뜻입니다. 또한 우승자 말고 모든 값을 무시하므로 나머지 데이터에 대해서는 아무 말도 하지 않습니다.
계산 예시
뚜렷한 우승자 하나: 4가 세 번 나옴
- 각 값이 몇 번 나오는지 셉니다: 2가 한 번, 4가 세 번, 5가 두 번, 7이 한 번, 9가 한 번
- 가장 높은 횟수는 3이고 4만 그것에 닿습니다
- 최빈값: 4, 도수 3, 그리고 1등 자리를 함께한 값이 하나 — 이 데이터 세트는 봉우리가 하나입니다
도수를 최빈값 개수와 함께 읽어야 합니다. 그렇지 않으면 답이 모호해집니다. 도수 3에 동점이 하나면 깔끔한 단일 최빈값이고, 도수 3에 동점이 셋이면 서로 다른 세 값이 모두 세 번씩 나온 것입니다. 두 데이터 세트는 도수가 같고 모양은 전혀 다릅니다.
최빈값이 둘: 2와 5가 똑같이 흔함
- 횟수: 2가 두 번, 5가 두 번, 9가 한 번 나옵니다
- 가장 높은 횟수는 2이고 서로 다른 두 값이 거기에 닿습니다
- 최빈값: 짝 가운데 작은 쪽인 2를 인쇄하고, 도수는 2, 최빈값 개수는 2입니다
이런 데이터 세트를 두 봉우리라고 부르고, 서로 다른 두 무리가 실수로 섞였다는 뜻인 경우가 많습니다. 2의 무리와 5의 무리이고, 히스토그램으로 그리면 혹 두 개로 나타납니다. 도구가 작은 값을 인쇄하는 것은 한 줄에 무언가를 채워 넣기 위해서일 뿐이고, 정직한 읽기는 2와 5가 둘 다 두 번이며, 최빈값 개수가 그렇게 말해 줍니다.
모든 값이 달라서 최빈값이 없음
- 모든 값이 정확히 한 번씩 나옵니다
- 따라서 가장 높은 도수는 1입니다
- 세 값이 그 도수를 함께 가집니다. 즉 전부입니다
- 패널은 도수 1과 최빈값 개수 3을 보고하고, 이것이 이 페이지가 최빈값이 없다고 말하는 방식입니다
도수가 1이면서 최빈값 개수가 값의 개수와 같은 것이 겹치는 값이 없는 데이터 세트의 서명이고, 연속적인 측정값에서는 뭔가 잘못되었다는 신호가 아니라 정상적인 결과입니다. 표시되는 값은 그냥 목록에서 가장 작은 값입니다. 그 줄을 채울 무언가가 필요하고, 옆의 두 개수가 그것을 우승자로 읽지 말라고 알려 줍니다.
한계
최빈값은 우승한 값만 쓰고 나머지를 전부 무시하므로, 세 중심 측도 가운데 정보량이 단연 가장 적습니다. 두 데이터 세트가 최빈값을 공유하면서 다른 모든 면에서 다를 수 있습니다. 연속적인 데이터에서는 거의 쓸모가 없습니다. 측정값을 충분히 잘게 반올림하면 어떤 값도 겹치지 않아 보고할 것이 없어지고, 거칠게 반올림하면 반올림 자체가 최빈값을 만들어 냅니다. 불안정하기도 합니다. 값 하나를 바꾸면 우승자가 바뀔 수 있어서 짧은 목록에서 나온 최빈값은 많이 믿을 것이 못 됩니다. 데이터 세트는 최빈값이 여럿일 수도 없을 수도 있고, 그래서 이 페이지가 수 하나 대신 도수와 최빈값 개수를 보고합니다. 결과에 도수분포표가 없는 것도 그래서입니다. 그 표는 사용자의 데이터로 만들어야 하는데, 이 페이지에서 사용자가 입력하기 전에 그 데이터를 볼 수 있는 것은 아무것도 없습니다. 목록은 200개까지이고, 값은 적힌 그대로 셉니다. 2.5와 2.50은 같은 수이지만, 거의 같은 측정값을 맞추기 위한 반올림은 하지 않습니다.
자주 묻는 질문
- 숫자 목록의 최빈값 구하기는 어떻게 하나요?
- 각 값이 몇 번 나오는지 세고 가장 많이 나온 것을 잡으면 됩니다. 2, 4, 4, 4, 5, 5, 7, 9에서 횟수는 1, 3, 2, 1, 1이므로 최빈값은 4이고 도수는 3입니다. 더하는 것도 정렬하는 것도 없습니다. 그래서 평균이 뜻이 없는 라벨에서도 최빈값을 구할 수 있습니다. 가장 흔한 사이즈, 가장 흔한 색이 그렇습니다.
- 데이터 세트에 최빈값이 여러 개일 수 있나요?
- 그럴 수 있고 흔합니다. 두 값이 가장 높은 도수에서 동점이면 두 봉우리이고, 셋 이상이면 여러 봉우리입니다. 2, 2, 5, 5, 9는 2와 5가 모두 두 번 나오므로 최빈값이 둘이고, 두 봉우리 모양은 보통 두 무리가 섞였다는 뜻입니다. 각 최빈값 주위에 무리가 하나씩 있는 것입니다. 패널은 동점인 값 가운데 작은 쪽을 인쇄하고 옆에 동점의 개수를 보고합니다. 둘 중 하나만 말하면 오해를 부르기 때문입니다.
- 최빈값이 없다는 것은 무슨 뜻인가요?
- 모든 값이 같은 횟수만큼 나와서 어느 것도 나머지보다 흔하지 않다는 뜻입니다. 이 페이지는 그 줄을 비워 두지 않고 도수 1과 값의 개수와 같은 최빈값 개수를 보고하므로, 1, 2, 3은 최빈값이 셋이라고 돌아옵니다. 목록이 짧고 겹치는 값이 없을 때 예상되는 답이고, 연속적인 측정값에서는 보통의 답입니다. 측정값을 충분히 잘게 반올림하면 두 값이 같아지지 않습니다.
- 최빈값이 없는데 왜 최빈값 줄에 값이 보이나요?
- 빈 줄보다, 수 하나와 그것을 설명하는 두 개수가 함께 있는 줄이 읽기 쉽기 때문입니다. 모든 값이 동점일 때 표시되는 값은 목록에서 가장 작은 값이고, 도수는 1이며, 최빈값 개수는 값의 개수와 같습니다. 셋을 함께 읽으면 겹치는 값이 없다는 답이 되고, 값만 따로 읽으면 1이 이겼다고 생각하게 됩니다. 그래서 두 개수가 옆에 있습니다.
- 최빈값은 연속적인 측정값에 쓸모가 있나요?
- 거의 없습니다. 무엇이든 충분히 정밀하게 재면 모든 측정값이 달라서 보고할 반복이 없습니다. 도수는 1, 동점 개수는 목록 길이와 같고, 최빈값은 없습니다. 같은 측정값을 거칠게 반올림하면 겹쳐 보이는 최빈값이 나타나는데, 그것은 반올림 경계가 어디에 떨어졌는지의 결과일 뿐입니다. 최빈값은 범주에서, 그리고 다섯 선택지 중 각각 몇 명이 골랐는지처럼 실제로 값이 겹치는 숫자에서 제 몫을 합니다.
- 최빈값에도 표본 버전과 모집단 버전이 있나요?
- 없습니다. 최빈값은 반복의 횟수이므로 조정할 제수가 없고, 이 페이지에도 그런 스위치가 없습니다. n − 1 보정은 제곱 편차의 합을 개수로 나누는 퍼짐 측도의 것입니다. 목록이 표본이든 집단 전체이든 최빈값은 같습니다.
참고 문헌
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1 — 최빈값을 위치 측도로 정의하면서, 그것이 반드시 하나만 있는 것은 아니라고 적은 절 — National Institute of Standards and Technology (NIST)
- Measures of the Center of the Data — Introductory Statistics 2e, section 2.5 — 평균과 중앙값, 최빈값을 정의하고 어느 것을 언제 쓰는지 다루는 절 — OpenStax, Rice University
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1 — 중국 국가 통계 어휘 표준이며 최빈값과 다른 위치 측도를 포함한다(기록 페이지에 온라인 전문을 제공하지 않는다고 적혀 있어, 공식이 아니라 용어를 위해 인용한다) — State Administration for Market Regulation, China