본문으로 건너뛰기
CalcMax

이상치 계산기

계산 결과

1

이상치 개수

이상치
9
아래 내부 울타리(Q1 − 1.5 × IQR)
1.7500
위 내부 울타리(Q3 + 1.5 × IQR)
7.7500
아래 외부 울타리(Q1 − 3 × IQR)
-0.5000
위 외부 울타리(Q3 + 3 × IQR)
10.0000
제1사분위수(Q1)
4.0000
제3사분위수(Q3)
5.5000
사분위 범위(IQR)
1.5000

이상치는 표본의 나머지에서 충분히 멀리 떨어져 한 번 더 볼 만한 관측값입니다. 이 이상치 계산기는 그것을 표시하는 통상의 규칙을 적용합니다. 숫자는 한 줄에 하나씩 넣거나 세미콜론, 공백, 또는 뒤에 공백이 오는 쉼표로 구분해 붙여 넣으세요. 제1사분위수보다 1.5 × IQR 이상 아래에 있거나 제3사분위수보다 1.5 × IQR 이상 위에 있는 값이 표시됩니다. 사용한 울타리와 그 울타리가 나온 사분위수도 인쇄하므로, 판정을 믿고 넘기는 대신 직접 검산할 수 있습니다. 어떤 값이 표시되었고 몇 개인지 알려 줍니다. 지우라고는 하지 않습니다.

공식

아래 울타리 = Q1 − 1.5 × IQR · 위 울타리 = Q3 + 1.5 × IQR

Q1
제1사분위수, 즉 25번째 백분위수이고 데이터의 사분의 일이 그 값이나 그 아래에 놓입니다. 아래 울타리를 잡아 줍니다
Q3
제3사분위수, 즉 75번째 백분위수입니다. Q1과 함께 데이터 가운데 절반의 범위를 정하고, 위 울타리를 잡아 줍니다
IQR
사분위 범위, 즉 Q3 − Q1이고 데이터 가운데 절반의 너비입니다. 여기에 1.5를 곱한 값이, 값이 표시되기 전에 그 가운데 절반 바깥으로 얼마나 나가야 하는지를 정합니다
아래 울타리
Q1 − 1.5 × IQR입니다. 이 선보다 엄격히 아래에 있는 값이 표시되고, 선 위에 정확히 놓인 값은 표시되지 않습니다. 값이 모두 같은 목록에서 아무것도 표시되지 않는 이유가 이것입니다
위 울타리
Q3 + 1.5 × IQR입니다. 이 선보다 엄격히 위에 있는 값이 표시됩니다. 이 규칙이 나온 출처에서는 두 울타리를 보통 L1과 U1로 적습니다
n
넣은 값의 개수이며 여기서는 200개까지입니다. 울타리는 사분위수로 만들어지므로 목록이 길어지면 사분위수가 움직이고 어떤 값이 표시되는지도 달라질 수 있습니다

값이 표본의 나머지에 비해 이례적인지, 그리고 그것을 어떻게 할지 정하기 전에 알아야 할 때 쓰세요. 다른 달의 열 배가 되는 월 수익률, 이웃한 값들의 눈금을 벗어난 센서 측정값, 반에서 유난히 낮은 시험 점수가 그런 자리입니다. 이 1.5 × IQR 규칙은 이 규칙을 널리 알린 사람의 이름을 따서 튜키의 규칙이라고도 부르며, 표준적인 첫 번째 통과 기준입니다. 데이터의 모양에 대해 아무 가정도 하지 않기 때문입니다. 평균과 표준편차에 기대는 규칙은 자기가 찾으려는 극단값에 의해 스스로 왜곡됩니다. 이 페이지가 하지 못하는 일은 표시된 값이 오류인지 진짜 극단값인지 알려 주는 것입니다. 둘은 다른 것이고, 이상치는 잘못된 데이터를 가리킬 수도 있고 그 집합에서 가장 흥미로운 측정값일 수도 있습니다. 사분위 범위는 꼬리를 일부러 무시하므로, 시험 대상이 되는 바로 그 값들에 끌려다니지 않습니다.

계산 예시

  1. 값 여덟 개, 하나가 표시됨

    1. Q1 = 4이고 Q3 = 5.5이므로 IQR = 5.5 − 4 = 1.5입니다
    2. 1.5 × IQR = 2.25이므로 아래 울타리는 4 − 2.25 = 1.75, 위 울타리는 5.5 + 2.25 = 7.75입니다
    3. 9는 7.75 위에 있으므로 표시되고, 나머지 값은 모두 울타리 안에 있습니다

    바깥 울타리는 −0.5와 10이고 9는 그 안에 있으므로, 이 값은 안쪽 규칙에만 걸린 것입니다. 극단이라기보다 약간 이례적인 정도입니다. 바깥 울타리를 따로 보고하는 것이 그 구분을 예 아니오로 뭉개지 않고 눈에 보이게 합니다.

  2. 둘이 표시됨, 하나는 안쪽, 하나는 바깥쪽

    1. Q1 = 3.75이고 Q3 = 9.25이므로 IQR = 5.5이고 1.5 × IQR = 8.25입니다
    2. 울타리는 3.75 − 8.25 = −4.5와 9.25 + 8.25 = 17.5이고, 바깥 울타리는 3.75 − 16.5 = −12.75와 9.25 + 16.5 = 25.75입니다
    3. 20은 17.5 위이지만 25.75 안에 있고, 30은 25.75 위입니다. 둘 다 표시되므로 합계는 2입니다

    표시된 두 값은 똑같이 극단적이지 않고, 개수만 보면 그 차이가 가려집니다. 20은 안쪽 울타리를 넘고 30은 바깥 울타리를 넘습니다. 인쇄되는 목록이 오름차순을 유지하므로 어느 쪽이 어느 쪽인지 볼 수 있습니다. 바깥 울타리는 값이 그것을 넘어야 표시된다는 두 번째 문턱이 아닙니다. 두 울타리 사이에 있는 값도 이미 표시된 값입니다.

  3. 하나만 빼고 모든 값이 같을 때

    1. Q1 = 1이고 Q3 = 1이므로 IQR = 0이고 1.5 × IQR = 0입니다
    2. 두 울타리가 모두 1로 무너집니다. 아래 울타리는 1 − 0 = 1, 위 울타리는 1 + 0 = 1입니다
    3. 2는 1보다 엄격히 위에 있으므로 표시됩니다 — 사분위 범위가 0인데도 그렇습니다

    사분위 범위가 0이면 규칙이 꺼져야 할 것처럼 보이지만 그렇지 않습니다. 거의 모든 값이 같을 때, 다른 하나는 정의상 두드러지게 벗어난 유일한 점이고 규칙은 그렇게 말합니다. 반대 결과, 즉 아무것도 표시되지 않으려면 모든 값이 같아야 합니다. 그러면 울타리가 그 값 위에 정확히 놓이고 비교가 엄격하므로 아무것도 바깥에 있지 않습니다.

한계

이 페이지는 한 가지 규칙에 걸린 값들을 보고하고, 그 규칙은 판결이 아니라 관례입니다. 1.5라는 배수는 선택입니다. 그 값을 주는 출처는 더 극단적인 두 번째 선을 위해 3.0도 함께 주고, 다른 교과서와 소프트웨어는 z 점수나 중위절대편차에 기초한 다른 검정을 내놓습니다. 두 도구가 경계선에 있는 값에 대해 다르게 판단하는 것은 정상이고, 어느 한쪽이 틀렸다는 뜻이 아닙니다. 표시된 값이 자동으로 오류인 것도 아닙니다. 이런 규칙은 잘못 입력한 숫자와 진짜 극단적인 관측값을 구별하지 못하고, 두 번째 종류가 데이터 세트에서 가장 값진 측정값인 경우가 많습니다. 표시가 붙었다는 것만으로 점을 빼는 것은 분석이 스스로 벌지 않은 결론을 얻게 되는 길입니다. 여기서 사분위수는 가운데 두 값 사이를 선형 보간해 구하며, 가장 흔한 관례지만 유일한 관례는 아닙니다. 가장 가까운 관측값으로 반올림하는 출처는 사분위수를 반 칸 옮겨 놓을 수 있고 울타리도 따라 움직입니다. 목록은 200개까지이며, 구분 기호 뒤에 숫자 세 자리가 이어지는 형태의 토큰은 추측하지 않고 거부합니다. 숫자 사이의 쉼표는 어떤 나라에서는 소수점이고 다른 나라에서는 천 단위 구분 기호이기 때문입니다.

자주 묻는 질문

데이터 세트에서 이상치 찾기는 어떻게 하나요?
값을 정렬해 제1사분위수와 제3사분위수인 Q1과 Q3을 찾습니다. 사분위 범위는 Q3 − Q1입니다. Q1 − 1.5 × IQR보다 아래에 있거나 Q3 + 1.5 × IQR보다 위에 있는 값이 표시됩니다. 목록 2, 4, 4, 4, 5, 5, 7, 9는 사분위수가 4와 5.5이므로 사분위 범위가 1.5이고, 울타리가 1.75와 7.75이며, 9가 표시됩니다. 위 계산기는 사분위수와 네 울타리를 모두 인쇄하므로 각 단계를 확인할 수 있습니다.
울타리란 무엇이고 왜 네 개인가요?
울타리는 규칙이 값과 견주는 절단선입니다. 소프트웨어에서 흔히 쓰는 말이고, 교과서 출처는 L1, L2, U1, U2로 적습니다. 안쪽 두 울타리는 Q1 − 1.5 × IQR과 Q3 + 1.5 × IQR이고, 바깥 울타리는 1.5 대신 3.0을 써서 더 멀리 나간 값을 표시합니다. 무엇이 표시되는지를 정하는 것은 안쪽 두 개뿐입니다. 바깥 짝을 인쇄하는 이유는 두 선 사이의 값은 약간 이례적이고 바깥 선 너머의 값은 그렇지 않은데, 개수 하나로는 그 차이를 보여 줄 수 없기 때문입니다.
표시된 이상치는 지워야 하나요?
표시가 붙었다는 것만으로는 안 됩니다. 규칙은 그 값이 다른 것들에서 두드러지게 벗어난다고 말할 뿐, 왜 그런지는 말하지 못합니다. 참고문헌도 이상치가 잘못된 데이터를 가리킬 수 있다고 적습니다. 잘못 입력한 숫자, 고장 난 센서, 엉뚱한 열에 들어간 단위가 그렇고, 그런 경우에는 고치거나 빼야 합니다. 반대로 진짜 측정값일 수도 있고, 그 집합에서 가장 많은 정보를 주는 값인 경우가 많습니다. 무엇이든 빼기 전에 이유를 찾으세요. 원본 기록과 계측기 로그, 그 값을 만들어 낸 조건을 확인하세요. 규칙이 표시했다는 이유로 점을 빼는 것은 데이터 세트가 누군가 원하는 말을 할 때까지 깎여 나가는 방식입니다.
다른 도구는 왜 다른 값에 표시하나요?
1.5라는 배수가 법칙이 아니라 관례이기 때문입니다. 1.5를 주는 참고문헌이 두 번째 선을 위해 3.0도 함께 주고, z 점수에 기초한 전혀 다른 규칙들도 있습니다. 하나는 각 값의 평균으로부터의 거리를 표준편차와 견주고, 다른 하나는 중위절대편차와 3.5라는 문턱을 씁니다. 사분위수 관례도 다릅니다. 이 페이지는 가운데 두 값 사이를 보간하지만, 어떤 출처는 가장 가까운 관측값으로 반올림하며 그러면 울타리가 경계선의 점을 살짝 넘어갈 수 있습니다. 두 도구가 울타리 근처의 값에 대해 다르게 판단하는 것은 예상된 일이고, 한쪽 도구를 믿지 않을 이유가 아니라 그 값을 들여다볼 이유입니다.
사분위 범위가 0이면 어떻게 되나요?
규칙은 그대로 돌아가고 값도 그대로 표시합니다. Q1과 Q3이 모두 1이면 사분위 범위가 0이므로 1.5 × IQR도 0이고, 두 울타리가 정확히 1에 놓이며, 1보다 엄격히 위에 있는 값이 표시됩니다. 목록 1, 1, 1, 1, 1, 2에서는 2가 표시됩니다. 사분위 범위가 0이면 데이터에 퍼짐이 없다고 말하는 것처럼 보여서 처음에는 틀린 것 같습니다. 하지만 맞습니다. 거의 모든 값이 같을 때, 다른 유일한 값이 바로 두드러지게 벗어난 값입니다. 비교가 엄격하므로 값이 모두 같은 목록에서는 아무것도 표시되지 않습니다. 울타리가 그 값 위에 바로 놓이고 그 바깥에 엄격히 들어가는 것이 없기 때문입니다.
z 점수 검정과 같은 것인가요?
아니고, 그 차이가 중요합니다. z 점수는 각 값의 평균으로부터의 거리를 표준편차로 나눕니다. 그런데 평균과 표준편차는 이상치를 포함한 표본 전체로 계산되므로, 극단값 하나가 표준편차를 부풀려 스스로를 숨길 수 있습니다. 사분위수에 기초한 규칙에는 그런 되먹임이 없습니다. 사분위수는 위치로 정해지고, 멀리 떨어진 값이 그 위치를 바꾸지 않습니다. 참고문헌이 z 점수 접근법에 한계를 두는 이유가 바로 이것이고, 같은 이유로 퍼짐의 측도가 시험 대상인 점에 끌려다니지 않도록 중위절대편차에 기초한 변형도 함께 제시합니다.

참고 문헌

관련 계산기