본문으로 건너뛰기
CalcMax

카이제곱 계산기

계산 결과

20.0000

카이제곱 통계량

p값
0.0170%
자유도
3
최소 기대 도수
25.0000

카이제곱 계산기는 세어 낸 범주들을 예상했던 빈도와 견주어, 통계량과 자유도, 그리고 거기에 딸리는 p값을 보고합니다. 이 집단들이 크기가 같은가 하는 모든 질문 뒤에 있는 검정입니다. 주사위가 공정한지, 네 선택지가 비슷하게 뽑혔는지, 각 범주의 관측 도수가 예측할 만한 이유가 있었던 기대 도수와 맞는지를 봅니다. 기대 도수를 비워 두면 모든 범주가 같은 확률이라고 가정하는데, 이것이 가장 흔한 경우이면서 미리 산수를 해 둘 필요가 없는 쪽이기도 합니다. 최소 기대 도수가 함께 인쇄되는 이유는 이 검정의 사용 조건을 견주는 기준이 바로 그 수이기 때문입니다.

공식

χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )

O
각 범주의 관측 도수입니다. 측정값이 아니라 개수이므로 정수이고, 전체 합이 표본 크기가 됩니다. 0도 허용됩니다. 그 범주가 한 번도 나오지 않았다는 뜻이고, 그것은 실수가 아니라 결과이기 때문입니다
E
각 범주의 기대 도수이며, 보고 싶은 값이 아니라 귀무가설이 예측하는 값입니다. 비워 두면 전체를 범주 수로 나눈 값이 되어, 범주들이 같은 확률인지를 묻는 검정이 됩니다
k
범주의 개수이며 입력한 목록의 길이에서 읽습니다. 자유도를 정하고, 기대 도수가 비어 있을 때 그것을 나누는 기준도 되므로, 숫자 목록 하나가 둘을 동시에 결정합니다
df
자유도이며 k가 아니라 k − 1입니다. 빼기를 잊는 것이 흔한데, 전체 합과 마지막 하나를 뺀 나머지가 정해지면 마지막 도수는 자동으로 정해지므로, 범주들은 자기 개수보다 하나 적은 정보를 나릅니다
χ²₀
이 페이지가 계산한 통계량이며, 자기 귀무분포에 넣어 꼬리 넓이를 구합니다. 정규곡선에서 값을 읽는 것과 같은 작업을 카이제곱 곡선으로 하는 것이고, 그래서 p값이 통계량뿐 아니라 자유도도 필요로 합니다

데이터가 범주에 떨어지는 개수 묶음이고, 그 개수가 어떤 예측과 맞는지가 궁금할 때 씁니다. 평균이나 비율 쪽 검정과 갈라지는 지점이 개수라는 점입니다. 관측값이 눈금 위에서 측정된 것이 아니고, 각 값이 얼마나 컸는지가 아니라 각 바구니에 몇 개가 들어갔는지가 문제가 됩니다. 예측은 균등 분할일 수도 있고, 이전 데이터에서 만든 기대 도수일 수도 있습니다. 전국 비율을 지역 인구에 적용한 값, 멘델의 분리비, 모형의 출력이 그렇습니다. 검정은 그 기대값만큼만 좋습니다. 세어 낸 것과 말해 둔 것을 견줄 뿐, 그 기대값 자체가 틀렸다는 것은 알아채지 못합니다. p값을 믿기 전에 볼 조건이 둘 있고, 그중 첫째는 페이지가 대신 인쇄해 줍니다. 최소 기대 도수가 보통의 경험법칙이 말하는 그 수이기 때문입니다.

계산 예시

  1. 네 범주를 고르지 않게 세고, 기대 도수는 비워 둠

    1. 합계가 100이고 기대값이 비어 있으므로 4개 범주에 각각 100 / 4 = 25
    2. 25에서 뺀 차의 제곱: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
    3. 각각을 기대값 25로 나눠 더함: 1 + 9 + 1 + 9 = 20
    4. 자유도는 k − 1 = 3이고, 20을 넘는 위쪽 꼬리는 0.017%

    이것이 이 페이지의 기본값이고, 눈에 띄게 고르지 않도록 골랐습니다. 기대값 25에 대고 40과 10입니다. p값이 0.017%로 나오니 균등 분할에서 멀리 떨어진 도수이고, 최소 기대 도수 25는 흔히 쓰는 어떤 문턱보다도 넉넉히 위에 있어서 p값 뒤의 근사가 여기서는 단단한 땅 위에 있습니다. 기대 도수를 한 번도 입력할 필요가 없었다는 점도 보세요. 그 칸을 비우는 것이 균등 분할을 표현하는 방식이고, 이 필드가 선택인 이유가 그것입니다.

  2. 세 범주를 이전 조사의 기대 도수에 대고

    1. 두 목록 모두 합이 100이라 기대값이 도수와 일관되므로 검정을 진행할 수 있음
    2. 차의 제곱: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
    3. 각각을 기대값으로 나눠 더함: 100/60 + 0/30 + 100/10 = 1.6667 + 0 + 10 = 11.6667
    4. 자유도는 3 − 1 = 2이고, 11.6667을 넘는 위쪽 꼬리는 0.2928%

    두 목록은 같은 관측값 개수를 서술해야 하고, 여기서는 둘 다 100입니다. 그래야 두 번째 목록이 다른 실험이 아니라 첫 번째에 대한 가설이 됩니다. 항을 하나씩 읽어 보면 가운데 범주는 기대값과 정확히 맞아떨어져 아무것도 보태지 않았고, 가장 작은 범주인 세 번째가 열한 점 반 가운데 열 점을 냈습니다. 기대값을 100% 빗나갔기 때문입니다. 최소 기대값 10도 보통 요구되는 수준 위에 있습니다.

  3. 동전을 20번 던져 균등 분할에 대고 검정

    1. 기대 도수: 20번을 두 결과에 균등하게 나누면 10과 10
    2. 차의 제곱: (12 − 10)² = 4, (8 − 10)² = 4
    3. 나눠 더함: 4/10 + 4/10 = 0.8
    4. 자유도는 2 − 1 = 1이고, 0.8을 넘는 위쪽 꼬리는 37.1093%

    20번 중 앞면 12번은 편향된 동전처럼 보이지만 꼬리 확률을 읽어 보면 그렇지 않습니다. 공정한 동전의 37%가 적어도 이만큼 고르지 않은 갈림을 내기 때문입니다. 첫 번째 예시와 같은 산수를 쓸 만한 가장 작은 표에서 한 것이고, 통계량을 혼자 읽으면 안 되는 이유를 보여 줍니다. 0.8과 20은 견줄 수 있는 수가 아니고, 눈금 위에 올려놓는 것은 p값뿐입니다. 범주가 둘일 때는 알아 둘 요령이 하나 있습니다. 카이제곱 통계량이 두 비율 검정이 쓸 z의 제곱과 같습니다.

한계

p값은 기대 도수가 어느 정도 커야 하는 근사 위에 서 있고, 그것을 견줄 기준이 인쇄된 최소 기대 도수입니다. 어디에 선을 그을지는 교과서마다 다릅니다. 모든 범주에 최소 5, 또는 모든 범주에 최소 1이면서 대부분의 범주에 5라는 두 기준이 모두 널리 쓰입니다. 기대값이 너무 작으면 근사가 조용히 무너져, 평범해 보이는 p값을 돌려줍니다. 도수가 독립이라고도 가정하는데, 짝지은 측정이나 반복 측정, 군집 표집에서 이것이 깨지고, 그때마다 통계량이 실제보다 커집니다. 기대값 자체는 주어진 것으로 받아들이므로, 틀린 예측에 대고 한 검정은 의도한 것과 다른 질문에 답합니다. 마지막으로 p값이 작다는 것은 도수가 기대와 어긋난다는 뜻이지 왜 그런지는 말해 주지 않습니다. 어느 범주가 책임인지는 알려 주지 않고, 범주가 여럿이면 통계량을 끌고 간 차이를 하나씩 따로 들여다볼 만합니다.

자주 묻는 질문

카이제곱 검정은 실제로 무엇을 알려 주나요?
관측한 도수가, 관측값이 몇 개인지를 감안할 때, 기대했던 빈도와 일관되는지를 알려 줍니다. 통계량은 관측과 기대 사이의 제곱 오차를 각 기대값의 크기로 나눈 것을 모두 더한 값이라, 같은 비율의 차이라도 기대값이 작을 때 더 크게 셉니다. p값은 공정한 세상이 적어도 그만큼 큰 어긋남을 얼마나 자주 내는지를 말합니다. 어느 한 범주가 아니라 표 전체에 대한 검정이고, 한 범주가 눈에 띄게 튀는 상황에서 둘을 혼동하기 쉽습니다.
기대 도수를 비워 두면 어떻게 되나요?
모든 범주가 같은 확률이라고 가정하고 기대 도수를 전체를 범주 수로 나눈 값으로 계산합니다. 주사위, 돌림판, 똑같이 유입되어야 할 네 개의 버튼처럼 이 검정이 가장 흔히 쓰이는 자리가 여기이고, 값이 다 같을 목록을 입력하지 않아도 됩니다. 갈림을 예측할 사전 데이터가 없을 때 쓸 수 있는 유일한 읽기이기도 합니다. 작년의 분포나 이론적 비율처럼 진짜 예측이 있을 때는 기대 도수를 입력하세요. 균등 분할에 대고 한 검정과 특정 모형에 대고 한 검정은 서로 다른 질문에 답하고, 이미 가진 정보를 쓰는 쪽은 두 번째뿐입니다.
두 목록의 합이 왜 같아야 하나요?
적합도 검정의 기대 도수는 자유롭게 고른 값이 아니라 전체 관측값 개수에서 나오기 때문입니다. 같은 관측값들이 가설이 참이라면 어떻게 흩어졌을지를 서술하는 값입니다. 합이 다른 두 목록은 서로 다른 두 실험을 서술하고, 그 둘로 계산한 통계량은 아무것도 검정하지 않습니다. 기대 도수를 정수로 적을 때는 각 값이 반 단위까지 어긋나도 의도가 달라지지 않으므로, 페이지가 범주당 0.5의 허용 오차를 둡니다. 합이 60일 때 20.5, 20.5, 20.5는 받아들여집니다. 정확한 균등 분할 20씩을 반올림한 값이기 때문입니다.
도수가 0인 범주가 있어도 되나요?
관측 도수는 되고 기대 도수는 안 되며, 이 비대칭은 식에서 바로 나옵니다. 관측된 0은 한 번도 나오지 않은 범주라는 평범한 결과이고, 차의 제곱이 그냥 크게 나오는데 그것이 마땅한 일입니다. 기대값 0은 나누는 수라서 쓸 수 없고, 그 항이 무한이 됩니다. 어떤 범주가 절대 일어날 수 없다는 예측은 이 검정이 도수에 대고 저울질할 수 있는 예측이 아닙니다. 실제 기대값이 0이 아니라 아주 작다면 검정은 그것을 받아들이고, 그것이 문제인지는 결과 아래에 인쇄된 최소 기대 도수에서 보면 됩니다.
카이제곱 임계값 표는 어디에 있나요?
이 페이지에는 없고, 이유는 p값 페이지와 같습니다. 중요한 값 하나가 이미 인쇄되어 있습니다. 통계량과 자유도가 꼬리 넓이를 직접 정하기 때문입니다. 표를 만들려면 유의수준을 하나 정해야 하므로, 1%에서 일하는 독자는 위 패널과 어긋나는 표를 들여다보게 됩니다. 조회를 할 자리는 임계값 도구입니다. 이 페이지가 원리적으로도 표를 보여 줄 수 없는 이유가 하나 더 있습니다. 자유도가 k − 1이고 k는 독자가 입력한 범주 수라서, 표의 어느 행이 해당하는지가 도수를 입력하기 전에는 정해지지 않습니다.
카이제곱 통계량만 보고 판정하면 안 되나요?
안 됩니다. 통계량의 크기는 기대값의 크기와 범주의 개수에 함께 달려 있어서, 견줄 기준 없이는 크고 작음을 말할 수 없습니다. 0.8은 범주 둘에서는 평범하지만 범주 스무 개에서는 놀라울 수 있고, 20도 기대값이 25일 때와 2,500일 때가 전혀 다릅니다. 눈금 위에 올려놓는 것은 p값이고, 그 p값이 자유도와 통계량을 함께 읽어야 하는 이유도 여기 있습니다. 판정을 인쇄하지 않는 이유는 p값 페이지와 같습니다. 유의수준은 검정을 돌리기 전에 읽는 사람이 정해 두는 것이지, 숫자가 화면에 뜬 뒤에 고르는 것이 아닙니다.

참고 문헌

관련 계산기