임계값 계산기
계산 결과
임계값
임계값 계산기는 신뢰수준이나 유의수준을, 검정 통계량이 넘어야 하는 경계로 바꿔 줍니다. 신뢰수준을 주면 곡선 가운데를 잘라 내는 z 점수나 t 값을 돌려주고, 유의수준을 주면 카이제곱이나 F 분포에서 그 너머가 너무 극단적인 결과로 쳐지는 지점을 돌려줍니다. 통계학 교과서 뒤에 인쇄된 표에 있는 수가 이것입니다. 그 표들이 존재하는 이유는 임계값에 닫힌 형태의 식이 없기 때문이고, 이 페이지는 그 표를 대신합니다. 정규분포를 뺀 나머지 분포는 모두 자유도가 모양을 정하므로, 같은 신뢰수준이 표본이 커짐에 따라 다른 경계를 냅니다. 자유도 5에서 95% 양측 t 값은 2.5706이고, 자유도가 백만이면 1.9600에 붙어 있습니다. t 분포와 z 점수 중 무엇을 쓸지는 별개의 질문이고, 그래서 페이지가 추측하지 않고 묻습니다. z는 표준편차를 미리 알고 있던 검정에, t는 같은 표본에서 추정한 검정에 붙습니다.
표준정규분포의 임계값
| 유의수준, α | 단측 z | 양측 z |
|---|---|---|
| 0.1 | 1.2816 | 1.6449 |
| 0.05 | 1.6449 | 1.96 |
| 0.01 | 2.3263 | 2.5758 |
| 0.001 | 3.0902 | 3.2905 |
주어진 α와 맞는 행을, 돌리는 검정과 맞는 열을 읽으면 됩니다. 두 열이 사람들이 실제로 들고 오는 두 질문에 답하고, 나란히 놓여 있어야 1.6449가 두 번 나오는 데 이유가 있다는 것이 보입니다. α = 0.05의 단측 경계이면서 α = 0.10의 양측 경계인데, 둘 다 위쪽 꼬리에 0.05를 두기 때문입니다. 두 번째 열은 첫 번째 열을 α의 절반에서 다시 계산한 것입니다. 여기에는 정규분포만 표로 있습니다. t와 카이제곱과 F의 경계는 모두 자유도에 달려 있어서 그것들을 한 장의 표로 만들면 표가 아니라 책이 되고, 위의 패널이 이미 어느 것이든 한 점에서 계산해 줍니다. 이 네 행의 어떤 값도 입력한 것에 달려 있지 않아서, 표가 패널 아래에 놓여도 어긋날 수가 없습니다.
공식
Φ(z) = 1 − α/2 T(t, df) = 1 − α/2 P(χ² > x, df) = α P(F > f, df₁, df₂) = α
- α
- 유의수준, 즉 경계를 그어 내는 꼬리 넓이이며, 위의 선택 상자가 신뢰수준이라고 부르는 것과 같은 양입니다. 두 어휘는 한 번의 뺄셈만큼 떨어져 있습니다. 신뢰수준 95%는 α = 0.05이고, 99%는 α = 0.01입니다. 차이를 나누는 것이 중요한 이유는, 그 5%가 한쪽 꼬리에 있는지 둘로 나뉘는지를 페이지가 알아야 하고, α로 읽어야만 그것이 보이기 때문입니다
- Φ⁻¹
- 표준정규 누적함수의 역함수이며, z 표를 읽어 내는 바로 그 곡선을 거꾸로 돌린 것입니다. 표는 주어진 z에 대한 넓이를 주는데 임계값은 주어진 넓이에 대한 z이므로, 답이 산수가 아니라 근사에서 나와야 하는 이유가 바로 이것입니다
- df
- 자유도이며 t 분포와 카이제곱 분포의 모양 모수입니다. 같은 신뢰수준이 페이지마다 다른 답을 내는 까닭이 이것입니다. 95% 양측에서 경계는 자유도 1일 때 12.7062, 열일 때 2.2281, 그리고 t와 정규분포를 구별할 수 없을 만큼 표본이 커지면 1.9600입니다
- df₁, df₂
- F 분포의 두 자유도이며 분자와 분모입니다. F 검정은 두 분산이나 여러 집단 평균을 한꺼번에 견주므로 둘 다 필요하고, 페이지의 두 번째 칸은 이 모드에서만 읽힙니다. 순서를 바꿔 넣는 것이 흔한 실수인데 다른 답이 나옵니다
- 꼬리
- 경계가 분포의 어느 쪽에 놓이는지입니다. 양측은 α를 반으로 갈라 각 끝에 α/2씩 두므로, 95% 양측 z는 1.9600이고 95% 단측 z는 1.6449입니다. 같은 신뢰인데 문턱이 낮은 것은 5% 전부가 이제 한쪽에 있기 때문입니다. 카이제곱과 F에는 양측 읽기가 아예 없습니다. 그 분포들은 비뚤어져 있어서 아래쪽 경계가 위쪽 경계의 음수가 아니라 완전히 별개의 수입니다
신뢰수준이나 유의수준이 있고 검정 통계량과 견줄 수를 필요로 할 때 씁니다. 손 계산을 끝내거나, 소프트웨어가 무엇을 썼는지 확인하거나, 표본 크기가 바뀔 때 문턱이 얼마나 움직이는지 보고 싶을 때입니다. 이 분야에서 가장 흔한 혼동을 정리해 주는 페이지이기도 합니다. 1.96과 1.645는 같은 검정에 대한 두 관례가 아니라 5% 수준의 양측 경계와 단측 경계이고, 어느 쪽이 적용되는지는 가설이 데이터를 보기 전에 방향을 말했는지가 정합니다. 거꾸로 읽으면 반대 질문에도 답합니다. 보고된 통계량 2.3은 경계 2.2281 옆에서 5% 양측으로 유의하고, 자유도 5에서 2.5706 옆에서는 유의하지 않습니다. 이 페이지가 정해 주지 않는 것은 어느 분포를 썼어야 하는가입니다. 그것은 연구에 대한 질문입니다. z는 표준편차가 알려진 상수일 때, t는 같은 데이터에서 추정했을 때, 카이제곱은 도수와 분산에, F는 분산의 비에 붙습니다. 선택 상자는 사용자의 몫이고, 헷갈리기 쉬운 부분은 아래 FAQ가 설명합니다.
계산 예시
기본값: 95% 양측 z 경계
- 신뢰수준 95%는 α = 0.05
- 양측이면 각각 0.025씩이므로, 위쪽 경계는 표준정규곡선이 아래에 0.975를 남기는 지점
- Φ⁻¹(0.975) = 1.9600
- 아래쪽 경계는 그 거울상인 −1.9600이고, 그래서 양측 검정은 |z|를 이 수 하나와 견줌
통계학에서 가장 많이 인용되는 수이고 시작하기에 맞는 자리입니다. 페이지의 다른 무엇을 믿기 전에 기억과 견줘 확인할 수 있기 때문입니다. 양측 읽기가 문제를 어떻게 바꾸는지 보세요. 5%의 절반을 위에 남기는 z를 묻는 것이지 전부를 남기는 z가 아니고, 그 반으로 가르는 일이 1.9600과 1.6449의 차이 전부입니다. 두 자유도 칸이 화면에 있지만 이 모드에서는 쓰이지 않습니다. z 검정에는 자유도가 없고, 페이지는 그것을 회색으로 칠하는 대신 읽지 않는 것으로 말합니다.
같은 95%인데 표준편차를 표본에서 구한 경우
- 신뢰수준도 꼬리 개수도 같으므로 α/2 = 0.025도 같음
- 분포가 정규분포에서 자유도 10인 t로 바뀌고, 그 꼬리는 더 두꺼움
- T⁻¹(0.975, 10) = 2.2281
- 같은 경계가 자유도 5에서는 2.5706, 자유도 50에서는 2.0086으로, 표본이 커지면서 1.9600 쪽으로 내려감
1.9600과 2.2281의 간격은 모집단 표준편차를 모르는 값으로 치른 대가이고, 두 분포를 서로 바꿔 쓸 수 있는 것으로 취급하지 않고 나눠 둔 이유입니다. 작은 보정이 아닙니다. 통계량 2.1은 z 문턱은 넘고 자유도 10의 t 문턱은 넘지 못합니다. 여기 인용한 세 t 값 2.5706, 2.2281, 2.0086은 같은 계산을 자유도만 바꿔 한 것이고, 차례로 읽으면 t가 다른 규칙이 아니라 벌금이 붙은 같은 규칙이라는 것이 가장 분명해집니다.
카이제곱 경계에는 양측 판이 없음
- 카이제곱은 제곱의 합이라 음수가 될 수 없고 곡선이 오른쪽으로 비뚤어져 있음
- 검정은 관측된 어긋남이 너무 큰지를 묻으므로 경계는 위쪽: 곡선이 아래에 0.95를 남기는 지점
- P(χ² > x, df = 3) = 0.05에서 x = 7.8147
- 여기서 양측을 고르면 근사가 아니라 거절됨
양측 카이제곱을 요구하는 것이 이 페이지가 거절하는 유일한 입력이고, 그 거절이 알려 주는 바가 있습니다. 대칭 분포에서는 두 경계가 서로의 음수라서 수 하나가 양 끝을 맡습니다. 비뚤어진 분포에서는 둘이 무관한 값이고, 자유도 3인 카이제곱의 위쪽 5% 점은 7.8147이지만 아래쪽 5% 점은 0.3518입니다. 어느 쪽이든 “양측 임계값”이라 인쇄하면 조용한 오류가 되므로 페이지가 멈춥니다. 아래쪽 경계도 요청하면 나오고, 변동이 너무 적을 때 기각하는 적합도 검정이 쓰는 쪽이 그것입니다.
아래쪽 경계는 위쪽 경계의 음수가 아님
- F 통계량은 분산의 비라서 카이제곱처럼 음수가 될 수 없고 곡선이 비뚤어져 있음
- 자유도 10과 20에서 위쪽 5% 경계는 2.3479
- 아래쪽 5% 경계는 아래에 0.05를 남기는 값: 0.3605
- 둘은 마이너스 부호의 관계가 아니라 같은 비뚤어진 곡선 위의 서로 독립적인 두 점
이 짝이 비대칭 분포에서도 꼬리를 묻는 이유입니다. F는 비이므로 아래쪽 꼬리는 유난히 작은 비의 것이고, 두 번째 집단이 더 변동이 큰 쪽으로 나왔을 때 등분산 검정이 들여다보는 자리가 바로 거기입니다. F(1−α, df₁, df₂) = 1 / F(α, df₂, df₁)이라는 역수 항등식이, 위쪽 꼬리만 인쇄된 표 하나에서 이것들을 읽던 방식이며, 페이지가 대신 해 주는 산수가 정확히 그것입니다.
한계
페이지는 경계를 돌려주고 거기서 멈춥니다. 무엇과도 견주지 않는데, 견줄 것이 없기 때문입니다. 검정 통계량은 페이지가 한 번도 보지 못한 데이터에서 나옵니다. 이 분리는 의도한 것이고, 페이지가 분포를 추론하는 대신 이름을 묻는 이유이기도 합니다. 경계는 무엇을 그 경계에 대고 재는지 알고 나서야 의미가 있고, 산수는 z와 t를 구별할 수 없습니다. 두 번째로 하지 않는 일은 자유도를 점검하는 것입니다. 자유도 1인 t는 12.7062라는 완벽하게 올바른 답을 내는데, 다섯 명짜리 연구에서 그 답은 거의 쓸모가 없습니다. 표준편차의 추정이 자유도 하나에 얹혀 있어서 경계가 넓기 때문입니다. 입력만으로는 일부러 한 스트레스 테스트와 실수를 구별할 수 없으므로, 어느 쪽이든 수는 그대로 돌아옵니다. 마지막으로 네 분포 모두 관측값이 독립이라고 가정하고, F의 경우 모집단이 정규분포라고 가정합니다. 틀린 분포에서 올바르게 계산한 임계값도 여전히 넘어야 할 잘못된 문턱입니다.
자주 묻는 질문
- 임계값과 p값은 무엇이 다른가요?
- 같은 사실을 반대쪽 끝에서 읽은 것입니다. 임계값은 고른 유의수준에서 시작해 경계를 돌려주고, p값은 관측한 통계량에서 시작해 그 너머의 꼬리 넓이를 돌려줍니다. 둘이 역함수 관계라서, 통계량을 경계와 견주는 것과 p값을 α와 견주는 것은 언제나 같은 판정을 냅니다. 소프트웨어가 둘 중 어느 쪽을 보고해도 되는 이유입니다. 실무적인 차이는 선택이 이루어지는 시점입니다. 임계값은 데이터를 보기 전에 고정되어 그 수준에서 돌린 모든 연구에 같은 값이고, p값은 그 특정 표본의 성질이라 미리 인용할 수 없습니다. 이 페이지는 경계 쪽이고, p값 페이지가 나머지 절반입니다.
- 1.96과 1.645 중 무엇을 써야 하나요?
- 관례의 문제가 아니라 꼬리의 문제입니다. 1.9600은 5% 수준의 양측 경계이고 1.6449는 같은 수준의 단측 경계입니다. 앞엣것은 5%를 양 끝에 나누고, 뒤엣것은 전부 위쪽에 둡니다. 데이터를 모으기 전에 방향이 정해져 있지 않았다면 양측 값을 쓰세요. 단측 검정은 반대 방향의 차이를 탐지할 능력을 포기하는 대가로 낮은 문턱을 사기 때문입니다. 위의 표가 그 무늬를 그대로 보여 줍니다. 각 α에 두 읽기가 있고, α의 단측 열은 2α의 양측 열입니다.
- 어느 분포를 골라야 하나요?
- 표준편차를 어떻게 얻었는지와 무엇을 견주는지에서 따라 나옵니다. 표준편차가 추정한 값이 아니라 알려진 상수일 때 z를 씁니다. 추정값이 안정적이어서 문제되지 않을 만큼 표본이 큰 경우도 포함됩니다. 표준편차가 평균과 같은 표본에서 나왔을 때는 t를 쓰는데, 이것이 보통의 상황이고 t가 실무에서 훨씬 흔한 이유입니다. 도수와 분산에는 카이제곱을 씁니다. 적합도, 분할표의 독립성, 분산의 신뢰구간이 그렇습니다. 통계량이 두 분산의 비일 때, 또는 분산분석에서 여러 집단 평균을 한꺼번에 견줄 때는 F를 씁니다. 페이지가 숫자에서 이것을 추론할 수 없어서, 선택이 자동 단계가 아니라 필드인 것입니다.
- 양측 카이제곱이나 F 임계값은 왜 요구할 수 없나요?
- 그 분포들이 비뚤어져 있어서 두 꼬리가 거울상이 아니기 때문입니다. 정규곡선이나 t 곡선에서는 아래쪽 경계가 위쪽 경계의 정확한 음수라서 수 하나가 양 끝을 서술하고 “양측”이 잘 정의된 요구가 됩니다. 카이제곱과 F는 0에서 시작해 오른쪽으로 꼬리를 끌므로 위쪽과 아래쪽 경계가 무관한 두 값입니다. 자유도 3인 카이제곱에서 위쪽 5% 점은 7.8147이고 아래쪽 5% 점은 0.3518입니다. 어느 쪽이든 양측 답이라 보고하면 조용히 틀린 수가 되므로, 페이지가 그 조합을 거절하고 어느 꼬리를 뜻했는지 묻습니다.
- 자유도를 바꾸면 임계값이 왜 달라지나요?
- 자유도가 t와 카이제곱과 F 분포의 모양을 정하고, 경계는 그 모양 위의 위치이기 때문입니다. 표본이 작으면 t가 넓어집니다. 95% 양측에서 경계는 자유도 1일 때 12.7062, 열일 때 2.2281, 쉰일 때 2.0086이고 자유도가 커지면서 1.9600에 다가갑니다. 그 수렴은 우연이 아닙니다. t는 정규분포를 추정한 흩어짐으로 나눴을 때 나오는 것이고, 표본이 커지면 그 추정이 더 이상 불확실성을 보태지 않습니다. 같은 기제가 카이제곱과 F의 경계도 자유도에 따라 움직이게 하고, 그래서 그 둘은 정규분포처럼 표로 만들 수 없습니다.
- 임계값과 신뢰구간은 같은 건가요?
- 아니요. 다만 신뢰구간이 임계값으로 조립됩니다. 구간의 너비는 임계값에 표준오차를 곱한 값이라서, 경계가 두 재료 가운데 하나이고 데이터의 흩어짐이 다른 하나입니다. 이 역할 분담이 이 페이지가 데이터 없이도 답할 수 있는 이유입니다. 경계는 신뢰수준과 자유도에만 달려 있고, 구간은 표본도 필요로 합니다. 같은 신뢰수준을 쓰는 두 연구의 구간이 서로 다른 이유도 이것으로 설명됩니다. 임계값은 공유하고 표준오차에서 갈립니다. 곱하는 수가 아니라 구간 자체가 필요하면 평균과 흩어짐을 입력으로 받는 신뢰구간 페이지가 그 자리입니다.
참고 문헌
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods — z 경계가 그 역함수인 누적함수이며, 보통 이 값을 읽어 내는 표의 출처 — National Institute of Standards and Technology (NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e — 정해진 신뢰수준에서 곡선 가운데를 잘라 내는 법과 두 꼬리 넓이가 더해져 무엇이 되는지 — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods — 검정 통계량을 자기 분포를 가진 양으로 보는 관점이며, 그 분포 위의 경계가 의미를 갖게 하는 것이 이것 — National Institute of Standards and Technology (NIST)