t검정 계산기
계산 결과
t 통계량
- p값
- 34.6594%
- 자유도
- 8
- 표준오차
- 1.0000
t검정 계산기는 평균에 대한 가장 흔한 검정을 돌립니다. 표본평균과 표준편차, 표본 크기를 t 통계량과 p값, 그리고 그 둘을 읽어 내는 자유도로 바꿔 줍니다. 단일 표본 모드는 하나의 평균을 고정된 값 — 목표치, 규격, 과거의 평균 — 과 견주고, 두 표본 모드는 두 집단을 서로 견줍니다. 여기 구현된 두 표본 검정은 합동 분산 t검정이고, 두 집단이 분산을 공유한다고 가정합니다. 두 표준편차를 n − 1을 가중치로 평균 내고, 그 하나의 합동 분산이 표준오차를 끌고 갑니다. 대안인 Welch 검정은 등분산 가정을 버리고 집단의 크기와 흩어짐이 다를 때 더 안전한 기본값이지만, 자유도가 분수로 나오고 다른 자리에 있는 다른 계산입니다. 이 페이지는 등분산 검정을 하고, 그것을 조용히 근사하는 대신 그렇다고 말합니다. p값은 통계량 너머 t 분포의 꼬리 넓이이고 퍼센트로 인쇄됩니다.
공식
t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- 검정 통계량이며, 관측된 평균이 검정하려는 값에서 표준오차 몇 개만큼 떨어져 있는지입니다. 부호가 방향을 나르고, 그래서 잘못된 방향의 단측 검정이 오류가 아니라 큰 p값을 돌려줍니다. 위쪽 꼬리 대립가설에 대고 t가 −1인 것은 작은 효과가 아니라 반대쪽을 가리키는 증거이고, 꼬리 넓이가 그렇게 말합니다
- x̄, μ₀
- 단일 표본 모드에서 표본평균과 그것을 견주는 값입니다. 분자가 그 차이이므로 통계량은 데이터의 단위로 잰 거리를 나타냅니다. 같은 차이라도 흩어짐이 넓거나 표본이 작으면 훨씬 적게 셈해지고, 그것을 공급하는 것이 분모입니다
- s
- 표본표준편차이며 미리 아는 값이 아니라 데이터에서 추정합니다. 그 추정이 정규분포 대신 t 분포를 쓰는 이유 전부입니다. 끌어들이는 추가 불확실성이 꼬리를 두껍게 만들고, 두꺼운 꼬리를 t 임계값이 감안합니다. 0보다 커야 합니다. 변동이 없는 표본은 나눌 분모가 없습니다
- n
- 표본 크기이며 단일 표본 모드에서 n − 1의 자유도를 줍니다. 두 표본 검정에서는 두 크기가 각각보다 하나 많은 수로 합쳐집니다. n₁ + n₂ − 2인데, 합동 분산이 각 집단의 평균에 자유도를 하나씩 쓰고 나서 그 둘레의 흩어짐을 재기 때문입니다
- s_p²
- 합동 분산이며 두 집단 분산의 가중평균으로, 각각이 자기 자유도만큼 가중됩니다. 등분산 가정이 들어오는 자리가 여기입니다. 두 집단을 하나의 모집단 흩어짐에서 나온 두 표본으로 취급하므로, 관측값이 많은 집단이나 자기 분산이 작은 집단이 하나의 공유 추정값에 비례해서 기여합니다. 두 분산이 크게 다르면 합동하는 일이 바로 잘못되는 지점이고, Welch 검정이 그 수리입니다
- p값
- 두 평균이 정말 같다면, 검정이 묻는 방향으로 적어도 이만큼 0에서 먼 통계량이 나올 확률입니다. 양측은 |t| 너머의 넓이를 두 배로 하고, 위쪽과 아래쪽 대립가설은 꼬리를 하나씩 씁니다. 여기서는 퍼센트로 보고되므로 5%가 익숙한 0.05이고, 가설이 주어진 데이터에 대한 진술이지 데이터가 주어진 가설에 대한 진술이 아닙니다
표본에서 평균과 표준편차를 얻었고, 목표치나 다른 집단과의 차이가 표집 잡음이 설명할 수 있는 것보다 큰지 알고 싶을 때 씁니다. 단일 표본 모드는 견주는 값이 고정된 수일 때를 다룹니다. 500그램을 채우도록 맞춘 기계, 5밀리미터라는 규격, 작년의 평균이 그렇습니다. 두 표본 모드는 두 양을 모두 재었고 어느 쪽도 특별하지 않은 경우를 다룹니다. 답을 읽기 전에 정해 둘 것이 둘 있습니다. 첫째는 꼬리 하나인지 둘인지입니다. 양측 검정은 두 집단이 어느 방향으로든 다른지를 묻고 올바른 기본값이며, 단측 검정은 방향이 있는 질문이라 답이 더 유리해지기 때문이 아니라 방향이 미리 정해져 있었기 때문에 골라야 합니다. 둘째는 등분산 가정이고, 두 표본 모드가 그것을 하면서 대신 점검해 주지는 못합니다. 드러나는 곳은 패널입니다. 입력한 두 표준편차가 가까우면 합동하는 값이 적고, 두 배 이상 차이 나면 Welch 검정이 원하는 쪽입니다. 이 페이지는 합동 검정을 계산합니다. 등분산인 경우에 대부분의 교과서와 대부분의 통계학자가 “t 검정”이라고 할 때 뜻하는 것이 그것이고, 가정을 짐작하는 대신 판단할 수 있도록 입력한 두 표준편차를 함께 보고합니다.
계산 예시
기본값: 표본평균 6을 목표치 5에 대고
- 표준오차: s / √n = 3 / 3 = 1
- t 통계량: (6 − 5) / 1 = 1 — 표본평균이 목표치 위로 표준오차 하나만큼 떨어져 있음
- 자유도: n − 1 = 8
- 양측 p값: 자유도 8인 t 분포에서 ±1 너머의 넓이이며 34.66%
한 단위 차이는 커 보이지만 표준오차를 옆에 놓으면 그렇지 않습니다. 표준오차 하나는 표집 잡음이 만들어 내는 범위 안쪽이고, p값이 그렇게 말합니다. 정규곡선과 견주면 가르치는 바가 있습니다. 분포가 정규였다면 같은 t = 1이 31.7%를 줄 텐데, 늘어난 3포인트는 열 번의 관측값에서 표준편차를 추정한 대가입니다.
t 통계량 2.306이 정확히 5%를 냄
- 표준오차: 3 / √9 = 1이므로 t 통계량이 평균 그 자체
- t 통계량: (2.306 − 0) / 1 = 2.306
- 자유도 8에서 95% 양측 t 경계는 2.306
- 경계에 정확히 앉아 있으므로 양측 p값이 정확히 5%
임계값 페이지가 반대 방향에서 만들어 내는 짝이고, 둘을 나란히 놓으면 같은 사실을 양 끝에서 읽은 것이라는 게 가장 분명해집니다. 그 페이지에 자유도 8의 95% 양측 t 경계를 물으면 2.306을 돌려주고, 2.306을 이 페이지에 넣으면 p값이 정확히 5%로 돌아옵니다. 그 사이에서 반올림된 것은 없습니다. 표준편차 3과 표본 크기 9가 표준오차를 정확히 1로 만들어서 통계량과 경계가 같은 수가 되도록 골랐기 때문입니다. 그것보다 조금 작은 통계량은 5% 위에, 조금 큰 통계량은 5% 아래에 앉을 것입니다.
흩어짐이 같은 두 집단 각각 열 명
- 합동 분산: ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4이므로 합동 표준편차는 2
- 표준오차: √(4 × (1/10 + 1/10)) = √0.8 = 0.8944
- t 통계량: (5 − 4) / 0.8944 = 1.118
- 자유도: 10 + 10 − 2 = 18이고 양측 p값은 27.83%
두 분산이 같으면 합동하는 일이 아무 일도 하지 않습니다. 합동 분산이 4로 나오는데, 두 집단이 각각 공급한 값과 정확히 같습니다. 표준오차는 어느 집단의 표준편차를 자기 √n으로 나눈 것보다 작습니다. 열 명짜리 평균 둘을 견주는 것이 열 명짜리 평균 하나를 추정하는 것보다 부정확한데, 표준오차가 0.6325가 아니라 0.8944입니다. 하나를 재는 대신 불확실한 양 둘을 빼기 때문이고, 그 대가는 비교가 표본 하나로는 답할 수 없는 질문에 답할 때만 치를 만합니다. 모집단 평균 칸이 화면에 있지만 이 모드에서는 쓰이지 않는다는 점도 보세요. 두 양을 다 재었으므로 어느 쪽도 고정된 목표가 아닙니다.
흩어짐도 크기도 다른 경우, 합동을 지켜봐야 할 때
- 합동 분산: ((9 × 4.41) + (11 × 3.24)) / 20 = (39.69 + 35.64) / 20 = 3.7665
- 표준오차: √(3.7665 × (1/10 + 1/12)) = √0.6905 = 0.831
- t 통계량: (5.2 − 4.1) / 0.831 = 1.3237
- 자유도: 10 + 12 − 2 = 20
합동 분산이 3.7665인데, 4.41과 3.24의 중간값이 아닙니다. 열두 명짜리 집단이 열 명짜리의 자유도 아홉에 대고 열하나를 내므로 더 무겁게 가중됩니다. 그 가중이 합동이라는 말의 내용 전부이고, 두 표준편차를 평균 내서는 답을 재현할 수 없는 이유입니다. 여기 두 흩어짐은 등분산 가정이 편안할 만큼 가깝습니다. 이 집단 크기에서 2.1과 0.6 같은 짝이라면 편안하지 않을 것이고, Welch 검정이 눈에 띄게 다른 p값을 낼 것입니다.
관측값 900개에서 나온 t = 1.96, t와 z가 만나는 자리
- 표준오차: 3 / √900 = 3 / 30 = 0.1
- t 통계량: (5.196 − 5) / 0.1 = 1.96
- 자유도: 899
- 양측 p값: 5.0304% — 정확히 5가 아니라 5를 조금 넘음
그 유명한 1.96은 정규곡선에서 5%를 내고 여기서는 5.0304%를 내는데, 그 간격이 이 예시의 요점입니다. 자유도 899에서 t 분포는 정규분포와 거의 구별되지 않지만 정확히 같지는 않습니다. 꼬리가 아직 조금 더 두꺼워서, 같은 통계량이 조금 더 바깥에 앉습니다. 큰 표본에서 t = 1.96이 자동으로 5% 유의가 아닌 이유이고, 0.0499를 보고하는 소프트웨어와 0.0501을 보고하는 소프트웨어가 같은 연구에 대해 셋째 자리에서 갈릴 수 있는 이유입니다.
한계
두 표본 모드는 두 집단이 분산을 공유한다고 가정하고, 그 가정은 표기를 정리하는 것이 아니라 실제로 일을 합니다. 집단 크기가 같으면 분산이 달라도 합동 검정이 제법 견고하지만, 크기가 다르고 분산도 다르면 검정이 어느 방향으로든 심하게 틀릴 수 있습니다. 이것이 베렌스-피셔 문제이고, Welch 검정이 그것을 풀려고 존재합니다. 두 표준편차가 패널에 있는 이유가 그것입니다. p값을 믿기 전에 둘을 견주고, 하나가 다른 하나의 두 배쯤을 넘으면서 집단 크기도 다르면 등분산 검정은 원하는 쪽이 아닙니다. 단일 표본 모드에는 그런 문제가 없지만 관측값이 독립이라고 가정하는데, 한 대상에 대한 반복 측정과 짝지은 자료나 군집 자료에서 이것이 깨지고, 그때는 대응표본이나 혼합모형이 필요합니다. 두 모드 모두 원래 데이터가 대략 정규분포라고 가정하고, 표본이 커질수록 그 가정에 둔감해집니다. 치우친 관측값 900개에 대한 t 검정이 합리적이고 치우친 관측값 9개에 대한 t 검정이 의심스러운 것을 만들어 내는 것이 중심극한정리입니다. 마지막으로 페이지는 통계량과 p값을 보고하고 결론은 내지 않습니다. 견줄 유의수준이 없고, 0.05라는 수는 결과가 아니라 관례이므로 판단은 있어야 할 자리에 남겨 둡니다.
자주 묻는 질문
- 이 페이지는 합동 분산 t검정인가요, Welch 검정인가요?
- 합동, 즉 등분산 검정이고 자유도가 n₁ + n₂ − 2입니다. 두 집단의 흩어짐과 크기가 다를 때는 Welch 검정이 더 나은 선택이고, 두 표준편차 칸이 패널에 있으니 확인할 수 있습니다. 하나가 다른 하나의 대략 두 배를 넘으면서 표본 크기도 다르면 원하는 쪽은 Welch이고, 이 페이지는 때로 상당히 어긋난 p값을 줄 것입니다. 등분산 버전을 여기 구현한 이유는 그것이 교과서의 검정이고, 참고 문헌이 등평균에 대한 두 표본 t 검정이라고 부르는 것이며, 자유도가 정수라서 이 페이지의 산수가 근사가 아니라 정확하기 때문입니다.
- 단측 검정과 양측 검정 중 무엇을 써야 하나요?
- 데이터를 보기 전에 방향이 정해져 있지 않았다면 양측입니다. 양측 검정은 두 집단이 아예 다른지를 묻고 유의수준을 양 끝에 나눕니다. 단측 검정은 한 집단이 더 큰지를 묻고 수준 전부를 그 꼬리에 둡니다. 같은 수준에서 유의에 이르기가 정확히 두 배 쉬운데, 1.96이 1.645가 되기 때문입니다. 질문이 정말로 방향을 가질 때는 정당한 선택이고, 차이가 어느 쪽으로 났는지를 본 뒤에 방향을 고르면 결과에 맞춘 사냥이 됩니다.
- t 통계량과 p값은 무엇이 다른가요?
- t 통계량은 차이를 표준오차 단위로 재고 표본 크기를 그 안에 품고 있으며, p값은 그 수를 해당 자유도의 t 분포를 써서 확률로 바꿉니다. 그래서 t는 “이 둘이 표준오차 몇 개만큼 떨어져 있나”에 답하고, p값은 “표집만으로 이런 간격이 얼마나 자주 나오나”에 답합니다. 둘 다 보고하는 이유는 앞엣것이 같은 설계의 연구끼리 견줄 수 있고, 뒤엣것이 유의수준과 견주는 대상이기 때문입니다. 어느 것도 효과의 크기는 아닙니다. 표본이 크면 하찮은 차이도 큰 t와 아주 작은 p값을 만들어 냅니다.
- t 통계량 1.96이 왜 정확히 5%를 내지 않나요?
- 1.96이 정규곡선의 5% 경계이고, t 분포는 유한한 자유도에서 언제나 꼬리가 조금 더 두껍기 때문입니다. 자유도 899에서 t = 1.96은 5.0304%로 선을 조금 넘고, 자유도 8에서 같은 통계량은 8.57%를 냅니다. t 분포는 자유도가 커지면서 정규분포로 수렴하고, 곡선은 처음부터 끝까지 같은 곡선이며 꼬리의 무게만 달라집니다. 손으로 1.96에 대고 계산하면 유의하다고 나오는데 소프트웨어가 0.0499를 보고할 수 있는 이유이고, 어느 쪽도 틀리지 않았습니다.
- t 통계량이 음수면 무슨 뜻인가요?
- 표본평균이 견주는 값보다, 또는 두 표본 모드에서 두 번째 집단의 평균보다 낮게 나왔다는 뜻입니다. 부호는 방향 정보이고 그 이상이 아닙니다. p값은 분포에 대한 그 크기로 계산됩니다. 양측 검정에서는 어느 쪽 극단이든 세므로 부호를 버립니다. 단측 검정에서는 부호가 중요하고 정보를 줄 수 있습니다. 위쪽 꼬리 대립가설에 대고 t = −2.5는 p값이 99% 근처로 나오는데, 그것은 영가설 결과가 아니라 반대쪽을 가리키는 증거이고, “유의하지 않음”으로 보고하면 그 정보를 버리는 셈입니다.
- t 검정에 관측값이 몇 개나 필요한가요?
- 페이지는 집단마다 최소 둘을 요구합니다. 관측값 하나짜리의 표준편차가 정의되지 않기 때문입니다. 그것은 수학적인 바닥이지 실무적인 권고가 아닙니다. 집단마다 둘인 t 검정은 자유도가 하나이고 엄청난 차이 말고는 탐지할 검정력이 거의 없어서, 두 집단이 거의 겹치지 않는 게 아니면 p값이 크게 나옵니다. 쓸모 있는 질문은 식이 허용하는 최소가 아니라 관심 있는 차이를 탐지하는 데 필요한 표본 크기이고, 그것은 데이터의 흩어짐과 알아채고 싶은 효과 크기에 달려 있습니다. 그 계산이 사는 자리는 표본 크기 페이지이고, 거기서는 데이터셋에서 앞으로 나아가는 대신 오차 범위에서 거꾸로 갑니다.
- t 임계값 표는 어디에 있나요?
- 임계값 페이지에 있고, 이 묶음에서는 거기에만 있습니다. 이 페이지가 표를 인쇄하지 않는 이유는 유의수준뿐 아니라 자유도로도 색인해야 해서, 유의수준마다 책 한 페이지가 되기 때문입니다. 답을 조회하지 않고 계산하는 이유도 그것입니다. 표는 누군가 인쇄하기로 고른 자유도만 나열할 수 있는데, 두 표본 검정이 만들어 내는 자유도 n₁ + n₂ − 2는 그 목록에 거의 없습니다. 머리에 담아 둘 만한 경계는 하나입니다. t 값이 표본이 커지면서 1.96으로 수렴하므로, 찾고 있는 표는 자유도가 커질수록 줄어드는 벌금이 붙은 정규분포표입니다.
참고 문헌
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods — 이 페이지가 구현한 합동 두 표본 검정이며, 합동 표준편차와 그 n₁ + n₂ − 2 자유도를 포함 — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods — 단일 표본 통계량을 만드는 표본평균과 표준오차 — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods — 자유도가 커질수록 t 분포가 다가가는 곡선이며, 1.96과 5%가 서로 근사적으로만 짝이 되는 이유 — National Institute of Standards and Technology (NIST)