상대 위험도 계산기
계산 결과
상대 위험도(RR)
- 오즈비(OR)
- 1.7143
상대 위험도 계산기는 한 결과가 두 집단에서 얼마나 자주 일어났는지 견줍니다. 집단마다 사례 수와 총 인원을 입력하면 위험비, 즉 노출군의 위험을 대조군의 위험으로 나눈 값을 돌려줍니다. 값이 1이면 두 집단이 그 결과를 겪을 가능성이 같았고, 1보다 크면 노출군이 더 가능성이 컸고, 1보다 작으면 덜했습니다. 이 페이지는 오즈비도 함께 돌려주는데, 많은 연구가 실제로 보고하는 수가 그것이고 위험비와 같은 것이 아니기 때문입니다. 결과가 드물 때는 둘이 일치하고 흔해질수록 벌어집니다. 흔한 결과를 다룬 코호트 연구에서는 오즈비가 위험비의 1.5배까지 커질 수 있고, 하나를 다른 하나로 읽는 것이 발견을 부풀리는 표준적인 방법입니다. 둘 다 같은 네 개의 도수에서 나오고, 그 도수가 화면에 있으므로 모든 단계를 손으로 확인할 수 있습니다.
공식
RR = (a / n₁) ÷ (c / n₂) OR = (a · d) / (b · c)
- a
- 노출군의 사례 수, 즉 노출과 결과를 모두 가진 사람들입니다. 비의 첫 번째 위험의 분자이고, 오즈비에 대한 노출군의 기여이기도 합니다. 도수 한 묶음이 두 답을 모두 먹여 살리는 이유가 이것입니다
- n₁
- 노출군의 크기이며 사례와 비사례를 합한 값입니다. 위험은 도수를 이 총계로 나눈 값이라, 같은 사례 서른 건이 백 명 중에서는 만 명 중과 아주 다른 뜻을 갖습니다. 위험비는 비율의 비교이지 도수의 비교가 아니고, 두 집단의 크기가 그것을 견줄 수 있게 만듭니다
- c
- 비노출군, 즉 대조군의 사례 수입니다. a와 c가 있으면 두 위험을 바로 적을 수 있고, 그 비가 몫입니다. 이 값이 0이면 페이지는 계산을 거부하는데, 그 거절은 의도한 것입니다. 사례가 하나도 없는 대조군은 위험이 0이고, 0으로 나누는 것은 무한이 아니라 정의되지 않습니다
- n₂
- 비노출군의 크기입니다. 두 집단의 크기는 같을 필요가 없고 흔히 같지 않습니다. 코호트 연구는 노출군보다 비노출군을 훨씬 많이 추적할 수 있고, 각 위험이 자기 집단 안에서 계산되므로 식은 보정 없이 그것을 감당합니다
- b, d
- 각 집단의 비사례이며, 페이지가 묻지 않고 유도합니다. 오즈비에만 나오고 b = n₁ − a, d = n₂ − c입니다. 유도하는 덕분에 네 입력이 서로 모순될 수 없습니다. 자유로운 네 칸은 사례 수가 집단 크기를 넘어서는 표를 서술할 수 있기 때문입니다
두 집단을 앞으로 추적해서 얻은 도수가 있고 그 위험의 비를 원할 때 씁니다. 코호트 연구가 추정하도록 만들어진 효과 크기입니다. 두 출력은 미묘하게 다른 질문에 답하고, 둘 사이의 선택은 보통 취향이 아니라 연구 설계가 합니다. 위험비가 둘 중 해석하기 쉬운 쪽입니다. 2라는 것은 노출군의 위험이 두 배였다는 뜻이고, 그 문장은 설명이 필요 없습니다. 오즈비는 환자-대조군 연구에서 나오는 것입니다. 그 설계에서는 사례의 비율을 연구자가 정하므로 위험을 아예 추정할 수 없고, 오즈비만 복원할 수 있습니다. 로지스틱 회귀가 보고하는 것도 그것입니다. 결과가 드물면 둘이 충분히 가까워서 오즈비를 위험비로 읽어도 큰 무리가 없고, 이것이 그렇게 하는 관행의 근거입니다. 결과가 흔하면 둘이 갈라지는데, 방향은 늘 같습니다. 오즈비가 1에서 더 멀어서, 보호적인 노출은 더 보호적으로 보이고 해로운 노출은 더 해롭게 보입니다. 이 페이지가 같은 표에서 둘을 다 계산하는 이유는 그 간격을 가정으로 지우는 대신 보이게 하기 위해서입니다. 설계를 염두에 두고 읽으세요. 연관은 인과가 아니고, 이 네 수 가운데 결과를 일으킨 노출과 그저 함께 다닌 노출을 구별하는 것은 하나도 없습니다.
계산 예시
기본값: 노출군 100명 중 30명, 비노출군 100명 중 20명
- 노출군의 위험: 30 / 100 = 0.30, 즉 30%
- 비노출군의 위험: 20 / 100 = 0.20, 즉 20%
- 위험비: 0.30 / 0.20 = 1.5 — 노출군의 위험이 1.5배
- 비사례 유도: b = 70, d = 80이므로 오즈비는 (30 × 80) / (70 × 20) = 2400 / 1400 = 1.7143
이만큼 흔한 결과에서 두 답이 14% 차이 나고, 둘을 다 보는 것이 페이지가 둘을 다 계산하는 이유입니다. 위험비는 위험이 50% 더 크다고 말하고, 오즈비는 오즈가 71% 더 높다고 말합니다. 어느 쪽도 틀리지 않았습니다. 서로 다른 양이기 때문입니다. 다만 1.71을 “위험이 71% 증가”라고 인용한 보고서는 둘을 뒤섞은 것이고, 의학과 사회과학 연구 결과를 읽을 때 가장 흔한 오류 가운데 하나입니다. 두 집단의 크기가 같아야 하는 것은 아니고, 여기서는 퍼센트를 둥글게 만들기 위해서만 그렇게 골랐습니다.
연관이 강해지면 두 척도 사이의 간격도 벌어짐
- 노출군의 위험: 45 / 150 = 0.30
- 비노출군의 위험: 15 / 150 = 0.10
- 위험비: 0.30 / 0.10 = 3, 세 배의 위험
- 오즈비: (45 × 135) / (105 × 15) = 6075 / 1575 = 3.8571
위험비가 3일 때 오즈비는 3.86에 이르렀고, 절대 간격이 앞 예시의 0.21이 아니라 거의 한 단위입니다. 이 무늬는 우연이 아니라 체계적입니다. 오즈비는 언제나 1에서 더 멀리 있고, 그 거리는 연관의 강도와 결과의 빈도에 따라 함께 커집니다. 드문 결과 규칙을 기억해 둘 만한 이유가 이것입니다. 작은 기술적 주의사항이 아니라, 오즈가 286% 올랐다고 보고하는 것과 위험이 200% 올랐다고 보고하는 것의 차이입니다.
위험이 더 낮은 쪽과 연관된 노출
- 노출군의 위험: 10 / 100 = 0.10
- 비노출군의 위험: 25 / 100 = 0.25
- 위험비: 0.10 / 0.25 = 0.4 — 위험이 60% 줄어듦
- 오즈비: (10 × 75) / (90 × 25) = 750 / 2250 = 0.3333, 오즈가 67% 줄어듦
1 아래에서도 방향은 같습니다. 오즈비가 위험비보다 1에서 멀어서, 노출이 실제보다 더 보호적으로 보입니다. 어느 틀에서든 감소를 조심스럽게 말할 만합니다. 위험비 0.4는 위험이 60% 줄었다는 뜻이지 60%로 줄었다는 뜻이 아닙니다. 두 읽기는 비가 1에서 멀어질수록 빠르게 벌어지고, 둘을 뒤섞은 보고서는 작은 효과를 극적으로 만들 수도 그 반대로 만들 수도 있습니다.
결과가 드물어 두 척도가 거의 포개지는 경우
- 노출군의 위험: 2000 / 100000 = 0.02, 즉 2%
- 비노출군의 위험: 1000 / 100000 = 0.01, 즉 1%
- 위험비: 0.02 / 0.01 = 2
- 오즈비: (2000 × 99000) / (98000 × 1000) = 198000000 / 98000000 = 2.0204 — 위험비와 1% 안쪽
드문 결과 근사가 외울 규칙이 아니라 산수로 여기 보입니다. 위험이 2%면 비사례가 사례를 압도해서, 비사례 수로 나누는 것과 집단 총계로 나누는 것이 거의 같아지고 오즈비가 위험비 위로 접혀 들어갑니다. 이 집단 크기들은 코호트 연구의 현실적인 모양이기도 합니다. 십만 명을 추적해 이천 건의 사건을 관찰하는 식입니다. 앞의 예시들이 퍼센트를 읽기 쉽게 유지하려고 작고 둥근 수를 쓴 것과 대조됩니다.
한계
페이지는 비를 돌려주고 그 노출이 결과를 일으켰는지에 대해서는 아무 주장도 하지 않습니다. 위험비 3은 노출군의 위험이 세 배였다고 말합니다. 노출이 그 위험을 만들어 냈다고는 말하지 않고, 네 도수는 원인과 우연히 함께 다니는 표지를 구별할 수 없습니다. 노출과 결과 모두와 연관된 변수가 고전적인 사례입니다. 두 집단을 같은 기간 동안 추적했다고도 가정하거나, 도수가 이미 공통 기간으로 환산되어 있다고 가정합니다. 발생은 쌓이므로 이 년 동안 관찰한 집단은 그렇지 않은 같은 집단을 일 년 관찰한 것의 대략 두 배 사례를 갖게 되는데, 입력만으로는 그것이 드러나지 않습니다. 영(0) 칸 거절은 빠뜨린 것이 아니라 의도한 한계입니다. 모든 칸에 작은 상수를 더하면 답이 지어낸 반쪽짜리 사람에 달리게 되므로, 페이지는 대신 물러서서 데이터가 너무 얇다는 것을 사용자가 보게 합니다. 환자-대조군 자료가 마지막 경계입니다. 그 설계에서는 연구자가 사례를 몇 건 모을지 정하므로 각 집단의 사례 비율이 표집의 인공물이고, 그 도수로 계산한 위험비는 무의미합니다. 오즈비는 대칭이라 살아남고, 환자-대조군 연구가 위험비가 아니라 오즈비를 보고하는 이유가 정확히 그것입니다.
자주 묻는 질문
- 상대 위험도와 오즈비는 무엇이 다른가요?
- 상대 위험도는 확률의 비이고 오즈비는 오즈의 비이며, 결과가 흔해질수록 둘이 갈라집니다. 위험이 30%와 20%일 때 위험비는 1.5이고 오즈비는 1.7143이며, 위험이 2%와 1%일 때는 2와 2.0204입니다. 오즈비는 언제나 1에서 더 멀어서, 해로운 노출은 더 해롭게 보이고 보호적인 노출은 더 보호적으로 보입니다. 결과가 드물면 차이가 무시할 만하고, 오즈비를 위험비로 읽는 잘 알려진 요령의 근거가 그것입니다. 그 요령은 천 명에 한 명이 걸리는 질병에는 안전하고, 셋에 한 명이 겪는 결과에는 안전하지 않습니다.
- 대조군에 사례가 하나도 없으면 왜 거절하나요?
- 그 집단의 위험이 0이고 위험비가 그것으로 나누게 되기 때문입니다. 어떤 소프트웨어는 모든 칸에 작은 수를 더해 처리하는데(할데인-안스콤 보정), 그러면 답이 지어낸 반쪽짜리 사람에 달리게 되고, 도수가 작을 때 결과가 눈에 띄게 움직입니다. 도수가 작을 때가 바로 이 문제가 생기는 때입니다. 이 페이지는 대신 오류를 돌려주어 문제가 드러나게 합니다. 대조군에 사례가 하나도 없으면 데이터가 효과의 위쪽을 묶을 수 없고, 어떤 유한한 수든 발견이 아니라 보정의 인공물이 됩니다. 진짜 해결은 데이터를 더 모으는 것뿐입니다.
- 환자-대조군 자료에 써도 되나요?
- 오즈비는 되고 상대 위험도는 안 됩니다. 환자-대조군 연구에서는 연구자가 사례를 몇 건, 대조군을 몇 명 모을지 정하므로 각 집단의 사례 비율이 관측된 것이 아니라 표집 설계가 정한 값입니다. 그러면 두 위험이 추정값으로서 무의미해집니다. 그러나 오즈비는 영향을 받지 않는데, 사례와 대조군에 대해 대칭이기 때문입니다. 표의 행과 열을 바꿔도 값이 그대로입니다. 환자-대조군 연구가 오즈비를 보고하는 이유가 정확히 이것이고, 그 도수로 계산한 위험비는 산수가 돌아가더라도 해석해서는 안 되는 이유도 이것입니다.
- 상대 위험도가 정확히 1이면 무슨 뜻인가요?
- 이 표본에서 두 집단의 위험이 같았다는 뜻이고, 따라서 노출이 결과와 연관을 보이지 않는다는 뜻입니다. 모집단에 연관이 없다는 뜻은 아닙니다. 표본은 참 비가 다른데도 정확히 1이나 다른 어떤 값을 쉽게 만들어 낼 수 있습니다. 비 둘레의 신뢰구간이 필요한 이유가 이것이고, 점추정만 보고하는 연구가 불완전한 이유도 이것입니다. 이 페이지는 추정값과 그 짝이 되는 척도에서 일부러 멈춥니다. 구간은 로그 비의 표준오차를 필요로 하고, 그것은 같은 네 도수를 다르게 읽는 것이 아니라 한 단계 더 나아간 계산이기 때문입니다.
- 상대 위험도 3은 제 위험이 세 배가 된다는 뜻인가요?
- 이 연구에서 노출군의 위험이 비노출군의 세 배였다는 뜻입니다. 그것이 본인의 위험에 큰 변화인지는 기저 위험에 달려 있고, 비는 그 정보를 나르지 않습니다. 비노출군의 위험이 십만 명에 한 명이면 세 배가 되어도 십만 명에 세 명이라 여전히 작습니다. 백 명에 한 명이면 세 배는 대응할 만한 변화입니다. 이것이 상대 위험과 절대 위험의 차이이고, 드문 결과에 대해서도 극적으로 들리는 비를 연구가 보고할 수 있는 이유입니다. 비와 함께 두 기저 위험을 항상 물으세요.
- 입력이 네 칸이 아니라 사례 수와 총 인원인 이유는 무엇인가요?
- 자유로운 네 칸은 불가능한 표를 서술할 수 있기 때문입니다. 네 도수를 따로 물으면 같은 집단에서 100명 중 사례 30명과 비사례 70명을 동시에 입력하는 것을 막을 것이 없습니다. 부분끼리 모순되는 표이고, 아무 불평 없이 계산되어 의미 없는 수를 만들어 냅니다. 집단마다 사례 수와 총 인원을 물으면 나머지 두 칸이 정해져서, 오즈비가 쓰는 비사례 수가 위험비가 쓰는 위험과 언제나 일관됩니다. 대가는 입력 하나가 줄어드는 것이고, 이득은 앞뒤가 맞지 않는 표가 흔치 않은 것이 아니라 표현 불가능해지는 것입니다.
참고 문헌
- 3.1 Terminology — Introductory Statistics 2e — 확률을 장기적인 비율로 보는 관점이며, 각 집단의 위험이 바로 그것이고 두 위험의 비가 의미를 갖게 하는 근거 — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods — 도수를 집단 총계로 나눈 값을 확률의 추정값으로 쓰는 단계와, 그 추정값이 나르는 표집 변동 — National Institute of Standards and Technology (NIST)