기댓값 계산기
계산 결과
기댓값
- 표준편차
- 30.3356
- 분산
- 920.2500
기댓값 계산기는 결과값의 목록과 그 확률을, 그 결과들이 평균적으로 수렴하는 하나의 수로 바꿔 줍니다. 각 결과가 일어날 가능성에 비례해서 반영되는 가중 평균입니다. 결과들과 각각의 확률을 넣으면 페이지가 기댓값과 함께, 결과가 보통 그 값에서 얼마나 떨어져 놓이는지를 서술하는 두 수인 분산과 표준편차를 보고합니다. 이 개념은 보상과 가능성을 짝지을 수 있는 것은 무엇이든 덮습니다. 점수로 환산하는 주사위 눈, 보험료에 맞선 보험금, 복권 한 장, 내기, 수익이 셋으로 갈리는 사업이 그렇습니다. 답을 읽기 전에 알아 둘 특징이 둘 있습니다. 기댓값은 실제로 일어날 수 있는 값이 아닐 수도 있고(공정한 주사위의 기댓값은 주사위가 보여 줄 수 없는 수인 3.5입니다), 음수일 수도 있습니다. 음의 기댓값이 가장 쓸모 있는 읽기인데, 같은 결정을 오래 되풀이하면 평균적으로 손해라는 뜻이기 때문입니다. 한 판이 아무리 좋아 보여도 마찬가지입니다.
공식
E[X] = Σ pᵢ xᵢ Var(X) = Σ pᵢ (xᵢ − E[X])² σ = √Var(X)
- xᵢ
- 결과 하나, 곧 목록에서 i번째 값입니다. 음수여도 되고 소수여도 됩니다. 목록은 세미콜론, 쉼표, 공백으로 나눈 수열이고 최대 200개입니다
- pᵢ
- 그 결과의 확률이며 0에서 100까지의 백분율로 넣습니다. 두 목록은 나란히 읽히므로 세 번째 확률은 세 번째 결과의 것이고, 길이가 같아야 합니다
- E[X]
- 기댓값입니다. 각 결과에 자기 확률을 곱해 더한 값이고, 패널이 가장 먼저 보고하는 가중 평균이며, 페이지의 다른 수들이 견주어지는 유일한 기준입니다
- Var(X)
- 분산입니다. 결과마다 기댓값에서 떨어진 거리를 제곱하고 그 결과의 확률로 가중한 값입니다. 제곱하기 때문에 멀리 떨어진 결과 하나가 분산을 지배할 수 있습니다
- σ
- 분산의 제곱근인 표준편차입니다. 결과 자체와 같은 단위로 돌아오므로, 퍼짐이 얼마나 넓은지 알고 싶을 때 읽어야 하는 수가 이것입니다
- Σ
- 목록의 모든 결과에 대해 더하라는 기호입니다. 어느 것도 두 번 세지지 않고 어느 것도 빠지지 않습니다. 확률의 합이 100%가 되는 것이 목록 전체를 가능성에 대한 완전한 서술로 만듭니다
결과가 나열할 수 있을 만큼 적고 각각에 이름 붙일 수 있는 확률이 있을 때 쓰세요. 지급표가 있는 게임, 정해진 금액을 받고 알려진 비율의 사고에 지급하는 보증, 시나리오가 셋인 결정이 그렇습니다. 수가 관측값이지 가능성이 아닐 때는 산술 평균 쪽으로 가세요. 측정값의 목록에는 기댓값이 아니라 평균이 필요하고, 개수로 나누는 것은 모든 값이 똑같이 그럴듯하다고 가정하는 것인데, 이 페이지는 바로 그 가정을 명시적인 확률로 바꿔 놓은 것입니다. 결과가 공식으로 서술할 수 있는 규칙을 따르기 시작하면 분포 쪽으로 가세요. 정해진 시행 횟수 가운데 성공 횟수는 자기만의 평균을 갖고, 푸아송 계수는 평균이 분산과 같으므로 계수마다 그 확률을 일일이 적을 필요가 없습니다. 장기는 이 수들이 모두 뜻을 갖는 틀입니다. 기댓값은 여러 번 되풀이할 때 평균이 수렴해 가는 값이지, 다음 한 번에 대한 예보가 아닙니다.
계산 예시
확률이 고르지 않은 결과 다섯 가지
- 각 결과에 확률을 분수로 곱합니다. 5 × 0.10 = 0.5, 10 × 0.20 = 2, 20 × 0.30 = 6, 40 × 0.25 = 10, 100 × 0.15 = 15
- 다섯 곱을 더합니다. 0.5 + 2 + 6 + 10 + 15 = 33.5이고, 이것이 기댓값입니다
- 분산은 각 결과에서 33.5를 빼고 제곱해 가중합니다. 0.10 × 812.25 + 0.20 × 552.25 + 0.30 × 182.25 + 0.25 × 42.25 + 0.15 × 4422.25 = 920.25
- 920.25의 제곱근인 30.3356이 표준편차입니다
확률은 백분율로 넣으며, 여기서 가장 틀리기 쉬운 것이 바로 그것입니다. 10을 10퍼센트가 아니라 분수로 읽으면 33.5가 아니라 3.35가 나오는데, 틀린 답은 어디 하나 틀려 보이지 않습니다. 퍼짐도 한 번 더 볼 만합니다. 기댓값 33.5에 대해 표준편차가 30.34라는 것은 15%로 그리 흔하지 않은 100이라는 결과가 일을 거의 다 하고 있다는 뜻이고, 분산 920.25는 같은 사실을 제곱 단위로 말합니다.
공정한 주사위: 나올 수 없는 답
- 결과가 여섯이고 각각의 확률이 16.67%입니다. 여섯 개가 정확히 100이 되도록 마지막 하나가 16.65%를 집니다
- 각 곱은 1 × 0.1667에서 6 × 0.1667까지이고, 더하면 3.4995입니다
- 분산은 3.4995에서 떨어진 거리를 제곱한 것의 평균이고, 2.916입니다
- 2.916의 제곱근은 1.7076입니다
기댓값이 불가능해 보일 때 떠올릴 예가 이것입니다. 육면체 주사위의 정답은 3.5이고, 어떤 면도 그 수를 보여 주지 않습니다. 기댓값은 분포 전체의 성질이지 한 번의 굴림에 대한 예측이 아닙니다. 표준편차가 제 몫을 하는 가장 깔끔한 경우이기도 합니다. 1.7076은 눈과 같은 단위로 재어지므로 굴림이 평균적으로 3.5에서 1.7쯤 떨어진 곳에 놓인다는 문장을 그대로 쓸 수 있고, 분산 2.916은 제곱한 눈 단위입니다.
보험금과 음의 기댓값
- 결과가 둘입니다. 아무 일도 없거나, 일이 생겨 5,000이 나가거나. −5000으로 적습니다
- 가중합니다. 0 × 0.97 + (−5000) × 0.03 = −150
- 분산은 0.97 × (0 + 150)² + 0.03 × (−5000 + 150)² = 727,500입니다
- 그 제곱근이 852.9361입니다
음의 기댓값은 오류도 아니고 계산을 피할 이유도 아닙니다. 실제 질문에 대한 답이고, 사람들이 이 페이지에 가장 흔히 들고 오는 것이 바로 그것입니다. 어떤 사건이 5,000을 잃을 확률이 3%라면 기간마다 평균적으로 150이 나가고, 150보다 비싼 보험료는 그 위험을 직접 지지 않는 값입니다. 표준편차 852.94가 그 자체로는 얼마나 말해 주지 않는지도 눈여겨보세요. 같은 희귀한 3% 가지가 지배하고 있어서, 결과들이 흥미롭게 퍼져 있다기보다 손실이 크고 드물다는 사실을 되풀이할 뿐입니다.
가중 평균이 단순 평균과 다른 이유
- 네 결과를 더하면 160이므로 단순 평균은 40입니다
- 가중하면 10 × 0.40 + 20 × 0.30 + 30 × 0.20 + 100 × 0.10 = 4 + 6 + 6 + 10 = 26입니다
- 분산은 0.40 × 256 + 0.30 × 36 + 0.20 × 16 + 0.10 × 5476 = 664입니다
- 그 제곱근이 25.7682입니다
두 수가 3분의 1 넘게 차이 나는데, 그 이유는 전부 확률에 있습니다. 큰 결과인 100이 무게의 10%만 지고, 작은 결과인 10과 20이 둘을 합쳐 70%를 집니다. 누군가 가중인지 말하지 않고 평균을 인용할 때 그 말 뒤에 숨어 있는 간격이 이것입니다. 확률 0이 빈칸이 아니라 뜻 있는 입력인 이유도 같습니다. 그 결과는 목록에서 제자리를 차지한 채 아무것도 보태지 않는데, 그것이 불가능과 묻지 않음의 차이입니다.
한계
이 페이지에서 잘못 읽기 쉬운 것이 셋 있고, 셋 다 산수가 아니라 입력에 관한 것입니다. 확률의 합은 100%여야 하고, 페이지는 그것을 대신 고쳐 주기를 거부합니다. 40과 50을 조용히 44.4와 55.6으로 다시 맞추면 지극히 평범해 보이는 수가 나오지만, 그것은 여러분이 묻지 않은 질문에 대한 답입니다. 허용 오차는 항목마다 마지막 자리의 절반이라서, 33.33으로 적은 세 몫은 99.99로 받아들여지고 40과 50의 짝은 그렇지 않습니다. 두 목록은 길이가 같아야 합니다. 항목이 나란히 읽히기 때문입니다. 빠진 확률은 0이 아니라 어긋난 배치이고, 페이지는 엉뚱한 수를 조용히 짝지어 주는 대신 그렇게 말합니다. 입력을 넘어서면 해석에도 한계가 있습니다. 기댓값은 되풀이의 장기를 서술하므로 한 번의 사건에 대해서는 쓸모 있는 말을 하지 않고, 드물고 극단적인 결과가 그것을 지배할 수 있는데 그 사실은 수 하나만 봐서는 드러나지 않습니다. 그럴 때는 옆의 표준편차나 분산을 함께 읽으세요. 또 여기서는 입력한 확률이 진짜라고 가정합니다. 모든 것이 여러분이 준 수 위의 산수이고, 추측한 확률 위에 세운 정확한 기댓값은 다른 질문에 대한 정확한 답입니다. 마지막으로 이 페이지에는 흔한 기댓값을 모아 둔 표가 없습니다. 그런 표는 여러분이 입력한 결과와 확률을 볼 수 없고, 위 패널과 어긋나는 표는 없는 것보다 나쁘기 때문입니다.
자주 묻는 질문
- 기댓값은 실제로 무엇을 알려 주나요?
- 같은 상황을 여러 번 되풀이해 결과를 평균 내면 보게 될 평균적인 결과를 알려 줍니다. 각 결과가 얼마나 자주 나오는지에 따라 가중하면서요. 지급표가 있는 게임이라면 손익분기 가격입니다. 한 판의 기댓값이 −150이면 공정한 참가비는 150이고, 그보다 싼 값은 여러분에게 유리합니다. 다만 다음에 무슨 일이 일어나는지는 알려 주지 않습니다. 한 판은 목록 가운데 결과 하나를 낼 뿐 결코 그 평균 자체를 내지 않으므로, 기댓값이 양수여도 몇 판만 해서 매번 잃는 것은 얼마든지 가능합니다.
- 기댓값이 결코 나올 수 없는 수일 수 있나요?
- 그럴 수 있고, 보통 그렇습니다. 공정한 주사위의 여섯 면은 각각 확률이 16.67%이고 기댓값은 3.5인데, 주사위에는 그런 면이 없습니다. 기댓값은 목록 전체의 가중 평균이지 목록의 구성원이 아니기 때문입니다. 분포의 균형점이고, 균형점은 무게들 사이의 빈 공간에 놓일 수 있습니다. 복권도 같습니다. 기댓값은 작은 음수인데, 어떤 복권도 그 수를 만들어 내지 못합니다.
- 확률의 합이 100%여야 하는 이유는 무엇인가요?
- 같은 가능성의 집합을 서술하는 두 목록이라면 그 가능성을 모두 설명해야 하기 때문입니다. 확률의 합이 90%라면 목록에서 결과가 빠졌거나 확률 하나가 틀린 것이고, 페이지는 어느 쪽인지 알 방법이 없습니다. 그래서 추측하는 대신 합계를 보고합니다. 여러분의 수를 100%로 다시 맞추지 않는 것도 일부러입니다. 40과 50을 그 합으로 나누면 44.4와 55.6이 되어 여러분이 묻지 않은 질문에 대한 답이 나오는데, 패널에는 그런 일이 일어났다는 표시가 하나도 없습니다. 허용 오차는 항목마다 마지막 자리의 절반이라서, 33.33으로 적은 세 몫은 더하면 99.99이지만 받아들여집니다.
- 산술 평균과는 어떻게 다른가요?
- 산술 평균은 값의 개수로 나누는데, 그것은 모든 값이 똑같이 그럴듯하다고 가정하는 것과 같습니다. 기댓값은 그 가정을 여러분이 고른 확률로 바꿔 놓아서, 확률이 10%인 값은 확률이 100%인 값보다 결과를 열 배 덜 끌어당깁니다. 둘은 확률이 모두 같을 때만 일치합니다. 결과 넷이 각각 25%라면 두 방식이 같은 수를 줍니다. 어긋날 때 그 차이는 전적으로 무게에 있고, 그래서 가중인지 밝히지 않은 평균은 한 번쯤 물어볼 값어치가 있습니다.
- 음의 기댓값은 무엇을 뜻하나요?
- 지는 쪽의 결과가 나머지를 누르고 돌려세울 만큼 크거나 그럴듯하다는 뜻이고, 그래서 그 결정을 되풀이하면 평균적으로 손해가 난다는 뜻입니다. 반드시 잃는다는 말과는 다릅니다. 5,000을 잃을 확률 3%와 아무 일도 없을 확률 97%의 기댓값은 −150이고, 대부분의 기간에는 아무 비용도 들지 않습니다. 음수라는 사실이 말해 주는 것은 그 위험이 평균적으로 얼마의 값어치인지이고, 그것이 보험료나 가격, 보험 견적과 견주어 볼 수입니다. 이 계산이 가장 자주 쓸모 있는 자리가 여기이고, 여기서 음수로 나오는 것은 실패가 아니라 결과입니다.
- 이 페이지에는 왜 기댓값 표가 없나요?
- 답이 여러분이 입력한 두 목록에 전적으로 달려 있고, 참조표는 그것을 볼 수 없기 때문입니다. 사람들이 원하는 표는 주사위, 복권, 룰렛 내기 같은 익숙한 사례의 짧은 목록이지만, 그 하나하나가 저마다의 결과와 확률을 갖고 있어서 인쇄된 한 줄은 패널의 질문과 다른 질문에 답하는 셈이 되고, 둘이 공개적으로 어긋날 때도 생깁니다. 패널이 곧 그 표입니다. 결과와 확률을 바꾸면 같은 세 줄이 다시 계산됩니다. 고정된 표가 진짜로 도움이 되는 페이지는 표가 입력에 달려 있지 않은 경우입니다. 등급 기준이나 구간 경계 같은 것이 그렇습니다.
참고 문헌
- Measures of the Center of the Data — Introductory Statistics 2e, section 2.5 — 값 목록의 균형점으로서의 평균과, 극단적인 값 하나가 그것을 어떻게 옮기는지. 기댓값이 목록의 어느 결과와도 멀리 떨어져 있을 수 있는 이유 — OpenStax, Rice University
- Measures of the Spread of the Data — OpenStax, Introductory Statistics 2e, section 2.7 — 분산이 편차의 제곱의 평균이라고 밝히며, 이 페이지가 그것을 똑같이 세는 대신 확률로 가중하는 그 양입니다 — OpenStax, Rice University
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods — 결과가 분포를 갖는다는 것의 뜻과, 결과에 부여된 확률을 그 결과에서 읽어 내는 방법 — National Institute of Standards and Technology (NIST)