共分散計算
計算結果
共分散
- 相関係数(r)
- 0.7746
- 1つ目のデータセットの平均
- 3.0000
- 2つ目のデータセットの平均
- 4.0000
- 1つ目のデータセットの標準偏差
- 1.5811
- 2つ目のデータセットの標準偏差
- 1.2247
- 件数
- 5
共分散は、対応する2組のデータが一緒に動くかどうか、つまり連動しているかどうかを測る数です。1つ目のデータセットのある値がその平均より上にあるとき、同じ位置にある2つ目のデータセットの値も平均より上にあることが多いか、という問いになります。2組のリストを貼り付けると、共分散とその符号、そして隣に、単位の消えた相関係数が返ります。2組の平均と標準偏差もあわせて印字されるので、途中の計算を1歩ずつ確かめられます。並べ替えは行いません。1つ目のリストの1番目は2つ目のリストの1番目と組になるので、入力した順番そのものがデータの一部です。2組の行数は同じでなければならず、xの行とyの行を1対1で対応させてください。既定のx = 1、2、3、4、5とy = 2、4、5、4、5では、共分散は1.5、相関係数は0.7746です。
公式
共分散 = Σ(xᵢ − x̄)(yᵢ − ȳ) ÷ 除数(n − 1:標本、n:母集団)。r = 共分散 ÷ (sₓ × s_y)
- xᵢ, yᵢ
- 組になった値どうしです。1つ目のリストのi番目は2つ目のリストのi番目と組になり、どちらのリストも並べ替えません。組は位置で決まるので、片方の順番を入れ替えると答えが変わります。2組の長さは同じでなければなりません
- x̄, ȳ
- それぞれのリストの平均で、どちらも結果に印字されます。各値は自分のリストの平均からの偏差として計算に入るので、リストのすべての値から同じ数を引いても共分散は変わりません
- n
- 組の数、つまりどちらかのリストの長さで、ここでは最大200です。母集団の共分散ではそのまま除数になり、標本では1を引いたものが除数になります
- sₓ, s_y
- それぞれのリストの標準偏差で、標本・母集団の設定は共分散と同じです。共分散を相関係数に変えるのがこの2つで、印字されているのでパネルの中の数だけでrを計算し直せます
- 共分散
- 共分散そのものです。2組が一緒に増えたり減ったりする傾向にあるときは正、片方が増えると片方が減るときは負、線形の関係が弱いときは0に近くなります。単位はxの単位とyの単位を掛けたものになります
- r
- ピアソンの相関係数で、共分散 ÷ (sₓ × s_y) です。この割り算で単位が約分され、値は−1から1の間に収まります。共分散と違って、リストを定数倍しても値が変わらず、標本と母集団の設定でも同じ数になります
同じ対象から2つの測定を取っていて、それらが足並みをそろえて動くかどうかが知りたいときに使います。身長と体重、勉強時間と得点、気温と電力使用量、同じセンサーを2つの時点で読んだ値がそれです。標準偏差が2変数に一般化した量にあたり、相関も回帰の傾きもポートフォリオの分散も、この数の上に組み立てられています。読むべきなのは符号で、大きさではありません。xをメートルで測るかセンチメートルで測るかで共分散は100倍変わりますが、関係そのものは何も変わっていません。だからこのページは、単位の消えた相関係数を隣に印字します。共分散は因果を何も語らず、直線しか見ません。きれいな曲線の関係にある2組でも、共分散は0になり得ます。
計算例
一緒に増える5組:共分散1.5、r = 0.7746
- 平均:x̄ = (1+2+3+4+5) ÷ 5 = 3、ȳ = (2+4+5+4+5) ÷ 5 = 4
- 平均からの偏差:xは−2、−1、0、1、2、yは−2、0、1、0、1
- 偏差どうしの積の和:(−2)(−2) + (−1)(0) + (0)(1) + (1)(0) + (2)(1) = 4 + 0 + 0 + 0 + 2 = 6
- 標本の除数はn − 1 = 4:共分散 = 6 ÷ 4 = 1.5
- 標準偏差は1.5811と1.2247なので、r = 1.5 ÷ (1.5811 × 1.2247) = 0.7746
符号が正であることが、共分散を読むときにいちばん大事なところです。xが平均より大きいときはyも平均より大きい、という関係になっています。大きさの1.5はxの単位とyの単位を掛けたもので、どちらかのリストを定数倍すれば変わってしまいます。だからこそ単位の消えた相関係数が隣に並びます。rは0.7746で、上向きの関係ははっきりしていますが、直線からは程遠い値です。4と4の組が一直線の並びから外れているためです。
同じ組を母集団として扱う:共分散1.2、rは変わらない
- 和は同じ:偏差の積の和はやはり6で、平均も3と4のまま
- 母集団の除数はn = 5:共分散 = 6 ÷ 5 = 1.2。標本の値より小さいのは、除数が大きいため
- 2つの標準偏差も同じ理由で小さくなる:1.4142と1.0954
- r = 1.2 ÷ (1.4142 × 1.0954) = 0.7746。前とまったく同じ
除数を切り替えると共分散と2つの標準偏差は動きますが、相関係数は動きません。n − 1とnがその比の中で約分されるためです。だからこのページで出した共分散を他所で報告された値と比べるときは、標本か母集団かを先に確かめてください。1.5と1.2で食い違っている2つの資料が、関係の強さについては完全に一致している、ということが起こります。
完璧な曲線なのに共分散は0
- 平均:どちらのリストも3
- 平均からの偏差:xは−2、−1、0、1、2、yは−2、1、2、1、−2
- 積の和:4 − 1 + 0 + 1 − 4 = 0
- 共分散:0 ÷ 4 = 0。r = 0 ÷ (1.5811 × 1.8708) = 0でもある
2つ目のリストは逆さのU字で、1、4、5、4、1は完全に規則的な形をしています。それでも1から5との共分散は正確に0になります。共分散が拾えるのは直線の関係だけで、ここでは2つ目のリストが増えてから減るので、正の寄与と負の寄与がきれいに打ち消し合います。したがって共分散がほぼ0というのは「線形の関係がない」という意味であって、「関係がない」という意味では決してありません。1つの数では散布図の代わりにならない理由がここにあります。
適用限界
共分散は相関係数ではなく、相関係数として読んではいけません。大きさは2組の単位の取り方に依存するので、尺度の違う変数の組どうしで比べることはできず、大きさを判断する上限もありません。直接読めるのは符号だけです。しかも拾えるのは線形の関係だけなので、強い曲線の関係でも共分散は0の近くになります。組で計算する量なので、2組の行は1対1でそろっていなければなりません。長さが違えば、片方の欠けや余りがそれ以降の組をすべてずらします。どちらかのリストにまったく変化がない場合も答えを出しません。値がすべて同じなら標準偏差が0になり、相関係数が定義できないためです。このページは0で割った値を印字するのではなく、答えないという選択をします。リストは200組までで、桁の間にコンマを入れた入力は推測せずに拒否します。国によっては数字の間のコンマが小数点を意味するためです。因果はここでは何も分かりません。一緒に動く2組は、どちらにも入っていない3つ目の変数に反応しているだけかもしれません。
よくある質問
- 共分散の求め方を教えてください
- まず2組を位置で組み合わせ、それぞれのリストの平均を引いて偏差にし、組ごとに2つの偏差を掛けて、その積をすべて足し、標本ならn − 1、母集団ならnで割ります。x = 1、2、3、4、5とy = 2、4、5、4、5なら積の和が6なので、標本の共分散は6 ÷ 4 = 1.5です。2つの平均、2つの標準偏差、そして答えは上に印字されるので、どの1歩でも追いかけられます。
- 2組の長さはそろっていなければなりませんか
- はい、それに順番も合っていなければなりません。片方の1番目はもう片方の1番目と組になり、並べ替えは行いません。だからこのページは、短いほうを埋めて帳尻を合わせるのではなく、長さの違う2組を拒否します。片方が3個でもう片方が2個のとき、どの行が欠けているのかを知る手立てがなく、黙って前の2組だけを組にすると、見た目は完全にもっともらしい誤った答えが出てしまうからです。貼り付ける前に、2組が同じ対象から同じ順で取られていることを確かめてください。
- 共分散の符号は何を意味しますか
- 正の共分散は、ある値が自分のリストの平均より上にあるとき、組になった値も相手のリストの平均より上にある傾向を意味し、2組は一緒に上がり下がりします。負の共分散はその逆で、片方が平均より上ならもう片方は下になります。0に近い値は直線の並びがないという意味ですが、関係がまったくないという意味ではありません。1、4、5、4、1というリストは完全に規則的な逆さU字で、1、2、3、4、5との共分散は正確に0になります。
- なぜ相関係数もいっしょに表示するのですか
- 共分散はそれだけでは読めないからです。単位が1つ目のリストの単位と2つ目のリストの単位を掛けたものになるので、片方をメートルからセンチメートルに変えるだけで100倍になり、関係そのものは何も変わりません。2つの標準偏差で割るとその単位が約分され、答えが−1から1の間に収まるので、変数どうしを比べられます。共分散は式を組み立てる土台になる量で、関係の強さを尋ねられたときに引用するのはrのほうです。
- 片方のリストが一定だと答えが出ないのはなぜですか
- 相関係数が0で割られることになるからです。リストの値がすべて同じならそのリストの標準偏差は0で、関係の強さは定義できません。共分散そのものは0としてきちんと定義できますが、このページは2つの数を並べて印字する作りなので、片方だけを報告すると、意味のないrを本物の値として受け取られてしまいます。同じ判断はサイトの他の場所でもしています。変動係数のページは、平均が正でないときに定義できない比を印字せず、答えを控えます。
- 標本と母集団のどちらの除数を使うべきですか
- 2組がもっと大きな集まりから取った標本で、その集まり全体について述べたいなら標本(n − 1)を使ってください。ふつうはこちらです。2組が対象そのもの全体なら母集団(n)を使います。この選択は共分散と2つの標準偏差を動かしますが、相関係数は動きません。n − 1とnがその比の中で約分されるためです。上の5組なら、標本で共分散1.5、母集団で1.2、rはどちらでも0.7746です。
参考文献
- Correlation, Variance and Covariance (Matrices) — R stats package reference:cov と cor の2関数を定義し、共分散の除数にn − 1を使うことと、相関係数を2つの標準偏差で割った比として扱う立場を記しています — The R Project for Statistical Computing
- scipy.stats.pearsonr — SciPy reference:ピアソン係数の値域と、線形の関連の強さとしての読み方を記したリファレンス — SciPy
- The Regression Equation — Introductory Statistics 2e, section 12.3:カール・ピアソンにちなむ相関係数rを、2変数間の線形の関連の強さと向きを表す数値として定義している節 — OpenStax(ライス大学)
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1:共分散と相関係数を含む、統計の用語と記号に関する中国の国家規格。規格の記録ページには、オンライン全文の提供がない旨が記されています — State Administration for Market Regulation, China