統計 03 · 2 変数の関係 — 共分散・相関・そして「相関 ≠ 因果」

Chapter 03

2 変数の関係 — 共分散・相関・そして「相関 ≠ 因果」

この章がなぜ必要なのか——統計が最も誤用される場所.

「アイスの売上と水難事故には強い相関がある」——これは事実である。 だが「アイスを売るのをやめれば人が溺れなくなる」わけがない。裏に「気温」がいるだけだ。

この章では前半で関係の強さを数値にする方法(共分散・相関係数)を導出し、 後半でその数値から何を言ってよくて何を言ってはいけないかを徹底的に詰める。

世に出回る統計の誤りの、おそらく半分以上がこの章の内容に関わる。 ここを押さえるだけで、ニュースやレポートの怪しさをかなり見抜けるようになる。

この章で使う既出の用語(定義は各リンク先). 母集団・標本・標本サイズ \(n\)・統計量(01 章 2 節)、尺度水準・連続(01 章 4 節)、\(\sum\) 記号(02 章 1 節)、平均 \(\bar x\)(02 章 2 節)、分散 \(s^2\)・標準偏差 \(s\)(02 章 3 節)、z スコア(02 章 4 節)、期待値 \(E[\cdot]\) と大文字 \(X\)(02 章 7 節、正確には 06 章)

1. 散布図から始める

2 つの変数 \((x_i, y_i)\) の組が \(n\) 個ある(\(i = 1, \dots, n\)。たとえば \(n\) 人の身長と体重)。まずやることは散布図を描くことである。数値を計算するのはその後。

散布図から読み取るべきもの:

見るもの何が分かるか
向き右上がりか右下がりか
形直線的か、曲がっているか
強さ帯が細いか太いか
外れ値群れから離れた点はないか
群れ塊が 2 つに分かれていないか

2. 共分散 — 「一緒に動く」を数値にする

定義への道すじ

\(x\) の平均を \(\bar x\)、\(y\) の平均を \(\bar y\) とする(02 章)。\(x\) が平均より大きいとき \(y\) も平均より大きい傾向があれば、2 つは「一緒に動いている」。 これを式にしたい。各点について偏差の積を作ってみる。

\[ (x_i - \bar{x})(y_i - \bar{y}) \]

この値の符号を考える。

位置\(x_i - \bar{x}\)\(y_i - \bar{y}\)積
右上(両方大きい)+++
左下(両方小さい)−−+
右下(x 大・y 小)+−−
左上(x 小・y 大)−+−

つまり右上がりの関係なら積は正、右下がりなら負になる。これを平均すれば関係の向きと強さが出る。

\[ \boxed{s_{xy} = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})} \]

(\(n-1\) の理由は 02 章の不偏分散と同じ。 母集団側の共分散(母共分散)は、母集団から 1 個体を選んだときの 2 つの値を \(X, Y\)、それぞれの母平均を \(\mu_X, \mu_Y\) として \(\sigma_{xy} = E[(X-\mu_X)(Y-\mu_Y)]\)——全個体での偏差の積の平均——と書く。 記号をまとめると: 手元のデータから計算する共分散が \(s_{xy}\)、母集団の共分散が \(\sigma_{xy}\)、どちらの意味でも使える一般的な書き方が \(\text{Cov}(X, Y)\) である。)

分散は共分散の特別な場合

\(y = x\) と置くと

\[ s_{xx} = \frac{1}{n-1}\sum (x_i-\bar{x})^2 = s_x^2 \]

分散とは、自分自身との共分散である。この視点は 19 章の重回帰(分散共分散行列)でそのまま効いてくる。

計算に便利な形

\[ \sum (x_i - \bar{x})(y_i - \bar{y}) = \sum x_i y_i - n\bar{x}\bar{y} \]

導出:

\[ \sum (x_i - \bar{x})(y_i - \bar{y}) = \sum \left(x_i y_i - x_i\bar{y} - \bar{x}y_i + \bar{x}\bar{y}\right) \]
\[ = \sum x_i y_i - \bar{y}\underbrace{\sum x_i}_{n\bar{x}} - \bar{x}\underbrace{\sum y_i}_{n\bar{y}} + n\bar{x}\bar{y} = \sum x_i y_i - n\bar{x}\bar{y} - n\bar{x}\bar{y} + n\bar{x}\bar{y} = \sum x_i y_i - n\bar{x}\bar{y} \]

∎

共分散の致命的な弱点

身長 (cm) と体重 (kg) の共分散が 50 だったとする。これは「強い関係」なのか? 分からない。 身長を m に変えれば共分散は 0.5 になる。単位を変えるだけで値が変わるからである。

\[ \text{Cov}(aX, bY) = ab\text{Cov}(X,Y) \]

だから共分散の絶対値そのものには意味がない。単位を消す必要がある。

3. 相関係数 — 単位を消す

定義

\[ \boxed{r = \frac{s_{xy}}{s_x s_y} = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum (x_i-\bar{x})^2}\sqrt{\sum (y_i-\bar{y})^2}}} \]

(2 つ目の等号: \(s_{xy}\) の \(\frac{1}{n-1}\) と、\(s_x s_y = \sqrt{\frac{1}{n-1}\sum(x_i-\bar x)^2}\sqrt{\frac{1}{n-1}\sum(y_i-\bar y)^2}\) に含まれる \(\frac{1}{n-1}\) が約分で消える。) これをピアソンの積率相関係数と呼ぶ(「積率」は偏差の積の平均という意味の古い用語で、06 章のモーメントのこと)。

分母で \(x\) と \(y\) の標準偏差を割ることで、単位が完全に消える。実際、02 章の z スコア \(z_{x_i} = (x_i - \bar x)/s_x\)、\(z_{y_i} = (y_i - \bar y)/s_y\) を使うと

\[ r = \frac{1}{n-1}\sum z_{x_i} z_{y_i} \]

つまり相関係数とは、両方を z スコアに直してから掛けて平均したものである。

\(-1 \leq r \leq 1\) の証明

コーシー・シュワルツの不等式を使う。任意の実数列 \(a_i, b_i\) に対し

\[ \left(\sum a_i b_i\right)^2 \leq \left(\sum a_i^2\right)\left(\sum b_i^2\right) \]

この不等式自体の証明: 任意の実数 \(t\) に対して

\[ f(t) = \sum (a_i t + b_i)^2 = t^2\sum a_i^2 + 2t\sum a_i b_i + \sum b_i^2 \geq 0 \]

\(f(t)\) は二乗の和なので常に 0 以上。\(t\) の二次式が常に 0 以上ということは、判別式が 0 以下である。

\[ D/4 = \left(\sum a_i b_i\right)^2 - \left(\sum a_i^2\right)\left(\sum b_i^2\right) \leq 0 \]

これが求める不等式である。∎

ここで \(a_i = x_i - \bar{x}\)、\(b_i = y_i - \bar{y}\) と置けば、

\[ r^2 = \frac{\left(\sum a_i b_i\right)^2}{\left(\sum a_i^2\right)\left(\sum b_i^2\right)} \leq 1 \quad\Longrightarrow\quad -1 \leq r \leq 1 \]

∎

等号が成り立つのはいつか: \(f(t) = 0\) となる \(t\) が存在するとき、すなわちすべての \(i\) で \(a_i t + b_i = 0\)、 つまり \(y_i - \bar{y} = -t(x_i - \bar{x})\)。これは全点が完全に一直線に乗ることを意味する。

\[ \boxed{\lvert r \rvert = 1 \iff \text{全データが完全な直線上にある}} \]

相関係数の読み方

\(\lvert r \rvert\)慣用的な表現
0.0 〜 0.2ほとんど相関なし
0.2 〜 0.4弱い相関
0.4 〜 0.7中程度の相関
0.7 〜 1.0強い相関

この表を信じすぎないこと. 分野によって基準はまるで違う。 物理の実験なら \(r = 0.95\) でも「合っていない」と言われるし、 心理学や社会科学では \(r = 0.3\) でも十分に意味のある発見とされる。 文脈なしに数値だけで強弱を語るのは危険である。

4. 相関係数が見落とすもの

(a) 非線形の関係

\(y = x^2\) で \(x\) が \(-3\) から \(3\) まで対称に分布していると、\(r = 0\) になる。 確かめる: \(x = -3, -2, -1, 0, 1, 2, 3\) なら \(\bar x = 0\) で、\(\sum(x_i - \bar x)(y_i - \bar y) = \sum x_i y_i - n\bar x\bar y = \sum x_i^3 - 0 = (-27) + (-8) + (-1) + 0 + 1 + 8 + 27 = 0\)。 きれいな放物線という完璧な関係があるのに、相関係数は 0である。

\[ \boxed{r = 0 \text{ は「無関係」ではなく「線形の関係が無い」だけ}} \]

(b) 外れ値 1 点で壊れる

無相関の点群に、遠く離れた 1 点を足すだけで \(r\) は 0.9 を超えうる。 例: 原点付近に散らばる無相関の 10 点(\(x, y\) とも \(-1\)〜\(1\) の範囲)に \((100, 100)\) を 1 点足すと、偏差の積は追加した 1 点の分(約 \(90 \times 90\))がほぼすべてを占め、\(r\) は 0.99 近くになる。 逆に、強い相関のある点群に 1 点足して \(r\) をほぼ 0 にすることもできる。

(c) アンスコムの四重奏

統計学者アンスコムが 1973 年に作った、有名な 4 つのデータセットがある。 どれも \(n = 11\) で、次の値がすべてほぼ同一である(データそのものは統計ソフトに anscombe の名前で入っていることが多く、たとえば I 組は \(x = 10, 8, 13, 9, 11, 14, 6, 4, 12, 7, 5\)、\(y = 8.04, 6.95, 7.58, 8.81, 8.33, 9.96, 7.24, 4.26, 10.84, 4.82, 5.68\))。

統計量値
\(\bar{x}\)9.0
\(\bar{y}\)7.5
\(s_x^2\)11.0
\(s_y^2\)4.13
\(r\)0.816
回帰直線(データに最もよく合う直線。求め方は 18 章)\(y = 3.00 + 0.500x\)

にもかかわらず、散布図はまったく違う。

データ実際の姿
I素直な線形関係。統計量どおり
IIきれいな放物線。直線を当てるのが間違い
III完全な直線 + 外れ値 1 個。その 1 点が傾きを歪めている
IV\(x\) がほぼ 1 点に集中 + 遠くに 1 点。その 1 点だけで直線が決まっている

アンスコムが伝えたかったこと.「まず絵を描け」。 平均・分散・相関・回帰式がすべて一致していても、中身はまるで違いうる。 数値による要約は必ず情報を捨てている。捨てた部分に本質があることは、珍しくない。

(d) 範囲制限 (range restriction)

母集団の一部だけを、\(x\) の値で切り出すと、相関はふつう弱くなる。

例. 大学入試の点数と入学後の成績の相関を、その大学の合格者だけで計算すると弱く出る。 合格者はすでに点数の高い層に絞られており、\(x\) の変動幅が縮んでいるからである。 式で見ると、\(r = s_{xy}/(s_x s_y)\) の分母 \(s_x\) が縮むだけなら \(r\) は大きくなりそうだが、分子 \(s_{xy}\) も一緒に縮む。 \(y\) を「\(x\) で決まる部分 + \(x\) と無関係なばらつき」に分けると、\(s_{xy}\) は前者の分だけで決まり \(s_x\) が縮むと同じ割合で縮む一方、\(s_y\) には \(x\) と無関係なばらつきが残って縮みにくい。結果として \(r\) は下がる。 これを見て「入試は無意味だ」と結論するのは誤りで、不合格者も含めれば強い相関が出る可能性がある。

5. 順位相関 — 単調性だけを見る

スピアマンの順位相関 \(\rho\)

値そのものではなく順位に置き換えてから、ピアソンの相関係数を計算する。

\[ \rho = 1 - \frac{6\sum d_i^2}{n(n^2-1)} \qquad (d_i = x \text{ の順位} - y \text{ の順位、同順位が無い場合}) \]

(順位は \(x\) も \(y\) も同じ向きに付ける。小さい順に 1, 2, …としても大きい順にしても、両方同じ向きなら結果は変わらない。)

性質ピアソン \(r\)スピアマン \(\rho\)
捉えるもの直線関係単調関係(曲がっていてもよい)
外れ値弱い強い
尺度間隔・比例順序でも可

\(y = e^x\) のような単調増加の曲線では、ピアソンは 1 未満だがスピアマンはちょうど 1 になる。

ケンドールの \(\tau\)

すべての点のペア \((i, j)\) を見て、\(x_i - x_j\) と \(y_i - y_j\) の符号が同じなら「順序が一致するペア(concordant)」、逆なら「逆転するペア(discordant)」と数える。

\[ \tau = \frac{(\text{一致ペア数}) - (\text{逆転ペア数})}{n(n-1)/2} \]

スピアマンより解釈が直接的(「ランダムに 2 点選んだとき順序が一致する確率の差」)で、外れ値にさらに頑健である。

6. カテゴリ変数の関係

分割表 (contingency table)

結果あり結果なし計
処置群\(a\)\(b\)\(a+b\)
対照群\(c\)\(d\)\(c+d\)

リスク比とオッズ比

指標式意味
リスク(率)\(a/(a+b)\)その群で結果が起きる割合
リスク比 (RR)\(\dfrac{a/(a+b)}{c/(c+d)}\)何倍起きやすいか。直感的
オッズ\(a/b\)起きる:起きないの比
オッズ比 (OR)\(\dfrac{a/b}{c/d} = \dfrac{ad}{bc}\)21 章のロジスティック回帰で主役になる

なぜオッズ比などという分かりにくいものを使うのか. 3 つ理由がある。(1) ケース・コントロール研究(結果が起きた人と起きなかった人を先に決めた人数だけ集め、後から処置の有無を調べる設計)では、 「結果あり」「結果なし」の人数比を研究者が決めてしまっているので、処置群の中で結果が起きる割合 \(a/(a+b)\)(リスク)は母集団の値を反映せず計算しても意味がない。 一方オッズ比 \(ad/bc\) は行と列を入れ替えても同じ式になり、「結果ありの人の中で処置を受けた割合」から計算しても同じ値になるので、この設計でも使える。 (2) ロジスティック回帰の係数が そのまま log オッズ比になる(21 章)。(3) 結果がまれ(\(a \ll b\) かつ \(c \ll d\))なら \(a/(a+b) \approx a/b\)、\(c/(c+d) \approx c/d\) となるので OR ≈ RR になる。

ただし結果がまれでないときに OR を RR のように読むと、効果を大幅に誇張する。 「オッズ比 2.0」を「リスク 2 倍」と報道するのはよくある誤りである。

7. 相関は因果ではない — 3 つの理由

\(X\) と \(Y\) に相関があるとき、可能性は 3 つある。

(a) 交絡 (confounding) — 第 3 の変数

       気温 Z
      ↙      ↘
アイス X    水難事故 Y

\(Z\) が \(X\) と \(Y\) の両方に影響していると、\(X\) と \(Y\) の間に因果関係が無くても相関が現れる。 これが交絡であり、観察データで最も頻繁に起きる問題である。24 章で正面から扱う。

(b) 逆因果 (reverse causation)

「運動している人は健康」——運動が健康を作ったのか、健康だから運動できるのか。 矢印の向きはデータの相関からは決まらない。

(c) 偶然 (chance)

無関係な 2 つの変数でも、たまたま相関が出ることがある。 特にたくさんの変数のペアを片っ端から調べると、必ずどこかに強い相関が現れる(17 章の多重比較問題)。

有名な「疑似相関」の実例. 「ニコラス・ケイジの年間映画出演本数」と「プールでの溺死者数」は \(r \approx 0.67\)、 「アメリカのチーズ消費量」と「ベッドシーツに絡まって死亡した人数」は \(r \approx 0.95\)。 どちらも当然、因果関係は無い。 十分な数の時系列を集めれば、無関係でも強い相関を示すペアは必ず見つかるという実演である。

では、いつ因果を言えるのか

方法強さ章
ランダム化比較試験 (RCT)最強。処置をコイン投げで割り当てれば交絡は原理的に消える24
自然実験・操作変数法準実験的(偶然や制度が「コイン投げの代わり」をした状況を利用する)24
差分の差分法・回帰不連続準実験的(処置の前後の変化を比較する/境界のすぐ両側を比較する)24
傾向スコア・層別・共変量調整測った交絡変数の値が同じ人どうしを比べる。観測された交絡だけ調整できる24
単なる相関因果を主張できない—

8. シンプソンのパラドックス

全体で見た傾向と、グループごとに見た傾向が逆転する現象。

具体例: 大学院入学の男女差

ある大学の全体の合格率:

出願合格合格率
男性80048060%
女性40016040%

一見、男性が明らかに有利に見える。ところが学部別に分けると:

学部 A(易しい)

出願合格合格率
男性60042070%
女性1007575%

学部 B(難しい)

出願合格合格率
男性2006030%
女性3008528.3%

学部 A では女性の方が合格率が高く、学部 B ではほぼ互角。どちらの学部でも女性が不利ではないのに、 全体では女性の合格率が 20 ポイントも低く出る。

なぜか: 女性は難しい学部 B に多く出願している(女性の 75% が B、男性は 25% が B)。 合格率の低い学部に集中しているため、全体の平均が引き下げられているのである。

\[ \boxed{\text{学部という交絡変数を無視して全体を見ると、逆の結論が出る}} \]

どちらが「正しい」のか. これは統計だけでは決まらない。因果構造による。

どの変数で層別すべきかは、データではなく因果の知識が決める。 これが 24 章で因果ダイアグラムを学ぶ動機になる。

9. まとめ

概念式一言で
共分散\(s_{xy} = \frac{1}{n-1}\sum(x_i-\bar{x})(y_i-\bar{y})\)一緒に動く度合い。単位に依存
相関係数\(r = s_{xy}/(s_x s_y)\)単位を消した共分散。\(-1 \le r \le 1\)
スピアマン順位に直してからの \(r\)単調性を見る。外れ値に強い
オッズ比\(ad/bc\)カテゴリ 2×2 の関連の強さ