Chapter 03
2 変数の関係 — 共分散・相関・そして「相関 ≠ 因果」
この章がなぜ必要なのか——統計が最も誤用される場所.
「アイスの売上と水難事故には強い相関がある」——これは事実である。 だが「アイスを売るのをやめれば人が溺れなくなる」わけがない。裏に「気温」がいるだけだ。
この章では前半で関係の強さを数値にする方法(共分散・相関係数)を導出し、 後半でその数値から何を言ってよくて何を言ってはいけないかを徹底的に詰める。
世に出回る統計の誤りの、おそらく半分以上がこの章の内容に関わる。 ここを押さえるだけで、ニュースやレポートの怪しさをかなり見抜けるようになる。
この章で使う既出の用語(定義は各リンク先). 母集団・標本・標本サイズ \(n\)・統計量(01 章 2 節)、尺度水準・連続(01 章 4 節)、\(\sum\) 記号(02 章 1 節)、平均 \(\bar x\)(02 章 2 節)、分散 \(s^2\)・標準偏差 \(s\)(02 章 3 節)、z スコア(02 章 4 節)、期待値 \(E[\cdot]\) と大文字 \(X\)(02 章 7 節、正確には 06 章)
1. 散布図から始める
2 つの変数 \((x_i, y_i)\) の組が \(n\) 個ある(\(i = 1, \dots, n\)。たとえば \(n\) 人の身長と体重)。まずやることは散布図を描くことである。数値を計算するのはその後。
散布図から読み取るべきもの:
| 見るもの | 何が分かるか |
|---|---|
| 向き | 右上がりか右下がりか |
| 形 | 直線的か、曲がっているか |
| 強さ | 帯が細いか太いか |
| 外れ値 | 群れから離れた点はないか |
| 群れ | 塊が 2 つに分かれていないか |
2. 共分散 — 「一緒に動く」を数値にする
定義への道すじ
\(x\) の平均を \(\bar x\)、\(y\) の平均を \(\bar y\) とする(02 章)。\(x\) が平均より大きいとき \(y\) も平均より大きい傾向があれば、2 つは「一緒に動いている」。 これを式にしたい。各点について偏差の積を作ってみる。
この値の符号を考える。
| 位置 | \(x_i - \bar{x}\) | \(y_i - \bar{y}\) | 積 |
|---|---|---|---|
| 右上(両方大きい) | + | + | + |
| 左下(両方小さい) | − | − | + |
| 右下(x 大・y 小) | + | − | − |
| 左上(x 小・y 大) | − | + | − |
つまり右上がりの関係なら積は正、右下がりなら負になる。これを平均すれば関係の向きと強さが出る。
(\(n-1\) の理由は 02 章の不偏分散と同じ。 母集団側の共分散(母共分散)は、母集団から 1 個体を選んだときの 2 つの値を \(X, Y\)、それぞれの母平均を \(\mu_X, \mu_Y\) として \(\sigma_{xy} = E[(X-\mu_X)(Y-\mu_Y)]\)——全個体での偏差の積の平均——と書く。 記号をまとめると: 手元のデータから計算する共分散が \(s_{xy}\)、母集団の共分散が \(\sigma_{xy}\)、どちらの意味でも使える一般的な書き方が \(\text{Cov}(X, Y)\) である。)
分散は共分散の特別な場合
\(y = x\) と置くと
分散とは、自分自身との共分散である。この視点は 19 章の重回帰(分散共分散行列)でそのまま効いてくる。
計算に便利な形
導出:
∎
共分散の致命的な弱点
身長 (cm) と体重 (kg) の共分散が 50 だったとする。これは「強い関係」なのか? 分からない。 身長を m に変えれば共分散は 0.5 になる。単位を変えるだけで値が変わるからである。
だから共分散の絶対値そのものには意味がない。単位を消す必要がある。
3. 相関係数 — 単位を消す
定義
(2 つ目の等号: \(s_{xy}\) の \(\frac{1}{n-1}\) と、\(s_x s_y = \sqrt{\frac{1}{n-1}\sum(x_i-\bar x)^2}\sqrt{\frac{1}{n-1}\sum(y_i-\bar y)^2}\) に含まれる \(\frac{1}{n-1}\) が約分で消える。) これをピアソンの積率相関係数と呼ぶ(「積率」は偏差の積の平均という意味の古い用語で、06 章のモーメントのこと)。
分母で \(x\) と \(y\) の標準偏差を割ることで、単位が完全に消える。実際、02 章の z スコア \(z_{x_i} = (x_i - \bar x)/s_x\)、\(z_{y_i} = (y_i - \bar y)/s_y\) を使うと
つまり相関係数とは、両方を z スコアに直してから掛けて平均したものである。
\(-1 \leq r \leq 1\) の証明
コーシー・シュワルツの不等式を使う。任意の実数列 \(a_i, b_i\) に対し
この不等式自体の証明: 任意の実数 \(t\) に対して
\(f(t)\) は二乗の和なので常に 0 以上。\(t\) の二次式が常に 0 以上ということは、判別式が 0 以下である。
これが求める不等式である。∎
ここで \(a_i = x_i - \bar{x}\)、\(b_i = y_i - \bar{y}\) と置けば、
∎
等号が成り立つのはいつか: \(f(t) = 0\) となる \(t\) が存在するとき、すなわちすべての \(i\) で \(a_i t + b_i = 0\)、 つまり \(y_i - \bar{y} = -t(x_i - \bar{x})\)。これは全点が完全に一直線に乗ることを意味する。
相関係数の読み方
| \(\lvert r \rvert\) | 慣用的な表現 |
|---|---|
| 0.0 〜 0.2 | ほとんど相関なし |
| 0.2 〜 0.4 | 弱い相関 |
| 0.4 〜 0.7 | 中程度の相関 |
| 0.7 〜 1.0 | 強い相関 |
この表を信じすぎないこと. 分野によって基準はまるで違う。 物理の実験なら \(r = 0.95\) でも「合っていない」と言われるし、 心理学や社会科学では \(r = 0.3\) でも十分に意味のある発見とされる。 文脈なしに数値だけで強弱を語るのは危険である。
4. 相関係数が見落とすもの
(a) 非線形の関係
\(y = x^2\) で \(x\) が \(-3\) から \(3\) まで対称に分布していると、\(r = 0\) になる。 確かめる: \(x = -3, -2, -1, 0, 1, 2, 3\) なら \(\bar x = 0\) で、\(\sum(x_i - \bar x)(y_i - \bar y) = \sum x_i y_i - n\bar x\bar y = \sum x_i^3 - 0 = (-27) + (-8) + (-1) + 0 + 1 + 8 + 27 = 0\)。 きれいな放物線という完璧な関係があるのに、相関係数は 0である。
(b) 外れ値 1 点で壊れる
無相関の点群に、遠く離れた 1 点を足すだけで \(r\) は 0.9 を超えうる。 例: 原点付近に散らばる無相関の 10 点(\(x, y\) とも \(-1\)〜\(1\) の範囲)に \((100, 100)\) を 1 点足すと、偏差の積は追加した 1 点の分(約 \(90 \times 90\))がほぼすべてを占め、\(r\) は 0.99 近くになる。 逆に、強い相関のある点群に 1 点足して \(r\) をほぼ 0 にすることもできる。
(c) アンスコムの四重奏
統計学者アンスコムが 1973 年に作った、有名な 4 つのデータセットがある。 どれも \(n = 11\) で、次の値がすべてほぼ同一である(データそのものは統計ソフトに anscombe の名前で入っていることが多く、たとえば I 組は \(x = 10, 8, 13, 9, 11, 14, 6, 4, 12, 7, 5\)、\(y = 8.04, 6.95, 7.58, 8.81, 8.33, 9.96, 7.24, 4.26, 10.84, 4.82, 5.68\))。
| 統計量 | 値 |
|---|---|
| \(\bar{x}\) | 9.0 |
| \(\bar{y}\) | 7.5 |
| \(s_x^2\) | 11.0 |
| \(s_y^2\) | 4.13 |
| \(r\) | 0.816 |
| 回帰直線(データに最もよく合う直線。求め方は 18 章) | \(y = 3.00 + 0.500x\) |
にもかかわらず、散布図はまったく違う。
| データ | 実際の姿 |
|---|---|
| I | 素直な線形関係。統計量どおり |
| II | きれいな放物線。直線を当てるのが間違い |
| III | 完全な直線 + 外れ値 1 個。その 1 点が傾きを歪めている |
| IV | \(x\) がほぼ 1 点に集中 + 遠くに 1 点。その 1 点だけで直線が決まっている |
アンスコムが伝えたかったこと.「まず絵を描け」。 平均・分散・相関・回帰式がすべて一致していても、中身はまるで違いうる。 数値による要約は必ず情報を捨てている。捨てた部分に本質があることは、珍しくない。
(d) 範囲制限 (range restriction)
母集団の一部だけを、\(x\) の値で切り出すと、相関はふつう弱くなる。
例. 大学入試の点数と入学後の成績の相関を、その大学の合格者だけで計算すると弱く出る。 合格者はすでに点数の高い層に絞られており、\(x\) の変動幅が縮んでいるからである。 式で見ると、\(r = s_{xy}/(s_x s_y)\) の分母 \(s_x\) が縮むだけなら \(r\) は大きくなりそうだが、分子 \(s_{xy}\) も一緒に縮む。 \(y\) を「\(x\) で決まる部分 + \(x\) と無関係なばらつき」に分けると、\(s_{xy}\) は前者の分だけで決まり \(s_x\) が縮むと同じ割合で縮む一方、\(s_y\) には \(x\) と無関係なばらつきが残って縮みにくい。結果として \(r\) は下がる。 これを見て「入試は無意味だ」と結論するのは誤りで、不合格者も含めれば強い相関が出る可能性がある。
5. 順位相関 — 単調性だけを見る
スピアマンの順位相関 \(\rho\)
値そのものではなく順位に置き換えてから、ピアソンの相関係数を計算する。
(順位は \(x\) も \(y\) も同じ向きに付ける。小さい順に 1, 2, …としても大きい順にしても、両方同じ向きなら結果は変わらない。)
| 性質 | ピアソン \(r\) | スピアマン \(\rho\) |
|---|---|---|
| 捉えるもの | 直線関係 | 単調関係(曲がっていてもよい) |
| 外れ値 | 弱い | 強い |
| 尺度 | 間隔・比例 | 順序でも可 |
\(y = e^x\) のような単調増加の曲線では、ピアソンは 1 未満だがスピアマンはちょうど 1 になる。
ケンドールの \(\tau\)
すべての点のペア \((i, j)\) を見て、\(x_i - x_j\) と \(y_i - y_j\) の符号が同じなら「順序が一致するペア(concordant)」、逆なら「逆転するペア(discordant)」と数える。
スピアマンより解釈が直接的(「ランダムに 2 点選んだとき順序が一致する確率の差」)で、外れ値にさらに頑健である。
6. カテゴリ変数の関係
分割表 (contingency table)
| 結果あり | 結果なし | 計 | |
|---|---|---|---|
| 処置群 | \(a\) | \(b\) | \(a+b\) |
| 対照群 | \(c\) | \(d\) | \(c+d\) |
リスク比とオッズ比
| 指標 | 式 | 意味 |
|---|---|---|
| リスク(率) | \(a/(a+b)\) | その群で結果が起きる割合 |
| リスク比 (RR) | \(\dfrac{a/(a+b)}{c/(c+d)}\) | 何倍起きやすいか。直感的 |
| オッズ | \(a/b\) | 起きる:起きないの比 |
| オッズ比 (OR) | \(\dfrac{a/b}{c/d} = \dfrac{ad}{bc}\) | 21 章のロジスティック回帰で主役になる |
なぜオッズ比などという分かりにくいものを使うのか. 3 つ理由がある。(1) ケース・コントロール研究(結果が起きた人と起きなかった人を先に決めた人数だけ集め、後から処置の有無を調べる設計)では、 「結果あり」「結果なし」の人数比を研究者が決めてしまっているので、処置群の中で結果が起きる割合 \(a/(a+b)\)(リスク)は母集団の値を反映せず計算しても意味がない。 一方オッズ比 \(ad/bc\) は行と列を入れ替えても同じ式になり、「結果ありの人の中で処置を受けた割合」から計算しても同じ値になるので、この設計でも使える。 (2) ロジスティック回帰の係数が そのまま log オッズ比になる(21 章)。(3) 結果がまれ(\(a \ll b\) かつ \(c \ll d\))なら \(a/(a+b) \approx a/b\)、\(c/(c+d) \approx c/d\) となるので OR ≈ RR になる。
ただし結果がまれでないときに OR を RR のように読むと、効果を大幅に誇張する。 「オッズ比 2.0」を「リスク 2 倍」と報道するのはよくある誤りである。
7. 相関は因果ではない — 3 つの理由
\(X\) と \(Y\) に相関があるとき、可能性は 3 つある。
(a) 交絡 (confounding) — 第 3 の変数
気温 Z
↙ ↘
アイス X 水難事故 Y\(Z\) が \(X\) と \(Y\) の両方に影響していると、\(X\) と \(Y\) の間に因果関係が無くても相関が現れる。 これが交絡であり、観察データで最も頻繁に起きる問題である。24 章で正面から扱う。
(b) 逆因果 (reverse causation)
「運動している人は健康」——運動が健康を作ったのか、健康だから運動できるのか。 矢印の向きはデータの相関からは決まらない。
(c) 偶然 (chance)
無関係な 2 つの変数でも、たまたま相関が出ることがある。 特にたくさんの変数のペアを片っ端から調べると、必ずどこかに強い相関が現れる(17 章の多重比較問題)。
有名な「疑似相関」の実例. 「ニコラス・ケイジの年間映画出演本数」と「プールでの溺死者数」は \(r \approx 0.67\)、 「アメリカのチーズ消費量」と「ベッドシーツに絡まって死亡した人数」は \(r \approx 0.95\)。 どちらも当然、因果関係は無い。 十分な数の時系列を集めれば、無関係でも強い相関を示すペアは必ず見つかるという実演である。
では、いつ因果を言えるのか
| 方法 | 強さ | 章 |
|---|---|---|
| ランダム化比較試験 (RCT) | 最強。処置をコイン投げで割り当てれば交絡は原理的に消える | 24 |
| 自然実験・操作変数法 | 準実験的(偶然や制度が「コイン投げの代わり」をした状況を利用する) | 24 |
| 差分の差分法・回帰不連続 | 準実験的(処置の前後の変化を比較する/境界のすぐ両側を比較する) | 24 |
| 傾向スコア・層別・共変量調整 | 測った交絡変数の値が同じ人どうしを比べる。観測された交絡だけ調整できる | 24 |
| 単なる相関 | 因果を主張できない | — |
8. シンプソンのパラドックス
全体で見た傾向と、グループごとに見た傾向が逆転する現象。
具体例: 大学院入学の男女差
ある大学の全体の合格率:
| 出願 | 合格 | 合格率 | |
|---|---|---|---|
| 男性 | 800 | 480 | 60% |
| 女性 | 400 | 160 | 40% |
一見、男性が明らかに有利に見える。ところが学部別に分けると:
学部 A(易しい)
| 出願 | 合格 | 合格率 | |
|---|---|---|---|
| 男性 | 600 | 420 | 70% |
| 女性 | 100 | 75 | 75% |
学部 B(難しい)
| 出願 | 合格 | 合格率 | |
|---|---|---|---|
| 男性 | 200 | 60 | 30% |
| 女性 | 300 | 85 | 28.3% |
学部 A では女性の方が合格率が高く、学部 B ではほぼ互角。どちらの学部でも女性が不利ではないのに、 全体では女性の合格率が 20 ポイントも低く出る。
なぜか: 女性は難しい学部 B に多く出願している(女性の 75% が B、男性は 25% が B)。 合格率の低い学部に集中しているため、全体の平均が引き下げられているのである。
どちらが「正しい」のか. これは統計だけでは決まらない。因果構造による。
- 「学部が合格率に影響し、性別が出願学部の選択に影響する」なら、学部で層別した結論(差別なし)が正しい。
- 逆に、もし「性別が学部の割り当てを強制的に決めている」なら、 その割り当て自体が差別なので、全体の数字(差別あり)を見るべきである。
どの変数で層別すべきかは、データではなく因果の知識が決める。 これが 24 章で因果ダイアグラムを学ぶ動機になる。
9. まとめ
| 概念 | 式 | 一言で |
|---|---|---|
| 共分散 | \(s_{xy} = \frac{1}{n-1}\sum(x_i-\bar{x})(y_i-\bar{y})\) | 一緒に動く度合い。単位に依存 |
| 相関係数 | \(r = s_{xy}/(s_x s_y)\) | 単位を消した共分散。\(-1 \le r \le 1\) |
| スピアマン | 順位に直してからの \(r\) | 単調性を見る。外れ値に強い |
| オッズ比 | \(ad/bc\) | カテゴリ 2×2 の関連の強さ |
- 相関係数は直線関係の強さしか測らない。\(r=0\) は無関係を意味しない。
- 数値を見る前に必ず散布図。アンスコムの四重奏がその理由をすべて語っている。
- 相関から因果を言うには、交絡・逆因果・偶然の 3 つを潰す必要がある。
- 層別で結論が逆転しうる(シンプソンのパラドックス)。どう層別するかは因果の知識が決める。