統計 24 · 実験計画と因果推論 — 「効果があった」を正しく言う

Chapter 24

実験計画と因果推論 — 「効果があった」を正しく言う

この章がなぜ必要なのか——統計の最終目的地.

03 章で「相関は因果ではない」と述べた。ではどうすれば因果を言えるのか。 それがこの章のテーマである。

「この薬は効くのか」「この施策は売上を上げたのか」「この教育プログラムに意味はあるのか」—— 実務で本当に知りたいのは、ほぼ常に因果である。 相関だけ分かっても、次にどう行動すべきかは決まらない。

そして重要な事実がある。因果は統計手法だけでは決して出てこない。 データの外にある「どういう仕組みでこのデータが生まれたか」という知識が必ず要る。 この章は、その知識をどう形式化し、どう使うかを扱う。

この章で使う既出の用語(定義は各リンク先). 母集団・統計量(01 章 2 節)、選択バイアス(01 章 3 節)、相関・交絡・リスク比(03 章)、独立(04 章 5 節)、期待値 \(E[\cdot]\)・条件付き期待値・共分散 \(\text{Cov}\)(06 章 3 節, 5 節, 8 節)、最小二乗法(10 章 7 節)、F 統計量(15 章 3 節、19 章 5 節)、反復測定(15 章 7 節)、p ハッキング(17 章 4 節)、重回帰・交互作用(19 章)、ロジスティック回帰(21 章)、モデル選択と因果(22 章 5 節)

1. 因果とは何か — 反実仮想

潜在的結果の枠組み (Rubin causal model)

個体 \(i\) について、2 つの世界を考える。

記号意味
\(T_i\)個体 \(i\) が実際に処置を受けたか(受けた: 1、受けない: 0)
\(Y_i(1)\)処置を受けた場合の結果
\(Y_i(0)\)処置を受けなかった場合の結果
\(Y_i\)実際に観測される結果。\(T_i=1\) なら \(Y_i(1)\)、\(T_i=0\) なら \(Y_i(0)\)、すなわち \(Y_i = T_iY_i(1)+(1-T_i)Y_i(0)\)
\(\tau_i = Y_i(1)-Y_i(0)\)個体 \(i\) の因果効果
\[ \boxed{\text{因果効果} = \text{処置した世界の結果} - \text{しなかった世界の結果}} \]

因果推論の根本問題

1 人の個体について、\(Y_i(1)\) と \(Y_i(0)\) の両方を観測することは絶対にできない。

薬を飲んだ人が「飲まなかったらどうなっていたか」は永遠に分からない。 観測できるのは片方だけで、もう片方は反実仮想 (counterfactual) として失われる。

つまり個体レベルの因果効果は、原理的に観測不可能である。 これを Holland は「因果推論の根本問題」と呼んだ。

だから平均を狙う

個体では無理でも、集団の平均なら推定できる可能性がある。

\[ \text{ATE}=E[Y(1)-Y(0)] = E[Y(1)]-E[Y(0)] \]
記号名前意味
ATE平均処置効果母集団全体での平均効果
ATT処置群における平均処置効果実際に処置を受けた人での効果
CATE条件付き平均処置効果部分集団ごとの効果

素朴な比較がなぜ間違うか

観測される差を分解する。処置群では \(Y = Y(1)\)、対照群では \(Y = Y(0)\) なので \(E[Y\mid T=1] = E[Y(1)\mid T=1]\)、\(E[Y\mid T=0] = E[Y(0)\mid T=0]\)。ここに \(E[Y(0)\mid T=1]\) を引いて足すと

\[ \underbrace{E[Y\mid T=1]-E[Y\mid T=0]}_{\text{観測される差}}=\underbrace{E[Y(1)-Y(0)\mid T=1]}_{\text{ATT(本当の効果)}}+\underbrace{E[Y(0)\mid T=1]-E[Y(0)\mid T=0]}_{\textbf{選択バイアス}} \]

(01 章で言葉として導入した選択バイアスを、この枠組みで式にしたものである。)

選択バイアスの意味: 「処置を受けた人が、もし受けなかったとしたら」と 「実際に受けなかった人」がもともと違うなら、その差が効果に混ざり込む。

例: 塾に通った子の成績が高い。だが塾に通う家庭はもともと教育熱心かもしれない。 「塾に通った子が通わなかったら」の成績は、実際に通わなかった子より高いかもしれない。 このとき素朴な比較は塾の効果を過大評価する。

2. ランダム化比較試験 (RCT) — 黄金律

なぜランダム化が効くのか

処置 \(T\) をコイン投げで決めると、\(T\) は \((Y(1),Y(0))\) を含むあらゆる個体特性と独立(04 章 5 節。一方の値を知っても他方の分布が変わらない)になる。記号 \(\perp\) で書く:

\[ (Y(1),Y(0)) \perp T \]

独立なら「\(T=1\) の人たち」に限っても \(Y(0)\) の分布は全体と同じなので、条件付き期待値は条件によらない:

\[ E[Y(0)\mid T=1]=E[Y(0)\mid T=0]=E[Y(0)] \]

選択バイアスがゼロになる。 同様に \(E[Y(1)\mid T=1]=E[Y(1)]\) なので

\[ E[Y\mid T=1]-E[Y\mid T=0]=E[Y(1)]-E[Y(0)]=\text{ATE} \]

∎(証明終わりの記号)

ランダム化の凄さは「測っていない変数も含めて」バランスが取れることである. 年齢、収入、遺伝、やる気、そして研究者が思いつきもしなかった要因まで、 期待値としてすべて両群で等しくなる。

統計的調整(19 章の重回帰など)は、測った変数しか調整できない。 ここが観察研究と実験の決定的な違いである。

RCT の設計要素

要素目的
ランダム割付交絡の排除
対照群平均への回帰・自然経過・時間効果を差し引く
盲検化プラセボ効果、観察者バイアスの排除
ブロック化重要な変数(性別・施設)で層化(その変数の値ごとにグループ=層に分けること。層別とも言う)してから、層の中でランダム化
事前登録p ハッキングの防止(17 章)
ITT 解析割り付けどおりに解析(脱落によるバイアス防止)

ITT(intention-to-treat)が重要な理由. 「薬を飲まなかった人を除外して解析」すると、 「飲み続けられた人」だけが残る——それはもうランダムではない。 副作用で脱落した人を除けば、薬の効果は過大評価される。

割り付けられたとおりに解析するのが原則。 効果は薄まるが、バイアスは入らない。

RCT ができない場合

理由例
倫理的に不可能喫煙、虐待、被曝
実行不可能国の政策、地震
コスト大規模・長期の介入
一般化可能性実験室の結果が現場で成り立つか(外的妥当性)

そこで観察データから因果を推定する方法が必要になる。

3. 因果ダイアグラム (DAG)

変数間の因果関係を矢印で表した有向非巡回グラフ(矢印をたどって元に戻る経路がないグラフ)。以下、処置を \(T\)、結果を \(Y\) と書く。 ある変数で調整するとは、その変数の値ごとに分けて(層別して)\(T\) と \(Y\) の関係を見ること、または回帰にその変数を入れることで、「その変数で条件付ける」とも言う。

3 つの基本構造

(1) 連鎖 (chain): \(T\to M\to Y\)

\(M\) は中間変数(媒介変数)。\(T\) の効果は \(M\) を通って伝わる。

\(M\) で調整してはいけない。 調整すると \(T\) の効果が消えてしまう。 「運動 → 血圧低下 → 心疾患減少」で血圧を調整すると、運動の効果が見えなくなる。

(2) 分岐 (fork): \(T\leftarrow Z\to Y\)

\(Z\) は交絡因子。\(T\) と \(Y\) の両方の原因である。

\(Z\) で必ず調整する。 調整しないと偽の相関が出る。 「アイス ← 気温 → 水難事故」の気温がこれである(03 章)。

(3) 合流 (collider): \(T\to C\leftarrow Y\)

\(C\) は合流点。\(T\) と \(Y\) の両方から影響を受ける。

\(C\) で調整してはいけない。 調整すると、無かった相関が生まれる。

例: 才能 \(A\) と美貌 \(B\) は無関係だが、「才能か美貌のどちらかが高ければ俳優になれる」とする(どちらも「俳優になる \(C\)」の原因)。 俳優だけを見る(\(C\) で条件付ける)と、才能と美貌に負の相関が現れる。 俳優になれた以上どちらかは高いはずなので、美貌が低い俳優は才能が高い方に偏り、逆も同様だからである。

これを合流点バイアス(選択バイアス、バークソンのパラドックス)と呼ぶ。 「入院患者だけを見ると 2 つの病気に負の相関が出る」など、 サンプルの選ばれ方が結果に依存している場面で必ず起きる。

バックドア基準

\(T\to Y\) の因果効果を推定するには、次を満たす変数の集合 \(S\) で調整すればよい。

  1. \(S\) は \(T\) の子孫(\(T\) から矢印をたどって行き着く変数)を含まない(中間変数を入れない)
  2. \(S\) が \(T\) から \(Y\) へのバックドアパス(\(T\) に向かう矢印で始まる経路。分岐の \(T\leftarrow Z\to Y\) がその最小例)をすべて塞ぐ

このとき、「\(T\) を観測したら \(t\) だった」ではなく「\(T\) を強制的に \(t\) にした」ときの \(Y\) の期待値——これを \(E[Y\mid do(T=t)]\) と書く(\(do\) 記法)——が、観測データだけから次のように計算できる:

\[ E[Y\mid do(T=t)]=\sum_s E[Y\mid T=t, S=s]P(S=s) \]

(\(S\) の値ごとに \(T=t\) の人の \(Y\) の平均を取り、\(S\) の分布で重み付き平均する。通常の条件付き期待値 \(E[Y\mid T=t]\) との違いは、\(S\) の分布を「\(T=t\) の人たちの分布」ではなく「全体の分布」で重み付けする点で、これが交絡を取り除く。)

これが決定的な結論を与える. 「どの変数で調整すべきか」はデータからは決まらない。 因果構造(DAG)を仮定して初めて決まる。

「とりあえず全部の変数を入れておけば安全」は誤りである。 中間変数や合流点を入れると、かえってバイアスが生まれる。 22 章で「因果推論のための変数選択をデータに任せてはいけない」と書いたのは、この意味である。

4. 観察データから因果を推定する方法

(a) 層別・回帰調整

交絡因子で層別し、層ごとの効果を重み付き平均する。あるいは重回帰に交絡因子を投入する(19 章)。

前提: すべての交絡因子を測定できている。式で書くと、測った変数(共変量)をまとめて \(X\) として \((Y(1),Y(0))\perp T\mid X\)——\(X\) が同じ人どうしでは処置の有無が潜在的結果と独立——で、無交絡性(条件付き独立性とも呼ぶ。同じ条件の 2 つの名前)という。

これは検証不可能な仮定である. 「測っていない交絡因子がない」ことは データからは絶対に確認できない。だからこそ、 観察研究の結論には常に「未測定交絡の可能性」という留保がつく。

(b) 傾向スコア (propensity score)

\[ e(X)=P(T=1\mid X) \]

「共変量 \(X\)(3 節 の交絡因子 \(Z\) に当たる、測定済みの変数たち)を持つ人が処置を受ける確率」。ふつうロジスティック回帰(21 章)で推定する。

定理(Rosenbaum & Rubin): 無交絡性が成り立つなら、 傾向スコアだけで条件付ければ十分である。

\[ (Y(1),Y(0))\perp T \mid X \quad\Longrightarrow\quad (Y(1),Y(0))\perp T\mid e(X) \]

理由: \(e(X)\) の値が同じ人たちの中で、処置を受ける確率は \(Y(1),Y(0)\) を知っても変わらない。実際、無交絡性より \(P(T=1\mid Y(1),Y(0),X)=P(T=1\mid X)=e(X)\) なので、これを「\(e(X)\) が同じ人たち」で平均すると \(P(T=1\mid Y(1),Y(0),e(X))=e(X)=P(T=1\mid e(X))\)。つまり \(e(X)\) が同じ層の中では、処置は確率 \(e(X)\) のコイン投げと同じで、潜在的結果と独立である。∎

多次元の \(X\) を 1 次元のスコアに圧縮できるのが最大の利点である。 共変量が 50 個あっても、傾向スコアという 1 つの数値でマッチングできる。

使い方内容
マッチングスコアが近い処置群と対照群をペアにする
層別スコアで 5 分位に分け、層ごとに比較
IPW(逆確率重み付け)処置群は \(1/e(X)\)、対照群は \(1/(1-e(X))\) で重み付けして疑似的なランダム化を作る(受けにくかったのに受けた人、受けやすかったのに受けなかった人を重く数える)
共変量調整回帰にスコアを入れる

バランスチェック(必須): マッチング後に共変量が両群で揃っているか、 標準化平均差(両群の平均の差を、両群を合わせた標準偏差で割ったもの。0.1 未満なら揃っているとみなす、というのが慣例的な目安)で確認する。

傾向スコアは魔法ではない. 調整できるのは測った変数だけである。 RCT と違い、未測定の交絡は一切扱えない。 「傾向スコアを使ったから因果が言える」というのは誤りで、 無交絡性という強い仮定に依存していることを常に明記すべきである。

(c) 差分の差分法 (DID)

処置群と対照群を、処置前後で比較する(\(\bar Y\) は各群・各時期の \(Y\) の平均)。

\[ \text{DID}=\underbrace{(\bar Y_{1,\text{後}}-\bar Y_{1,\text{前}})}_{\text{処置群の変化}}-\underbrace{(\bar Y_{0,\text{後}}-\bar Y_{0,\text{前}})}_{\text{対照群の変化}} \]

回帰で書くと(\(\text{Post}\) は処置後の観測なら 1、処置前なら 0 の変数)

\[ Y = \beta_0+\beta_1 T + \beta_2 \text{Post} + \beta_3(T\times\text{Post})+\varepsilon \]

\(\beta_3\) が DID 推定量である(19 章の交互作用)。

前提: 平行トレンド仮定 — 処置がなければ、両群は同じ変化をしたはずである。

なぜ強力なのか. 群の固定的な違い(\(\beta_1\))も、時間による共通の変化(\(\beta_2\))も、 引き算で消える。時間不変の未測定交絡を除去できるのが大きい。

検証方法: 処置前に複数時点のデータがあれば、 処置前のトレンドが平行だったかを確認できる(プレトレンド検定)。

(d) 操作変数法 (IV)

操作変数 \(W\)(3 節 の交絡因子 \(Z\) とは役割が正反対の変数なので、文字を分ける。文献では \(Z\) と書くことが多い)の条件:

  1. 関連性: \(W\) は処置 \(T\) に影響する
  2. 除外制約: \(W\) は \(T\) を通じてのみ \(Y\) に影響する
  3. 独立性: \(W\) は未測定交絡と無関係
\[ \hat\tau_{IV}=\frac{\text{Cov}(W,Y)}{\text{Cov}(W,T)} \]

(\(\text{Cov}\) は共分散(06 章)。「\(W\) が動いたとき \(Y\) がどれだけ動くか」を「\(W\) が動いたとき \(T\) がどれだけ動くか」で割ったもので、2 段階最小二乗法 (2SLS) で実装する。)

古典的な例: 「軍隊経験が生涯収入に与える影響」を推定したい。 志願兵は元々の特性が違うので比較できない。 そこで徴兵くじの番号を操作変数に使う。 くじはランダムなので交絡と無関係(条件 3)、徴兵確率に影響し(条件 1)、 徴兵以外の経路で収入に影響しない(条件 2)。

除外制約は検証できない仮定である。理屈で正当化するしかない。 また弱い操作変数(条件 1 が弱い)だと推定が極めて不安定になるので、 第 1 段階(\(T\) を \(W\) に回帰する段階)の F 統計量(19 章)が 10 を超えるかを必ず確認する(Staiger と Stock による経験的な目安)。

(e) 回帰不連続デザイン (RDD)

処置が「ある閾値を超えたかどうか」で決まる場合、閾値のすぐ両側を比較する。

例: 試験で 60 点以上が奨学金を受け取る。 59 点の学生と 61 点の学生は、能力的にほぼ同じはずである。 閾値の近傍では、実質的にランダム化が起きていると見なせる。

前提: 閾値の前後で他の要因が連続的であること。 学生が閾値を操作できないこと(点数を意図的に調整できるなら成立しない)。 密度の連続性(McCrary 検定)で確認する。

5. 手法の比較

手法必要な仮定強さ(因果の主張の確からしさ=内的妥当性の目安。仮定が少なく検証しやすいほど星が多い)
RCTランダム化が正しく行われた★★★★★
RDD閾値近傍の連続性★★★★
操作変数法除外制約(検証不可)★★★★
DID平行トレンド★★★
傾向スコア無交絡性(検証不可)★★
回帰調整無交絡性 + 関数形が正しい★★
単純な相関—☆

6. 感度分析

観察研究では、未測定交絡の可能性を定量的に評価する。

手法内容
E 値観測された関連を説明し尽くすのに必要な、未測定交絡の強さ
Rosenbaum 境界マッチング研究で、結論が覆るのに必要な偏りの大きさ

E 値の使い方: 「E 値 = 3.2」なら、 「この結果を偽物にするには、リスク比(03 章)3.2 以上の強さで 処置と結果の両方に関連する未測定交絡が必要」という意味になる。 そんな強い交絡因子が実際に考えられるかを、ドメイン知識で判断する。

観察研究の結論は「因果である」ではなく「これだけ強い交絡がなければ因果である」 という形で述べるのが誠実である。

7. ブラッドフォード・ヒルの視点

疫学で古くから使われる、因果を判断するための観点。統計的検定ではなく判断の枠組みである。

観点内容
関連の強さ効果が大きいほど交絡で説明しにくい
一貫性異なる集団・方法で再現される
特異性特定の原因と特定の結果
時間性原因が結果に先行する(必須条件)
用量反応関係曝露が増えれば効果も増える
もっともらしさ生物学的機序が説明できる
整合性既存の知識と矛盾しない
実験的証拠介入すると変化する
類似性似た事例が知られている

時間性だけが絶対条件で、他は補強材料である. 喫煙と肺がんの因果は、RCT を行わずにこれらの証拠の積み重ねで確立された。 単一の研究ではなく、証拠の総体で判断する——これが実務の姿である。

8. 実験計画法の基礎

RCT を効率的に設計するための古典的な技法。

原則内容
反復 (replication)誤差の大きさを推定できるようにする
無作為化 (randomization)系統的な偏りを排除
局所管理 (local control)ブロック化で誤差を小さくする

主な設計

設計内容
完全無作為化単純にランダム割付
乱塊法ブロック内でランダム化。同一個体を 1 つのブロックとみなせば 15 章の反復測定と同じ構造になる
ラテン方格2 方向のブロック化
要因計画複数因子を同時に。交互作用が見られる
直交表少ない試行数で多因子を評価(タグチメソッド)

要因計画の効率. 3 因子を各 2 水準で調べるとき、\(2^3=8\) 通りの要因計画では、どの因子の効果も「4 回 vs 4 回」の比較で推定できる。 1 因子ずつ変える実験で同じ「4 回 vs 4 回」の精度を出すには、因子ごとに 8 回、合計 24 回近く要る。 つまり要因計画は 同じ試行数で精度が高く、しかも交互作用まで分かる。 15 章の二元配置分散分析は、この設計の解析法である。

9. まとめ

概念内容
因果効果\(Y(1)-Y(0)\)。片方は永遠に観測できない
選択バイアス処置群と対照群がもともと違うこと
RCTランダム化で未測定交絡も含めてバランスする
交絡因子(fork)調整する
中間変数(chain)調整しない
合流点(collider)調整しない(するとバイアスが生まれる)
DID時間不変の交絡を除去。平行トレンドが前提
操作変数除外制約が要。検証不可能