Chapter 17
多重比較と再現性 — 20 回検定すれば 1 回は「有意」になる
この章がなぜ必要なのか——科学が直面している最大の統計問題.
2010 年代、心理学・医学・経済学など多くの分野で 「過去の有名な研究結果が再現できない」ことが次々と明らかになった(再現性の危機)。 ある大規模プロジェクトでは、心理学の主要論文 100 本を追試したところ、 有意な結果を再現できたのは 4 割弱にとどまった。
原因の中心は、統計手法そのものではなく使い方にある。 検定を繰り返す、有意になるまでデータを追加する、有意な結果だけ発表する—— どれも悪意なくやってしまえるのに、結果として文献全体が汚染される。
この章は、12 章で学んだ検定を現実の研究プロセスの中でどう扱うべきかを扱う。 統計を「使える人」と「信頼できる人」を分けるのは、ここの理解である。
この章で使う既出の用語(定義は各リンク先). ブールの不等式(04 章 3 節)、ベイズの定理・事前確率(05 章 1〜2 節)、 帰無仮説・棄却・p 値・片側/両側(12 章 1〜3 節)、有意水準 \(\alpha\)・第 1 種の誤り(12 章 4 節)、検出力・効果量・勝者の呪い(12 章 5 節)、 信頼区間(11 章)、テューキー HSD・ダネット検定(15 章 4 節)。 公表バイアスは 01 章 3 節 で名前だけ挙げたものを本章 5 節 で詳しく扱う。ボンフェローニ補正とホルム法も 15 章 4 節 で名前だけ挙げたものを本章 2 節 で導く。
1. 多重比較問題
問題の本質
\(m\) 個の独立な検定を行い、すべての \(H_0\) が真だとする。 少なくとも 1 つが誤って有意になる確率(ファミリーワイズ誤り率、FWER)は、「どれも有意にならない」確率 \((1-\alpha)^m\) の余事象なので
(検定どうしが正に相関していれば FWER はこれより小さくなり、極端にすべて同じ検定なら \(\alpha\) のままである。独立の場合の値が実務上の目安として使われる。)
| \(m\) | FWER(\(\alpha=0.05\)) |
|---|---|
| 1 | 5% |
| 5 | 23% |
| 10 | 40% |
| 20 | 64% |
| 100 | 99.4% |
| 1,000,000(ゲノム解析) | ほぼ 1 |
有名な風刺: 「緑のジェリービーンズはニキビの原因」. ある漫画(xkcd)が的確に描いている—— 20 色のジェリービーンズをそれぞれニキビとの関連で検定し、 19 色は有意でなかったが緑だけ \(p<0.05\) になった。 新聞の見出しは「緑のジェリービーンズとニキビに関連!(95% の確率で偶然ではない)」。
20 回検定すれば 1 回は偶然有意になる。これが多重比較問題の本質である。 そして実際の研究では、19 回の失敗は報告されないことが多い。
どこで発生するか
多重比較は、明示的な「20 回の検定」だけで起きるのではない。
| 場面 | 実質的な検定回数 |
|---|---|
| 3 群のペア比較 | 3 |
| 10 個の従属変数を測る | 10 |
| 5 つの部分集団で分析(男女別、年代別…) | 5 以上 |
| ゲノムワイド関連解析 | 100 万以上 |
| fMRI の全ボクセル解析 | 数万〜数十万 |
| A/B テストを毎日覗く | 覗いた回数 |
「死んだ鮭の fMRI」. 2009 年、ある研究者たちが死んだ大西洋サケの脳を fMRI にかけ、 「人物写真を見せて感情を推測させる」課題を与えた。 多重比較補正なしで解析したところ、死んだ魚の脳に有意な活動領域が検出された。 これは多重比較補正の必要性を示すために意図的に行われた実験で、 イグ・ノーベル賞を受賞している。
2. FWER を制御する方法
ボンフェローニ補正
各検定を \(\alpha/m\) で判定する(または p 値を \(m\) 倍して \(\alpha\) と比べる)。
なぜ FWER が制御されるのか: 04 章のブールの不等式より
(各検定を有意水準 \(\alpha/m\) で判定しているので \(P(A_i) = \alpha/m\)。)
∎ 独立性を仮定しなくても成り立つのが大きな長所である。
欠点は保守的すぎること. 検定が正の相関を持つ場合(実務ではよくある)、 実際の FWER は \(\alpha\) よりずっと小さくなり、検出力を無駄に失う。 \(m=100\) なら各検定を \(p<0.0005\) で判定することになり、本物の効果もほとんど検出できない。
ホルム法(ボンフェローニの改良)
p 値を小さい順に \(p_{(1)}\le p_{(2)}\le\cdots\le p_{(m)}\) と並べ、
を満たすかを \(i=1\) から順にチェック。最初に満たさなくなったところで停止し、それ以降はすべて非有意とする。
| 順位 \(i\) | 閾値 |
|---|---|
| 1 | \(\alpha/m\) |
| 2 | \(\alpha/(m-1)\) |
| ... | ... |
| \(m\) | \(\alpha\) |
ホルム法はボンフェローニより常に良い. FWER の制御は同じく厳密で、 かつ棄却できる仮説は常にボンフェローニ以上である。 ボンフェローニを使う理由は「説明が簡単」以外にない。 実務ではホルム法を既定にしてよい。
その他
| 方法 | 特徴 |
|---|---|
| シダック補正 | \(\alpha'=1-(1-\alpha)^{1/m}\)。独立を仮定。わずかに強力 |
| テューキー HSD | ペア比較専用。厳密で強力(15 章) |
| ダネット | 対照群との比較のみ。比較数が減るぶん強力(15 章) |
3. FDR — 別の考え方
FWER は「1 つでも誤りがあれば失敗」という厳しい基準である。 探索的研究(1 万個の遺伝子から候補を絞る)ではこれでは何も見つからない。
そこで基準を変える。
「有意と判定したもののうち、偽陽性が占める割合」を制御する。
ベンジャミニ・ホッホバーグ法 (BH 法)
- p 値を昇順に並べる
- \(p_{(i)} \leq \dfrac{i}{m}q\) を満たす最大の \(i\) を見つける
- 順位 \(1\) から \(i\) までをすべて有意とする
例: \(m=10\)、\(q=0.05\)。
| \(i\) | \(p_{(i)}\) | 閾値 \(\frac{i}{10}\times 0.05\) | 判定 |
|---|---|---|---|
| 1 | 0.001 | 0.005 | ✓ |
| 2 | 0.008 | 0.010 | ✓ |
| 3 | 0.012 | 0.015 | ✓ |
| 4 | 0.031 | 0.020 | ✗ |
| 5 | 0.033 | 0.025 | ✗ |
| 6 | 0.041 | 0.030 | ✗ |
| 7 | 0.12 | 0.035 | ✗ |
| 8 | 0.35 | 0.040 | ✗ |
| 9 | 0.61 | 0.045 | ✗ |
| 10 | 0.88 | 0.050 | ✗ |
条件を満たす最大の \(i\) は 3。よって上位 3 つを有意とする。 (\(i=4,5\) が閾値を超えていても、\(i=3\) までは有意になる点に注意。)
FWER と FDR の使い分け
| FWER | FDR | |
|---|---|---|
| 制御するもの | 1 つでも誤る確率 | 誤りの割合 |
| 厳しさ | 厳しい | 緩い |
| 検出力 | 低い | 高い |
| 使う場面 | 確証的研究、規制当局への申請、臨床試験の主要評価項目 | 探索的研究、スクリーニング、オミクス解析 |
どちらが正しいかは目的による. 新薬の承認判断で「10 個中 1 個は偽物でもよい」とは言えない → FWER。 1 万個の遺伝子から次の実験の候補を絞るなら「上位 100 個のうち 5 個は外れでよい」→ FDR。
重要なのは「どちらを使ったかを明示すること」である。
4. p ハッキング
「有意な結果」を得るために、意識的・無意識的に分析を調整してしまう行為の総称。
典型的な手口
| 手口 | 内容 |
|---|---|
| オプショナル・ストッピング | 有意になるまでデータを追加し、なったらやめる |
| HARKing | 結果を見てから仮説を作り、最初からそう予測していたことにする |
| 外れ値の選択的除去 | 有意になる除去基準を探す |
| 従属変数の選択 | 10 個測って有意だった 1 個だけ報告 |
| 共変量の選択 | 入れたり抜いたりして有意になる組み合わせを探す |
| 部分集団の探索 | 全体で有意でなくても「40 代女性では有意」 |
| 片側/両側の切替 | 結果を見てから片側にする |
これらの多くは悪意なく行われる. 研究者は「データをよく見ているだけ」と感じている。 だが「分析の自由度」(researcher degrees of freedom) が多いほど、 偶然の有意を拾う確率は跳ね上がる。
Simmons らの 2011 年の論文は、シミュレーションで「従属変数を 2 つ測ってどちらかで判定」「途中で 10 人追加」「共変量の出し入れ」「条件の一部を落とす」の 4 つを組み合わせるだけで 第 1 種の誤り率が 5% から 60% を超えることを示した。 同じ論文は、実データを使って「特定の曲を聴くと実年齢が若返る」という 物理的に不可能な結論を p<0.05 で「実証」してみせている。
オプショナル・ストッピングの深刻さ
A/B テストで「毎日 p 値をチェックして、0.05 を下回ったら実験終了」とすると、 真に差がなくても最終的に有意になる確率は 5% ではなく、たとえば 20 回チェックするなら約 20〜30% に達する(シミュレーションによる値。チェック回数を増やすほど上がり、無限に続ければいつか必ず下回る)。 上の「60% 超」が複数の自由度を組み合わせた値であるのに対し、これは覗き見 1 つだけの効果である。
なぜか. p 値は試行ごとにランダムに揺れる。 十分な回数チェックすれば、いつかは 0.05 を下回る瞬間が来る。 「下回った瞬間に止める」というルール自体が、偏りを生む。
正しい対処:
- サンプルサイズを事前に決め、それまで結果を見ない(最も単純で確実)
- どうしても途中で見たいなら逐次検定——途中で何度か見ることを前提に各回の閾値を厳しくして全体で \(\alpha\) を保つ設計。O'Brien-Fleming 境界は早い時点ほど厳しく最後に 0.05 近くまで緩め、Pocock 境界は毎回同じ厳しめの閾値を使う——や、 always-valid p 値(いつ止めても第 1 種の誤り率が \(\alpha\) を超えないように作った p 値。混合逐次確率比検定 mSPRT はその代表)を使う
- ベイズ流の逐次モニタリング(23 章)
5. 公表バイアス
有意な結果の方が発表されやすいという構造的な偏り。
帰結: 文献に載っている効果量は、真の効果より系統的に大きい。 有意になるには効果が大きく出る必要があるので、 「たまたま大きく出た研究」だけが選ばれて残る(勝者の呪い。12 章 5 節。オークションで落札者は価値を最も過大評価した人である、という経済学の用語から)。
だからメタアナリシスで効果を集計しても、公表バイアスがあれば過大評価になる。
検出する方法
| 方法 | 内容 |
|---|---|
| ファンネルプロット | 効果量 vs 精度の散布図。対称でなければ疑わしい |
| エッガー検定 | ファンネルの非対称性を検定 |
| p-curve | 有意な p 値の分布を見る。0.05 直下に山があれば p ハッキングの兆候 |
| トリム・アンド・フィル | 欠けている研究を推定して補正 |
p-curve の理屈が面白い. 真の効果があるなら、p 値は 0 に近いほど多く出る(右下がりの分布)。 真の効果がなく p ハッキングだけがあるなら、 0.05 のすぐ下に不自然な山ができる(0.049 で止めるから)。 分布の形から、文献全体の健全性を診断できる。
6. 対策 — どうすればよいか
研究者側
| 対策 | 内容 |
|---|---|
| 事前登録 (preregistration) | 仮説・分析計画・サンプルサイズをデータ収集前に公開登録する |
| Registered Report | 結果が出る前に査読を受け、掲載を確定させる。公表バイアスを構造的に排除 |
| サンプルサイズの事前設計 | 検出力分析(12 章)を実施 |
| 多重比較補正の明示 | どの方法で何回分補正したか |
| 全結果の報告 | 有意でなかったものも含めて |
| データ・コードの公開 | 再解析可能にする |
| 効果量と信頼区間の報告 | p 値だけで語らない |
読者側 — 論文を読むときのチェックリスト
- ☐ サンプルサイズは事前に決められていたか(検出力分析の記載があるか)
- ☐ 事前登録されているか。登録内容と論文の内容は一致しているか
- ☐ 何回検定したか。多重比較補正はあるか
- ☐ 効果量と信頼区間が報告されているか
- ☐ p 値が 0.045〜0.049 に集中していないか
- ☐ 部分集団解析が「後付け」でないか
- ☐ 追試(replication)はあるか
最後の項目が最も重要である. 単一の研究で \(p<0.05\) が出ても、 それは「注目に値する」以上のことは意味しない。 独立した追試で再現されて初めて、知見と呼べる。
7. 「p<0.05」から離れる動き
p 値の閾値を下げる提案
一部の研究者は「\(p<0.005\) を新しい基準にすべき」と提案している。 理由はベイズ的な計算による。ベイズ因子(\(H_1\) のもとでデータが出る確率と \(H_0\) のもとで出る確率の比。23 章 6 節)で測ると、 \(p=0.05\) ちょうどのデータは、\(H_1\) に最も有利な事前分布を選んでも \(H_0\) に対してせいぜい 2.5〜3.4 倍の証拠にしかならない(Berger と Sellke による 1987 年の計算など)。 「20 回に 1 回」という響きより、実は思ったより弱い。
「統計的有意性」を廃止する提案
2019 年、800 人以上の科学者が連名で 「statistical significance という二分法をやめよう」と提唱した。
主張の核心: p=0.049 と p=0.051 の間に本質的な違いはない。 にもかかわらず、前者は「効果あり」、後者は「効果なし」と正反対に報告される。 連続的な証拠の強さを、恣意的な閾値で二値化することが問題を生んでいる。
代替案は「p 値を連続量として報告し、効果量・信頼区間・文脈と合わせて総合判断する」。 「有意/非有意」というラベルを貼らない。
実際、多くの学術誌がこの方向に舵を切りつつある。 12 章で「必ず効果量と信頼区間を報告せよ」と述べたのは、この流れに沿っている。
8. ベイズ的な視点からの整理
05 章のベイズの定理で、有意な結果の信頼性を計算してみる。
- 検定する仮説のうち、真に効果があるものの割合(事前確率)を \(\pi\)
- 検出力を \(1-\beta\)、有意水準を \(\alpha\)
(ベイズの定理で、事前確率 \(\pi\)、尤度 \(P(\text{有意}\mid\text{本物}) = 1-\beta\)、\(P(\text{有意}\mid\text{偽}) = \alpha\) とおいたもの。以下の表は \(\alpha = 0.05\)。)
| \(\pi\) | 検出力 | 有意な結果が本物である確率 |
|---|---|---|
| 50% | 80% | 94% |
| 10% | 80% | 64% |
| 10% | 20% | 31% |
| 1% | 80% | 14% |
| 1% | 20% | 3.9% |
これが再現性の危機の数学的な説明である. 探索的な研究では、そもそも本物の効果がある仮説の割合 \(\pi\) は低い。 そこに検出力不足が重なると、有意な結果の 7 割が偽物になりうる(表の \(\pi=10\%\)・検出力 20% の行: 本物は 31%、つまり 69% が偽物)。
対策は 2 つ: \(\pi\) を上げる(理論に基づいた仮説を立てる)か、 検出力を上げる(サンプルサイズを増やす)か。 「とりあえずデータを取って何か有意なものを探す」という研究スタイルは、 この式に照らすと極めて非効率であることが分かる。
9. まとめ
| 概念 | 内容 |
|---|---|
| FWER | 1 つでも誤る確率。\(1-(1-\alpha)^m\) |
| ボンフェローニ | \(\alpha/m\)。単純だが保守的 |
| ホルム法 | 常にボンフェローニ以上。推奨 |
| FDR | 有意としたもののうち偽陽性の割合 |
| BH 法 | FDR を制御。探索的研究向け |
| p ハッキング | 有意になるまで分析を調整すること |
| 公表バイアス | 有意な結果だけが世に出る |
- 検定を繰り返せば偽陽性は必ず出る。20 回で 64%。
- 確証的研究は FWER(ホルム法)、探索的研究は FDR(BH 法)。
- オプショナル・ストッピングは第 1 種の誤りを 20〜30% に押し上げる。事前にサンプルサイズを決める。
- 事前登録・全結果の報告・効果量と信頼区間の併記が現代の標準。
- 単一の \(p<0.05\) は知見ではない。追試されて初めて知見になる。