統計 12 · 仮説検定の枠組み — p 値・2 種類の誤り・検出力

Chapter 12

仮説検定の枠組み — p 値・2 種類の誤り・検出力

この章がなぜ必要なのか——統計で最も使われ、最も誤解されている道具.

「新薬 A は既存薬より効くのか」「デザイン B の方がクリック率が高いのか」—— こうした問いに答えるための標準的な手続きが仮説検定である。

だが p 値ほど誤解されている概念は他にない。 「p < 0.05 だから正しい」「p = 0.06 だから効果がない」——どちらも誤りである。

この章では、検定の論理を背理法から組み立て直し、 p 値が本当は何を測っているのかを正確に定める。 ここを曖昧にしたまま 13 章以降の具体的な検定に進むと、 計算はできるが結論を読み違える、という最悪の状態になる。

この章で使う既出の用語(定義は各リンク先). 母集団・母数・統計量(01 章 2 節)、条件付き確率 \(P(A\mid B)\)(04 章 4 節)、 ベイズの定理・事前確率・尤度・偽陽性/偽陰性(05 章 2〜3 節)、尤度比(05 章 4 節)、 標本平均と標準誤差(06 章 6 節)、標準正規分布と 1.96(08 章 4 節)、t 分布(08 章 8 節)、 標本分布(09 章 1 節)、尤度関数 \(L(\theta)\)(10 章 3 節)、信頼区間(11 章 1〜3 節)。

1. 検定の論理 — 統計版の背理法

数学の背理法

「\(\sqrt 2\) が無理数」を示すには、有理数だと仮定して矛盾を導く。矛盾したので仮定が誤り。

統計の背理法

矛盾は導けない。データは常に「起こりうる」からである。だから代わりにこう言う。

「差がない」と仮定する。その仮定のもとで、観測されたデータは極めて起こりにくい。 ならば、その仮定を疑うのが自然だろう。

これが仮説検定である。数学の背理法と違い、確率的な背理法であることに注意。 「起こりにくいことが起きた」だけかもしれない——この可能性は原理的に排除できない。

2 つの仮説

仮説記号内容
帰無仮説 (null hypothesis)\(H_0\)「差がない」「効果がない」——否定したい方
対立仮説 (alternative)\(H_1\)「差がある」——主張したい方

なぜ「無に帰したい仮説」を立てるのか. 「差がある」は無数の形があり(0.1 の差か、100 の差か)、確率計算ができない。 一方「差がちょうど 0」は 1 点なので、そのもとでの分布が計算できる。 だから「否定したい方」を仮定するのである。 母数を 1 点に決める仮説を単純仮説、範囲で指定する仮説(\(\mu\ne\mu_0\) など)を複合仮説という。\(H_0\) は通常単純仮説、\(H_1\) は通常複合仮説である。

基準値 \(\mu_0\) は問題設定から決まる(製品の仕様値、既存薬の効果、前回調査の値など)。「差がない」の検定なら差の基準値は 0 である。

これは「無罪推定」の構造と同じである。まず無罪(\(H_0\))と仮定し、 証拠が十分に強ければ有罪(\(H_1\))を認める。証拠不十分なら無罪のまま—— ただしそれは「無実が証明された」という意味ではない。

2. 検定の手順

  1. \(H_0\) と \(H_1\) を立てる(データを見る前に)
  2. 有意水準 \(\alpha\) を決める(データを見る前に)。\(\alpha\) は「\(H_0\) が正しいのに誤って棄却してしまう確率」として自分で許容する上限で、慣習は 0.05(4 節)
  3. 検定統計量——データから計算し、\(H_0\) からのずれの大きさを測る統計量(例: \(t = (\bar x-\mu_0)/(s/\sqrt n)\))——を計算する
  4. \(H_0\) のもとでの検定統計量の分布を求める
  5. p 値を計算する(または棄却域——\(H_0\) のもとで起きる確率が合計 \(\alpha\) になるように定めた、検定統計量の極端な値の範囲——に入るかを見る。「\(p<\alpha\)」と「棄却域に入る」は同じことである)
  6. \(p < \alpha\) なら \(H_0\) を棄却、そうでなければ「棄却できない」

1・2 が「データを見る前に」なのは絶対条件である. データを見てから仮説や水準を決めると、後述する p ハッキングになり、 検定の理論的保証がすべて失われる(17 章)。

3. p 値の正確な定義

\[ \boxed{p\text{ 値} = H_0 \text{ が真であるという仮定のもとで、観測された値以上に極端な値が得られる確率}} \]

何を「極端」とみなすかは \(H_1\) の向きで決まる。検定統計量を \(T\)、観測値を \(t_{\text{obs}}\) とすると

\[ \text{両側(} H_1:\mu\ne\mu_0 \text{): } p = P(\lvert T\rvert \geq \lvert t_{\text{obs}}\rvert \mid H_0), \qquad \text{片側(} H_1:\mu>\mu_0 \text{): } p = P(T \geq t_{\text{obs}} \mid H_0) \]

強調すべき点:

04 章の「検察官の誤謬」がここに再登場する. \(P(\text{データ}\mid H_0)\) と \(P(H_0\mid\text{データ})\) は別物である。 前者を後者と読み替えるのが、p 値に関する最大の誤りである。

後者を知りたければ、05 章のベイズの定理により事前確率が必要になる。 p 値だけからは原理的に計算できない。

片側検定と両側検定

\(H_1\)p 値
両側\(\mu \neq \mu_0\)両裾の合計
片側\(\mu > \mu_0\)(または \(<\))片裾のみ

原則として両側を使う. 観測が \(H_1\) の向きに出ていれば片側の p 値は両側の半分になるので有意になりやすい(逆向きに出た場合は片側 p 値が 0.5 を超え、決して有意にならない)。 だが片側検定は反対方向の差を最初から無視するという強い主張を含む。 「新薬が既存薬より悪いことは絶対にありえない」と本気で言えるときだけ許される。

データを見てから「こっちの方向だったから片側で」とやるのは、明確な不正である。

4. 2 種類の誤り

\(H_0\) が真\(H_0\) が偽
棄却する第 1 種の誤り \(\alpha\)正しい判断(検出力 \(1-\beta\))
棄却しない正しい判断第 2 種の誤り \(\beta\)
誤り別名意味
第 1 種 \(\alpha\)偽陽性、あわて者の誤り効果がないのに「ある」と言う
第 2 種 \(\beta\)偽陰性、ぼんやり者の誤り効果があるのに見逃す

裁判の比喩で. 第 1 種の誤り = 冤罪(無実の人を有罪にする)。 第 2 種の誤り = 真犯人の取り逃がし。

「疑わしきは罰せず」とは、\(\alpha\) を小さく抑えることを優先する立場である。 検定の手続きそのものが制御するのは \(\alpha\) だけで、\(\beta\) は手続きの中では制御されない。 \(\beta\) を抑えるのは実験を設計する段階の仕事(5 節 の検出力分析)で、そこでの慣習が \(\beta=0.2\)(検出力 80%)である。 2 つの誤りは非対称に扱われている——これは数学ではなく、社会的な選択である。

\(\alpha\) と \(\beta\) のトレードオフ

\(\alpha\) を小さくすると(棄却しにくくすると)\(\beta\) は大きくなる。 \(n\) を固定したまま両方小さくすることはできない。 両方減らす唯一の方法は \(n\) を増やすことである。

有意水準 0.05 の由来

根拠は薄い. フィッシャーが 1920 年代に「便利な目安」として使い始め、慣習として定着した。 フィッシャー自身「絶対的な基準ではない」と繰り返し述べている。

分野によって基準は違う。素粒子物理学では新粒子の発見に 5σ——標準正規分布で 5 より大きい値が出る片側確率 \(p < 2.9\times 10^{-7}\)——を要求する。 ゲノム解析では 100 万回の検定を行うので \(p<5\times10^{-8}\) を使う。 0.05 に神聖な意味はない。 文脈で決めるべきものである。

5. 検出力 (power)

\[ \text{検出力} = 1-\beta = P(H_0 \text{ を棄却} \mid H_1 \text{ が真}) \]

「本当に差があるとき、それを見つけられる確率」。

検出力を決める 4 要素

要素増やすと検出力は
効果量 \(d\)(真の差を \(\sigma\) で割ったもの。次項)上がる
標本サイズ \(n\)上がる
有意水準 \(\alpha\)上がる(が第 1 種の誤りも増える)
ばらつき \(\sigma\)下がる

この 4 つのうち 3 つを決めれば残り 1 つが決まる。この関係を使うのが検出力分析である。

効果量 (effect size)

差を標準偏差で割った、単位のない量。

\[ \text{Cohen's } d = \frac{\mu_1-\mu_0}{\sigma} \]
\(d\)慣用的な表現
0.2小
0.5中
0.8大

必要サンプルサイズ(2 群の平均比較)

\[ \boxed{n \approx \frac{2(z_{\alpha/2}+z_\beta)^2}{d^2} \quad (\text{各群})} \]

ここで \(z_q\) は標準正規分布の上側 \(q\) 点(\(P(Z>z_q)=q\))。\(z_{0.025}=1.96\)、\(z_{0.2}=0.84\)。

導出(\(\sigma\) 既知、各群 \(n\) 人、両側検定): 2 群の平均の差 \(\bar X_1-\bar X_2\) の標準誤差は \(\sigma\sqrt{2/n}\) なので、検定統計量は \(Z = (\bar X_1-\bar X_2)/(\sigma\sqrt{2/n})\)。 \(H_0\) のもとで \(Z\sim N(0,1)\)、\(Z > z_{\alpha/2}\) で棄却する(真の差が正の側だけ考える)。 真の差が \(d\sigma\) なら \(Z\) の平均は \(d\sqrt{n/2}\) にずれるので、検出力は \(P(Z > z_{\alpha/2}) = P(N(0,1) > z_{\alpha/2} - d\sqrt{n/2})\)。 これを \(1-\beta\) にするには \(z_{\alpha/2} - d\sqrt{n/2} = -z_\beta\)、すなわち \(d\sqrt{n/2} = z_{\alpha/2}+z_\beta\)。両辺を二乗して \(n\) について解けば上の式。∎

\(\alpha=0.05\)(\(z_{\alpha/2}=1.96\))、検出力 80%(\(z_\beta=0.84\))なら \(2\times(1.96+0.84)^2 = 2\times 7.84 = 15.68\) なので

\[ n \approx \frac{15.7}{d^2} \]
効果量 \(d\)\(15.68/d^2\)各群の必要 \(n\)(切り上げ)
0.2(小)392.0392
0.5(中)62.763
0.8(大)24.525

検出力 80% が慣習. 「本当に差があるとき、5 回に 1 回は見逃す」設計である。 決して高い水準ではないが、\(n\) を増やすコストとの妥協点として定着している。

検出力分析は必ず実験前に行うこと。 事後に「検出力が低かったから有意にならなかった」 と言うのは意味がない(観測された効果量から計算した事後検出力は、p 値の言い換えにすぎない)。

検出力不足の深刻な帰結

検出力が低い研究は、有意になった場合でも信用できない.

直感に反するが、こう考えるとよい。検出力 20% の研究で有意差が出たとする。 真の効果が本当にあるなら、有意になる確率は 20%。 一方、真の効果がなくても 5% の確率で有意になる。 仮に「効果がある仮説」と「ない仮説」が事前に半々なら、

$$P(\text{本物}\mid\text{有意}) = \frac{0.20\times 0.5}{0.20\times 0.5 + 0.05\times 0.5} = \frac{0.10}{0.125}=80\%$$

検出力 80% なら \(0.40/0.425 = 94\%\)。検出力が低いほど、有意な結果の信頼性が落ちる。 しかも検出力が低い研究で有意になるには効果量が過大に出る必要があるので、 効果の大きさも誇張される(勝者の呪い)。

これは 05 章のベイズの定理そのものである。基準率を無視すると判断を誤る。

6. 具体例で通す

問題: ある工場の製品の平均重量は 100 g とされている。 25 個抜き取ったら平均 102 g、標準偏差 5 g だった。平均は 100 g から変化したか?(\(\alpha=0.05\))

手順 1-2:

\[ H_0: \mu = 100, \qquad H_1: \mu \neq 100, \qquad \alpha = 0.05 \]

手順 3: 検定統計量(\(\sigma\) 未知なので t)

\[ t = \frac{\bar x - \mu_0}{s/\sqrt{n}} = \frac{102-100}{5/\sqrt{25}} = \frac{2}{1} = 2.0 \]

手順 4: \(H_0\) のもとで \(t\sim t_{24}\)

手順 5: 両側 p 値。\(t_{24}\) で \(\lvert t\rvert\ge 2.0\) となる確率(t 分布表または統計ソフトで求める)は約 0.057。 (自由度 24 の両側 5% 点が 2.064 なので、2.0 はそれよりわずかに内側、つまり p はわずかに 0.05 より大きい。)

手順 6: \(p=0.057 > 0.05\) なので棄却できない。

この結論の正しい書き方. ❌ 「平均は 100 g である(\(H_0\) が正しい)」 ❌ 「差はなかった」 ⭕ 「平均が 100 g から変化したとは言えなかった(有意差なし)」

そして必ず信頼区間を併記する。この場合 95% CI は \(102\pm 2.064\times 1 = [99.94, 104.06]\)。 区間は 100 をぎりぎり含むが、104 g という実用上重要かもしれない差も含んでいる。 「差がない」ではなく「この程度の n では決められなかった」が正確な状況である。

7. 「有意でない」は「差がない」ではない

これは検定に関する第 2 の大誤解である。

結果言えること言えないこと
\(p<\alpha\)「\(H_0\) のもとでは起こりにくい」「\(H_0\) が偽である確率は \(1-p\)」
\(p\ge\alpha\)「\(H_0\) を否定する証拠が足りない」「\(H_0\) が正しい」「差がない」

証拠がないことは、ないことの証拠ではない. 検出力が低ければ、本物の差があっても簡単に見逃す。 \(p=0.4\) でも、信頼区間が \([-10, +25]\) のように広ければ、 「差がない」どころか「大きな差があるかもしれないが分からない」が正しい。

本当に「差がない」を主張したいなら、非劣性試験や同等性試験を使う。 それは「差が \(\pm\Delta\) より小さい」を対立仮説にする、別の枠組みである。 同等性試験の標準的な方法 TOST (two one-sided tests) は、「差 \(\le -\Delta\)」と「差 \(\ge\Delta\)」を帰無仮説とする 2 つの片側検定を行い、両方を棄却できたときに「差は \(\pm\Delta\) の内側」と結論する。

8. p 値が「有意」でも重要とは限らない

\(n\) を大きくすればどんな微小な差も有意になる。\(\bar x-\mu_0\) と \(s\) を固定して \(n\) だけ増やすと

\[ t = \frac{\bar x - \mu_0}{s/\sqrt{n}} \propto \sqrt{n} \]

例: 6 節 の工場で、真の差が 0.01 g しかなく \(s=5\) g だとする。\(n=10^6\) なら \(t = 0.01/(5/1000) = 2.0\)(\(p\approx 0.046\))、\(n=10^7\) なら \(t = 0.01/(5/\sqrt{10^7}) \approx 6.3\)(\(p\approx 3\times10^{-10}\))で、\(n\) を増やせば必ず有意になる。 だがその差に実用上の意味はあるか?

\[ \boxed{\text{統計的有意性} \neq \text{実質的重要性}} \]

だから必ず効果量と信頼区間を報告する. p 値は「偶然で説明しにくいか」だけを答え、「どれだけ大きいか」は答えない。 意思決定に必要なのは後者である。

A/B テストで「有意にコンバージョン率が向上(+0.02 ポイント)」という結果が出たとき、 実装コストに見合うかを決めるのは p 値ではなく効果量と信頼区間である。

9. p 値の誤用一覧(2016 年 ASA 声明の要旨)

アメリカ統計協会が異例の声明を出すほど、p 値の誤用は深刻である。要点は 6 つ。

  1. p 値はデータとモデルの適合しにくさを示す
  2. p 値は「\(H_0\) が真である確率」ではない
  3. 科学的結論を p < 0.05 だけで決めるべきではない
  4. 適切な推論には完全な報告と透明性が必要(p ハッキングをしない、17 章)
  5. p 値は効果の大きさも結果の重要性も測らない
  6. p 値だけでは証拠の強さの尺度として不十分

10. ネイマン・ピアソンの補題(理論的な補足)

「同じ有意水準のもとで、検出力(5 節)が最も高くなる検定統計量は何か」に答える定理。

単純仮説どうし \(H_0:\theta=\theta_0\) vs \(H_1:\theta=\theta_1\)(1 節 で述べたように、\(H_1\) も 1 点に決めた場合)において、 有意水準 \(\alpha\) を満たす検定の中で検出力が最大になるのは、尤度比検定である。\(L(\theta)\) は尤度関数(10 章 3 節)。

\[ \Lambda = \frac{L(\theta_1)}{L(\theta_0)} > k \quad\text{のとき棄却} \]

(\(k\) は \(P(\Lambda>k\mid H_0) = \alpha\) となるように選ぶ。)

証明: データ \(x\) に対し、尤度比検定が棄却するなら 1、しないなら 0 を \(\varphi^*(x)\)、同じ有意水準の任意の検定を \(\varphi(x)\) とする。 \(\varphi^*=1\) のところでは \(L_1 - kL_0 > 0\) かつ \(\varphi^*-\varphi\ge 0\)、\(\varphi^*=0\) のところでは \(L_1-kL_0\le 0\) かつ \(\varphi^*-\varphi\le 0\) なので、どちらでも \((\varphi^*-\varphi)(L_1-kL_0)\ge 0\)。 \(x\) について積分すると

\[ \underbrace{\int(\varphi^*-\varphi)L_1\,dx}_{\text{検出力の差}} \;\ge\; k\underbrace{\int(\varphi^*-\varphi)L_0\,dx}_{=\alpha-\alpha_\varphi\ \ge\ 0} \]

右辺は「両検定の第 1 種の誤りの差」の \(k\) 倍で、\(\varphi\) の有意水準は \(\alpha\) 以下だから 0 以上。よって尤度比検定の検出力は \(\varphi\) の検出力以上。∎

05 章の尤度比がここに戻ってきた. ベイズでは事前オッズに掛ける量だったが、 頻度論では「最良の検定統計量」として現れる。 立場は違っても、証拠の強さは尤度比で測るという点は共通している。

13 章〜15 章で扱う t 検定・χ² 検定・F 検定も、実は尤度比検定(あるいはその近似)として導出できる。 個別の検定はこの原理の具体化であり、一般の形の尤度比検定は 21 章 5 節 で扱う。

11. まとめ

概念定義
\(H_0\)「差がない」。否定したい仮説
p 値\(H_0\) のもとで、観測以上に極端な値が出る確率
\(\alpha\)(第 1 種)効果がないのに「ある」と言う確率
\(\beta\)(第 2 種)効果があるのに見逃す確率
検出力\(1-\beta\)。慣習は 80%
効果量\(d=(\mu_1-\mu_0)/\sigma\)
必要 \(n\)\(\approx 15.7/d^2\)(2 群、\(\alpha\)=.05、power 80%)