統計 11 · 区間推定 — 「95% 信頼区間」の本当の意味

Chapter 11

区間推定 — 「95% 信頼区間」の本当の意味

この章がなぜ必要なのか——点推定だけでは判断できない.

「標本平均は 170.2 cm でした」——それで? この数字がどれだけ信用できるのかが分からなければ、意思決定に使えない。 \(n=5\) で得た 170.2 と、\(n=10000\) で得た 170.2 は、まったく重みが違う。

区間推定は「この幅のどこかに真値がありそうだ」という形で、 推定値と一緒に不確かさを伝える。

そして「95% 信頼区間」の意味は、ほぼすべての人が最初に誤解する。 「真値がこの区間に入る確率が 95%」ではない。 その理由をこの章で正確に押さえる。

この章で使う既出の用語(定義は各リンク先). 母集団・母数・標本(01 章 2 節)、標本平均 \(\bar x\)・標本標準偏差 \(s\)(02 章)、 期待値・分散・独立な和の分散(06 章 3〜5 節)、標本平均 \(\bar X\) の分散と標準誤差(06 章 6 節)、 二項分布と \(V[\hat p]\)(07 章 3 節)、正規分布 \(N(\mu,\sigma^2)\)・標準正規分布 \(N(0,1)\)(平均 0、分散 1)・1.96 などの数値(08 章 4 節)、 χ² 分布と標本分散の関係(08 章 7 節)、t 分布と自由度(08 章 8 節)、 中心極限定理と二項分布の正規近似(09 章 3 節)、主な統計量の標本分布(09 章 4 節)、 推定量・推定値(点推定値とも呼ぶ。1 つの値で推定したもの)・不偏性(10 章 1〜2 節)。

1. 信頼区間の考え方

導出(母平均、\(\sigma\) 既知の場合)

09 章 3〜4 節より、\(n\) が十分大きいか母集団が正規分布(08 章 4 節)なら

\[ Z = \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \sim N(0,1) \]

標準正規分布では、95% の確率で \(-1.96 \le Z \le 1.96\) である(1.96 は両側 5% 点。08 章 4 節)。

\[ P\left(-1.96 \leq \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \leq 1.96\right) = 0.95 \]

中の不等式を \(\mu\) について解く。各辺に \(\sigma/\sqrt{n}\) を掛け、\(\bar X\) を引き、\(-1\) を掛けて(不等号の向きが反転する)並べ直す。

\[ -1.96\frac{\sigma}{\sqrt n} \le \bar X - \mu \le 1.96\frac{\sigma}{\sqrt n} \;\Longleftrightarrow\; -\bar X - 1.96\frac{\sigma}{\sqrt n} \le -\mu \le -\bar X + 1.96\frac{\sigma}{\sqrt n} \;\Longleftrightarrow\; \bar X - 1.96\frac{\sigma}{\sqrt n} \le \mu \le \bar X + 1.96\frac{\sigma}{\sqrt n} \]
\[ P\left(\bar{X}-1.96\frac{\sigma}{\sqrt{n}} \leq \mu \leq \bar{X}+1.96\frac{\sigma}{\sqrt{n}}\right)=0.95 \]
\[ \boxed{\text{95\% 信頼区間: } \bar{x} \pm 1.96\frac{\sigma}{\sqrt{n}}} \]

一般に、区間が真値を外す割合を \(\alpha\)(95% なら \(\alpha=0.05\))とし、\(1-\alpha\) を信頼係数と呼ぶ。 \(z_{\alpha/2}\) は標準正規分布の上側 \(\alpha/2\) 点、すなわち \(P(Z>z_{\alpha/2}) = \alpha/2\) となる値で、両裾を合わせて \(\alpha\) を外側に残す。

信頼係数\(z_{\alpha/2}\)
90%1.645
95%1.960
99%2.576
\[ \boxed{\text{推定値} \pm (\text{臨界値})\times(\text{標準誤差})} \]

この形はこの先ずっと繰り返し現れる。すべての信頼区間はこの形をしている。

2. 「95%」の意味 — ここを間違えない

正しい解釈: 「同じ手順で標本を取り、区間を作ることを何度も繰り返せば、 作られた区間のうち 95% が真の \(\mu\) を含む」

誤った解釈: 「真の \(\mu\) がこの区間に入る確率が 95%」

なぜ後者が誤りなのか

頻度論の立場では、\(\mu\) は固定された定数である(05 章)。定数だから確率変数ではない。 「\(\mu\) が [168.14, 172.26](3 節 で計算する区間)に入る確率」は、0 か 1 のどちらかであって、95% ではない。 入っているか入っていないかのどちらかで、私たちがそれを知らないだけである。

ランダムなのは区間の方である。標本を取り直せば区間の位置が変わる。 95% とは、その手順の長期的な成功率を指している。

たとえ話. 輪投げを考える。杭(\(\mu\))は動かない。輪(区間)を投げる。 「95% 信頼区間」とは「この投げ方なら 100 回中 95 回は杭に入る」という腕前の宣言である。 一度投げてしまった後に「この輪が杭に入っている確率は 95%」と言うのは奇妙だ。 入っているか、いないか、それだけである。

「真値がこの区間にある確率が 95%」と言いたいなら、ベイズの信用区間を使うしかない(23 章)。 「信頼区間」と「信用区間」は漢字 1 字違いだが別の概念で、区間の数値がほぼ同じになることも多いが、主張している内容が違う。

この違いが実務で効く場面

3. 母平均の信頼区間(\(\sigma\) 未知 — 実用形)

現実には \(\sigma\) は分からない。標本標準偏差 \(s\)(02 章)で置き換えると、\((\bar X-\mu)/(s/\sqrt n)\) は自由度 \(n-1\) の t 分布に従う(08 章 8 節。自由度は「\(s^2\) の計算で自由に動ける偏差の個数」で、\(\sum(x_i-\bar x)=0\) の拘束 1 本ぶん減って \(n-1\))。 1 節 と同じ変形で、\(1.96\) を t 分布の上側 \(\alpha/2\) 点 \(t_{n-1,\alpha/2}\) に置き換えればよい。

\[ \boxed{\bar{x} \pm t_{n-1,\alpha/2}\frac{s}{\sqrt{n}}} \]

前提: 母集団が正規分布、または \(n\) が十分大きい。

例: \(n=25\)、\(\bar x = 170.2\)、\(s=5.0\)。自由度 24 の t 分布の上側 2.5% 点は \(t_{24,0.025}=2.064\)(t 分布表または統計ソフトで求める。08 章 8 節の表で自由度 10 が 2.228、30 が 2.042 なのでその間の値)。

\[ 170.2 \pm 2.064\times\frac{5.0}{\sqrt{25}} = 170.2\pm 2.064 = [168.14,\ 172.26] \]

\(z\) を使うと 170.2 ± 1.96 = [168.24, 172.16] となり、区間が狭くなる。 \(\sigma\) を知らないという不確かさを無視した分、自信過剰な区間になっている。 \(n\) が小さいほどこの差は大きい。

4. 母比率の信頼区間

\(X\sim\text{Bin}(n,p)\) の成功回数から \(\hat p = X/n\) とすると、\(V[\hat p]=V[X]/n^2 = p(1-p)/n\)(07 章 3 節)。 中心極限定理で \(\hat p\approx N(p, p(1-p)/n)\)(09 章 3 節)なので 1 節 と同じ形の区間が作れる。標準誤差の中の \(p\) は未知なので \(\hat p\) で置き換えて

\[ \boxed{\hat{p} \pm z_{\alpha/2}\sqrt{\frac{\hat p(1-\hat p)}{n}}} \]

これをワルド信頼区間と呼ぶ。正規近似が成り立つ目安(09 章 3 節 と同じ)として \(np\ge5\) かつ \(n(1-p)\ge5\) 程度が要る。

例(世論調査): \(n=1000\)、支持率 \(\hat p = 0.42\)。

\[ 0.42 \pm 1.96\sqrt{\frac{0.42\times 0.58}{1000}} = 0.42\pm 1.96\times 0.0156 = 0.42\pm 0.031 \]
\[ [38.9\%,\ 45.1\%] \]

報道の「支持率 42%、誤差 ±3%」はこれである. 「前回 44% から 42% に下落」と報じられても、 どちらの区間も大きく重なっているので、変化があったとは言えないことが多い。 ニュースを読むときに真っ先に確認すべきは、この誤差幅である。

ワルド区間の欠陥と改良

\(\hat p\) が 0 や 1 に近いと、ワルド区間は破綻する。 \(\hat p = 0\) なら区間幅が 0 になり「支持率はぴったり 0%」という馬鹿げた結論になる。

改良版:

方法式特徴
ウィルソン区間\(\dfrac{\hat p + \frac{z^2}{2n} \pm z\sqrt{\frac{\hat p(1-\hat p)}{n}+\frac{z^2}{4n^2}}}{1+\frac{z^2}{n}}\)被覆確率が良好。推奨
Agresti-Coull成功に 2、失敗に 2 を足してからワルド簡便でウィルソンに近い
Clopper-Pearson二項分布から厳密に保守的(区間が広め)だが確実

ウィルソン区間の導出: ワルド区間は標準誤差の \(p\) を \(\hat p\) で置き換えたが、置き換えずに「\(\lvert\hat p - p\rvert \le z\sqrt{p(1-p)/n}\) を満たす \(p\) の集合」を求める。両辺を二乗して \(p\) について整理すると 2 次不等式

\[ \left(1+\frac{z^2}{n}\right)p^2 - \left(2\hat p + \frac{z^2}{n}\right)p + \hat p^2 \le 0 \]

になり、その 2 つの解(2 次方程式の解の公式)が区間の両端である。\(z^2/(2n)\) は「中心を \(\hat p\) から \(1/2\) の側へ少し寄せる」項、\(z^2/(4n^2)\) は「\(\hat p=0\) でも幅が 0 にならない」ようにする項として効く。∎

Clopper-Pearson の考え方: 「\(p\) がこの値なら、観測された \(X\) 以下(以上)の値が出る確率は \(\alpha/2\)」となる \(p\) を二項分布から直接求め、両端とする。

「成功 0 回」の落とし穴. \(n=20\) で不具合が 1 件も出なかった。「不具合率は 0%」か? 違う。 Clopper-Pearson の 95% 上限 \(p_U\) は「\(p=p_U\) のとき 0 件になる確率がちょうど 5%」となる値、すなわち \((1-p_U)^{20} = 0.05\) の解で、\(p_U = 1-0.05^{1/20} \approx 13.9\%\) である。

一般に、\(n\) 回中 0 回なら上限はおよそ \(3/n\)(3 の法則)。\((1-p)^n = 0.05\) の対数を取ると \(n\log(1-p) \approx -np = \log 0.05 \approx -3\) だからである。 \(n=100\) なら 3%、\(n=1000\) なら 0.3%。 「一度も起きていない」は「起きない」ではない。安全性の議論で決定的に重要である。

5. 2 群の差の信頼区間

平均の差(独立 2 標本)

\[ V[\bar X_1 - \bar X_2] = \frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2} \]

(06 章: 独立なら差の分散は分散の和。)

等分散を仮定する場合(プールした分散を使う):

\[ s_p^2 = \frac{(n_1-1)s_1^2+(n_2-1)s_2^2}{n_1+n_2-2} \]
\[ (\bar x_1-\bar x_2)\pm t_{n_1+n_2-2,\alpha/2}s_p\sqrt{\frac{1}{n_1}+\frac{1}{n_2}} \]

等分散を仮定しない場合(ウェルチ法、推奨):

\[ (\bar x_1-\bar x_2)\pm t_{\nu,\alpha/2}\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}} \]

自由度はウェルチ・サタスウェイトの近似:

\[ \nu = \frac{\left(\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}\right)^2}{\frac{(s_1^2/n_1)^2}{n_1-1}+\frac{(s_2^2/n_2)^2}{n_2-1}} \]

この式の出所: t 分布になるには、分母の分散推定量 \(Q = s_1^2/n_1 + s_2^2/n_2\) が「\(\sigma_Q^2\chi^2_\nu/\nu\) の形」(08 章 8 節)である必要があるが、2 つの χ² の重み付き和は正確にはその形にならない。 そこで平均と分散が一致する \(\nu\) を選んで近似する。\(\chi^2_\nu/\nu\) は平均 1、分散 \(2/\nu\) なので、\(Q\) の平均を \(E[Q]\)、分散を \(V[Q]\) とすると \(V[Q] = 2(E[Q])^2/\nu\)、すなわち \(\nu = 2(E[Q])^2/V[Q]\)。 各 \((n_i-1)s_i^2/\sigma_i^2\sim\chi^2_{n_i-1}\)(分散 \(2(n_i-1)\))より \(V[s_i^2] = 2\sigma_i^4/(n_i-1)\) だから

\[ \nu = \frac{2\left(\frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2}\right)^2}{\frac{2(\sigma_1^2/n_1)^2}{n_1-1}+\frac{2(\sigma_2^2/n_2)^2}{n_2-1}} \]

の \(\sigma_i^2\) を \(s_i^2\) で置き換えたものが上の式である。∎

迷ったらウェルチを使う. 等分散の検定をしてから選ぶ、という手順は 「検定の結果で次の検定を選ぶ」ことになり、全体の誤り率が制御できなくなる。 ウェルチは等分散でも性能がほとんど落ちないので、最初からウェルチで通すのが現代の推奨である。 R の t.test() の既定がウェルチなのはこの理由による。

比率の差

\[ (\hat p_1 - \hat p_2)\pm z_{\alpha/2}\sqrt{\frac{\hat p_1(1-\hat p_1)}{n_1}+\frac{\hat p_2(1-\hat p_2)}{n_2}} \]

A/B テストで最もよく使う式である。

6. 分散の信頼区間

\(\dfrac{(n-1)s^2}{\sigma^2}\sim\chi^2_{n-1}\)(08 章)より

\[ P\left(\chi^2_{n-1,1-\alpha/2} \leq \frac{(n-1)s^2}{\sigma^2} \leq \chi^2_{n-1,\alpha/2}\right)=1-\alpha \]

(\(\chi^2_{n-1,q}\) は自由度 \(n-1\) の χ² 分布の上側 \(q\) 点。)中の不等式の各辺の逆数を取ると不等号の向きが反転し、\((n-1)s^2\) を掛けて \(\sigma^2\) について解ける。

\[ \frac{1}{\chi^2_{n-1,\alpha/2}} \le \frac{\sigma^2}{(n-1)s^2} \le \frac{1}{\chi^2_{n-1,1-\alpha/2}} \quad\Longrightarrow\quad \boxed{\left[\frac{(n-1)s^2}{\chi^2_{n-1,\alpha/2}},\ \frac{(n-1)s^2}{\chi^2_{n-1,1-\alpha/2}}\right]} \]

χ² 分布は左右非対称なので、この区間も点推定値 \(s^2\) を中心にしない(左右対称にならない)。

分散の区間は非常に広い. \(n=20\)(自由度 19)では \(\chi^2_{19,0.025} = 32.85\)、\(\chi^2_{19,0.975} = 8.91\) なので、95% 区間は \([19s^2/32.85,\ 19s^2/8.91] = [0.58s^2,\ 2.13s^2]\) にもなる。分散を精度よく推定するには、平均よりずっと多くのデータが要る。 「ばらつきが変わった」という主張には慎重であるべき理由である。

7. 区間の幅を決めるもの

\[ \text{幅} = 2\times z_{\alpha/2}\times\frac{\sigma}{\sqrt{n}} \]
変えるもの幅への影響
\(n\) を 4 倍幅は 半分
信頼係数 95%→99%幅は 1.31 倍(\(2.576/1.96\))
\(\sigma\) が 2 倍幅は 2 倍

信頼係数を上げれば区間は広がる. 当然である。 「絶対に外さない」区間を作りたければ \((-\infty,\infty)\) にすればよいが、それは何の情報も持たない。 確実さと情報量はトレードオフであり、95% はその妥協点として慣習的に選ばれているにすぎない。

8. 信頼区間 vs 予測区間 — 混同注意

種類何を含むか幅
信頼区間母平均 \(\mu\)(1 つの定数)\(\pm t\dfrac{s}{\sqrt{n}}\)
予測区間次の 1 個の観測値 \(X_{n+1}\)\(\pm ts\sqrt{1+\dfrac{1}{n}}\)

予測区間の導出: 予測誤差 \(X_{n+1}-\bar{X}\) の分散は

\[ V[X_{n+1}]+V[\bar X] = \sigma^2 + \frac{\sigma^2}{n} = \sigma^2\left(1+\frac{1}{n}\right) \]

(\(X_{n+1}\) は既存の標本と独立なので分散が足される。) 正規母集団なら \(X_{n+1}-\bar X\) は平均 0 の正規分布なので \(\dfrac{X_{n+1}-\bar X}{\sigma\sqrt{1+1/n}}\sim N(0,1)\)。 \(\sigma\) を \(s\) で置き換えると、\(s^2\) は \(\bar X\) とも \(X_{n+1}\) とも独立なので 3 節 と同じ理由で \(t_{n-1}\) になり、上の表の式を得る。∎

決定的な違い: \(n\to\infty\) で信頼区間の幅は 0 に収束するが、 予測区間の幅は \(\pm 1.96\sigma\) に収束して0 にならない。

どれだけデータを集めても、次の 1 人の身長は当てられない。 減らせるのは「平均がどこにあるか」の不確かさだけであって、 個体そのもののばらつきは減らせないからである。

実務でこれを取り違えると大事故になる。「平均納期の信頼区間は ±1 日」だからといって、 「次の注文は ±1 日で届く」わけではない。18 章の回帰でも同じ区別が現れる。

9. 信頼区間と検定の関係

この節は仮説検定の言葉を先取りして使う(正式な定義は 12 章)。 「\(H_0: \mu=\mu_0\)」は帰無仮説、すなわち「母平均は基準値 \(\mu_0\) である」という仮定で、 「有意水準 5% の両側検定で \(H_0\) を棄却する」とは、\(\lvert\bar x-\mu_0\rvert > t_{n-1,0.025}\cdot\text{SE}\)(観測が \(H_0\) のもとで 5% しか起きない極端さ)のときに \(H_0\) を否定する手続きである。

\[ \boxed{\text{95\% 信頼区間が } \mu_0 \text{ を含まない} \iff \text{有意水準 5\% の両側検定で } H_0:\mu=\mu_0 \text{ を棄却}} \]

なぜ同値なのか: 信頼区間は「\(\lvert\bar x-\mu_0\rvert \le t\cdot\text{SE}\) を満たす \(\mu_0\) の集合」であり、 検定は「\(\lvert\bar x - \mu_0\rvert > t\cdot\text{SE}\) なら棄却」。同じ不等式を逆向きに読んでいるだけである。

だから信頼区間の方が情報量が多い. 検定は「棄却/しない」の 2 値しか返さないが、 信頼区間は「棄却されない \(\mu_0\) の範囲全体」を教えてくれる。 しかも効果の大きさとその精度が同時に読める。

現代の統計ガイドライン(多くの医学誌を含む)が 「p 値だけでなく必ず信頼区間を報告せよ」と定めているのはこのためである。 17 章でこの問題を改めて扱う。

10. まとめ

対象信頼区間
母平均(\(\sigma\) 既知)\(\bar x \pm z_{\alpha/2}\sigma/\sqrt{n}\)
母平均(\(\sigma\) 未知)\(\bar x \pm t_{n-1,\alpha/2}s/\sqrt{n}\)
母比率\(\hat p\pm z_{\alpha/2}\sqrt{\hat p(1-\hat p)/n}\)(ウィルソン推奨)
平均の差ウェルチ法
分散χ² を使う。非対称
予測区間\(\bar x\pm ts\sqrt{1+1/n}\)