Chapter 11
区間推定 — 「95% 信頼区間」の本当の意味
この章がなぜ必要なのか——点推定だけでは判断できない.
「標本平均は 170.2 cm でした」——それで? この数字がどれだけ信用できるのかが分からなければ、意思決定に使えない。 \(n=5\) で得た 170.2 と、\(n=10000\) で得た 170.2 は、まったく重みが違う。
区間推定は「この幅のどこかに真値がありそうだ」という形で、 推定値と一緒に不確かさを伝える。
そして「95% 信頼区間」の意味は、ほぼすべての人が最初に誤解する。 「真値がこの区間に入る確率が 95%」ではない。 その理由をこの章で正確に押さえる。
この章で使う既出の用語(定義は各リンク先). 母集団・母数・標本(01 章 2 節)、標本平均 \(\bar x\)・標本標準偏差 \(s\)(02 章)、 期待値・分散・独立な和の分散(06 章 3〜5 節)、標本平均 \(\bar X\) の分散と標準誤差(06 章 6 節)、 二項分布と \(V[\hat p]\)(07 章 3 節)、正規分布 \(N(\mu,\sigma^2)\)・標準正規分布 \(N(0,1)\)(平均 0、分散 1)・1.96 などの数値(08 章 4 節)、 χ² 分布と標本分散の関係(08 章 7 節)、t 分布と自由度(08 章 8 節)、 中心極限定理と二項分布の正規近似(09 章 3 節)、主な統計量の標本分布(09 章 4 節)、 推定量・推定値(点推定値とも呼ぶ。1 つの値で推定したもの)・不偏性(10 章 1〜2 節)。
1. 信頼区間の考え方
導出(母平均、\(\sigma\) 既知の場合)
09 章 3〜4 節より、\(n\) が十分大きいか母集団が正規分布(08 章 4 節)なら
標準正規分布では、95% の確率で \(-1.96 \le Z \le 1.96\) である(1.96 は両側 5% 点。08 章 4 節)。
中の不等式を \(\mu\) について解く。各辺に \(\sigma/\sqrt{n}\) を掛け、\(\bar X\) を引き、\(-1\) を掛けて(不等号の向きが反転する)並べ直す。
一般に、区間が真値を外す割合を \(\alpha\)(95% なら \(\alpha=0.05\))とし、\(1-\alpha\) を信頼係数と呼ぶ。 \(z_{\alpha/2}\) は標準正規分布の上側 \(\alpha/2\) 点、すなわち \(P(Z>z_{\alpha/2}) = \alpha/2\) となる値で、両裾を合わせて \(\alpha\) を外側に残す。
| 信頼係数 | \(z_{\alpha/2}\) |
|---|---|
| 90% | 1.645 |
| 95% | 1.960 |
| 99% | 2.576 |
この形はこの先ずっと繰り返し現れる。すべての信頼区間はこの形をしている。
2. 「95%」の意味 — ここを間違えない
正しい解釈: 「同じ手順で標本を取り、区間を作ることを何度も繰り返せば、 作られた区間のうち 95% が真の \(\mu\) を含む」
誤った解釈: 「真の \(\mu\) がこの区間に入る確率が 95%」
なぜ後者が誤りなのか
頻度論の立場では、\(\mu\) は固定された定数である(05 章)。定数だから確率変数ではない。 「\(\mu\) が [168.14, 172.26](3 節 で計算する区間)に入る確率」は、0 か 1 のどちらかであって、95% ではない。 入っているか入っていないかのどちらかで、私たちがそれを知らないだけである。
ランダムなのは区間の方である。標本を取り直せば区間の位置が変わる。 95% とは、その手順の長期的な成功率を指している。
たとえ話. 輪投げを考える。杭(\(\mu\))は動かない。輪(区間)を投げる。 「95% 信頼区間」とは「この投げ方なら 100 回中 95 回は杭に入る」という腕前の宣言である。 一度投げてしまった後に「この輪が杭に入っている確率は 95%」と言うのは奇妙だ。 入っているか、いないか、それだけである。
「真値がこの区間にある確率が 95%」と言いたいなら、ベイズの信用区間を使うしかない(23 章)。 「信頼区間」と「信用区間」は漢字 1 字違いだが別の概念で、区間の数値がほぼ同じになることも多いが、主張している内容が違う。
この違いが実務で効く場面
- 「95% 信頼区間が 0 を含まなかった」→「効果がある確率が 95%」ではない
- 複数の研究の信頼区間を見比べるとき、それぞれ別々の手順の産物である
- 事前情報を組み込みたいなら、頻度論の信頼区間では原理的に不可能
3. 母平均の信頼区間(\(\sigma\) 未知 — 実用形)
現実には \(\sigma\) は分からない。標本標準偏差 \(s\)(02 章)で置き換えると、\((\bar X-\mu)/(s/\sqrt n)\) は自由度 \(n-1\) の t 分布に従う(08 章 8 節。自由度は「\(s^2\) の計算で自由に動ける偏差の個数」で、\(\sum(x_i-\bar x)=0\) の拘束 1 本ぶん減って \(n-1\))。 1 節 と同じ変形で、\(1.96\) を t 分布の上側 \(\alpha/2\) 点 \(t_{n-1,\alpha/2}\) に置き換えればよい。
前提: 母集団が正規分布、または \(n\) が十分大きい。
例: \(n=25\)、\(\bar x = 170.2\)、\(s=5.0\)。自由度 24 の t 分布の上側 2.5% 点は \(t_{24,0.025}=2.064\)(t 分布表または統計ソフトで求める。08 章 8 節の表で自由度 10 が 2.228、30 が 2.042 なのでその間の値)。
\(z\) を使うと 170.2 ± 1.96 = [168.24, 172.16] となり、区間が狭くなる。 \(\sigma\) を知らないという不確かさを無視した分、自信過剰な区間になっている。 \(n\) が小さいほどこの差は大きい。
4. 母比率の信頼区間
\(X\sim\text{Bin}(n,p)\) の成功回数から \(\hat p = X/n\) とすると、\(V[\hat p]=V[X]/n^2 = p(1-p)/n\)(07 章 3 節)。 中心極限定理で \(\hat p\approx N(p, p(1-p)/n)\)(09 章 3 節)なので 1 節 と同じ形の区間が作れる。標準誤差の中の \(p\) は未知なので \(\hat p\) で置き換えて
これをワルド信頼区間と呼ぶ。正規近似が成り立つ目安(09 章 3 節 と同じ)として \(np\ge5\) かつ \(n(1-p)\ge5\) 程度が要る。
例(世論調査): \(n=1000\)、支持率 \(\hat p = 0.42\)。
報道の「支持率 42%、誤差 ±3%」はこれである. 「前回 44% から 42% に下落」と報じられても、 どちらの区間も大きく重なっているので、変化があったとは言えないことが多い。 ニュースを読むときに真っ先に確認すべきは、この誤差幅である。
ワルド区間の欠陥と改良
\(\hat p\) が 0 や 1 に近いと、ワルド区間は破綻する。 \(\hat p = 0\) なら区間幅が 0 になり「支持率はぴったり 0%」という馬鹿げた結論になる。
改良版:
| 方法 | 式 | 特徴 |
|---|---|---|
| ウィルソン区間 | \(\dfrac{\hat p + \frac{z^2}{2n} \pm z\sqrt{\frac{\hat p(1-\hat p)}{n}+\frac{z^2}{4n^2}}}{1+\frac{z^2}{n}}\) | 被覆確率が良好。推奨 |
| Agresti-Coull | 成功に 2、失敗に 2 を足してからワルド | 簡便でウィルソンに近い |
| Clopper-Pearson | 二項分布から厳密に | 保守的(区間が広め)だが確実 |
ウィルソン区間の導出: ワルド区間は標準誤差の \(p\) を \(\hat p\) で置き換えたが、置き換えずに「\(\lvert\hat p - p\rvert \le z\sqrt{p(1-p)/n}\) を満たす \(p\) の集合」を求める。両辺を二乗して \(p\) について整理すると 2 次不等式
になり、その 2 つの解(2 次方程式の解の公式)が区間の両端である。\(z^2/(2n)\) は「中心を \(\hat p\) から \(1/2\) の側へ少し寄せる」項、\(z^2/(4n^2)\) は「\(\hat p=0\) でも幅が 0 にならない」ようにする項として効く。∎
Clopper-Pearson の考え方: 「\(p\) がこの値なら、観測された \(X\) 以下(以上)の値が出る確率は \(\alpha/2\)」となる \(p\) を二項分布から直接求め、両端とする。
「成功 0 回」の落とし穴. \(n=20\) で不具合が 1 件も出なかった。「不具合率は 0%」か? 違う。 Clopper-Pearson の 95% 上限 \(p_U\) は「\(p=p_U\) のとき 0 件になる確率がちょうど 5%」となる値、すなわち \((1-p_U)^{20} = 0.05\) の解で、\(p_U = 1-0.05^{1/20} \approx 13.9\%\) である。
一般に、\(n\) 回中 0 回なら上限はおよそ \(3/n\)(3 の法則)。\((1-p)^n = 0.05\) の対数を取ると \(n\log(1-p) \approx -np = \log 0.05 \approx -3\) だからである。 \(n=100\) なら 3%、\(n=1000\) なら 0.3%。 「一度も起きていない」は「起きない」ではない。安全性の議論で決定的に重要である。
5. 2 群の差の信頼区間
平均の差(独立 2 標本)
(06 章: 独立なら差の分散は分散の和。)
等分散を仮定する場合(プールした分散を使う):
等分散を仮定しない場合(ウェルチ法、推奨):
自由度はウェルチ・サタスウェイトの近似:
この式の出所: t 分布になるには、分母の分散推定量 \(Q = s_1^2/n_1 + s_2^2/n_2\) が「\(\sigma_Q^2\chi^2_\nu/\nu\) の形」(08 章 8 節)である必要があるが、2 つの χ² の重み付き和は正確にはその形にならない。 そこで平均と分散が一致する \(\nu\) を選んで近似する。\(\chi^2_\nu/\nu\) は平均 1、分散 \(2/\nu\) なので、\(Q\) の平均を \(E[Q]\)、分散を \(V[Q]\) とすると \(V[Q] = 2(E[Q])^2/\nu\)、すなわち \(\nu = 2(E[Q])^2/V[Q]\)。 各 \((n_i-1)s_i^2/\sigma_i^2\sim\chi^2_{n_i-1}\)(分散 \(2(n_i-1)\))より \(V[s_i^2] = 2\sigma_i^4/(n_i-1)\) だから
の \(\sigma_i^2\) を \(s_i^2\) で置き換えたものが上の式である。∎
迷ったらウェルチを使う. 等分散の検定をしてから選ぶ、という手順は 「検定の結果で次の検定を選ぶ」ことになり、全体の誤り率が制御できなくなる。 ウェルチは等分散でも性能がほとんど落ちないので、最初からウェルチで通すのが現代の推奨である。 R の
t.test()の既定がウェルチなのはこの理由による。
比率の差
A/B テストで最もよく使う式である。
6. 分散の信頼区間
\(\dfrac{(n-1)s^2}{\sigma^2}\sim\chi^2_{n-1}\)(08 章)より
(\(\chi^2_{n-1,q}\) は自由度 \(n-1\) の χ² 分布の上側 \(q\) 点。)中の不等式の各辺の逆数を取ると不等号の向きが反転し、\((n-1)s^2\) を掛けて \(\sigma^2\) について解ける。
χ² 分布は左右非対称なので、この区間も点推定値 \(s^2\) を中心にしない(左右対称にならない)。
分散の区間は非常に広い. \(n=20\)(自由度 19)では \(\chi^2_{19,0.025} = 32.85\)、\(\chi^2_{19,0.975} = 8.91\) なので、95% 区間は \([19s^2/32.85,\ 19s^2/8.91] = [0.58s^2,\ 2.13s^2]\) にもなる。分散を精度よく推定するには、平均よりずっと多くのデータが要る。 「ばらつきが変わった」という主張には慎重であるべき理由である。
7. 区間の幅を決めるもの
| 変えるもの | 幅への影響 |
|---|---|
| \(n\) を 4 倍 | 幅は 半分 |
| 信頼係数 95%→99% | 幅は 1.31 倍(\(2.576/1.96\)) |
| \(\sigma\) が 2 倍 | 幅は 2 倍 |
信頼係数を上げれば区間は広がる. 当然である。 「絶対に外さない」区間を作りたければ \((-\infty,\infty)\) にすればよいが、それは何の情報も持たない。 確実さと情報量はトレードオフであり、95% はその妥協点として慣習的に選ばれているにすぎない。
8. 信頼区間 vs 予測区間 — 混同注意
| 種類 | 何を含むか | 幅 |
|---|---|---|
| 信頼区間 | 母平均 \(\mu\)(1 つの定数) | \(\pm t\dfrac{s}{\sqrt{n}}\) |
| 予測区間 | 次の 1 個の観測値 \(X_{n+1}\) | \(\pm ts\sqrt{1+\dfrac{1}{n}}\) |
予測区間の導出: 予測誤差 \(X_{n+1}-\bar{X}\) の分散は
(\(X_{n+1}\) は既存の標本と独立なので分散が足される。) 正規母集団なら \(X_{n+1}-\bar X\) は平均 0 の正規分布なので \(\dfrac{X_{n+1}-\bar X}{\sigma\sqrt{1+1/n}}\sim N(0,1)\)。 \(\sigma\) を \(s\) で置き換えると、\(s^2\) は \(\bar X\) とも \(X_{n+1}\) とも独立なので 3 節 と同じ理由で \(t_{n-1}\) になり、上の表の式を得る。∎
決定的な違い: \(n\to\infty\) で信頼区間の幅は 0 に収束するが、 予測区間の幅は \(\pm 1.96\sigma\) に収束して0 にならない。
どれだけデータを集めても、次の 1 人の身長は当てられない。 減らせるのは「平均がどこにあるか」の不確かさだけであって、 個体そのもののばらつきは減らせないからである。
実務でこれを取り違えると大事故になる。「平均納期の信頼区間は ±1 日」だからといって、 「次の注文は ±1 日で届く」わけではない。18 章の回帰でも同じ区別が現れる。
9. 信頼区間と検定の関係
この節は仮説検定の言葉を先取りして使う(正式な定義は 12 章)。 「\(H_0: \mu=\mu_0\)」は帰無仮説、すなわち「母平均は基準値 \(\mu_0\) である」という仮定で、 「有意水準 5% の両側検定で \(H_0\) を棄却する」とは、\(\lvert\bar x-\mu_0\rvert > t_{n-1,0.025}\cdot\text{SE}\)(観測が \(H_0\) のもとで 5% しか起きない極端さ)のときに \(H_0\) を否定する手続きである。
なぜ同値なのか: 信頼区間は「\(\lvert\bar x-\mu_0\rvert \le t\cdot\text{SE}\) を満たす \(\mu_0\) の集合」であり、 検定は「\(\lvert\bar x - \mu_0\rvert > t\cdot\text{SE}\) なら棄却」。同じ不等式を逆向きに読んでいるだけである。
だから信頼区間の方が情報量が多い. 検定は「棄却/しない」の 2 値しか返さないが、 信頼区間は「棄却されない \(\mu_0\) の範囲全体」を教えてくれる。 しかも効果の大きさとその精度が同時に読める。
現代の統計ガイドライン(多くの医学誌を含む)が 「p 値だけでなく必ず信頼区間を報告せよ」と定めているのはこのためである。 17 章でこの問題を改めて扱う。
10. まとめ
| 対象 | 信頼区間 |
|---|---|
| 母平均(\(\sigma\) 既知) | \(\bar x \pm z_{\alpha/2}\sigma/\sqrt{n}\) |
| 母平均(\(\sigma\) 未知) | \(\bar x \pm t_{n-1,\alpha/2}s/\sqrt{n}\) |
| 母比率 | \(\hat p\pm z_{\alpha/2}\sqrt{\hat p(1-\hat p)/n}\)(ウィルソン推奨) |
| 平均の差 | ウェルチ法 |
| 分散 | χ² を使う。非対称 |
| 予測区間 | \(\bar x\pm ts\sqrt{1+1/n}\) |
- 信頼区間は常に「推定値 ± 臨界値 × 標準誤差」の形。
- 95% は手順の成功率であって、その区間に真値が入る確率ではない。
- 幅は \(1/\sqrt{n}\) でしか縮まない。精度 2 倍にはデータ 4 倍。
- 信頼区間と予測区間は別物。後者は \(n\to\infty\) でも縮まない。
- 信頼区間と両側検定は同値。だが信頼区間の方が情報量が多い。