Chapter 09
標本分布・大数の法則・中心極限定理
この章がなぜ必要なのか——推測統計はここから始まる.
1000 人を測って平均 170.2 cm を得た。この 170.2 は、 選ぶ人が違えば別の値になる。つまり標本平均 \(\bar{X}\) 自身が確率変数である。
ならば \(\bar{X}\) にも分布がある。その分布さえ分かれば、 「170.2 という値から、真の \(\mu\) はどのあたりか」を確率で語れる。
そして驚くべきことに、元の分布が何であれ、\(\bar{X}\) の分布は正規分布に近づく。 これが中心極限定理であり、統計学で最も重要な定理である。 この 1 つの定理のおかげで、私たちは母集団の形を知らなくても推測ができる。
この章で使う既出の用語(定義は各リンク先). 推測統計(01 章 1 節)、母集団・標本・統計量(01 章 2 節)、 標本平均 \(\bar x\)・標本分散 \(s^2\) と「なぜ \(n-1\)」(02 章)、歪度(02 章)、チェビシェフの不等式(02 章 7 節)、 オッズ(03 章 8 節)、独立同分布 i.i.d.(04 章 5 節)、確率変数と cdf(06 章 1〜2 節)、 期待値・分散・\(V[aX+b]=a^2V[X]\)(06 章 3〜4 節)、標本平均 \(\bar X\) の期待値・分散と標準誤差(06 章 6 節)、 積率母関数 mgf と「独立な和の mgf は積」(06 章 7 節)、二項分布(07 章 3 節)、 正規分布・標準正規分布・1.96 などの数値(08 章 4 節)、χ²・t・F 分布と mgf の一意性定理(08 章 4 節, 7〜9 節)。 記号 \(X\sim\)(分布)は「その分布に従う」、\(\overset{iid}{\sim}\) は「独立に同じ分布に従う」と読む。
1. 標本分布 — 統計量もまた確率変数
3 つの分布を混同しない
統計を学ぶ人が最も混乱するのがここである。まったく別の 3 つの分布がある。
| 名前 | 何の分布か | 平均 | 標準偏差 |
|---|---|---|---|
| 母集団分布 | 個体 \(X\) の分布 | \(\mu\) | \(\sigma\) |
| 標本の分布 | 手元の \(n\) 個のヒストグラム | \(\bar{x}\) | \(s\) |
| 標本分布 (sampling distribution) | 統計量 \(\bar{X}\) の分布 | \(\mu\) | \(\sigma/\sqrt{n}\) |
(\(\mu,\sigma\) は母平均・母標準偏差、\(\bar x, s\) は手元のデータから計算した標本平均・標本標準偏差。 \(\bar X\) は「取り直すたびに変わる」標本平均を確率変数として大文字で書いたもので、\(\bar x\) はその実現値である。)
3 番目が新しい概念である. 「標本を取る → 平均を計算する」を何度も繰り返したとき、 出てくる平均値たちがどう散らばるか。それが標本分布である。
現実には標本は 1 組しか取らない。だが「もし何度も取ったら」という思考実験上の分布を考えることで、 手元の 1 つの値がどれだけ信用できるかを測れる。これが推測統計の全アイデアである。
用語が紛らわしいので、英語で押さえるとよい。 distribution of the sample(標本の分布)と sampling distribution(標本分布)は別物である。
標本平均の期待値と分散(06 章の再掲)
\(X_1,\dots,X_n \overset{iid}{\sim}\) 平均 \(\mu\)、分散 \(\sigma^2\) の分布とし、\(\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i\) とする。
(SE は標準誤差 standard error の略で、\(\bar X\) の標準偏差のこと。5 節 で詳しく扱う。)
この 2 つが標本分布の中心と幅である。あとは「形」が分かれば分布が完全に決まる。 その形を教えてくれるのが中心極限定理である。
2. 大数の法則 (Law of Large Numbers)
弱法則
「\(n\) を大きくすれば、標本平均が母平均から \(\varepsilon\) 以上ずれる確率はいくらでも小さくできる」(\(\forall\varepsilon>0\) は「どんな正の数 \(\varepsilon\) についても」の意味。\(\bar X_n\) は \(n\) 個の平均であることを添字で示したもの)。
証明(チェビシェフの不等式から 3 行)
02 章のチェビシェフの不等式 \(P(\lvert X-\mu\rvert \ge k\sigma_X)\le 1/k^2\) を、\(X\) の代わりに \(\bar{X}_n\)(平均 \(\mu\)、標準偏差 \(\sigma_X = \sigma/\sqrt n\))に適用する。 \(k\sigma_X = \varepsilon\) とおくと \(1/k^2 = \sigma_X^2/\varepsilon^2 = V[\bar X_n]/\varepsilon^2\) なので
∎
驚くほど簡単に証明できる. 必要なのは「分散が有限であること」だけである。 母集団の形は一切問わない。
強法則
「ほとんど確実に収束する」。弱法則より強い主張だが、実務上の意味はほぼ同じである。
何を保証し、何を保証しないか
保証すること: \(n\) を大きくすれば標本平均は母平均に近づく。だから推定は可能である。
保証しないこと: 「これまで表が多く出たから、これから裏が多く出る」——これは違う。 コインを 100 回投げて表が 60 回(+10 のずれ)だったとする。 さらに 9900 回投げれば、比率は 0.5 に近づく。しかし枚数の差は縮まらない。 むしろ枚数の差の標準偏差は \(\sqrt{n}\) で増える。 表の枚数 \(X\sim\text{Bin}(n, 1/2)\) の標準偏差は \(\sqrt{n\cdot\frac12\cdot\frac12} = \sqrt{n}/2\)(07 章 3 節)、比率 \(X/n\) の標準偏差はそれを \(n\) で割った \(1/(2\sqrt{n})\) だからである。
$$\text{比率のずれの標準偏差} = \frac{1}{2\sqrt{n}} \to 0, \qquad \text{枚数のずれの標準偏差} = \frac{\sqrt{n}}{2} \to \infty$$
過去の偏りは打ち消されるのではなく、大量の新しい試行に薄められるだけである。 これが 04 章のギャンブラーの誤謬に対する正確な回答である。
3. 中心極限定理 (Central Limit Theorem, CLT)
主張
\(X_1,\dots,X_n\) が i.i.d.、平均 \(\mu\)、有限の分散 \(\sigma^2\) を持つとする。このとき
(\(\xrightarrow{d}\) は分布収束: \(Z_n\) の cdf \(P(Z_n\le z)\) が、すべての \(z\) で \(\Phi(z)\) に近づくという意味。)同じことを言い換えると
これがどれほど異常な主張かを味わってほしい. 元の分布は何でもよい。一様分布でも、指数分布でも、 「0 か 1 しか取らない」ような極端に離散的な分布でも、 平均を取れば必ず正規分布の形になる。
だから統計では正規分布ばかり出てくる。世の中の量が正規分布だからではなく、 私たちが平均や和を見ているからである。
証明のあらすじ(積率母関数による)
\(Y_i = (X_i-\mu)/\sigma\)(平均 0、分散 1)と置く。\(Z_n = \frac{1}{\sqrt{n}}\sum Y_i\) である。
\(Y\) の積率母関数(mgf、06 章 7 節)を \(M(t)=E[e^{tY}]\) とすると、06 章 7 節 のとおり \(M(0)=1\)、\(M'(0)=E[Y]=0\)、\(M''(0)=E[Y^2]=1\)。 \(M(t)\) を \(t=0\) のまわりで 2 次までの多項式で近似する(テイラー展開)と
ここで \(o(t^2)\) は「\(t\to 0\) のとき \(t^2\) より速く 0 になる余り」を表す記号である。
独立な和の mgf は積(06 章 7 節)なので、\(Z_n = \sum (Y_i/\sqrt n)\) の mgf は \(M(t/\sqrt n)\) の \(n\) 乗になる。
対数を取ると、\(\log(1+u) = u + o(u)\)(\(u\to 0\))より
(余りの項は \(n\) 倍しても \(n\cdot o(1/n) = o(1) \to 0\) なので消える。これが \(\lim(1+a/n)^n = e^a\) の余り付き版である。)よって
これは標準正規分布の mgf である(08 章 4 節で導いた)。 mgf が 0 の近くで一致する分布は同じ分布であり(mgf の一意性定理。08 章 4 節 参照)、さらに mgf が各 \(t\) で収束すれば分布も収束することが知られているので、\(Z_n\xrightarrow{d}N(0,1)\)。∎
証明の急所は 1 か所だけ. テイラー展開で \(t^2/2\) の項だけが残り、 それを \(n\) 乗すると指数関数になる。 平均 0・分散 1 に標準化した時点で、2 次の項以外は \(n\to\infty\) で消える—— だから元の分布の詳細(3 次以上のモーメント)は結果に影響しない。 これが「元の分布が何でもよい」の数学的な理由である。
どのくらいの \(n\) が必要か
「\(n\ge 30\) なら正規近似してよい」という経験則が広く使われるが、元の分布の歪み(左右の非対称さ。02 章の歪度)による。
| 元の分布 | 必要な \(n\) の目安 |
|---|---|
| 正規分布 | 1(もともと正規) |
| 対称・単峰(一様など) | 5〜10 |
| 中程度に歪む(指数分布) | 30〜50 |
| 強く歪む(対数正規、二項で \(p\) が極端) | 100〜数百 |
| 分散が無限(コーシー分布) | どれだけ増やしても収束しない |
CLT が成り立たない例: コーシー分布. \(f(x)=\frac{1}{\pi(1+x^2)}\) は裾が重すぎて期待値も分散も存在しない。 実際 \(E[\lvert X\rvert] = \frac{2}{\pi}\int_0^\infty \frac{x}{1+x^2}dx = \frac{1}{\pi}\Big[\log(1+x^2)\Big]_0^\infty = \infty\) で、期待値を定める積分が発散する。 このとき標本平均の分布は \(n\) をいくら増やしても元のコーシー分布のままで、まったく収束しない。 「平均を取れば安定する」という直感が完全に崩れる。
実務では、金融のリターンなど裾の重いデータで 「\(n\) を増やしたのに推定が安定しない」という形で顔を出す。 CLT は無条件の魔法ではなく、分散が有限であることが前提である。
二項分布の正規近似
\(X\sim\text{Bin}(n,p)\) はベルヌーイの和なので、CLT がそのまま使える。
連続修正: 整数値しか取らない \(X\) を連続分布で近似するので、整数 \(k\) の棒を幅 1 の区間 \([k-0.5, k+0.5]\) で表す。 つまり \(P(X\le k)\) は \(P(X\le k+0.5)\)、\(P(X\ge k)\) は \(P(X\ge k-0.5)\) として正規分布で計算すると精度が上がる。
例: コイン 100 回で表が 60 回以上出る確率。
\(np=50\)、\(\sqrt{np(1-p)}=5\)。\(P(X\ge 60)\) なので \(60-0.5 = 59.5\) を使って連続修正し、
(厳密な二項計算では 0.0284。)
4. 主な統計量の標本分布
正規母集団 \(N(\mu,\sigma^2)\) からの i.i.d. 標本について、以下がすべて成り立つ。
| 統計量 | 分布 | 条件 |
|---|---|---|
| \(\bar{X}\) | \(N(\mu, \sigma^2/n)\) | 正規母集団なら厳密。一般でも \(n\) 大で近似 |
| \(\dfrac{\bar{X}-\mu}{\sigma/\sqrt{n}}\) | \(N(0,1)\) | \(\sigma\) 既知 |
| \(\dfrac{\bar{X}-\mu}{s/\sqrt{n}}\) | \(t_{n-1}\) | \(\sigma\) 未知 |
| \(\dfrac{(n-1)s^2}{\sigma^2}\) | \(\chi^2_{n-1}\) | 正規母集団 |
| \(\dfrac{s_1^2/\sigma_1^2}{s_2^2/\sigma_2^2}\) | \(F(n_1-1,n_2-1)\) | 2 つの独立な正規母集団 |
| \(\hat{p}=X/n\) | \(\approx N\left(p, \dfrac{p(1-p)}{n}\right)\) | \(np\ge5, n(1-p)\ge5\) |
\(\bar{X}\) と \(s^2\) の独立性(正規母集団のとき): 08 章 7 節の幾何的な見方(データベクトルを平均方向とそれに直交する方向に分けると、正規分布では両者が独立になる)から従う。 この独立性が t 分布の定義条件を満たすために不可欠だった。
5. 標準誤差 — 実務で最も使う概念
\(\sigma\) は未知なので、実際には \(s\) で置き換えて推定する。
SD と SE の違い(極めて重要)
| 標準偏差 SD | 標準誤差 SE | |
|---|---|---|
| 何のばらつきか | 個体のばらつき | 推定値のばらつき |
| \(n\) を増やすと | 変わらない(母集団の性質) | 小さくなる(\(1/\sqrt{n}\)) |
| 使う場面 | 「この集団はどのくらい多様か」 | 「この平均値はどのくらい信用できるか」 |
グラフのエラーバーは必ず確認すること. 同じデータでも SD で描くか SE で描くかで見た目の説得力がまるで違う。 \(n=100\) なら SE は SD の 1/10 になるので、SE で描くとエラーバーは 10 分の 1 に見える。 論文や資料では「エラーバーが何を表すか」を必ず明記しなければならない。
必要サンプルサイズの設計
「推定誤差を \(\pm E\) 以内に 95% の確からしさで収めたい」なら、CLT より \(\bar X\) は \(\mu\pm 1.96\,\sigma/\sqrt n\) の範囲に 95% の確率で入る(1.96 は標準正規分布の両側 5% 点。08 章 4 節)ので
比率の場合(ベルヌーイの分散 \(\sigma^2 = p(1-p) = \frac14 - \left(p-\frac12\right)^2 \le \frac14\) を使い、\(p=1/2\) の最悪ケースで):
| 許容誤差 \(E\) | 必要な \(n\) |
|---|---|
| ±5% | 385 |
| ±3% | 1,068 |
| ±2% | 2,401 |
| ±1% | 9,604 |
世論調査が「約 1000 人」なのはこの表の 2 行目である. 誤差 ±3% を得るのに 1068 人。ここから精度を 3 倍(±1%)にするには 9604 人——9 倍必要。 精度は \(\sqrt{n}\) でしか上がらない(06 章)という事実の、最も分かりやすい現れである。
もう一つ驚くべき事実: この式に母集団のサイズが入っていない。 日本全体(1 億人)を調べようが、ある市(10 万人)を調べようが、必要な標本数は同じである。 「1 億人を 1000 人で代表できるのか」という直感的な違和感は、統計的には根拠がない。 重要なのは標本の絶対数であって、母集団に対する比率ではない。
6. デルタ法 — 変換した統計量の分散
\(\hat{\theta}\) が漸近的に \(N(\theta, \sigma^2/n)\) に従うとき、その関数 \(g(\hat\theta)\) はどうなるか。
\(g\) を \(\theta\) のまわりでテイラー展開する。
右辺は \(\hat\theta\) の 1 次式なので、\(V[aX+b]=a^2V[X]\)(06 章 4 節)より
例: 比率 \(\hat p\) の対数オッズ \(g(p)=\log\frac{p}{1-p}\) の分散。 (03 章のオッズ \(a/b\) は「起きた度数 : 起きなかった度数」の比で、起きる確率を \(p = a/(a+b)\) とおけば \(a/b = p/(1-p)\)。同じものである。) \(g'(p) = \frac{1}{p(1-p)}\)、\(V[\hat p]=p(1-p)/n\) なので
21 章のロジスティック回帰で、オッズ比の信頼区間を作るのに使う。
7. ブートストラップ — 標本分布を計算機で作る
CLT が使えない、あるいは統計量が複雑で理論式が無いときの汎用手法。
- 手元の \(n\) 個のデータから、復元抽出で \(n\) 個選ぶ(同じ点が何度も選ばれてよい)
- その擬似標本で統計量を計算する
- 1〜2 を \(B\) 回(通常 1000〜10000 回)繰り返す
- 得られた \(B\) 個の値のばらつきが、標本分布の近似になる
(\(\hat\theta^*_b\) は \(b\) 回目の擬似標本で計算した統計量、\(\bar{\hat\theta^*}\) はその \(B\) 個の平均。\(B-1\) で割るのは標本分散と同じ不偏化のため(02 章)で、\(B\) が数千なら \(B\) で割っても差はない。)
なぜこれで動くのか. 本当は「母集団から標本を取る」を繰り返したいが、母集団は手に入らない。 そこで手元の標本を母集団の代用品として使う。 標本が母集団の縮図であるかぎり(無作為抽出なら期待できる)、 「標本から取り直す」ばらつきは「母集団から取り直す」ばらつきを近似する。
中央値、相関係数、四分位範囲、複雑なモデルの予測値など、 理論式を導けない統計量でも標準誤差と信頼区間が出せるのが最大の利点である。 16 章で詳しく扱う。
8. まとめ
| 定理 | 内容 |
|---|---|
| 大数の法則 | \(\bar{X}_n \to \mu\)。だから推定できる |
| 中心極限定理 | \(\bar{X}_n \approx N(\mu,\sigma^2/n)\)。元の分布によらない |
- 標本分布(統計量の分布)という概念が推測統計の出発点。母集団分布・標本の分布と混同しない。
- CLT のおかげで、母集団の形を知らなくても正規分布ベースの推測ができる。ただし分散が有限が前提。
- SE \(=\sigma/\sqrt{n}\)。精度を 2 倍にするにはデータ 4 倍。
- 必要サンプルサイズは母集団の大きさに依存しない。
- 理論が使えなければブートストラップで計算機に作らせればよい。