Chapter 06
確率変数・期待値・分散
この章がなぜ必要なのか——「事象」から「数」へ.
04 章〜05 章では「事象」の確率を扱った。だが統計で扱いたいのは 「身長」「売上」「不良品の個数」といった数である。
「サイコロで偶数が出る事象」ではなく「サイコロの目という数」を主役にすると、 平均・分散といった 02 章の道具がそのまま使えるようになり、 足し算・掛け算といった演算もできるようになる。
そして本章で導く \(V[\bar{X}] = \sigma^2/n\) という 1 本の式が、 標本を増やすと精度が上がるという統計学の中心的事実の正体である。 09 章以降のすべて(信頼区間の幅も、検定の検出力も、必要サンプル数の計算も)がここから出てくる。
この章で使う既出の用語(定義は各リンク先). 連続・離散(01 章 4 節)、事象・標本空間・\(P(A)\)(04 章 2 節)、 条件付き確率と乗法定理(04 章 4 節)、事象の独立と i.i.d.(04 章 5 節)、全確率の公式(04 章 6 節)、 平均・分散・標準偏差・歪度・尖度(02 章)
1. 確率変数
定義
確率変数 (random variable) とは、標本空間 \(\Omega\) の各要素に実数を割り当てる関数である。
(\(\mathbb{R}\) は実数全体の集合。「\(\Omega\) の要素を入れると実数が返る」という意味の書き方である。)
例: コインを 2 回投げる。\(\Omega = \{HH, HT, TH, TT\}\)。 \(X\) =「表の枚数」とすると \(X(HH)=2, X(HT)=X(TH)=1, X(TT)=0\)。
「変数」なのに「関数」? 用語が紛らわしいが、こう考えるとよい。 偶然が結果 \(\omega\) を選ぶ。その結果に応じて \(X(\omega)\) という数が決まる。 偶然が数を選ぶ仕組み、それが確率変数である。
慣習として、確率変数は大文字 \(X\)、その実現値は小文字 \(x\) で書く。 \(P(X = x)\) は「確率変数 \(X\) が値 \(x\) を取る確率」と読む。
離散と連続
| 型 | 取りうる値 | 確率の記述 |
|---|---|---|
| 離散型 | 有限個または可算個 | 確率質量関数 \(p(x) = P(X=x)\) |
| 連続型 | 区間内の実数すべて | 確率密度関数 \(f(x)\) |
2. 分布を記述する 3 つの関数
確率質量関数 (pmf) — 離散型
確率密度関数 (pdf) — 連続型
連続型で「\(X\) がちょうど 3 になる確率」は 0 である. \(P(X=3) = \int_3^3 f(x)dx = 0\)。幅ゼロの区間の面積はゼロだからだ。
「では身長がちょうど 170.0 cm の人はいないのか」と思うかもしれないが、そのとおりである。 無限の精度で測れば 170.000000... ぴったりの人はいない。 現実に「170 cm の人」と言うときは「169.5〜170.5 cm」という区間を意味している。
密度 \(f(x)\) は確率ではないことにも注意。1 を超えてもよい。 確率になるのは幅を掛けて面積にしたときだけである。
累積分布関数 (cdf) — 両方に使える
| 性質 | 内容 |
|---|---|
| 単調非減少 | \(a<b \Rightarrow F(a)\le F(b)\) |
| 極限 | \(F(-\infty)=0\), \(F(\infty)=1\) |
| 区間確率 | \(P(a<X\le b) = F(b)-F(a)\) |
| 密度との関係 | 連続型なら \(f(x) = F'(x)\) |
cdf が実務で主役になる場面. 正規分布表も、統計ソフトの p 値も、 実際に計算しているのは cdf の値である。 たとえば 08 章の標準正規分布の cdf を \(F\) とすると、 「1.96 より大きい値が出る確率は 2.5%」は \(1 - F(1.96) = 0.025\) ということ(1.96 という数の出所は 08 章で扱う)。
3. 期待値
定義
「値 × その確率」を全部足したもの。02 章の平均の、確率版である。 以下、\(E[X]\) を \(\mu\) とも書く。
例: サイコロ。\(E[X] = \frac{1}{6}(1+2+3+4+5+6) = 3.5\)。 3.5 という目は存在しないが、それでよい。 数直線上の各値 \(x\) の位置に重さ \(p(x)\) のおもりを置いたとき、全体がつり合う支点の位置が \(\sum_x x\,p(x)\)、すなわち期待値である (02 章で平均を「データの重心」と呼んだのと同じ見方で、データ 1 個ずつの重さ \(1/n\) を確率 \(p(x)\) に置き換えている)。 期待値は「重心」であって「起こる値」ではない。
関数の期待値
\(g(X)\) という変換をした後の期待値は、\(g\) を掛けて足すだけでよい。
これは自明ではない(無意識の統計学者の法則と呼ばれる). 本来なら \(Y = g(X)\) の分布 \(p_Y(y) = P(Y=y)\) を求めてから \(E[Y] = \sum_y y\,p_Y(y)\) を計算すべきだが、 実は \(X\) の分布のまま \(g(x)\) を重み付けするだけでよい。
導出(離散): \(Y=y\) となるのは \(g(x)=y\) となる \(x\) のどれかが出たときなので \(p_Y(y) = \sum_{x:\,g(x)=y} p(x)\)。よって
\[ E[Y] = \sum_y y\,p_Y(y) = \sum_y \sum_{x:\,g(x)=y} y\,p(x) = \sum_y \sum_{x:\,g(x)=y} g(x)\,p(x) = \sum_x g(x)\,p(x) \]3 つ目の等号は、和の中では \(y = g(x)\) だから。最後の等号は、すべての \(x\) を「\(g(x)\) の値ごと」に分けて足していたものを、分けずに足し直しただけである。∎
期待値の性質(最重要)
導出: \(E[aX+b] = \sum (ax+b)p(x) = a\sum x p(x) + b\sum p(x) = aE[X] + b\)。∎
導出(離散の場合): 2 つの確率変数をまとめて扱うため、同時確率質量関数 \(p(x,y) = P(X=x \text{ かつ } Y=y)\) を使う。 \(X\) だけの分布 \(p_X(x) = P(X=x)\) は、\(\{Y=y\}\)(\(y\) を動かす)が標本空間の分割であることから 全確率の公式で \(p_X(x) = \sum_y p(x,y)\) と得られる(周辺分布という)。\(p_Y(y) = \sum_x p(x,y)\) も同様。
∎
これが「期待値の線形性」であり、確率論で最も便利な性質である. 独立性が要らないのが決定的に強い。どんなに複雑に絡み合った変数でも、和の期待値は期待値の和になる。
応用例: \(n\) 人が自分の帽子をランダムに取るとき、自分の帽子を取る人数の期待値は? 全体の分布を考えると難しいが、\(X_i\) =「\(i\) さんが自分のを取れば 1、でなければ 0」と置く。 帽子はどの並びも同じ確率で配られるので、\(i\) さんの手に渡る帽子は \(n\) 個のどれも等確率 \(1/n\) で、自分のものである確率も \(1/n\)。 よって \(E[X_i] = 1\cdot\frac{1}{n} + 0\cdot\left(1-\frac{1}{n}\right) = \frac{1}{n}\) で、\(E[\sum X_i] = n \times 1/n = 1\)。 \(X_i\) どうしは独立でないのに、答えは一瞬で出る。期待値は常に 1 人である。
積については独立が必要。ここで確率変数 \(X, Y\) が独立であるとは、どの値 \(x, y\) についても事象 \(\{X=x\}\) と \(\{Y=y\}\) が 04 章 5 節 の意味で独立、すなわち
が成り立つことをいう(連続型なら密度について \(f(x,y) = f_X(x)f_Y(y)\))。
導出: 独立なら \(p(x,y)=p_X(x)p_Y(y)\) なので
∎(逆は成り立たない。\(E[XY]=E[X]E[Y]\) でも独立とは限らない。)
4. 分散
定義
平均からのズレの二乗の期待値。02 章の分散の確率版である。 その平方根 \(\text{SD}[X] = \sqrt{V[X]}\) を標準偏差 (standard deviation) と呼び、母集団の値を指すときは \(\sigma\)、分散は \(\sigma^2\) と書く(02 章)。
計算に便利な公式
導出:
∎
(覚え方: 「二乗の平均 − 平均の二乗」。この順番を逆にすると負になるので間違いにすぐ気づける。)
分散の性質
導出: \(E[aX+b] = a\mu+b\) なので
∎
2 つの重要な含意.
- \(b\) が消える: 全員に同じ値を足しても、ばらつきは変わらない。当然である。
- \(a\) は二乗で効く: 2 倍に引き伸ばすと分散は 4 倍。標準偏差なら 2 倍。 標準偏差が「元の単位」なのはこのためである(\(\text{SD}[aX+b] = \lvert a\rvert\text{SD}[X]\))。
5. 共分散と和の分散
共分散
(2 つ目の等式は分散の便利公式と同じ手順で示せる。)
\(X,Y\) が独立なら \(E[XY]=E[X]E[Y]\) なので \(\text{Cov}=0\)。
逆は成り立たない. \(\text{Cov}=0\)(無相関)でも独立とは限らない。 反例: \(X\) が \(-1,0,1\) を各 1/3 で取り、\(Y = X^2\) とする。 \(E[X]=0\)、\(E[XY]=E[X^3] = \frac{1}{3}(-1+0+1)=0\) なので \(\text{Cov}=0\)。 しかし \(Y\) は \(X\) から完全に決まるので、独立からは程遠い。
共分散は直線的な関係しか見ていない(03 章の相関と同じ事情)。
和の分散(最重要)
導出: \(\mu = \mu_X + \mu_Y\) として
∎
独立なら Cov = 0 なので:
\(n\) 個の和への拡張: \(\mu_i = E[X_i]\) として、二乗を展開すると
(\(i=j\) の項が分散、\(i\ne j\) の項が共分散。)どの 2 つも独立なら共分散の項がすべて 0 になり
「分散は足せる」——ただし独立のときだけ. これが 02 章で「なぜ絶対値でなく二乗なのか」の答えの 1 つだった。 絶対偏差にはこの加法性がない。二乗にはある。だから理論が組み立てられる。
なお、引き算でも分散は足される: \(V[X-Y] = V[X] + (-1)^2V[Y] = V[X]+V[Y]\)(独立のとき)。 「差を取ればばらつきが減る」わけではなく、むしろ増える。 13 章の 2 標本 t 検定で、2 群の分散を足すのはこのためである。
6. 標本平均の分散 — この章の核心
\(X_1,\dots,X_n\) が独立で、すべて同じ分布(平均 \(\mu\)、分散 \(\sigma^2\))に従うとする(i.i.d.)。 標本平均を
とすると:
期待値
標本平均の期待値は母平均に等しい。推定に使う量(推定量)の期待値が、推定したい母集団の値にぴったり一致することを不偏といい、標本平均は母平均の不偏推定量である(10 章 2 節)。
分散
(1 つ目の等号は \(V[aX]=a^2V[X]\)、2 つ目は前節の「\(n\) 個の和への拡張」。)
この \(\sigma/\sqrt{n}\) を標準誤差 (standard error, SE) と呼ぶ。
統計学で最も重要な 1 本の式. これが意味することを噛みしめてほしい。
- 標本平均のばらつきは \(\sqrt{n}\) に反比例して小さくなる。
- 精度を 2 倍にしたければ、データは 4 倍必要。10 倍の精度なら 100 倍のデータ。
- 逆に言えば、少し増やしただけでは大して精度は上がらない。
「なぜ n を増やすと結論が確かになるのか」への数学的な答えがこれである。 11 章の信頼区間の幅、12 章の検出力、必要サンプルサイズの設計——すべてこの式から出る。
標準偏差 \(\sigma\) と標準誤差 \(\sigma/\sqrt{n}\) の区別は極めて重要。 前者は「個体のばらつき」、後者は「平均という推定値のばらつき」。 論文のエラーバーが SD なのか SE なのかで意味がまるで違う。
7. モーメントと積率母関数
モーメント
\(k\) 次のモーメント: \(E[X^k]\)。\(k\) 次の中心モーメント: \(E[(X-\mu)^k]\)。
| \(k\) | 中心モーメント | 意味 |
|---|---|---|
| 1 | 0 | (定義から常に 0) |
| 2 | 分散 | ばらつき |
| 3 | \(E[(X-\mu)^3]/\sigma^3\) が歪度(02 章の確率版) | 非対称性 |
| 4 | \(E[(X-\mu)^4]/\sigma^4 - 3\) が超過尖度(02 章の確率版) | 裾の重さ |
積率母関数 (mgf)
なぜこんなものを考えるのか: 微分するとモーメントが出てくるからである。
導出: \(e^{tX} = 1 + tX + \frac{t^2X^2}{2!}+\cdots\) を期待値に入れると
\(t\) で \(k\) 回微分して \(t=0\) を代入すれば \(E[X^k]\) が残る。∎
独立な和で威力を発揮:
これが「正規分布の和は正規分布」「ポアソンの和はポアソン」といった再生性の証明手段になる(07 章〜08 章)。 分布の畳み込み(面倒な積分)を、単なる掛け算に変えてくれるのが mgf である。 09 章の中心極限定理の証明も、この道具を使うのが標準的な方法である。
8. 条件付き期待値
\(X = x\) と分かったときの \(Y\) の条件付き確率(04 章 4 節)は \(P(Y=y\mid X=x) = p(x,y)/p_X(x)\) である。これで重み付けした平均を条件付き期待値という。
これは \(x\) を入れると数が返る関数なので \(h(x)\) と書ける。 そこで \(x\) に確率変数 \(X\) を入れた \(h(X)\)、つまり結果 \(\omega\) に数 \(h(X(\omega))\) を対応させる関数を考えると、 これは \(\Omega\) から \(\mathbb{R}\) への関数なので 1 節 の定義どおり確率変数である。これを \(E[Y\mid X]\) と書く。 同様に、\(Y\) の関数 \(g(Y)\) についても \(E[g(Y)\mid X=x] = \sum_y g(y)\,P(Y=y\mid X=x)\) と定める。
繰り返し期待値の法則(全期待値の公式)
導出:
∎
意味. 「場合分けして期待値を計算し、それを重み付きで平均すれば、全体の期待値になる」。 04 章の全確率の公式の期待値版である。 上の導出で \(y\) を \(g(y)\) に置き換えても同じ計算が通るので、\(E[g(Y)] = E\big[E[g(Y)\mid X]\big]\) も成り立つ。
分散分解の公式
\(X=x\) と分かったときの \(Y\) の分散を、\(m(x) = E[Y\mid X=x]\) として
と定める(2 つ目の等号は 4 節 の便利公式と同じ計算)。\(x\) に \(X\) を入れた確率変数を \(V[Y\mid X]\) と書く。このとき
導出: 便利公式 \(V[Y] = E[Y^2] - (E[Y])^2\) の 2 つの項を、それぞれ全期待値の公式で書き直す。
引き算すると
∎
これが 15 章の分散分析 (ANOVA) の理論的な正体であり、18 章の回帰の決定係数 \(R^2\) の正体でもある. 「\(Y\) のばらつきのうち、\(X\) で説明できる部分と、説明できない部分」という分解が、 ここで確率論の定理として一般的に証明されている。
9. まとめ
| 概念 | 式 | 条件 | ||
|---|---|---|---|---|
| 期待値の線形性 | \(E[aX+bY+c]=aE[X]+bE[Y]+c\) | 常に成立 | ||
| 積の期待値 | \(E[XY]=E[X]E[Y]\) | 独立が必要 | ||
| 分散の便利公式 | \(V[X]=E[X^2]-(E[X])^2\) | 常に | ||
| 定数倍 | \(V[aX+b]=a^2V[X]\) | 常に | ||
| 和の分散 | \(V[X+Y]=V[X]+V[Y]+2\text{Cov}\) | 常に | ||
| 独立な和 | \(V[X+Y]=V[X]+V[Y]\) | 独立が必要 | ||
| 標本平均 | \(E[\bar{X}]=\mu\), \(V[\bar{X}]=\sigma^2/n\) | i.i.d. | ||
| 分散分解 | $`V[Y]=E[V[Y | X]]+V[E[Y | X]]`$ | 常に |
- 期待値は独立性なしで足せる。分散は独立のときだけ足せる。
- \(\text{SE}[\bar{X}] = \sigma/\sqrt{n}\) — 統計学で最も重要な式。精度は \(\sqrt{n}\) でしか上がらない。
- SD(個体のばらつき)と SE(推定値のばらつき)を混同しない。