Chapter 04
確率の基礎 — 標本空間・公理・条件付き確率
この章がなぜ必要なのか——「ばらつき」を数式で書けるようにする.
01 章で見たとおり、標本を取り直せば結果は変わる。この「揺れ」を扱わないかぎり、 「1000 人の平均が 170.2 cm だったから、日本人全体もだいたいそのくらい」の 「だいたい」を数字にできない。
確率は、その「だいたい」を厳密に扱うための言語である。 ここから 08 章までは統計というより数学の色が濃くなるが、 ここを通らずに推測統計に入ると、後で必ず意味が分からなくなる。
逆に言えば、ここさえ押さえれば、p 値も信頼区間も「何を計算しているのか」が全部見えるようになる。
この章で使う既出の用語(定義は各リンク先). 推測統計(01 章 1 節)、標本(01 章 2 節)、連続(01 章 4 節)
1. 確率とは何か — 3 つの立場
意外に思われるかもしれないが、「確率とは何か」には複数の立場がある。
| 立場 | 定義 | 例 | 弱点 |
|---|---|---|---|
| 古典的(ラプラス) | 同様に確からしい \(N\) 通りのうち \(k\) 通り → \(k/N\) | サイコロで 1 が出る確率 = 1/6 | 「同様に確からしい」が循環定義。無限の場合に使えない |
| 頻度的 | 無限回繰り返したときの相対頻度の極限 | コインを何万回も投げたら表は半分 | 1 回きりの出来事(明日の降水確率)に使えない |
| 主観的(ベイズ的) | 個人の信念の度合い | 「この馬が勝つ確率は 30% だと思う」 | 人によって違ってよいのか? |
どれが正しいのか. 実用上は「どれでもよい」。数学としての確率論は次節の公理だけで組み立てられ、 解釈は後から付けるものだからである。
ただし解釈の違いは実務に影響する。 12 章の仮説検定(頻度論)と 23 章のベイズ統計は、この解釈の違いから来る別々の流儀である。 たとえば、頻度論の「95% 信頼区間」(11 章)は 「同じ手順でデータを取り直して区間を作ることを繰り返せば、そのうち 95% の区間が真の値を含む」という手順の性質であり、 ベイズの「95% 信用区間」(23 章)は「真の値がこの区間にある信念の度合いが 95%」である。 名前も数値も似ているのに意味が違うのは、確率の解釈がそれぞれ頻度的・主観的だからである。
2. 標本空間と事象
| 用語 | 記号 | 意味 |
|---|---|---|
| 試行 | — | 結果が偶然に決まる行為(サイコロを振る) |
| 標本空間 | \(\Omega\) | 起こりうる結果の全体集合 |
| 標本点 | \(\omega\) | 個々の結果 |
| 事象 | \(A \subseteq \Omega\) | 標本空間の部分集合 |
例: サイコロ 1 個。\(\Omega = \{1,2,3,4,5,6\}\)、「偶数が出る」という事象は \(A = \{2,4,6\}\)。
集合演算がそのまま事象の演算になる。
| 集合 | 事象としての意味 |
|---|---|
| \(A \cup B\) | \(A\) または \(B\) が起きる |
| \(A \cap B\) | \(A\) かつ \(B\) が起きる |
| \(A^c\) | \(A\) が起きない |
| \(A \cap B = \emptyset\) | \(A\) と \(B\) は排反(同時に起きない) |
| \(A \sqcup B\) | \(A \cup B\) と同じ和集合。ただし \(A\cap B=\emptyset\)(排反)であることを強調したいときにこの記号を使う |
事象 \(A\) が起きる確率を \(P(A)\) と書く(\(P\) は probability の頭文字)。\(P(A)\) は 0 以上 1 以下の数で、次節の公理を満たすものとして定める。
3. コルモゴロフの公理
現代の確率論は、次の 3 つの約束事だけから出発する(1933 年、コルモゴロフ)。
(事象が無限個ある場合のために、正式には (A3) を「互いに排反な \(A_1, A_2, \dots\) が可算個——自然数 \(1,2,3,\dots\) で番号を付けられる個数——あるとき \(P(\bigcup_i A_i) = \sum_i P(A_i)\)」という形で置く。本章の例はすべて有限個なので、上の 2 個の形で読んでよい。)
驚くべきことに、確率のあらゆる性質はこの 3 つから導かれる。実際にやってみる。以下、∎ は「証明終わり」の印である。
導かれる性質
(0) \(n\) 個への拡張: \(A_1,\dots,A_n\) がどの 2 つも排反なら \(P(A_1\cup\cdots\cup A_n) = P(A_1)+\cdots+P(A_n)\)
(A3) は 2 個の形だが、\(A_1\cup\cdots\cup A_{n-1}\) と \(A_n\) も排反なので (A3) を使うと \(P(A_1\cup\cdots\cup A_n) = P(A_1\cup\cdots\cup A_{n-1}) + P(A_n)\)。 左側の項にもう一度同じことをし、これを \(n-1\) 回繰り返せば右辺は \(P(A_1)+\cdots+P(A_n)\) になる。∎
(1) 余事象: \(P(A^c) = 1 - P(A)\)
\(A\) と \(A^c\) は排反で、和は \(\Omega\)。よって (A3) から \(P(A) + P(A^c) = P(\Omega) = 1\)。∎
(2) 空事象: \(P(\emptyset) = 0\)
\(\Omega^c = \emptyset\) なので (1) から \(P(\emptyset) = 1 - P(\Omega) = 0\)。∎
(3) 単調性: \(A \subseteq B \Longrightarrow P(A) \leq P(B)\)
\(B\) の各要素は「\(A\) に入る」か「\(A\) に入らない」かのどちらかなので \(B = (B\cap A) \sqcup (B \cap A^c)\) と分解できる。 \(A \subseteq B\) なら \(B\cap A = A\) だから \(B = A \sqcup (B \cap A^c)\)。この 2 つは排反なので (A3) から \(P(B) = P(A) + P(B\cap A^c) \geq P(A)\)(最後の不等号は (A1) より \(P(B\cap A^c)\ge 0\) だから)。∎
(4) 上限: \(P(A) \leq 1\)
\(A \subseteq \Omega\) と (3) から。∎
(5) 加法定理(排反でなくてよい):
導出: \(A \cup B\) の各要素は「\(A\) だけに入る」「両方に入る」「\(B\) だけに入る」のいずれか 1 つなので、排反な 3 つに分解できる。
(0) より
一方、\(A\) の各要素は \(B\) に入るか入らないかのどちらかなので \(A = (A\cap B^c)\sqcup(A\cap B)\)、(A3) より \(P(A) = P(A\cap B^c) + P(A \cap B)\)。 同様に \(B = (A^c\cap B)\sqcup(A\cap B)\) から \(P(B) = P(A^c \cap B) + P(A\cap B)\)。 足すと \(P(A)+P(B) = P(A\cap B^c) + P(A^c\cap B) + 2P(A\cap B)\) となり、\(P(A\cup B)\) より \(P(A\cap B)\) を 1 回多く数えている。その 1 回分を引けばよい。∎
直感. 2 つの円が重なったベン図で、重なり部分を二重に数えないよう 1 回引く。それだけの話である。
(6) ブールの不等式(和集合上界):
導出: \(n=2\) のときは (5) と (A1) から \(P(A_1\cup A_2) = P(A_1)+P(A_2)-P(A_1\cap A_2) \le P(A_1)+P(A_2)\)。 一般の \(n\) では、\(A_1\cup\cdots\cup A_n = (A_1\cup\cdots\cup A_{n-1})\cup A_n\) に \(n=2\) の結果を使うと \(P(A_1\cup\cdots\cup A_n) \le P(A_1\cup\cdots\cup A_{n-1}) + P(A_n)\)。左側の項にも同じことを繰り返せば右辺は \(\sum_i P(A_i)\) になる。∎
意味は「重なりを引かないぶん、和のほうが必ず大きい(か等しい)」。17 章のボンフェローニ補正はこの不等式が根拠である。
4. 条件付き確率
定義
事象 \(B\) が起きたと分かっているときの \(A\) の確率:
なぜこの式なのか. 「\(B\) が起きた」と分かった時点で、可能性の世界は \(\Omega\) から \(B\) に縮む。 舞台が \(B\) に狭まったのだから、確率も \(B\) の中で測り直さなければならない。 分母を \(P(B)\) にするのは、狭まった舞台の全体を改めて 1 にするための正規化である。
分子が \(P(A\cap B)\) なのは、新しい舞台 \(B\) の中で \(A\) にあたるのは \(A\cap B\) の部分だけだから。
例: サイコロで「偶数が出た」と分かっているとき、「4 以上」である確率。
乗法定理
定義を変形するだけ。
3 つ以上へ拡張(連鎖律):
導出: 乗法定理を \(A = A_n\)、\(B = A_1\cap\cdots\cap A_{n-1}\) に当てはめると \(P(A_1\cap\cdots\cap A_n) = P(A_1\cap\cdots\cap A_{n-1})\,P(A_n\mid A_1\cap\cdots\cap A_{n-1})\)。 右辺の最初の因子にもう一度乗法定理を当て、これを \(n-1\) 回繰り返すと上の式になる。∎
5. 独立
定義
\(P(B) > 0\) なら、これは次と同値である。
意味. 「\(B\) が起きたと知っても、\(A\) の確率が変わらない」。 つまり \(B\) の情報は \(A\) について何も教えてくれない、ということである。
排反と独立はまったく別物
これは最頻出の混同なので、はっきりさせておく。
| 排反 (mutually exclusive) | 独立 (independent) | |
|---|---|---|
| 定義 | \(A\cap B=\emptyset\)(よって (2) より \(P(A\cap B)=0\)) | \(P(A\cap B)=P(A)P(B)\) |
| 意味 | 同時には起きない | 情報を持たない |
| 例 | サイコロで「1 が出る」と「2 が出る」 | 1 回目が 1、2 回目が 2 |
むしろ「排反 ⇒ 独立でない」. \(P(A),P(B)>0\) で排反なら、 \(P(A\cap B)=0 \neq P(A)P(B)>0\) なので独立ではない。 直感的にも当然で、「\(A\) が起きた」と分かれば「\(B\) は起きていない」と確定するのだから、 \(A\) の情報は \(B\) について最大限に教えてくれている。これは独立の正反対である。
3 つ以上の独立
\(A, B, C\) が独立であるためには、すべての部分集合について積の形が成り立つ必要がある。
2 つずつは独立なのに 3 つでは独立でない例: コインを 2 回投げる。 \(A\) = 1 回目が表、\(B\) = 2 回目が表、\(C\) = 表の枚数が奇数(=ちょうど 1 枚)。
\(P(A)=P(B)=P(C)=1/2\)、\(P(A\cap B)=P(B\cap C)=P(A\cap C)=1/4\) で 2 つずつは独立。 しかし \(A \cap B\)(両方表)のとき \(C\) は起きないので \(P(A\cap B\cap C)=0 \neq 1/8\)。
独立試行
同じ試行を独立に \(n\) 回繰り返すとき、各回の結果は互いに独立で、しかも毎回同じ確率の仕組みに従う。これが独立同分布 (independent and identically distributed、頭文字を取って i.i.d.) の考え方で、 09 章以降の推測統計はほぼすべて i.i.d. を仮定して組み立てられる。
i.i.d. が崩れる場面は実務に多い. 時系列データ(前日の値が今日に影響する)、 クラスターデータ(同じ学校の生徒同士は似ている)、繰り返し測定(同じ人を何度も測る)。 これらに i.i.d. 前提の手法を当てると、標準誤差を過小評価して「有意」を出しすぎる。 25 章の時系列はまさにこの問題を扱う。
6. 全確率の公式
標本空間を互いに排反な \(m\) 個の事象 \(B_1,\dots,B_m\) で覆い尽くす(分割する)。各 \(P(B_i)>0\) とする。
このとき任意の事象 \(A\) について
導出: \(A = A\cap\Omega = (A\cap B_1)\sqcup\cdots\sqcup(A\cap B_m)\) は排反な和なので (0) と乗法定理から
∎
意味. 「場合分けして、それぞれの確率で重みを付けて足す」。 \(P(A)\) を直接計算するのが難しくても、条件付きなら簡単、という場面は非常に多い。
例: 工場 A が製品の 60%、工場 B が 40% を作る。不良率はそれぞれ 2%、5%。全体の不良率は?
7. モンティ・ホール問題 — 条件付き確率の威力
3 つのドアの 1 つに賞品がある。あなたが 1 番を選ぶ。 司会者(中身を知っている)が、残りのうちハズレのドア(たとえば 3 番)を開けて見せる。 ここで「2 番に変えますか?」と聞かれる。変えるべきか?
答え: 変えるべき。 変えれば当たる確率は 2/3、変えなければ 1/3 である。
導出(条件付き確率の定義と全確率の公式で): 賞品の位置を \(B_1,B_2,B_3\)(各 1/3)、 「司会者が 3 番を開ける」を \(D_3\) とする。あなたは 1 番を選んでいる。求めたいのは \(P(B_1\mid D_3)\) と \(P(B_2\mid D_3)\) である。 条件付き確率の定義から \(P(B_i\mid D_3) = P(B_i\cap D_3)/P(D_3)\)、分子は乗法定理で \(P(D_3\mid B_i)P(B_i)\) と書けるので、 必要なのは各 \(P(D_3\mid B_i)\) と、全確率の公式で求まる \(P(D_3)\) である。
| 賞品の位置 | 司会者が 3 番を開ける確率 | 理由 |
|---|---|---|
| \(B_1\)(1 番) | 1/2 | 2 番でも 3 番でもよいので半々 |
| \(B_2\)(2 番) | 1 | 2 番は賞品、1 番はあなたの選択 → 3 番しか開けられない |
| \(B_3\)(3 番) | 0 | 賞品のドアは開けない |
∎
ここで使った「\(P(B_i\mid D_3) = P(D_3\mid B_i)P(B_i)/P(D_3)\)」という形は、次章のベイズの定理そのものである。
なぜ直感に反するのか. 「ドアが 2 つ残ったから 50:50」と感じるが、それは間違いである。 決定的なのは司会者が中身を知っていて、必ずハズレを開けるという点だ。 司会者の行動は情報を運んでいる。
別の見方: 最初の選択が当たり(1/3)なら変えると外れ、最初が外れ(2/3)なら変えると必ず当たる。 だから変える戦略の勝率は 2/3 である。
ドアが 100 枚だと思えば一目瞭然. あなたが 1 枚選び、司会者が残り 99 枚のうち 98 枚を開けてハズレを見せる。 残った 1 枚に変えるべきか? もちろん変える。あなたの最初の 1 枚が当たる確率は 1/100 のままである。
8. よくある誤解の先回り
ギャンブラーの誤謬. 「コインで表が 5 回続いた。次は裏が出やすいはずだ」——誤り。 コインに記憶はない。独立なので次も 1/2 である。 「大数の法則で平均に戻るのでは?」という反論もあるが、 大数の法則は「過去を打ち消す」のではなく「将来の大量の試行が過去を薄める」だけである(09 章)。
少数の法則(代表性ヒューリスティック). 逆に「表が 5 回続いたから、このコインは偏っている」も早計。 公正なコインで 5 連続が出る確率は \((1/2)^5 = 1/32 \approx 3\%\) で、決して珍しくない。 少ない試行から強い結論を出したがるのが人間の癖である。
検察官の誤謬(条件の取り違え). \(P(A\mid B)\) と \(P(B\mid A)\) はまったく別物である。 「無実なら証拠が一致する確率は 100 万分の 1」(= \(P(\text{証拠}\mid\text{無実})\))は、 「証拠が一致したなら無実の確率は 100 万分の 1」(= \(P(\text{無実}\mid\text{証拠})\))ではない。 両者を結ぶのが次章のベイズの定理であり、そこには事前確率が必ず入る。 この取り違えは実際の裁判で冤罪を生んでいる。
9. まとめ
| 概念 | 式 |
|---|---|
| コルモゴロフの公理 | \(P(A)\ge 0\), \(P(\Omega)=1\), 排反なら加法的 |
| 加法定理 | \(P(A\cup B)=P(A)+P(B)-P(A\cap B)\) |
| 条件付き確率 | \(P(A\mid B)=P(A\cap B)/P(B)\) |
| 乗法定理 | \(P(A\cap B)=P(B)P(A\mid B)\) |
| 独立 | \(P(A\cap B)=P(A)P(B)\) |
| 全確率の公式 | \(P(A)=\sum_i P(A\mid B_i)P(B_i)\) |
- 確率論はたった 3 つの公理から全部出てくる。
- 条件付き確率は「舞台が狭まったので測り直す」。
- 排反と独立は正反対に近い概念。混同しない。
- \(P(A\mid B) \neq P(B\mid A)\)。この 2 つを結ぶのが次章のベイズの定理である。