Chapter 07
離散分布 — ベルヌーイ・二項・ポアソン・幾何・負の二項
この章がなぜ必要なのか——「よくある状況」には名前がついている.
「コインを 100 回投げて表が 60 回出た。これは偏ったコインか?」 この問いに答えるには、公正なコインなら表が何回出るはずか、その分布を知らねばならない。
幸い、現実に現れる確率的状況の多くはいくつかの型に分類できる。 「成功/失敗を \(n\) 回」なら二項分布、「一定時間に何回起きるか」ならポアソン分布。
型が分かれば、平均も分散も確率も公式で即座に出せる。 分布を覚えるとは、公式を暗記することではなく、 目の前の状況がどの型なのかを見抜けるようになることである。
この章で使う既出の用語(定義は各リンク先). 母集団・標本(01 章 2 節)、離散・連続(01 章 4 節)、試行・事象(04 章 2 節)、 独立と i.i.d.(04 章 5 節)、確率変数と確率質量関数 \(P(X=x)\)(06 章 1〜2 節)、 期待値 \(E[X]\) とその線形性(06 章 3 節)、分散 \(V[X]\)・便利公式 \(V[X]=E[X^2]-(E[X])^2\)・標準偏差 \(\text{SD}[X]=\sqrt{V[X]}\)(06 章 4 節)、 独立な和の分散(06 章 5 節)、条件付き期待値と全期待値の公式(06 章 8 節)。 \(X \sim\)(分布名)は「\(X\) はその分布に従う」と読む。
1. 分布の家系図(先に全体像)
離散分布はバラバラの知識ではなく、1 つの土台から派生している。
ベルヌーイ試行(成功確率 p の1回試行)
│
┌──────────────┼───────────────┐
↓ ↓ ↓
n回中の 初めて成功 r回目の成功
成功回数 までの回数 までの回数
↓ ↓ ↓
二項分布 幾何分布 負の二項分布
│
│ n→∞, p→0, np=λ 固定
↓
ポアソン分布すべての出発点は「成功確率 \(p\) の 1 回の試行」である。そこから何を数えるかで分布が決まる。 図中の \(r\) は「何回目の成功か」(6 節 で定義)、\(\lambda\) は二項分布の \(np\) を固定した値で、ポアソン分布の平均発生回数になる(4 節 で定義)。
2. ベルヌーイ分布 — すべての土台
定義
1 回の試行で、成功(1)が確率 \(p\)、失敗(0)が確率 \(1-p\)。
(\(x=1\) なら \(p\)、\(x=0\) なら \(1-p\) になることを確認せよ。指数を使って 1 行にまとめただけである。)
期待値と分散
分散が \(p=0.5\) で最大になる. \(p(1-p)\) は上に凸の放物線で、頂点は \(p=1/2\)、最大値 \(1/4\)。 意味は明快で、五分五分のときが最も予測しにくい。 \(p=0.99\) ならほぼ確実に成功するので、ばらつきは小さい。
これは 11 章で「比率の信頼区間(推定値の誤差の範囲を示す区間)は \(p=0.5\) のとき最も広い」という形で効いてくる。 世論調査の必要サンプル数(望む精度を得るのに要る \(n\)。09 章 5 節)を \(p=0.5\) で計算するのは、最悪ケースで見積もるためである。
3. 二項分布 — \(n\) 回中の成功回数
定義
成功確率 \(p\) のベルヌーイ試行を独立に \(n\) 回繰り返したときの成功回数 \(X\)。
\(X \sim \text{Bin}(n,p)\) と書く。
式の意味:
| 部分 | 意味 |
|---|---|
| \(p^k\) | 成功が \(k\) 回起きる確率 |
| \((1-p)^{n-k}\) | 失敗が \(n-k\) 回起きる確率 |
| \(\binom{n}{k}\) | どの回に成功が来るかの並び方の数 |
たとえば \(n=3, k=2\) なら、成功の位置は \(\{1,2\},\{1,3\},\{2,3\}\) の \(\binom{3}{2}=3\) 通り。 どの並びも確率は同じ \(p^2(1-p)\) なので、3 倍する。
確率の総和が 1 になる確認(二項定理そのもの):
期待値と分散(ベルヌーイの和として)
\(X = X_1 + \cdots + X_n\)(各 \(X_i\) は独立なベルヌーイ)と見れば、06 章の道具で一瞬である。
(等号の上の「独立」は、その等号が独立性を使っていることを示す。以下同じ。)
定義から直接計算すると \(\sum k\binom{n}{k}p^k(1-p)^{n-k}\) という面倒な和になるが、 「ベルヌーイの和」と見れば 2 行で終わる。 これが 06 章で期待値の線形性と分散の加法性を強調した理由である。 難しい和を計算するより、分解して簡単な部品の和と見る方が圧倒的に楽になる。
再生性
同じ族の分布に従う独立な確率変数の和が、また同じ族の分布に従う性質を再生性という。二項分布はこれを持つ。 \(X\sim\text{Bin}(n_1,p)\)、\(Y\sim\text{Bin}(n_2,p)\) が独立なら
理由: \(X\) は \(n_1\) 個の独立なベルヌーイの和、\(Y\) は \(n_2\) 個の独立なベルヌーイの和で、\(X\) と \(Y\) が独立なら 合わせて \(n_1+n_2\) 個の独立なベルヌーイの和になる。これは定義から \(\text{Bin}(n_1+n_2,p)\) である。∎
具体例
公正なコイン(\(p=0.5\))を 10 回投げる。
注意すべき点. 期待値がちょうど 5 でも、ちょうど 5 回になる確率は 25% しかない。 「期待値のあたりに集中する」が「期待値そのものになる」ではない。 同じ計算で \(P(X=4)=P(X=6)=210/1024\)、\(P(X=3)=P(X=7)=120/1024\) なので、 \(4 \le X \le 6\) なら \((210+252+210)/1024 \approx 0.66\)、\(3\le X\le 7\) なら \((120+210+252+210+120)/1024 \approx 0.89\) になる。
4. ポアソン分布 — まれな事象の回数
定義
\(X\sim\text{Po}(\lambda)\) と書く。\(\lambda > 0\) は「単位時間(単位面積)あたりの平均発生回数」。
二項分布からの導出
\(n\to\infty\)、\(p\to 0\)、\(np=\lambda\) 一定の極限を取る。\(p = \lambda/n\) を代入する。
3 つの部分に分けて \(n\to\infty\) を取る。
| 部分 | 極限 | 理由 |
|---|---|---|
| \(\dfrac{n(n-1)\cdots(n-k+1)}{n^k}\) | \(\to 1\) | \(k\) 個の因子がそれぞれ \(\to 1\) |
| \(\left(1-\dfrac{\lambda}{n}\right)^n\) | \(\to e^{-\lambda}\) | \(\lim_{n\to\infty}(1+x/n)^n = e^x\) で \(x=-\lambda\) とおく |
| \(\left(1-\dfrac{\lambda}{n}\right)^{-k}\) | \(\to 1\) | 指数が固定で底が \(\to 1\) |
よって
∎
この導出が語ること. ポアソン分布とは「試行回数が莫大で、1 回あたりの確率が極めて小さく、 その積(平均発生数)が適度な値」という状況の分布である。
- 1 時間に来る客の数: 街には何万人もいて(\(n\) 大)、各人がこの店に来る確率は小さい(\(p\) 小)
- 1 日の交通事故件数、1 ページの誤植数、1 cm² の細菌コロニー数
- サーバーへの単位時間あたりのアクセス数
「たくさんの機会があり、各機会での確率は小さい」 ——これがポアソンの合図である。
期待値と分散
(\(k=0\) の項は 0 なので \(k\ge 1\) から始め、\(k/k! = 1/(k-1)!\) を使った。)
分散は \(E[X(X-1)]\) を経由すると同じ手で計算できる。\(k=0,1\) の項は 0 なので \(k\ge 2\) から始め、\(k(k-1)/k! = 1/(k-2)!\) を使う。
\(X(X-1) = X^2 - X\) なので \(E[X^2] = E[X(X-1)] + E[X] = \lambda^2+\lambda\)。便利公式から
平均と分散が等しい! これはポアソン分布の際立った特徴である。
実務では、この性質をモデルの検証に使える。 カウントデータの標本平均と標本分散を比べて、分散の方がはるかに大きければ (過分散 overdispersion)、ポアソンは不適切である。 客が「団体で」来るような場合に起きる。理由: 1 人ずつ独立に来るなら 1 時間の人数は \(\text{Po}(\lambda)\) で分散 \(\lambda\) だが、 必ず 5 人組で来て組の数が \(\text{Po}(\lambda/5)\) なら、人数は \(5\times(\text{組の数})\) なので平均は同じ \(\lambda\) のまま、 分散は \(5^2\times\lambda/5 = 5\lambda\) に膨らむ(\(V[aX]=a^2V[X]\))。 そのときは負の二項分布を使う(本章 6 節、21 章)。
二項分布の近似としての実用
\(n\) が大きく \(p\) が小さいとき、\(\text{Bin}(n,p) \approx \text{Po}(np)\)。目安は \(n\ge 50\) かつ \(np \le 10\) 程度。
例: 不良率 0.1% の製品を 2000 個検査。不良品が 3 個以上ある確率は?
\(\lambda = 2000\times 0.001 = 2\) として
(二項分布で厳密に計算しても 0.3233 で、ほぼ一致する。)
ポアソン過程
時間軸上でランダムに事象が起きる仕組みをポアソン過程と呼ぶ。3 つの条件で特徴づけられる。
- 独立増分: 重ならない時間区間での発生回数は独立
- 定常性: 発生率 \(\lambda\) は時間によらず一定
- 希少性: 極めて短い時間に 2 回以上起きる確率は無視できる
このとき、長さ \(t\) の区間での発生回数は \(\text{Po}(\lambda t)\) に従い、 次の事象までの待ち時間は指数分布(待ち時間が \(t\) を超える確率が \(e^{-\lambda t}\) になる連続分布)に従う(08 章 5 節で導く)。
5. 幾何分布 — 初めて成功するまで
定義(試行回数版)
初めて成功するまでの試行回数 \(X\)(成功した回も数える)。
「\(k-1\) 回失敗して \(k\) 回目に成功」。並び方は 1 通りしかないので二項係数は付かない。
期待値と分散
\(E[X]=1/p\) の導出(うまい方法): 1 回目の結果で場合分けし、全期待値の公式(06 章 8 節)を使う。 1 回目が成功なら \(X=1\)。1 回目が失敗なら、2 回目以降は最初とまったく同じ状況の繰り返しなので、 「残りの試行回数」は \(X\) と同じ分布に従い、\(E[X\mid \text{1 回目失敗}] = 1 + E[X]\)。
∎
\(V[X]\) の導出: 同じ場合分けを \(X^2\) に使う。1 回目が失敗なら残りは \(X\) と同分布なので \(E[X^2\mid\text{1 回目失敗}] = E[(1+X)^2] = 1 + 2E[X] + E[X^2]\)。
∎
直感どおり. 確率 1/6 なら平均 6 回、確率 1/100 なら平均 100 回。 ガチャの「確率 1%」で平均 100 回引く必要がある、というのはこれである。
ただし平均 100 回でも、100 回引いて出ない確率は \(0.99^{100}\approx 36.6\%\) もある。 平均は「そのくらいで出ることが多い」ではない。幾何分布は右に長い裾を引く。
無記憶性
導出: \(P(X>k) = (1-p)^k\)(\(k\) 回全部失敗)なので
∎
意味. 「もう 50 回外した。そろそろ当たるはずだ」——間違い。 過去に何回外そうが、次に当たるまでの回数の分布は最初とまったく同じである。 これが 04 章のギャンブラーの誤謬の正体であり、離散分布で無記憶性を持つのは幾何分布だけである。 (連続の世界では指数分布だけ。08 章。)
6. 負の二項分布 — \(r\) 回成功するまで
定義
\(r\) 回目の成功が起きるまでの試行回数 \(X\)。
「最後(\(k\) 回目)は必ず成功、それ以前の \(k-1\) 回のうち \(r-1\) 回が成功」。
\(r=1\) とすると幾何分布に一致する。
導出: 1 回目の成功までの試行回数を \(G_1\)、そこから 2 回目の成功までの試行回数を \(G_2\)、…とすると \(X = G_1 + \cdots + G_r\)。各 \(G_j\) は「初めて成功するまでの回数」なので幾何分布に従い、試行が独立なので \(G_j\) どうしも独立。 よって期待値の線形性から \(E[X] = r/p\)、独立な和の分散から \(V[X] = r(1-p)/p^2\)。∎
実務での主な用途: 過分散のカウントデータ
試行回数 \(X\) の代わりに失敗回数 \(Y = X - r\)(\(r\) 回成功するまでに何回失敗したか)を数える形に書き直すと、 \(Y\) は \(0,1,2,\dots\) を取るカウントの分布になる。定数を引いても分散は変わらないので
この平均を \(\mu = r(1-p)/p\) と置くと \((1-p)/p = \mu/r\)、\(1/p = 1 + (1-p)/p = 1+\mu/r\) なので
つまり平均より分散が大きいカウント分布として使える。 \(\mu\) を固定して \(r\to\infty\) とすると分散は \(\mu\) に近づき(分布自体もポアソン \(\text{Po}(\mu)\) に収束する)、\(r\) が小さいほど分散が膨らむ。 「ポアソンを試したら分散が大きすぎた」ときの標準的な受け皿である(21 章の GLM で使う)。
7. 超幾何分布 — 非復元抽出
\(N\) 個のうち \(K\) 個が当たり。戻さずに \(n\) 個引いたときの当たりの個数。
導出: \(i\) 回目に引いたものが当たりなら 1、でなければ 0 を \(X_i\) とすると \(X = X_1+\cdots+X_n\)。 \(i\) 回目に引かれるものは \(N\) 個のどれも等確率(引く順番を入れ替えても仕組みは同じ)なので \(P(X_i=1) = K/N\)、よって \(E[X_i]=K/N\)、\(E[X] = nK/N\)。 分散は \(X_i\) が独立でない(戻さないので)ため、06 章 5 節 の一般形 \(V[\sum X_i] = \sum V[X_i] + \sum_{i\ne j}\text{Cov}[X_i,X_j]\) を使う。 \(V[X_i] = \frac{K}{N}\left(1-\frac{K}{N}\right)\)(ベルヌーイ)。\(i\ne j\) について、\(i\) 回目も \(j\) 回目も当たりである確率は \(\frac{K}{N}\cdot\frac{K-1}{N-1}\) なので
共分散の項は \(n(n-1)\) 個あるので
∎
二項分布 \(\text{Bin}(n, K/N)\) と比べると、分散に \(\dfrac{N-n}{N-1}\)(有限母集団修正)が掛かる。 これは 1 より小さいので、非復元の方がばらつきが小さい。
なぜ小さくなるのか. 引いたものを戻さないので、残りの構成が分かってくる。 極端な話 \(n=N\)(全部引く)なら結果は確定で分散 0。式でも \(\frac{N-n}{N-1}=0\) になる。
\(N \gg n\)(母集団が標本よりずっと大きい)なら修正項は 1 に近く、二項分布で近似できる。 実務で「母集団が標本の 20 倍以上あれば二項近似でよい」とされるのはこの理由である。 \(N = 20n\) なら修正項は \(\frac{19n}{20n-1} \approx 0.95\) で、分散の差は 5%(標準偏差なら約 2.5%)にとどまる。
14 章のフィッシャーの正確検定は、この分布を直接使う。
8. 分布の選び方
| 状況 | 分布 | パラメータ |
|---|---|---|
| 1 回の成功/失敗 | ベルヌーイ | \(p\) |
| \(n\) 回中の成功回数(復元) | 二項 | \(n, p\) |
| \(n\) 個抜き取りの当たり数(非復元) | 超幾何 | \(N,K,n\) |
| 単位時間の発生回数(まれ) | ポアソン | \(\lambda\) |
| 初めて成功するまでの回数 | 幾何 | \(p\) |
| \(r\) 回成功するまでの回数 | 負の二項 | \(r,p\) |
| カウントで分散 > 平均 | 負の二項 | \(\mu, r\) |
9. まとめ表
| 分布 | pmf | \(E[X]\) | \(V[X]\) |
|---|---|---|---|
| ベルヌーイ\((p)\) | \(p^x(1-p)^{1-x}\) | \(p\) | \(p(1-p)\) |
| 二項\((n,p)\) | \(\binom{n}{k}p^k(1-p)^{n-k}\) | \(np\) | \(np(1-p)\) |
| ポアソン\((\lambda)\) | \(\lambda^k e^{-\lambda}/k!\) | \(\lambda\) | \(\lambda\) |
| 幾何\((p)\) | \((1-p)^{k-1}p\) | \(1/p\) | \((1-p)/p^2\) |
| 負の二項\((r,p)\) | \(\binom{k-1}{r-1}p^r(1-p)^{k-r}\) | \(r/p\) | \(r(1-p)/p^2\) |
| 超幾何\((N,K,n)\) | \(\binom{K}{k}\binom{N-K}{n-k}/\binom{N}{n}\) | \(nK/N\) | 二項 × 有限修正 |
- すべてはベルヌーイ試行から派生する。何を数えるかで分布が決まる。
- 二項の期待値・分散は「ベルヌーイの和」と見れば 2 行で出る。
- ポアソンは二項の \(n\to\infty, p\to 0\) 極限。平均 = 分散が特徴。
- 幾何分布は無記憶。「そろそろ当たる」は数学的に誤り。