統計 07 · 離散分布 — ベルヌーイ・二項・ポアソン・幾何・負の二項

Chapter 07

離散分布 — ベルヌーイ・二項・ポアソン・幾何・負の二項

この章がなぜ必要なのか——「よくある状況」には名前がついている.

「コインを 100 回投げて表が 60 回出た。これは偏ったコインか?」 この問いに答えるには、公正なコインなら表が何回出るはずか、その分布を知らねばならない。

幸い、現実に現れる確率的状況の多くはいくつかの型に分類できる。 「成功/失敗を \(n\) 回」なら二項分布、「一定時間に何回起きるか」ならポアソン分布。

型が分かれば、平均も分散も確率も公式で即座に出せる。 分布を覚えるとは、公式を暗記することではなく、 目の前の状況がどの型なのかを見抜けるようになることである。

この章で使う既出の用語(定義は各リンク先). 母集団・標本(01 章 2 節)、離散・連続(01 章 4 節)、試行・事象(04 章 2 節)、 独立と i.i.d.(04 章 5 節)、確率変数と確率質量関数 \(P(X=x)\)(06 章 1〜2 節)、 期待値 \(E[X]\) とその線形性(06 章 3 節)、分散 \(V[X]\)・便利公式 \(V[X]=E[X^2]-(E[X])^2\)・標準偏差 \(\text{SD}[X]=\sqrt{V[X]}\)(06 章 4 節)、 独立な和の分散(06 章 5 節)、条件付き期待値と全期待値の公式(06 章 8 節)。 \(X \sim\)(分布名)は「\(X\) はその分布に従う」と読む。

1. 分布の家系図(先に全体像)

離散分布はバラバラの知識ではなく、1 つの土台から派生している。

        ベルヌーイ試行(成功確率 p の1回試行)
                    │
     ┌──────────────┼───────────────┐
     ↓              ↓               ↓
  n回中の         初めて成功       r回目の成功
  成功回数         までの回数       までの回数
     ↓              ↓               ↓
  二項分布       幾何分布        負の二項分布
     │
     │ n→∞, p→0, np=λ 固定
     ↓
  ポアソン分布

すべての出発点は「成功確率 \(p\) の 1 回の試行」である。そこから何を数えるかで分布が決まる。 図中の \(r\) は「何回目の成功か」(6 節 で定義)、\(\lambda\) は二項分布の \(np\) を固定した値で、ポアソン分布の平均発生回数になる(4 節 で定義)。

2. ベルヌーイ分布 — すべての土台

定義

1 回の試行で、成功(1)が確率 \(p\)、失敗(0)が確率 \(1-p\)。

\[ P(X = x) = p^x (1-p)^{1-x}, \qquad x \in \{0, 1\} \]

(\(x=1\) なら \(p\)、\(x=0\) なら \(1-p\) になることを確認せよ。指数を使って 1 行にまとめただけである。)

期待値と分散

\[ E[X] = 1\cdot p + 0\cdot(1-p) = p \]
\[ E[X^2] = 1^2\cdot p + 0^2\cdot(1-p) = p \]
\[ V[X] = E[X^2]-(E[X])^2 = p - p^2 = p(1-p) \]
\[ \boxed{E[X]=p, \qquad V[X]=p(1-p)} \]

分散が \(p=0.5\) で最大になる. \(p(1-p)\) は上に凸の放物線で、頂点は \(p=1/2\)、最大値 \(1/4\)。 意味は明快で、五分五分のときが最も予測しにくい。 \(p=0.99\) ならほぼ確実に成功するので、ばらつきは小さい。

これは 11 章で「比率の信頼区間(推定値の誤差の範囲を示す区間)は \(p=0.5\) のとき最も広い」という形で効いてくる。 世論調査の必要サンプル数(望む精度を得るのに要る \(n\)。09 章 5 節)を \(p=0.5\) で計算するのは、最悪ケースで見積もるためである。

3. 二項分布 — \(n\) 回中の成功回数

定義

成功確率 \(p\) のベルヌーイ試行を独立に \(n\) 回繰り返したときの成功回数 \(X\)。

\[ \boxed{P(X=k) = \binom{n}{k}p^k(1-p)^{n-k}, \qquad k = 0,1,\dots,n} \]

\(X \sim \text{Bin}(n,p)\) と書く。

式の意味:

部分意味
\(p^k\)成功が \(k\) 回起きる確率
\((1-p)^{n-k}\)失敗が \(n-k\) 回起きる確率
\(\binom{n}{k}\)どの回に成功が来るかの並び方の数

たとえば \(n=3, k=2\) なら、成功の位置は \(\{1,2\},\{1,3\},\{2,3\}\) の \(\binom{3}{2}=3\) 通り。 どの並びも確率は同じ \(p^2(1-p)\) なので、3 倍する。

確率の総和が 1 になる確認(二項定理そのもの):

\[ \sum_{k=0}^n \binom{n}{k}p^k(1-p)^{n-k} = (p + (1-p))^n = 1 \]

期待値と分散(ベルヌーイの和として)

\(X = X_1 + \cdots + X_n\)(各 \(X_i\) は独立なベルヌーイ)と見れば、06 章の道具で一瞬である。

\[ E[X] = \sum_{i=1}^n E[X_i] = np \]
\[ V[X] \overset{\text{独立}}{=} \sum_{i=1}^n V[X_i] = np(1-p) \]

(等号の上の「独立」は、その等号が独立性を使っていることを示す。以下同じ。)

\[ \boxed{E[X]=np, \qquad V[X]=np(1-p)} \]

定義から直接計算すると \(\sum k\binom{n}{k}p^k(1-p)^{n-k}\) という面倒な和になるが、 「ベルヌーイの和」と見れば 2 行で終わる。 これが 06 章で期待値の線形性と分散の加法性を強調した理由である。 難しい和を計算するより、分解して簡単な部品の和と見る方が圧倒的に楽になる。

再生性

同じ族の分布に従う独立な確率変数の和が、また同じ族の分布に従う性質を再生性という。二項分布はこれを持つ。 \(X\sim\text{Bin}(n_1,p)\)、\(Y\sim\text{Bin}(n_2,p)\) が独立なら

\[ X+Y \sim \text{Bin}(n_1+n_2, p) \]

理由: \(X\) は \(n_1\) 個の独立なベルヌーイの和、\(Y\) は \(n_2\) 個の独立なベルヌーイの和で、\(X\) と \(Y\) が独立なら 合わせて \(n_1+n_2\) 個の独立なベルヌーイの和になる。これは定義から \(\text{Bin}(n_1+n_2,p)\) である。∎

具体例

公正なコイン(\(p=0.5\))を 10 回投げる。

\[ E[X] = 5, \qquad V[X] = 10\times 0.5\times 0.5 = 2.5, \qquad \text{SD}[X] = \sqrt{2.5} \approx 1.58 \]
\[ P(X=5) = \binom{10}{5}(0.5)^{10} = \frac{10!}{5!\,5!}\cdot\frac{1}{1024} = \frac{252}{1024} \approx 0.246 \]

注意すべき点. 期待値がちょうど 5 でも、ちょうど 5 回になる確率は 25% しかない。 「期待値のあたりに集中する」が「期待値そのものになる」ではない。 同じ計算で \(P(X=4)=P(X=6)=210/1024\)、\(P(X=3)=P(X=7)=120/1024\) なので、 \(4 \le X \le 6\) なら \((210+252+210)/1024 \approx 0.66\)、\(3\le X\le 7\) なら \((120+210+252+210+120)/1024 \approx 0.89\) になる。

4. ポアソン分布 — まれな事象の回数

定義

\[ \boxed{P(X=k) = \frac{\lambda^k e^{-\lambda}}{k!}, \qquad k=0,1,2,\dots} \]

\(X\sim\text{Po}(\lambda)\) と書く。\(\lambda > 0\) は「単位時間(単位面積)あたりの平均発生回数」。

二項分布からの導出

\(n\to\infty\)、\(p\to 0\)、\(np=\lambda\) 一定の極限を取る。\(p = \lambda/n\) を代入する。

\[ P(X=k) = \binom{n}{k}\left(\frac{\lambda}{n}\right)^k\left(1-\frac{\lambda}{n}\right)^{n-k} \]
\[ = \frac{n(n-1)\cdots(n-k+1)}{k!}\cdot\frac{\lambda^k}{n^k}\cdot\left(1-\frac{\lambda}{n}\right)^{n}\left(1-\frac{\lambda}{n}\right)^{-k} \]

3 つの部分に分けて \(n\to\infty\) を取る。

部分極限理由
\(\dfrac{n(n-1)\cdots(n-k+1)}{n^k}\)\(\to 1\)\(k\) 個の因子がそれぞれ \(\to 1\)
\(\left(1-\dfrac{\lambda}{n}\right)^n\)\(\to e^{-\lambda}\)\(\lim_{n\to\infty}(1+x/n)^n = e^x\) で \(x=-\lambda\) とおく
\(\left(1-\dfrac{\lambda}{n}\right)^{-k}\)\(\to 1\)指数が固定で底が \(\to 1\)

よって

\[ P(X=k) \to \frac{\lambda^k}{k!}e^{-\lambda} \]

∎

この導出が語ること. ポアソン分布とは「試行回数が莫大で、1 回あたりの確率が極めて小さく、 その積(平均発生数)が適度な値」という状況の分布である。

「たくさんの機会があり、各機会での確率は小さい」 ——これがポアソンの合図である。

期待値と分散

\[ E[X] = \sum_{k=0}^\infty k\frac{\lambda^k e^{-\lambda}}{k!} = \lambda e^{-\lambda}\sum_{k=1}^\infty \frac{\lambda^{k-1}}{(k-1)!} = \lambda e^{-\lambda}e^{\lambda} = \lambda \]

(\(k=0\) の項は 0 なので \(k\ge 1\) から始め、\(k/k! = 1/(k-1)!\) を使った。)

分散は \(E[X(X-1)]\) を経由すると同じ手で計算できる。\(k=0,1\) の項は 0 なので \(k\ge 2\) から始め、\(k(k-1)/k! = 1/(k-2)!\) を使う。

\[ E[X(X-1)] = \sum_{k=2}^\infty k(k-1)\frac{\lambda^k e^{-\lambda}}{k!} = \lambda^2 e^{-\lambda}\sum_{k=2}^\infty\frac{\lambda^{k-2}}{(k-2)!} = \lambda^2 e^{-\lambda}e^{\lambda} = \lambda^2 \]

\(X(X-1) = X^2 - X\) なので \(E[X^2] = E[X(X-1)] + E[X] = \lambda^2+\lambda\)。便利公式から

\[ V[X] = E[X^2]-(E[X])^2 = \lambda^2+\lambda-\lambda^2 = \lambda \]
\[ \boxed{E[X]=\lambda, \qquad V[X]=\lambda} \]

平均と分散が等しい! これはポアソン分布の際立った特徴である。

実務では、この性質をモデルの検証に使える。 カウントデータの標本平均と標本分散を比べて、分散の方がはるかに大きければ (過分散 overdispersion)、ポアソンは不適切である。 客が「団体で」来るような場合に起きる。理由: 1 人ずつ独立に来るなら 1 時間の人数は \(\text{Po}(\lambda)\) で分散 \(\lambda\) だが、 必ず 5 人組で来て組の数が \(\text{Po}(\lambda/5)\) なら、人数は \(5\times(\text{組の数})\) なので平均は同じ \(\lambda\) のまま、 分散は \(5^2\times\lambda/5 = 5\lambda\) に膨らむ(\(V[aX]=a^2V[X]\))。 そのときは負の二項分布を使う(本章 6 節、21 章)。

二項分布の近似としての実用

\(n\) が大きく \(p\) が小さいとき、\(\text{Bin}(n,p) \approx \text{Po}(np)\)。目安は \(n\ge 50\) かつ \(np \le 10\) 程度。

例: 不良率 0.1% の製品を 2000 個検査。不良品が 3 個以上ある確率は?

\(\lambda = 2000\times 0.001 = 2\) として

\[ P(X\ge 3) = 1 - P(0)-P(1)-P(2) = 1 - e^{-2}\left(1 + 2 + 2\right) = 1 - 5e^{-2} \approx 0.323 \]

(二項分布で厳密に計算しても 0.3233 で、ほぼ一致する。)

ポアソン過程

時間軸上でランダムに事象が起きる仕組みをポアソン過程と呼ぶ。3 つの条件で特徴づけられる。

  1. 独立増分: 重ならない時間区間での発生回数は独立
  2. 定常性: 発生率 \(\lambda\) は時間によらず一定
  3. 希少性: 極めて短い時間に 2 回以上起きる確率は無視できる

このとき、長さ \(t\) の区間での発生回数は \(\text{Po}(\lambda t)\) に従い、 次の事象までの待ち時間は指数分布(待ち時間が \(t\) を超える確率が \(e^{-\lambda t}\) になる連続分布)に従う(08 章 5 節で導く)。

5. 幾何分布 — 初めて成功するまで

定義(試行回数版)

初めて成功するまでの試行回数 \(X\)(成功した回も数える)。

\[ P(X=k) = (1-p)^{k-1}p, \qquad k=1,2,3,\dots \]

「\(k-1\) 回失敗して \(k\) 回目に成功」。並び方は 1 通りしかないので二項係数は付かない。

期待値と分散

\[ \boxed{E[X] = \frac{1}{p}, \qquad V[X] = \frac{1-p}{p^2}} \]

\(E[X]=1/p\) の導出(うまい方法): 1 回目の結果で場合分けし、全期待値の公式(06 章 8 節)を使う。 1 回目が成功なら \(X=1\)。1 回目が失敗なら、2 回目以降は最初とまったく同じ状況の繰り返しなので、 「残りの試行回数」は \(X\) と同じ分布に従い、\(E[X\mid \text{1 回目失敗}] = 1 + E[X]\)。

\[ E[X] = \underbrace{p\cdot 1}_{\text{1回目で成功}} + \underbrace{(1-p)(1 + E[X])}_{\text{失敗したら振り出しに戻る}} \]
\[ E[X] = p + (1-p) + (1-p)E[X] = 1 + (1-p)E[X] \]
\[ pE[X] = 1 \quad\Longrightarrow\quad E[X] = \frac{1}{p} \]

∎

\(V[X]\) の導出: 同じ場合分けを \(X^2\) に使う。1 回目が失敗なら残りは \(X\) と同分布なので \(E[X^2\mid\text{1 回目失敗}] = E[(1+X)^2] = 1 + 2E[X] + E[X^2]\)。

\[ E[X^2] = p\cdot 1 + (1-p)\big(1 + 2E[X] + E[X^2]\big) \quad\Longrightarrow\quad pE[X^2] = 1 + \frac{2(1-p)}{p} \quad\Longrightarrow\quad E[X^2] = \frac{2-p}{p^2} \]
\[ V[X] = E[X^2]-(E[X])^2 = \frac{2-p}{p^2} - \frac{1}{p^2} = \frac{1-p}{p^2} \]

∎

直感どおり. 確率 1/6 なら平均 6 回、確率 1/100 なら平均 100 回。 ガチャの「確率 1%」で平均 100 回引く必要がある、というのはこれである。

ただし平均 100 回でも、100 回引いて出ない確率は \(0.99^{100}\approx 36.6\%\) もある。 平均は「そのくらいで出ることが多い」ではない。幾何分布は右に長い裾を引く。

無記憶性

\[ P(X > s+t \mid X > s) = P(X > t) \]

導出: \(P(X>k) = (1-p)^k\)(\(k\) 回全部失敗)なので

\[ P(X>s+t\mid X>s) = \frac{(1-p)^{s+t}}{(1-p)^s} = (1-p)^t = P(X>t) \]

∎

意味. 「もう 50 回外した。そろそろ当たるはずだ」——間違い。 過去に何回外そうが、次に当たるまでの回数の分布は最初とまったく同じである。 これが 04 章のギャンブラーの誤謬の正体であり、離散分布で無記憶性を持つのは幾何分布だけである。 (連続の世界では指数分布だけ。08 章。)

6. 負の二項分布 — \(r\) 回成功するまで

定義

\(r\) 回目の成功が起きるまでの試行回数 \(X\)。

\[ P(X=k) = \binom{k-1}{r-1}p^r(1-p)^{k-r}, \qquad k = r, r+1,\dots \]

「最後(\(k\) 回目)は必ず成功、それ以前の \(k-1\) 回のうち \(r-1\) 回が成功」。

\(r=1\) とすると幾何分布に一致する。

\[ E[X] = \frac{r}{p}, \qquad V[X] = \frac{r(1-p)}{p^2} \]

導出: 1 回目の成功までの試行回数を \(G_1\)、そこから 2 回目の成功までの試行回数を \(G_2\)、…とすると \(X = G_1 + \cdots + G_r\)。各 \(G_j\) は「初めて成功するまでの回数」なので幾何分布に従い、試行が独立なので \(G_j\) どうしも独立。 よって期待値の線形性から \(E[X] = r/p\)、独立な和の分散から \(V[X] = r(1-p)/p^2\)。∎

実務での主な用途: 過分散のカウントデータ

試行回数 \(X\) の代わりに失敗回数 \(Y = X - r\)(\(r\) 回成功するまでに何回失敗したか)を数える形に書き直すと、 \(Y\) は \(0,1,2,\dots\) を取るカウントの分布になる。定数を引いても分散は変わらないので

\[ E[Y] = \frac{r}{p} - r = \frac{r(1-p)}{p}, \qquad V[Y] = \frac{r(1-p)}{p^2} \]

この平均を \(\mu = r(1-p)/p\) と置くと \((1-p)/p = \mu/r\)、\(1/p = 1 + (1-p)/p = 1+\mu/r\) なので

\[ V[Y] = \frac{r(1-p)}{p}\cdot\frac{1}{p} = \mu\left(1+\frac{\mu}{r}\right) = \mu + \frac{\mu^2}{r} \]

つまり平均より分散が大きいカウント分布として使える。 \(\mu\) を固定して \(r\to\infty\) とすると分散は \(\mu\) に近づき(分布自体もポアソン \(\text{Po}(\mu)\) に収束する)、\(r\) が小さいほど分散が膨らむ。 「ポアソンを試したら分散が大きすぎた」ときの標準的な受け皿である(21 章の GLM で使う)。

7. 超幾何分布 — 非復元抽出

\(N\) 個のうち \(K\) 個が当たり。戻さずに \(n\) 個引いたときの当たりの個数。

\[ P(X=k) = \frac{\binom{K}{k}\binom{N-K}{n-k}}{\binom{N}{n}} \]
\[ E[X] = n\frac{K}{N}, \qquad V[X] = n\frac{K}{N}\left(1-\frac{K}{N}\right)\frac{N-n}{N-1} \]

導出: \(i\) 回目に引いたものが当たりなら 1、でなければ 0 を \(X_i\) とすると \(X = X_1+\cdots+X_n\)。 \(i\) 回目に引かれるものは \(N\) 個のどれも等確率(引く順番を入れ替えても仕組みは同じ)なので \(P(X_i=1) = K/N\)、よって \(E[X_i]=K/N\)、\(E[X] = nK/N\)。 分散は \(X_i\) が独立でない(戻さないので)ため、06 章 5 節 の一般形 \(V[\sum X_i] = \sum V[X_i] + \sum_{i\ne j}\text{Cov}[X_i,X_j]\) を使う。 \(V[X_i] = \frac{K}{N}\left(1-\frac{K}{N}\right)\)(ベルヌーイ)。\(i\ne j\) について、\(i\) 回目も \(j\) 回目も当たりである確率は \(\frac{K}{N}\cdot\frac{K-1}{N-1}\) なので

\[ \text{Cov}[X_i,X_j] = \frac{K}{N}\cdot\frac{K-1}{N-1} - \left(\frac{K}{N}\right)^2 = \frac{K}{N}\cdot\frac{N(K-1)-K(N-1)}{N(N-1)} = -\frac{K}{N}\cdot\frac{N-K}{N(N-1)} = -\frac{1}{N-1}\cdot\frac{K}{N}\left(1-\frac{K}{N}\right) \]

共分散の項は \(n(n-1)\) 個あるので

\[ V[X] = \frac{K}{N}\left(1-\frac{K}{N}\right)\left[n - \frac{n(n-1)}{N-1}\right] = n\frac{K}{N}\left(1-\frac{K}{N}\right)\frac{N-n}{N-1} \]

∎

二項分布 \(\text{Bin}(n, K/N)\) と比べると、分散に \(\dfrac{N-n}{N-1}\)(有限母集団修正)が掛かる。 これは 1 より小さいので、非復元の方がばらつきが小さい。

なぜ小さくなるのか. 引いたものを戻さないので、残りの構成が分かってくる。 極端な話 \(n=N\)(全部引く)なら結果は確定で分散 0。式でも \(\frac{N-n}{N-1}=0\) になる。

\(N \gg n\)(母集団が標本よりずっと大きい)なら修正項は 1 に近く、二項分布で近似できる。 実務で「母集団が標本の 20 倍以上あれば二項近似でよい」とされるのはこの理由である。 \(N = 20n\) なら修正項は \(\frac{19n}{20n-1} \approx 0.95\) で、分散の差は 5%(標準偏差なら約 2.5%)にとどまる。

14 章のフィッシャーの正確検定は、この分布を直接使う。

8. 分布の選び方

状況分布パラメータ
1 回の成功/失敗ベルヌーイ\(p\)
\(n\) 回中の成功回数(復元)二項\(n, p\)
\(n\) 個抜き取りの当たり数(非復元)超幾何\(N,K,n\)
単位時間の発生回数(まれ)ポアソン\(\lambda\)
初めて成功するまでの回数幾何\(p\)
\(r\) 回成功するまでの回数負の二項\(r,p\)
カウントで分散 > 平均負の二項\(\mu, r\)

9. まとめ表

分布pmf\(E[X]\)\(V[X]\)
ベルヌーイ\((p)\)\(p^x(1-p)^{1-x}\)\(p\)\(p(1-p)\)
二項\((n,p)\)\(\binom{n}{k}p^k(1-p)^{n-k}\)\(np\)\(np(1-p)\)
ポアソン\((\lambda)\)\(\lambda^k e^{-\lambda}/k!\)\(\lambda\)\(\lambda\)
幾何\((p)\)\((1-p)^{k-1}p\)\(1/p\)\((1-p)/p^2\)
負の二項\((r,p)\)\(\binom{k-1}{r-1}p^r(1-p)^{k-r}\)\(r/p\)\(r(1-p)/p^2\)
超幾何\((N,K,n)\)\(\binom{K}{k}\binom{N-K}{n-k}/\binom{N}{n}\)\(nK/N\)二項 × 有限修正