Chapter 14
カテゴリと分散の検定 — χ² 検定・F 検定
この章がなぜ必要なのか——数えたデータを検定する.
「血液型と性格に関連はあるか」「サイコロは公正か」「アンケートの回答分布は去年と変わったか」—— 平均ではなく度数(カウント)を扱う場面は非常に多い。
ここで主役になるのが χ² 検定である。適合度の検定も独立性の検定も、 根っこは同じ「観測度数と期待度数のズレを二乗して足す」という 1 つのアイデアでできている。
後半では分散の検定(F 検定)を扱う。これは 15 章の分散分析への橋渡しでもある。
この章で使う既出の用語(定義は各リンク先). 標本・統計量(01 章 2 節)、離散・連続(01 章 4 節)、標準化(z スコア)(02 章 4 節)、尖度(4 次モーメント)(02 章 5 節)、 2×2 表の \(a,b,c,d\)・リスク比・オッズ比(03 章 8 節)、事象の独立(04 章 5 節)、累積分布関数 cdf(06 章 2 節)、 二項分布・ポアソン分布・超幾何分布(07 章)、χ² 分布と自由度・標本分散との関係(08 章 7 節)、F 分布(08 章 9 節)、 連続修正(09 章 3 節)、推定値(10 章 1 節)、帰無仮説・p 値・両側/片側・効果量(12 章)、ウェルチの t 検定(13 章 3 節)。 「上側 5% 点」などの臨界値は、分布表または統計ソフトで求める。
1. χ² 統計量の考え方
\(k\) 個のカテゴリについて、観測度数 \(O_i\) と、\(H_0\) のもとで期待される度数 \(E_i\)(\(i=1,\dots,k\))を比べる。
なぜこの形なのかを分解して考える。
| 部分 | 理由 |
|---|---|
| \(O_i - E_i\) | ズレそのもの |
| 二乗 | 符号を消す(02 章と同じ理屈) |
| \(\div E_i\) | 期待度数で割って基準化する |
\(E_i\) で割る理由が最も重要である. 期待 10 に対して観測 20(ズレ 10)は大事件だが、 期待 10000 に対して観測 10010(ズレ 10)は誤差の範囲である。 同じズレでも、期待値が大きいほど相対的に小さい。
理論的には、\(O_i\) は「\(n\) 個の観測のうちカテゴリ \(i\) に落ちた個数」なので二項分布 \(\text{Bin}(n,p_i)\) に従い、\(p_i\) が小さければポアソン分布で近似できる(07 章 4 節)。ポアソンでは分散 = 平均。 つまり \(E_i\) が分散の推定値になっている。だから
$$\frac{(O_i-E_i)^2}{E_i} \approx \frac{(\text{観測}-\text{平均})^2}{\text{分散}} = (\text{標準化した値})^2$$
となり、\(n\) が大きければ各項は標準正規分布の二乗に近く、標準正規分布の二乗の和 = χ² 分布(08 章 7 節の定義そのもの)になる。 χ² 統計量が χ² 分布に従うのは、偶然ではなくこの構造による。 (厳密には \(O_i\) の分散は \(np_i(1-p_i) = E_i(1-p_i)\) で、\(\sum O_i = n\) の拘束もあるため各項は独立でない。それらを正確に扱うと、和が自由度 \(k-1\) の χ² 分布に従うことが示される。)
2. 適合度検定 (goodness-of-fit test)
問題設定
「観測された度数分布が、想定した分布に合っているか」
自由度が \(k-1\) の理由: 自由度とは「拘束を引いた後に自由に動ける個数」である(08 章 7 節)。\(k\) 個のカテゴリの度数には \(\sum O_i = n\) という拘束が 1 本ある。 \(k-1\) 個決まれば残りは自動的に決まるので、自由度は \(k-1\)(標本分散の \(n-1\) と同じ考え方)。
例: サイコロは公正か
60 回振った結果:
| 目 | 1 | 2 | 3 | 4 | 5 | 6 | 計 |
|---|---|---|---|---|---|---|---|
| 観測 \(O\) | 8 | 12 | 6 | 14 | 9 | 11 | 60 |
| 期待 \(E\) | 10 | 10 | 10 | 10 | 10 | 10 | 60 |
自由度 5 の χ² 分布で上側 5% 点は 11.07(χ² 分布表)。\(4.2 < 11.07\) なので棄却できない(p ≈ 0.52)。 このデータからは「サイコロが偏っている」とは言えない。
パラメータを推定した場合
分布のパラメータをデータから推定したなら、推定した個数だけ自由度が減る。
| 検定する分布 | 推定するパラメータ | 自由度 |
|---|---|---|
| 一様(指定済み) | 0 | \(k-1\) |
| ポアソン(\(\lambda\) を推定) | 1 | \(k-2\) |
| 正規(\(\mu,\sigma\) を推定) | 2 | \(k-3\) |
理屈: パラメータを推定するとは、\(E_i\) をデータに合わせて調整することである。 調整すればするほど当てはまりが良くなるのは当たり前なので、その分「甘く」なる。 それを補正するのが自由度の減少である。 18 章以降の回帰でも、パラメータを増やすと自由度が減るのはまったく同じ理屈である。
3. 独立性の検定 (test of independence)
問題設定
2 つのカテゴリ変数に関連があるか。\(r\times c\) 分割表を扱う。
期待度数の作り方
独立なら \(P(A\cap B)=P(A)P(B)\)(04 章 5 節)なので、「行 \(i\) かつ列 \(j\)」の確率を \(\frac{R_i}{n}\times\frac{C_j}{n}\) と見積もり、\(n\) を掛けて
(\(R_i\) = 第 \(i\) 行の合計、\(C_j\) = 第 \(j\) 列の合計。)
自由度 \((r-1)(c-1)\) の理由: 行和と列和が固定されているので、 \((r-1)\times(c-1)\) 個のセルを決めれば残りはすべて自動的に決まる。
例: 喫煙と肺疾患
| 疾患あり | 疾患なし | 行計 | |
|---|---|---|---|
| 喫煙 | 40 | 160 | 200 |
| 非喫煙 | 20 | 280 | 300 |
| 列計 | 60 | 440 | 500 |
期待度数:
自由度 \((2-1)(2-1)=1\) の χ² 分布の上側 5% 点は 3.84(\(=1.96^2\)。自由度 1 の χ² は標準正規の二乗だから)。\(20.20 \gg 3.84\) なので強く棄却(p < 0.001)。
関連の強さも報告する(03 章 8 節)。2×2 表のセルを 03 章と同じく 1 行目 \(a, b\)、2 行目 \(c, d\) と書く(ここでは \(a=40, b=160, c=20, d=280\))。
χ² は「関連があるか」しか言わない。「どのくらい強いか」は言わない。 12 章と同じ話で、\(n\) を増やせばどんな微小な関連も有意になる。 必ず効果量(オッズ比、リスク比、下記のクラメールの V)を併記する。
関連の強さの指標
| 指標 | 式 | 範囲 |
|---|---|---|
| φ 係数(2×2) | \(\sqrt{\chi^2/n}\) | 0〜1 |
| クラメールの V | \(\sqrt{\dfrac{\chi^2}{n\cdot\min(r-1,c-1)}}\) | 0〜1 |
| リスク比(2×2) | \(\dfrac{a/(a+b)}{c/(c+d)}\) | 0〜∞ |
| オッズ比(2×2) | \(ad/bc\) | 0〜∞ |
上の例では \(V = \sqrt{20.20/500}=0.20\)(弱〜中程度の関連)。
4. χ² 検定の前提と注意
期待度数の下限
(コクランの基準。2×2 表ではセルが 4 つしかないので、実質「すべてのセルで 5 以上」になる。)
これが満たされないと、χ² 近似が悪くなる。
なぜ期待度数が小さいとまずいのか. χ² 分布は連続分布だが、度数は離散である。 期待度数が大きければ CLT により正規近似が効くが、 期待度数 2 とか 3 では離散性が目立ちすぎて近似が崩れる。 結果としてp 値が小さく出すぎ、偽陽性が増える。
対策
| 状況 | 対策 |
|---|---|
| セルの期待度数が小さい | カテゴリを併合する |
| 2×2 で \(n\) が小さい | フィッシャーの正確検定 |
| \(r\times c\) で \(n\) が小さい | 並べ替え検定(16 章)、モンテカルロ p 値(\(H_0\) のもとで表を乱数で大量に生成し、観測以上に極端な表の割合を p 値とする) |
イェーツの連続性補正(2×2 のみ)
整数の度数を連続な χ² 分布で近似するときに、09 章 3 節 の連続修正と同じ考えで \(\lvert O-E\rvert\) を 0.5(棒の幅の半分)だけ縮める補正である。だが保守的すぎる(検出力を落としすぎる)と批判されており、 現代では「\(n\) が小さいならフィッシャーの正確検定を使う」方が推奨される。
5. フィッシャーの正確検定
行和 \(R_1=a+b, R_2=c+d\) と列和 \(C_1=a+c, C_2=b+d\)(3 節 の \(R_i, C_j\) を 2×2 で書いたもの)を固定すると、表は左上のセル \(a\) の値 1 つで決まる。 \(H_0\)(独立)のもとで \(a\) は「\(n\) 個のうち \(C_1\) 個が『疾患あり』で、そこから \(R_1\) 個を戻さずに引いたときの『疾患あり』の個数」と同じ分布、すなわち超幾何分布(07 章 7 節)に従う。
p 値は、取りうるすべての \(a\) のうち「観測された表と同じか、それより起こる確率が小さい」表の確率を足し合わせたもの(両側)。
「正確」の意味. 近似を使わず、確率を厳密に計算するという意味である。 \(n\) が小さいときは常にこちらを使ってよい。 計算量は \(n\) が大きいと爆発するが、現代の計算機なら数千程度までは問題ない。
有名な逸話: フィッシャーの同僚が「紅茶を先に入れたかミルクを先に入れたか味で分かる」 と主張したのを検証するため、8 杯(各 4 杯)を出して当てさせた。 この実験の解析法としてこの検定が考案された(貴婦人の紅茶実験)。
6. 独立性検定と等質性検定
見た目は同じ計算だが、設計が違う。
| 独立性の検定 | 等質性の検定 | |
|---|---|---|
| 標本の取り方 | 全体から \(n\) 人を取り、2 変数を測る | 各群のサイズを先に決めて別々に標本を取る |
| 帰無仮説 | 2 変数が独立 | 各群の分布が同一 |
| 例 | 500 人を調査し、喫煙状況と疾患を記録 | 喫煙者 200 人・非喫煙者 300 人を集めて疾患率を比較 |
計算はまったく同じである。解釈と、言えることの範囲が違う。 独立性の検定の設計では、2 変数の同時分布(喫煙率、有病率、両者の関連)をすべて推定できる。 等質性の検定では群のサイズを先に決めているので、喫煙率は推定できず、言えるのは「群間で疾患の分布が違うか」だけである。
7. 分散の検定
1 標本(χ² 検定)
(08 章 7 節の「標本分散と χ² 分布の関係」そのもの。)両側検定なので、上下両方の棄却点と比べる。
2 標本(F 検定)
慣例として大きい方を分子に置き、上側だけを見て p 値を 2 倍する(両側検定)。
例: \(s_1^2=25\)(\(n_1=15\))、\(s_2^2=10\)(\(n_2=20\))。
\(F(14,19)\) の上側 2.5% 点は約 2.65(F 分布表)。両側 5% 検定で大きい方を分子に置いたので、上側の \(\alpha/2 = 2.5\%\) 点と比べる(上側 p 値を 2 倍して 5% と比べるのと同じこと)。\(2.5 < 2.65\) なので有意差なし。
F 検定の重大な弱点
F 検定は正規性からのずれに極めて敏感である. 分布の裾がわずかに重いだけで、第 1 種の誤り率が 5% のはずが 20% を超えることがある。 t 検定が正規性に頑健なのとは対照的で、これは \(s^2\) の分散が母集団の4 次モーメント(尖度。02 章 5 節)に依存するためである(正規分布のときだけ \(2\sigma^4/(n-1)\) になる)。
だから「t 検定の前に F 検定で等分散を確認する」という手順は推奨されない(13 章)。 前段の検定自体が信用できないうえ、2 段階の手順で誤り率が制御できなくなる。 最初からウェルチを使えばよい。
等分散性のより頑健な検定
どうしても等分散を検定したい場合:
| 検定 | 特徴 |
|---|---|
| バートレット検定 | 正規性を仮定。F 検定同様に敏感 |
| ルビーン検定 | 各データの群平均からの絶対偏差 \(\lvert x_{ij}-\bar x_i\rvert\) に分散分析 ANOVA(15 章。群平均の差の検定)を適用。頑健 |
| ブラウン・フォーサイス検定 | ルビーンの中央値版。さらに頑健。推奨 |
8. 適合度検定のもう一つの道具
コルモゴロフ・スミルノフ検定 (KS 検定)
連続分布への適合を、経験分布関数と理論 cdf の最大乖離で測る。 経験分布関数 \(F_n(x)\) は「データのうち \(x\) 以下の割合」、\(F_0(x)\) は帰無仮説の分布の累積分布関数、\(\sup_x\) は \(x\) を動かしたときの上限(最大値)。
χ² 検定と違ってビン分け(連続データを区間に区切ってカテゴリにすること)が不要なのが利点。ただしパラメータを推定した場合は臨界値が変わる (そのままの KS 検定は使えず、リリーフォース検定などを使う)。
正規性の検定
| 検定 | 特徴 |
|---|---|
| シャピロ・ウィルク検定 | 検出力が高い。\(n\le 5000\) 程度 |
| アンダーソン・ダーリング検定 | 裾の適合を重視 |
| Q-Q プロット | 横軸に理論分布の分位点、縦軸にデータの分位点を打った散布図。正規なら直線に並ぶ。検定より視覚的確認の方が有用なことが多い |
正規性の検定は使い方が難しい. \(n\) が小さいと検出力が低くて「正規でない」を見逃し、 \(n\) が大きいとわずかなずれでも有意になる(12 章の話と同じ)。 つまり最も知りたいときに役に立たない。
実務では、正規性検定の p 値で判断するより、 Q-Q プロットを見て「t 検定が壊れるほどのずれか」を目で判断する方が良い。 t 検定は多少のずれには頑健である(13 章)。
9. まとめ
| 検定 | 統計量 | 分布 | 用途 |
|---|---|---|---|
| 適合度 χ² | \(\sum\frac{(O-E)^2}{E}\) | \(\chi^2_{k-1-m}\)(\(m\) は推定した母数の数) | 想定分布との一致 |
| 独立性 χ² | 同上 | \(\chi^2_{(r-1)(c-1)}\) | 2 変数の関連 |
| フィッシャー正確 | 超幾何分布 | — | 2×2 で \(n\) 小 |
| 1 標本分散 | \(\frac{(n-1)s^2}{\sigma_0^2}\) | \(\chi^2_{n-1}\) | 分散が指定値か |
| 2 標本分散 | \(s_1^2/s_2^2\) | \(F\) | 分散が等しいか |
- χ² 統計量は「ズレの二乗を期待度数で基準化して足す」。\(E\) で割るのは分散で割るのと同じ意味。
- 自由度は「拘束を引いた後に自由に動ける個数」。パラメータ推定でさらに減る。
- 期待度数 5 未満のセルがあるならフィッシャーの正確検定。
- F 検定(分散の検定)は正規性に脆い。t 検定の前段に使うべきではない。
- χ² が有意でも関連の強さは分からない。クラメールの V やオッズ比を併記する。