統計 14 · カテゴリと分散の検定 — χ² 検定・F 検定

Chapter 14

カテゴリと分散の検定 — χ² 検定・F 検定

この章がなぜ必要なのか——数えたデータを検定する.

「血液型と性格に関連はあるか」「サイコロは公正か」「アンケートの回答分布は去年と変わったか」—— 平均ではなく度数(カウント)を扱う場面は非常に多い。

ここで主役になるのが χ² 検定である。適合度の検定も独立性の検定も、 根っこは同じ「観測度数と期待度数のズレを二乗して足す」という 1 つのアイデアでできている。

後半では分散の検定(F 検定)を扱う。これは 15 章の分散分析への橋渡しでもある。

この章で使う既出の用語(定義は各リンク先). 標本・統計量(01 章 2 節)、離散・連続(01 章 4 節)、標準化(z スコア)(02 章 4 節)、尖度(4 次モーメント)(02 章 5 節)、 2×2 表の \(a,b,c,d\)・リスク比・オッズ比(03 章 8 節)、事象の独立(04 章 5 節)、累積分布関数 cdf(06 章 2 節)、 二項分布・ポアソン分布・超幾何分布(07 章)、χ² 分布と自由度・標本分散との関係(08 章 7 節)、F 分布(08 章 9 節)、 連続修正(09 章 3 節)、推定値(10 章 1 節)、帰無仮説・p 値・両側/片側・効果量(12 章)、ウェルチの t 検定(13 章 3 節)。 「上側 5% 点」などの臨界値は、分布表または統計ソフトで求める。

1. χ² 統計量の考え方

\(k\) 個のカテゴリについて、観測度数 \(O_i\) と、\(H_0\) のもとで期待される度数 \(E_i\)(\(i=1,\dots,k\))を比べる。

\[ \boxed{\chi^2 = \sum_{i=1}^{k} \frac{(O_i-E_i)^2}{E_i}} \]

なぜこの形なのかを分解して考える。

部分理由
\(O_i - E_i\)ズレそのもの
二乗符号を消す(02 章と同じ理屈)
\(\div E_i\)期待度数で割って基準化する

\(E_i\) で割る理由が最も重要である. 期待 10 に対して観測 20(ズレ 10)は大事件だが、 期待 10000 に対して観測 10010(ズレ 10)は誤差の範囲である。 同じズレでも、期待値が大きいほど相対的に小さい。

理論的には、\(O_i\) は「\(n\) 個の観測のうちカテゴリ \(i\) に落ちた個数」なので二項分布 \(\text{Bin}(n,p_i)\) に従い、\(p_i\) が小さければポアソン分布で近似できる(07 章 4 節)。ポアソンでは分散 = 平均。 つまり \(E_i\) が分散の推定値になっている。だから

$$\frac{(O_i-E_i)^2}{E_i} \approx \frac{(\text{観測}-\text{平均})^2}{\text{分散}} = (\text{標準化した値})^2$$

となり、\(n\) が大きければ各項は標準正規分布の二乗に近く、標準正規分布の二乗の和 = χ² 分布(08 章 7 節の定義そのもの)になる。 χ² 統計量が χ² 分布に従うのは、偶然ではなくこの構造による。 (厳密には \(O_i\) の分散は \(np_i(1-p_i) = E_i(1-p_i)\) で、\(\sum O_i = n\) の拘束もあるため各項は独立でない。それらを正確に扱うと、和が自由度 \(k-1\) の χ² 分布に従うことが示される。)

2. 適合度検定 (goodness-of-fit test)

問題設定

「観測された度数分布が、想定した分布に合っているか」

\[ H_0: p_1=p_{10}, p_2=p_{20},\dots,p_k=p_{k0} \]
\[ E_i = np_{i0}, \qquad \chi^2 = \sum_{i=1}^k\frac{(O_i-E_i)^2}{E_i} \sim \chi^2_{k-1} \]

自由度が \(k-1\) の理由: 自由度とは「拘束を引いた後に自由に動ける個数」である(08 章 7 節)。\(k\) 個のカテゴリの度数には \(\sum O_i = n\) という拘束が 1 本ある。 \(k-1\) 個決まれば残りは自動的に決まるので、自由度は \(k-1\)(標本分散の \(n-1\) と同じ考え方)。

例: サイコロは公正か

60 回振った結果:

目123456計
観測 \(O\)81261491160
期待 \(E\)10101010101060
\[ \chi^2 = \frac{4}{10}+\frac{4}{10}+\frac{16}{10}+\frac{16}{10}+\frac{1}{10}+\frac{1}{10} = \frac{42}{10}=4.2 \]

自由度 5 の χ² 分布で上側 5% 点は 11.07(χ² 分布表)。\(4.2 < 11.07\) なので棄却できない(p ≈ 0.52)。 このデータからは「サイコロが偏っている」とは言えない。

パラメータを推定した場合

分布のパラメータをデータから推定したなら、推定した個数だけ自由度が減る。

\[ \text{自由度} = k - 1 - (\text{推定したパラメータ数}) \]
検定する分布推定するパラメータ自由度
一様(指定済み)0\(k-1\)
ポアソン(\(\lambda\) を推定)1\(k-2\)
正規(\(\mu,\sigma\) を推定)2\(k-3\)

理屈: パラメータを推定するとは、\(E_i\) をデータに合わせて調整することである。 調整すればするほど当てはまりが良くなるのは当たり前なので、その分「甘く」なる。 それを補正するのが自由度の減少である。 18 章以降の回帰でも、パラメータを増やすと自由度が減るのはまったく同じ理屈である。

3. 独立性の検定 (test of independence)

問題設定

2 つのカテゴリ変数に関連があるか。\(r\times c\) 分割表を扱う。

\[ H_0: \text{行の変数と列の変数は独立} \]

期待度数の作り方

独立なら \(P(A\cap B)=P(A)P(B)\)(04 章 5 節)なので、「行 \(i\) かつ列 \(j\)」の確率を \(\frac{R_i}{n}\times\frac{C_j}{n}\) と見積もり、\(n\) を掛けて

\[ E_{ij} = n\times\frac{R_i}{n}\times\frac{C_j}{n} = \frac{R_i C_j}{n} \]

(\(R_i\) = 第 \(i\) 行の合計、\(C_j\) = 第 \(j\) 列の合計。)

\[ \chi^2 = \sum_{i=1}^r\sum_{j=1}^c \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \sim \chi^2_{(r-1)(c-1)} \]

自由度 \((r-1)(c-1)\) の理由: 行和と列和が固定されているので、 \((r-1)\times(c-1)\) 個のセルを決めれば残りはすべて自動的に決まる。

例: 喫煙と肺疾患

疾患あり疾患なし行計
喫煙40160200
非喫煙20280300
列計60440500

期待度数:

\[ E_{11}=\frac{200\times 60}{500}=24, \quad E_{12}=\frac{200\times 440}{500}=176, \quad E_{21}=\frac{300\times 60}{500}=36, \quad E_{22}=\frac{300\times 440}{500}=264 \]
\[ \chi^2 = \frac{(40-24)^2}{24}+\frac{(160-176)^2}{176}+\frac{(20-36)^2}{36}+\frac{(280-264)^2}{264} \]
\[ = \frac{256}{24}+\frac{256}{176}+\frac{256}{36}+\frac{256}{264} = 10.67+1.45+7.11+0.97 = 20.20 \]

自由度 \((2-1)(2-1)=1\) の χ² 分布の上側 5% 点は 3.84(\(=1.96^2\)。自由度 1 の χ² は標準正規の二乗だから)。\(20.20 \gg 3.84\) なので強く棄却(p < 0.001)。

関連の強さも報告する(03 章 8 節)。2×2 表のセルを 03 章と同じく 1 行目 \(a, b\)、2 行目 \(c, d\) と書く(ここでは \(a=40, b=160, c=20, d=280\))。

\[ \text{オッズ比} = \frac{ad}{bc} = \frac{40\times 280}{160\times 20}=3.5, \qquad \text{リスク比} = \frac{a/(a+b)}{c/(c+d)} = \frac{40/200}{20/300} = 3.0 \]

χ² は「関連があるか」しか言わない。「どのくらい強いか」は言わない。 12 章と同じ話で、\(n\) を増やせばどんな微小な関連も有意になる。 必ず効果量(オッズ比、リスク比、下記のクラメールの V)を併記する。

関連の強さの指標

指標式範囲
φ 係数(2×2)\(\sqrt{\chi^2/n}\)0〜1
クラメールの V\(\sqrt{\dfrac{\chi^2}{n\cdot\min(r-1,c-1)}}\)0〜1
リスク比(2×2)\(\dfrac{a/(a+b)}{c/(c+d)}\)0〜∞
オッズ比(2×2)\(ad/bc\)0〜∞

上の例では \(V = \sqrt{20.20/500}=0.20\)(弱〜中程度の関連)。

4. χ² 検定の前提と注意

期待度数の下限

\[ \boxed{\text{期待度数 5 未満のセルが全セルの 20\% 以下、かつどのセルも } E_{ij}\ge 1} \]

(コクランの基準。2×2 表ではセルが 4 つしかないので、実質「すべてのセルで 5 以上」になる。)

これが満たされないと、χ² 近似が悪くなる。

なぜ期待度数が小さいとまずいのか. χ² 分布は連続分布だが、度数は離散である。 期待度数が大きければ CLT により正規近似が効くが、 期待度数 2 とか 3 では離散性が目立ちすぎて近似が崩れる。 結果としてp 値が小さく出すぎ、偽陽性が増える。

対策

状況対策
セルの期待度数が小さいカテゴリを併合する
2×2 で \(n\) が小さいフィッシャーの正確検定
\(r\times c\) で \(n\) が小さい並べ替え検定(16 章)、モンテカルロ p 値(\(H_0\) のもとで表を乱数で大量に生成し、観測以上に極端な表の割合を p 値とする)

イェーツの連続性補正(2×2 のみ)

\[ \chi^2_{\text{Yates}} = \sum\frac{(\lvert O-E\rvert - 0.5)^2}{E} \]

整数の度数を連続な χ² 分布で近似するときに、09 章 3 節 の連続修正と同じ考えで \(\lvert O-E\rvert\) を 0.5(棒の幅の半分)だけ縮める補正である。だが保守的すぎる(検出力を落としすぎる)と批判されており、 現代では「\(n\) が小さいならフィッシャーの正確検定を使う」方が推奨される。

5. フィッシャーの正確検定

行和 \(R_1=a+b, R_2=c+d\) と列和 \(C_1=a+c, C_2=b+d\)(3 節 の \(R_i, C_j\) を 2×2 で書いたもの)を固定すると、表は左上のセル \(a\) の値 1 つで決まる。 \(H_0\)(独立)のもとで \(a\) は「\(n\) 個のうち \(C_1\) 個が『疾患あり』で、そこから \(R_1\) 個を戻さずに引いたときの『疾患あり』の個数」と同じ分布、すなわち超幾何分布(07 章 7 節)に従う。

\[ P(\text{この表}) = \frac{\binom{R_1}{a}\binom{R_2}{c}}{\binom{n}{C_1}} = \frac{R_1!R_2!C_1!C_2!}{n!a!b!c!d!} \]

p 値は、取りうるすべての \(a\) のうち「観測された表と同じか、それより起こる確率が小さい」表の確率を足し合わせたもの(両側)。

「正確」の意味. 近似を使わず、確率を厳密に計算するという意味である。 \(n\) が小さいときは常にこちらを使ってよい。 計算量は \(n\) が大きいと爆発するが、現代の計算機なら数千程度までは問題ない。

有名な逸話: フィッシャーの同僚が「紅茶を先に入れたかミルクを先に入れたか味で分かる」 と主張したのを検証するため、8 杯(各 4 杯)を出して当てさせた。 この実験の解析法としてこの検定が考案された(貴婦人の紅茶実験)。

6. 独立性検定と等質性検定

見た目は同じ計算だが、設計が違う。

独立性の検定等質性の検定
標本の取り方全体から \(n\) 人を取り、2 変数を測る各群のサイズを先に決めて別々に標本を取る
帰無仮説2 変数が独立各群の分布が同一
例500 人を調査し、喫煙状況と疾患を記録喫煙者 200 人・非喫煙者 300 人を集めて疾患率を比較

計算はまったく同じである。解釈と、言えることの範囲が違う。 独立性の検定の設計では、2 変数の同時分布(喫煙率、有病率、両者の関連)をすべて推定できる。 等質性の検定では群のサイズを先に決めているので、喫煙率は推定できず、言えるのは「群間で疾患の分布が違うか」だけである。

7. 分散の検定

1 標本(χ² 検定)

\[ H_0: \sigma^2=\sigma_0^2, \qquad \chi^2 = \frac{(n-1)s^2}{\sigma_0^2}\sim\chi^2_{n-1} \]

(08 章 7 節の「標本分散と χ² 分布の関係」そのもの。)両側検定なので、上下両方の棄却点と比べる。

2 標本(F 検定)

\[ H_0:\sigma_1^2=\sigma_2^2, \qquad F = \frac{s_1^2}{s_2^2}\sim F(n_1-1,\ n_2-1) \]

慣例として大きい方を分子に置き、上側だけを見て p 値を 2 倍する(両側検定)。

例: \(s_1^2=25\)(\(n_1=15\))、\(s_2^2=10\)(\(n_2=20\))。

\[ F = \frac{25}{10}=2.5 \]

\(F(14,19)\) の上側 2.5% 点は約 2.65(F 分布表)。両側 5% 検定で大きい方を分子に置いたので、上側の \(\alpha/2 = 2.5\%\) 点と比べる(上側 p 値を 2 倍して 5% と比べるのと同じこと)。\(2.5 < 2.65\) なので有意差なし。

F 検定の重大な弱点

F 検定は正規性からのずれに極めて敏感である. 分布の裾がわずかに重いだけで、第 1 種の誤り率が 5% のはずが 20% を超えることがある。 t 検定が正規性に頑健なのとは対照的で、これは \(s^2\) の分散が母集団の4 次モーメント(尖度。02 章 5 節)に依存するためである(正規分布のときだけ \(2\sigma^4/(n-1)\) になる)。

だから「t 検定の前に F 検定で等分散を確認する」という手順は推奨されない(13 章)。 前段の検定自体が信用できないうえ、2 段階の手順で誤り率が制御できなくなる。 最初からウェルチを使えばよい。

等分散性のより頑健な検定

どうしても等分散を検定したい場合:

検定特徴
バートレット検定正規性を仮定。F 検定同様に敏感
ルビーン検定各データの群平均からの絶対偏差 \(\lvert x_{ij}-\bar x_i\rvert\) に分散分析 ANOVA(15 章。群平均の差の検定)を適用。頑健
ブラウン・フォーサイス検定ルビーンの中央値版。さらに頑健。推奨

8. 適合度検定のもう一つの道具

コルモゴロフ・スミルノフ検定 (KS 検定)

連続分布への適合を、経験分布関数と理論 cdf の最大乖離で測る。 経験分布関数 \(F_n(x)\) は「データのうち \(x\) 以下の割合」、\(F_0(x)\) は帰無仮説の分布の累積分布関数、\(\sup_x\) は \(x\) を動かしたときの上限(最大値)。

\[ D = \sup_x \lvert F_n(x)-F_0(x)\rvert \]

χ² 検定と違ってビン分け(連続データを区間に区切ってカテゴリにすること)が不要なのが利点。ただしパラメータを推定した場合は臨界値が変わる (そのままの KS 検定は使えず、リリーフォース検定などを使う)。

正規性の検定

検定特徴
シャピロ・ウィルク検定検出力が高い。\(n\le 5000\) 程度
アンダーソン・ダーリング検定裾の適合を重視
Q-Q プロット横軸に理論分布の分位点、縦軸にデータの分位点を打った散布図。正規なら直線に並ぶ。検定より視覚的確認の方が有用なことが多い

正規性の検定は使い方が難しい. \(n\) が小さいと検出力が低くて「正規でない」を見逃し、 \(n\) が大きいとわずかなずれでも有意になる(12 章の話と同じ)。 つまり最も知りたいときに役に立たない。

実務では、正規性検定の p 値で判断するより、 Q-Q プロットを見て「t 検定が壊れるほどのずれか」を目で判断する方が良い。 t 検定は多少のずれには頑健である(13 章)。

9. まとめ

検定統計量分布用途
適合度 χ²\(\sum\frac{(O-E)^2}{E}\)\(\chi^2_{k-1-m}\)(\(m\) は推定した母数の数)想定分布との一致
独立性 χ²同上\(\chi^2_{(r-1)(c-1)}\)2 変数の関連
フィッシャー正確超幾何分布—2×2 で \(n\) 小
1 標本分散\(\frac{(n-1)s^2}{\sigma_0^2}\)\(\chi^2_{n-1}\)分散が指定値か
2 標本分散\(s_1^2/s_2^2\)\(F\)分散が等しいか