統計 13 · 平均の検定 — z 検定と t 検定

Chapter 13

平均の検定 — z 検定と t 検定

この章がなぜ必要なのか——実務で最も頻繁に使う検定.

「新施策で売上平均は上がったか」「A 群と B 群で効果に差があるか」—— 実務で出会う検定の大半は、平均の比較である。

12 章で枠組みは整った。この章ではそれを具体的な計算手順に落とす。 ただし、どの検定を選ぶかが結果を左右する。 対応があるか、等分散か、正規性は成り立つか—— 選択を誤ると、正しく計算しても間違った結論になる。

この章で使う既出の用語(定義は各リンク先). 母集団・標本・母平均 \(\mu\)・母標準偏差 \(\sigma\)(01 章 2 節)、標本平均 \(\bar x\)・標本標準偏差 \(s\)(02 章)、箱ひげ図(02 章 6 節)、外れ値(03 章 1 節)、 i.i.d.(04 章 5 節)、分散 \(V[\cdot]\) と独立な和の分散(06 章 4〜5 節)、標準誤差(06 章 6 節)、 正規分布 \(N(\mu,\sigma^2)\) と標準正規分布 \(N(0,1)\)・標準正規分布表(08 章 4 節)、t 分布 \(t_{n-1}\) と自由度(08 章 8 節)、 中心極限定理 CLT(09 章 3 節)、信頼区間と t 分布の上側 \(\alpha/2\) 点 \(t_{n-1,\alpha/2}\)(11 章 1 節, 3 節)、ウェルチ・サタスウェイトの自由度(11 章 5 節)、 帰無仮説・p 値・両側/片側(12 章 1〜3 節)、有意水準 \(\alpha\)・第 1 種の誤り・検出力(12 章 4〜5 節)、効果量 \(d\) と必要サンプルサイズ(12 章 5 節)。 「〜点」(例: 両側 5% 点)は、その分布でその確率を外側に残す境界の値で、分布表または統計ソフトで求める。

1. 検定の選び方(先に地図)

状況使う検定検定統計量の分布
1 群、\(\sigma\) 既知1 標本 z 検定\(N(0,1)\)
1 群、\(\sigma\) 未知1 標本 t 検定\(t_{n-1}\)
2 群、独立、等分散対応なし t 検定(プール)\(t_{n_1+n_2-2}\)
2 群、独立、等分散でないウェルチの t 検定\(t_\nu\)(\(\nu\) は 3 節(b) の近似自由度)
2 群、対応あり(同一個体)対応あり t 検定\(t_{n-1}\)
3 群以上分散分析(15 章)\(F\)
正規性が疑わしいノンパラメトリック(16 章)—

2. 1 標本 t 検定

仮説と統計量

\[ H_0:\mu=\mu_0, \qquad H_1:\mu\neq\mu_0 \]
\[ \boxed{t = \frac{\bar{x}-\mu_0}{s/\sqrt{n}} \sim t_{n-1} \quad (H_0 \text{ のもとで})} \]

分子 = 観測された差、分母 = その差の標準誤差。 つまり t 統計量は「差が標準誤差の何個分か」を表している。

この構造はすべての検定に共通する.

$$\text{検定統計量} = \frac{\text{観測された差}}{\text{その差のばらつき}}$$

差が大きくても、ばらつきが大きければ「偶然かもしれない」。 差が小さくても、ばらつきが極小なら「偶然とは思えない」。 統計は差の絶対値ではなく、差とノイズの比を見ている。 信号対雑音比(SN 比)と同じ発想である。

前提

  1. 標本が i.i.d.(母集団からの無作為抽出で得た標本はこれを満たす)
  2. 母集団が正規分布——ただし \(n\) が大きければ CLT により緩和される(09 章)。

正規性はどこまで気にすべきか. t 検定は正規性からのずれに比較的頑健(前提が多少崩れても結論がほとんど変わらない)である。\(n\ge 30\) 程度で、 極端に歪んでいなければ実用上問題ない。

ただし外れ値には弱い。1 点の異常値が \(\bar x\) と \(s\) の両方を動かす。 正規性の心配より、まず箱ひげ図を描いて外れ値を確認する方が実践的である。

例題

ある部品の設計寸法は 50.0 mm。10 個測って \(\bar x = 50.4\)、\(s=0.6\)。設計値からずれているか?

\[ t = \frac{50.4-50.0}{0.6/\sqrt{10}} = \frac{0.4}{0.1897} = 2.108 \]

自由度 9 の t 分布の両側 5% 点は 2.262(08 章 8 節の表で自由度 5 が 2.571、10 が 2.228 なので、その間の値)。\(2.108 < 2.262\) なので棄却できない(p ≈ 0.064)。

95% 信頼区間: \(50.4\pm 2.262\times 0.1897 = [49.97, 50.83]\)。

50.0 をぎりぎり含んでいる. p = 0.064 という値も含め、 「差がない」ではなく「この n では判定できない」というのが実態である。 品質管理の文脈で 0.4 mm のずれが問題なら、n を増やして測り直すべきである。

3. 対応なし 2 標本 t 検定

仮説

\[ H_0: \mu_1=\mu_2, \qquad H_1:\mu_1\neq\mu_2 \]

(a) 等分散を仮定する場合(Student の t 検定)

2 群の分散が共通の \(\sigma^2\) だと仮定し、両群のデータを合わせて推定する(プール分散)。

\[ s_p^2 = \frac{(n_1-1)s_1^2+(n_2-1)s_2^2}{n_1+n_2-2} \]

これは自由度で重み付けした加重平均である. 単純平均 \((s_1^2+s_2^2)/2\) ではなく、サイズの大きい群の情報を重く見る。 分母の \(n_1+n_2-2\) は、各群で平均を 1 つずつ推定したので自由度が 2 減った結果である。

\[ \boxed{t = \frac{\bar x_1-\bar x_2}{s_p\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}} \sim t_{n_1+n_2-2}} \]

分母の導出: 2 群が独立なので差の分散は分散の和で、\(V[\bar X_1-\bar X_2] = \dfrac{\sigma^2}{n_1}+\dfrac{\sigma^2}{n_2} = \sigma^2\left(\dfrac{1}{n_1}+\dfrac{1}{n_2}\right)\)。 \(\sigma^2\) を \(s_p^2\) で置き換えて平方根を取る。\((n_1+n_2-2)s_p^2/\sigma^2\) は 2 つの独立な χ² の和で \(\chi^2_{n_1+n_2-2}\) なので、08 章 8 節と同じ理由で \(t_{n_1+n_2-2}\) になる。∎

(b) 等分散を仮定しない場合(ウェルチの t 検定)

\[ \boxed{t = \frac{\bar x_1-\bar x_2}{\sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}}}} \]

自由度はウェルチ・サタスウェイトの近似:

\[ \nu = \frac{\left(\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}\right)^2}{\dfrac{(s_1^2/n_1)^2}{n_1-1}+\dfrac{(s_2^2/n_2)^2}{n_2-1}} \]

(\(\nu\) は一般に整数にならない。t 分布の自由度は 08 章 8 節 の定義では χ² の自由度=整数だが、t 分布の密度は自由度を連続的なパラメータとして定義でき、統計ソフトはそのまま非整数の \(\nu\) で計算する。式の出所は 11 章 5 節。)

なぜウェルチを既定にすべきか.

  1. 等分散が成り立つときも、ウェルチの性能はほとんど落ちない(検出力の損失はわずか)
  2. 等分散が崩れているとき、Student の t 検定は第 1 種の誤り率が大きく狂う。 特に「\(n\) が小さい方の群の分散が大きい」場合、5% のはずが 10% 以上になることがある
  3. 「まず等分散検定をして、有意でなければ Student」という手順は、 検定を 2 段階でつなぐので全体の誤り率が制御できない

R の t.test() の既定がウェルチなのはこの理由による。 迷わずウェルチを使ってよい。

例題

群\(n\)\(\bar x\)\(s\)
A2075.28.1
B2570.412.3

ウェルチで:

\[ \frac{s_1^2}{n_1}=\frac{65.61}{20}=3.281, \qquad \frac{s_2^2}{n_2}=\frac{151.29}{25}=6.052 \]
\[ t = \frac{75.2-70.4}{\sqrt{3.281+6.052}} = \frac{4.8}{3.055}=1.571 \]
\[ \nu = \frac{(9.333)^2}{\frac{3.281^2}{19}+\frac{6.052^2}{24}} = \frac{87.11}{0.5666+1.5261}=41.6 \]

自由度 41.6 の t 分布の両側 5% 点は約 2.019(自由度 30 で 2.042、100 で 1.984 なのでその間)。\(1.571 < 2.019\) なので有意差なし(p ≈ 0.124)。

95% CI: \(4.8 \pm 2.019\times 3.055 = [-1.37, 10.97]\)。

区間が 0 をまたいでいる. ただし幅が広く、 「差は 0 かもしれないし 11 かもしれない」という状態である。 「効果なし」と結論するのは誤りで、「決められなかった」が正しい。

4. 対応あり t 検定

いつ使うか

同じ個体を 2 回測った場合(前後比較、左右の比較、マッチングしたペア)。

方法

差 \(d_i = x_{i,\text{後}} - x_{i,\text{前}}\) を作り、その差に対して 1 標本 t 検定をする。

\[ \boxed{t = \frac{\bar d}{s_d/\sqrt{n}} \sim t_{n-1}} \]

(\(n\) はペアの数。)

なぜ対応ありの方が強力なのか

個体 \(i\) の測定値を「前後共通の平均水準 \(\mu_1\) または \(\mu_2\)」+「個体差 \(u_i\)(その人が平均よりどれだけ高い/低いか。平均 0、分散 \(\sigma_u^2\))」+「測定ごとの偶然誤差 \(\varepsilon_{i1},\varepsilon_{i2}\)(平均 0、分散 \(\sigma_\varepsilon^2\)、互いに独立で \(u_i\) とも独立)」に分けて書く。

\[ x_{i,\text{前}} = \mu_1 + u_i + \varepsilon_{i1}, \qquad x_{i,\text{後}} = \mu_2 + u_i + \varepsilon_{i2} \]

差を取ると

\[ d_i = (\mu_2-\mu_1) + (\varepsilon_{i2}-\varepsilon_{i1}) \]

個体差 \(u_i\) が完全に消える。 独立な和の分散の公式から

\[ V[d_i] = 2\sigma_\varepsilon^2 \qquad \text{vs} \qquad V[x_{i,\text{前}}] = V[x_{i,\text{後}}] = \sigma_u^2 + \sigma_\varepsilon^2 \]

対応なしで解析すると差の分散は \(2(\sigma_u^2+\sigma_\varepsilon^2)\) と見積もられる。個体差 \(\sigma_u^2\) が大きいほど、対応ありの利得は大きい。

具体例で. 10 人にダイエット法を試す。体重は 45 kg の人も 90 kg の人もいる(\(\sigma_u\) 大)。 前後の体重を独立な 2 群として比べると、この巨大な個体差がノイズになって 「平均 2 kg の減少」など到底検出できない。 同じ人の前後の差を取れば個体差は消え、\(-2\pm 0.5\) kg という明瞭な信号が残る。

設計段階でペアにできるなら、必ずそうすべきである。 検出力が桁違いに変わる。

逆に、対応があるデータを対応なしで解析するのは誤り. 上の式のとおり、差の標準誤差に本来消えるはずの個体差 \(\sigma_u^2\) が入り込むので標準誤差を過大評価し、検出力を無駄にする。 (6 節 の擬似反復も「独立でないデータを独立扱いする」誤りだが、効き方は逆で標準誤差の過小評価になる。違いは 6 節 で述べる。) 独立なデータを勝手にペアにして対応ありで解析した場合は、差の分散が \(\sigma_1^2+\sigma_2^2\) で標準誤差の見積もりは変わらないが、自由度が \(n_1+n_2-2\) から \(n-1\) に減るぶん検出力を無駄にする。

5. 母比率の検定

1 標本

\[ H_0: p = p_0 \]
\[ \boxed{z = \frac{\hat p - p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}} \approx N(0,1)} \]

分母に \(\hat p\) ではなく \(p_0\) を使う点に注意. 検定は「\(H_0\) が真だとしたら」の世界で計算するので、 標準誤差も \(H_0\) のもとの値 \(p_0\) で計算するのが筋である。 (信頼区間では \(H_0\) を仮定しないので \(\hat p\) を使う。11 章。) 平均の t 検定で分母に標本の \(s\) を使ったのは、\(H_0:\mu=\mu_0\) が \(\sigma\) について何も決めないので標本から推定するしかないからである。 比率では \(H_0: p=p_0\) が分散 \(p_0(1-p_0)\) まで決めてしまうので、それを使う。この非対称性は理屈が通っている。

2 標本(A/B テストの基本形)

\[ H_0: p_1=p_2 \]

各群の成功数(人数)を \(x_1, x_2\)、\(\hat p_1 = x_1/n_1\)、\(\hat p_2 = x_2/n_2\) とする。 \(H_0\) のもとでは共通の \(p\) があるはずなので、両群を合わせて推定する(プール比率)。

\[ \hat p = \frac{x_1+x_2}{n_1+n_2} \]
\[ \boxed{z = \frac{\hat p_1-\hat p_2}{\sqrt{\hat p(1-\hat p)\left(\dfrac{1}{n_1}+\dfrac{1}{n_2}\right)}}} \]

例(A/B テスト): A 群 1000 人中 120 人がクリック(12.0%)、B 群 1000 人中 145 人(14.5%)。

\[ \hat p = \frac{265}{2000}=0.1325 \]
\[ z = \frac{0.145-0.120}{\sqrt{0.1325\times 0.8675\times \frac{2}{1000}}} = \frac{0.025}{0.01516}=1.649 \]

標準正規分布表で \(P(Z>1.649) = 0.0496\) なので両側 p ≈ 2 × 0.0496 ≈ 0.099。5% 水準では有意でない。

差の 95% CI(11 章 5 節の式):

\[ 0.025 \pm 1.96\sqrt{\frac{0.12\times0.88}{1000}+\frac{0.145\times0.855}{1000}} = 0.025\pm 0.0297 = [-0.005, 0.055] \]

A/B テストで最も多い失敗. この結果を見て「B の方が良さそうだから採用」と決めるのは、 有意でない差を有意なものとして扱っている。 一方で「有意でないから効果なし」と切り捨てるのも早計で、 区間の上限は +5.5 ポイントであり、実務上は大きな差になりうる。

正しい対応は「\(n\) が足りない」と認識すること。 12 章の式 \(n \approx 2(z_{\alpha/2}+z_\beta)^2/d^2\) で、比率なら \(\sigma^2\) をプール比率の分散 \(\hat p(1-\hat p) = 0.1325\times 0.8675 = 0.115\) とおいて \(d = 0.025/\sqrt{0.115} = 0.0737\)、\(n \approx 15.68/0.0737^2 \approx 2900\)。この効果量(2.5 ポイント差)を 検出力 80% で検出するには各群 3000 人近くが必要である。

さらに悪いのが逐次的な覗き見(有意になるまで毎日チェックして、なったらやめる)。 これは第 1 種の誤り率を 5% から 20〜30% に押し上げる(17 章)。

6. 前提が崩れたら

崩れる前提症状対策
正規性\(n\) 小 + 強い歪み対数変換、ノンパラ検定(16 章)、ブートストラップ
等分散群のばらつきが大きく違うウェルチ(既定でよい)
独立性時系列、クラスター、反復測定混合効果モデル、時系列モデル(25 章)
外れ値1 点が結果を支配原因を調べる。ロバスト法、順位検定

独立性の崩れが最も危険. 正規性や等分散のずれは影響が限定的だが、 独立でないデータを独立扱いすると、標準誤差が大幅に狂う。 「同じ人から 10 回測ったデータを n=10 として扱う」は典型的な誤りで、 実質的な情報量は n=1 に近いのに、n=10 の精度を主張してしまう。 これを擬似反復 (pseudoreplication) と呼び、生物学や心理学で長年問題になっている。

4 節 のモデルで言えば、10 回の測定 \(x_{i1},\dots,x_{i,10}\) には共通の個体差 \(u_i\) が入っていて、平均しても \(u_i\) は消えない。 個体の平均の分散は \(\sigma_u^2 + \sigma_\varepsilon^2/10\) なのに、独立扱いすると \((\sigma_u^2+\sigma_\varepsilon^2)/10\) と見積もるので、標準誤差を過小評価して偽陽性が増える。 4 節 の「対応ありを対応なしで解析」が過大評価だったのと逆向きなのは、あちらは個体差が差で消える構造を活かし損ねたのに対し、こちらは消えない個体差を \(n\) で割ってしまうからである。

7. 効果量の報告

p 値だけでは不十分(12 章)。平均の比較では次を併記する。

指標式
Cohen's d\(\dfrac{\bar x_1-\bar x_2}{s_p}\)(分母は 3 節(a) のプール標準偏差。検定にウェルチを使った場合でも、効果量の単位としては両群を代表する \(s_p\) を使う)
Hedges' g\(d\) に小標本バイアス補正 \(\left(1-\dfrac{3}{4(n_1+n_2)-9}\right)\) を掛けたもの
差の信頼区間元の単位のままなので最も解釈しやすい

最も実務的なのは「差の信頼区間」である. 「平均 4.8 点高い(95% CI: −1.4 〜 11.0)」という報告は、 効果の大きさ・向き・精度をすべて一度に伝える。 Cohen's d は分野をまたぐ比較(メタアナリシス)で有用だが、 単一の研究の報告では元の単位の方が意思決定に直結する。

8. まとめ

検定統計量自由度
1 標本 t\(\dfrac{\bar x-\mu_0}{s/\sqrt n}\)\(n-1\)
対応なし t(プール)\(\dfrac{\bar x_1-\bar x_2}{s_p\sqrt{1/n_1+1/n_2}}\)\(n_1+n_2-2\)
ウェルチ t\(\dfrac{\bar x_1-\bar x_2}{\sqrt{s_1^2/n_1+s_2^2/n_2}}\)近似式
対応あり t\(\dfrac{\bar d}{s_d/\sqrt n}\)\(n-1\)
1 標本比率 z\(\dfrac{\hat p-p_0}{\sqrt{p_0(1-p_0)/n}}\)—
2 標本比率 zプール比率を使う—