Chapter 13
平均の検定 — z 検定と t 検定
この章がなぜ必要なのか——実務で最も頻繁に使う検定.
「新施策で売上平均は上がったか」「A 群と B 群で効果に差があるか」—— 実務で出会う検定の大半は、平均の比較である。
12 章で枠組みは整った。この章ではそれを具体的な計算手順に落とす。 ただし、どの検定を選ぶかが結果を左右する。 対応があるか、等分散か、正規性は成り立つか—— 選択を誤ると、正しく計算しても間違った結論になる。
この章で使う既出の用語(定義は各リンク先). 母集団・標本・母平均 \(\mu\)・母標準偏差 \(\sigma\)(01 章 2 節)、標本平均 \(\bar x\)・標本標準偏差 \(s\)(02 章)、箱ひげ図(02 章 6 節)、外れ値(03 章 1 節)、 i.i.d.(04 章 5 節)、分散 \(V[\cdot]\) と独立な和の分散(06 章 4〜5 節)、標準誤差(06 章 6 節)、 正規分布 \(N(\mu,\sigma^2)\) と標準正規分布 \(N(0,1)\)・標準正規分布表(08 章 4 節)、t 分布 \(t_{n-1}\) と自由度(08 章 8 節)、 中心極限定理 CLT(09 章 3 節)、信頼区間と t 分布の上側 \(\alpha/2\) 点 \(t_{n-1,\alpha/2}\)(11 章 1 節, 3 節)、ウェルチ・サタスウェイトの自由度(11 章 5 節)、 帰無仮説・p 値・両側/片側(12 章 1〜3 節)、有意水準 \(\alpha\)・第 1 種の誤り・検出力(12 章 4〜5 節)、効果量 \(d\) と必要サンプルサイズ(12 章 5 節)。 「〜点」(例: 両側 5% 点)は、その分布でその確率を外側に残す境界の値で、分布表または統計ソフトで求める。
1. 検定の選び方(先に地図)
| 状況 | 使う検定 | 検定統計量の分布 |
|---|---|---|
| 1 群、\(\sigma\) 既知 | 1 標本 z 検定 | \(N(0,1)\) |
| 1 群、\(\sigma\) 未知 | 1 標本 t 検定 | \(t_{n-1}\) |
| 2 群、独立、等分散 | 対応なし t 検定(プール) | \(t_{n_1+n_2-2}\) |
| 2 群、独立、等分散でない | ウェルチの t 検定 | \(t_\nu\)(\(\nu\) は 3 節(b) の近似自由度) |
| 2 群、対応あり(同一個体) | 対応あり t 検定 | \(t_{n-1}\) |
| 3 群以上 | 分散分析(15 章) | \(F\) |
| 正規性が疑わしい | ノンパラメトリック(16 章) | — |
2. 1 標本 t 検定
仮説と統計量
分子 = 観測された差、分母 = その差の標準誤差。 つまり t 統計量は「差が標準誤差の何個分か」を表している。
この構造はすべての検定に共通する.
$$\text{検定統計量} = \frac{\text{観測された差}}{\text{その差のばらつき}}$$
差が大きくても、ばらつきが大きければ「偶然かもしれない」。 差が小さくても、ばらつきが極小なら「偶然とは思えない」。 統計は差の絶対値ではなく、差とノイズの比を見ている。 信号対雑音比(SN 比)と同じ発想である。
前提
- 標本が i.i.d.(母集団からの無作為抽出で得た標本はこれを満たす)
- 母集団が正規分布——ただし \(n\) が大きければ CLT により緩和される(09 章)。
正規性はどこまで気にすべきか. t 検定は正規性からのずれに比較的頑健(前提が多少崩れても結論がほとんど変わらない)である。\(n\ge 30\) 程度で、 極端に歪んでいなければ実用上問題ない。
ただし外れ値には弱い。1 点の異常値が \(\bar x\) と \(s\) の両方を動かす。 正規性の心配より、まず箱ひげ図を描いて外れ値を確認する方が実践的である。
例題
ある部品の設計寸法は 50.0 mm。10 個測って \(\bar x = 50.4\)、\(s=0.6\)。設計値からずれているか?
自由度 9 の t 分布の両側 5% 点は 2.262(08 章 8 節の表で自由度 5 が 2.571、10 が 2.228 なので、その間の値)。\(2.108 < 2.262\) なので棄却できない(p ≈ 0.064)。
95% 信頼区間: \(50.4\pm 2.262\times 0.1897 = [49.97, 50.83]\)。
50.0 をぎりぎり含んでいる. p = 0.064 という値も含め、 「差がない」ではなく「この n では判定できない」というのが実態である。 品質管理の文脈で 0.4 mm のずれが問題なら、n を増やして測り直すべきである。
3. 対応なし 2 標本 t 検定
仮説
(a) 等分散を仮定する場合(Student の t 検定)
2 群の分散が共通の \(\sigma^2\) だと仮定し、両群のデータを合わせて推定する(プール分散)。
これは自由度で重み付けした加重平均である. 単純平均 \((s_1^2+s_2^2)/2\) ではなく、サイズの大きい群の情報を重く見る。 分母の \(n_1+n_2-2\) は、各群で平均を 1 つずつ推定したので自由度が 2 減った結果である。
分母の導出: 2 群が独立なので差の分散は分散の和で、\(V[\bar X_1-\bar X_2] = \dfrac{\sigma^2}{n_1}+\dfrac{\sigma^2}{n_2} = \sigma^2\left(\dfrac{1}{n_1}+\dfrac{1}{n_2}\right)\)。 \(\sigma^2\) を \(s_p^2\) で置き換えて平方根を取る。\((n_1+n_2-2)s_p^2/\sigma^2\) は 2 つの独立な χ² の和で \(\chi^2_{n_1+n_2-2}\) なので、08 章 8 節と同じ理由で \(t_{n_1+n_2-2}\) になる。∎
(b) 等分散を仮定しない場合(ウェルチの t 検定)
自由度はウェルチ・サタスウェイトの近似:
(\(\nu\) は一般に整数にならない。t 分布の自由度は 08 章 8 節 の定義では χ² の自由度=整数だが、t 分布の密度は自由度を連続的なパラメータとして定義でき、統計ソフトはそのまま非整数の \(\nu\) で計算する。式の出所は 11 章 5 節。)
なぜウェルチを既定にすべきか.
- 等分散が成り立つときも、ウェルチの性能はほとんど落ちない(検出力の損失はわずか)
- 等分散が崩れているとき、Student の t 検定は第 1 種の誤り率が大きく狂う。 特に「\(n\) が小さい方の群の分散が大きい」場合、5% のはずが 10% 以上になることがある
- 「まず等分散検定をして、有意でなければ Student」という手順は、 検定を 2 段階でつなぐので全体の誤り率が制御できない
R の
t.test()の既定がウェルチなのはこの理由による。 迷わずウェルチを使ってよい。
例題
| 群 | \(n\) | \(\bar x\) | \(s\) |
|---|---|---|---|
| A | 20 | 75.2 | 8.1 |
| B | 25 | 70.4 | 12.3 |
ウェルチで:
自由度 41.6 の t 分布の両側 5% 点は約 2.019(自由度 30 で 2.042、100 で 1.984 なのでその間)。\(1.571 < 2.019\) なので有意差なし(p ≈ 0.124)。
95% CI: \(4.8 \pm 2.019\times 3.055 = [-1.37, 10.97]\)。
区間が 0 をまたいでいる. ただし幅が広く、 「差は 0 かもしれないし 11 かもしれない」という状態である。 「効果なし」と結論するのは誤りで、「決められなかった」が正しい。
4. 対応あり t 検定
いつ使うか
同じ個体を 2 回測った場合(前後比較、左右の比較、マッチングしたペア)。
方法
差 \(d_i = x_{i,\text{後}} - x_{i,\text{前}}\) を作り、その差に対して 1 標本 t 検定をする。
(\(n\) はペアの数。)
なぜ対応ありの方が強力なのか
個体 \(i\) の測定値を「前後共通の平均水準 \(\mu_1\) または \(\mu_2\)」+「個体差 \(u_i\)(その人が平均よりどれだけ高い/低いか。平均 0、分散 \(\sigma_u^2\))」+「測定ごとの偶然誤差 \(\varepsilon_{i1},\varepsilon_{i2}\)(平均 0、分散 \(\sigma_\varepsilon^2\)、互いに独立で \(u_i\) とも独立)」に分けて書く。
差を取ると
個体差 \(u_i\) が完全に消える。 独立な和の分散の公式から
対応なしで解析すると差の分散は \(2(\sigma_u^2+\sigma_\varepsilon^2)\) と見積もられる。個体差 \(\sigma_u^2\) が大きいほど、対応ありの利得は大きい。
具体例で. 10 人にダイエット法を試す。体重は 45 kg の人も 90 kg の人もいる(\(\sigma_u\) 大)。 前後の体重を独立な 2 群として比べると、この巨大な個体差がノイズになって 「平均 2 kg の減少」など到底検出できない。 同じ人の前後の差を取れば個体差は消え、\(-2\pm 0.5\) kg という明瞭な信号が残る。
設計段階でペアにできるなら、必ずそうすべきである。 検出力が桁違いに変わる。
逆に、対応があるデータを対応なしで解析するのは誤り. 上の式のとおり、差の標準誤差に本来消えるはずの個体差 \(\sigma_u^2\) が入り込むので標準誤差を過大評価し、検出力を無駄にする。 (6 節 の擬似反復も「独立でないデータを独立扱いする」誤りだが、効き方は逆で標準誤差の過小評価になる。違いは 6 節 で述べる。) 独立なデータを勝手にペアにして対応ありで解析した場合は、差の分散が \(\sigma_1^2+\sigma_2^2\) で標準誤差の見積もりは変わらないが、自由度が \(n_1+n_2-2\) から \(n-1\) に減るぶん検出力を無駄にする。
5. 母比率の検定
1 標本
分母に \(\hat p\) ではなく \(p_0\) を使う点に注意. 検定は「\(H_0\) が真だとしたら」の世界で計算するので、 標準誤差も \(H_0\) のもとの値 \(p_0\) で計算するのが筋である。 (信頼区間では \(H_0\) を仮定しないので \(\hat p\) を使う。11 章。) 平均の t 検定で分母に標本の \(s\) を使ったのは、\(H_0:\mu=\mu_0\) が \(\sigma\) について何も決めないので標本から推定するしかないからである。 比率では \(H_0: p=p_0\) が分散 \(p_0(1-p_0)\) まで決めてしまうので、それを使う。この非対称性は理屈が通っている。
2 標本(A/B テストの基本形)
各群の成功数(人数)を \(x_1, x_2\)、\(\hat p_1 = x_1/n_1\)、\(\hat p_2 = x_2/n_2\) とする。 \(H_0\) のもとでは共通の \(p\) があるはずなので、両群を合わせて推定する(プール比率)。
例(A/B テスト): A 群 1000 人中 120 人がクリック(12.0%)、B 群 1000 人中 145 人(14.5%)。
標準正規分布表で \(P(Z>1.649) = 0.0496\) なので両側 p ≈ 2 × 0.0496 ≈ 0.099。5% 水準では有意でない。
差の 95% CI(11 章 5 節の式):
A/B テストで最も多い失敗. この結果を見て「B の方が良さそうだから採用」と決めるのは、 有意でない差を有意なものとして扱っている。 一方で「有意でないから効果なし」と切り捨てるのも早計で、 区間の上限は +5.5 ポイントであり、実務上は大きな差になりうる。
正しい対応は「\(n\) が足りない」と認識すること。 12 章の式 \(n \approx 2(z_{\alpha/2}+z_\beta)^2/d^2\) で、比率なら \(\sigma^2\) をプール比率の分散 \(\hat p(1-\hat p) = 0.1325\times 0.8675 = 0.115\) とおいて \(d = 0.025/\sqrt{0.115} = 0.0737\)、\(n \approx 15.68/0.0737^2 \approx 2900\)。この効果量(2.5 ポイント差)を 検出力 80% で検出するには各群 3000 人近くが必要である。
さらに悪いのが逐次的な覗き見(有意になるまで毎日チェックして、なったらやめる)。 これは第 1 種の誤り率を 5% から 20〜30% に押し上げる(17 章)。
6. 前提が崩れたら
| 崩れる前提 | 症状 | 対策 |
|---|---|---|
| 正規性 | \(n\) 小 + 強い歪み | 対数変換、ノンパラ検定(16 章)、ブートストラップ |
| 等分散 | 群のばらつきが大きく違う | ウェルチ(既定でよい) |
| 独立性 | 時系列、クラスター、反復測定 | 混合効果モデル、時系列モデル(25 章) |
| 外れ値 | 1 点が結果を支配 | 原因を調べる。ロバスト法、順位検定 |
独立性の崩れが最も危険. 正規性や等分散のずれは影響が限定的だが、 独立でないデータを独立扱いすると、標準誤差が大幅に狂う。 「同じ人から 10 回測ったデータを n=10 として扱う」は典型的な誤りで、 実質的な情報量は n=1 に近いのに、n=10 の精度を主張してしまう。 これを擬似反復 (pseudoreplication) と呼び、生物学や心理学で長年問題になっている。
4 節 のモデルで言えば、10 回の測定 \(x_{i1},\dots,x_{i,10}\) には共通の個体差 \(u_i\) が入っていて、平均しても \(u_i\) は消えない。 個体の平均の分散は \(\sigma_u^2 + \sigma_\varepsilon^2/10\) なのに、独立扱いすると \((\sigma_u^2+\sigma_\varepsilon^2)/10\) と見積もるので、標準誤差を過小評価して偽陽性が増える。 4 節 の「対応ありを対応なしで解析」が過大評価だったのと逆向きなのは、あちらは個体差が差で消える構造を活かし損ねたのに対し、こちらは消えない個体差を \(n\) で割ってしまうからである。
7. 効果量の報告
p 値だけでは不十分(12 章)。平均の比較では次を併記する。
| 指標 | 式 |
|---|---|
| Cohen's d | \(\dfrac{\bar x_1-\bar x_2}{s_p}\)(分母は 3 節(a) のプール標準偏差。検定にウェルチを使った場合でも、効果量の単位としては両群を代表する \(s_p\) を使う) |
| Hedges' g | \(d\) に小標本バイアス補正 \(\left(1-\dfrac{3}{4(n_1+n_2)-9}\right)\) を掛けたもの |
| 差の信頼区間 | 元の単位のままなので最も解釈しやすい |
最も実務的なのは「差の信頼区間」である. 「平均 4.8 点高い(95% CI: −1.4 〜 11.0)」という報告は、 効果の大きさ・向き・精度をすべて一度に伝える。 Cohen's d は分野をまたぐ比較(メタアナリシス)で有用だが、 単一の研究の報告では元の単位の方が意思決定に直結する。
8. まとめ
| 検定 | 統計量 | 自由度 |
|---|---|---|
| 1 標本 t | \(\dfrac{\bar x-\mu_0}{s/\sqrt n}\) | \(n-1\) |
| 対応なし t(プール) | \(\dfrac{\bar x_1-\bar x_2}{s_p\sqrt{1/n_1+1/n_2}}\) | \(n_1+n_2-2\) |
| ウェルチ t | \(\dfrac{\bar x_1-\bar x_2}{\sqrt{s_1^2/n_1+s_2^2/n_2}}\) | 近似式 |
| 対応あり t | \(\dfrac{\bar d}{s_d/\sqrt n}\) | \(n-1\) |
| 1 標本比率 z | \(\dfrac{\hat p-p_0}{\sqrt{p_0(1-p_0)/n}}\) | — |
| 2 標本比率 z | プール比率を使う | — |
- すべての検定統計量は「差 ÷ 差の標準誤差」の形をしている。
- 2 群の比較は既定でウェルチ。等分散検定を先にやる手順は推奨されない。
- 対応があるなら必ず対応あり検定を使う。個体差が消えて検出力が大きく上がる。
- A/B テストでは、有意でないときに「効果なし」と結論しない。信頼区間の幅を見る。