Chapter 02
記述統計 — 中心・ばらつき・分布の形
この章がなぜ必要なのか——「たくさんの数字」を「少しの数字」に潰す.
1000 人の身長データがある。1000 個の数字をそのまま眺めても何も分からない。 人間が一度に把握できるのはせいぜい数個である。
そこで「この 1000 個は、だいたい 170 のあたりに、±6 くらいの幅で散らばっている」と要約する。 1000 個の情報を 2 個(中心とばらつき)に圧縮したわけだ。 当然、圧縮すれば情報は失われる。何を残し何を捨てたのかを自覚することが、この章の本当のテーマである。
そして、この章で出てくる「平均」と「分散」は、以降のすべての章で主役を張り続ける。 ここでの理解の深さが、そのまま後半の理解の深さになる。
この章で使う既出の用語(定義は各リンク先). 記述統計(01 章 1 節)、母集団・標本・標本サイズ \(n\)・母平均 \(\mu\)・母分散 \(\sigma^2\)(01 章 2 節)、名義尺度・比例尺度(01 章 4 節)
1. Σ 記号の読み方(ここだけ先に)
統計の式は \(\sum\) だらけになるので、最初に潰しておく。
「\(i\) を 1 から \(n\) まで動かして、\(x_i\) を全部足せ」という命令である。それだけ。
以降で何度も使う 3 つの性質を確認しておく(どれも「足し算の順番を入れ替えてよい」だけの話である)。範囲が自明なときは \(\sum_{i=1}^{n}\) を単に \(\sum\) と書く。この章では常に \(i = 1\) から \(n\) までの和である。
| 性質 | 式 | 意味 |
|---|---|---|
| 定数倍は外に出る | \(\sum c x_i = c \sum x_i\) | 全部 2 倍してから足す = 足してから 2 倍 |
| 和は分けられる | \(\sum (x_i + y_i) = \sum x_i + \sum y_i\) | 縦に足すか横に足すかの違い |
| 定数の和は個数倍 | \(\sum_{i=1}^{n} c = nc\) | \(c\) を \(n\) 個足す |
2. 中心を表す — 代表値
平均 (mean)
最もよく使われる代表値。物理的には「データを数直線に置いたときの重心(つり合いの支点)」である。
なぜ重心なのか(導出): 平均からの偏差の総和を計算してみる。
つまり平均より上にはみ出した分と、下に足りない分が、ちょうど打ち消し合う。 数直線上の位置 \(x_i\) に同じ重さのおもりを置き、支点を \(c\) に置くと、各おもりがシーソーを回そうとする力の大きさは支点からの距離 \(x_i - c\) に比例する(てこの原理)。 その合計 \(\sum(x_i - c)\) が 0 になる支点がつり合いの点で、上の計算はそれが \(c = \bar x\) だと言っている。これがシーソーのつり合う点=重心である。この「偏差の和は 0」という事実は、この先何度も使う。
平均が持つもう一つの顔: 二乗誤差を最小にする点
「代表値 \(c\) を 1 つ決めて、全データをそれで代表させる。ズレの二乗和を最小にする \(c\) は何か」を解いてみる。
\(c\) で微分して 0 と置く。
二階微分は \(f''(c) = 2n > 0\) なので、これは確かに最小値である。
これが決定的に重要な理由. 統計のあらゆる場面で「二乗和を最小にする」という考えが出てくる (分散、最小二乗法、分散分析)。それらはすべてこの事実の親戚である。 18 章の回帰分析は、この式の \(c\) を「直線 \(a + bx_i\)」に置き換えただけのものになる。
中央値 (median)
データを小さい順に並べたときの真ん中の値。
(\(x_{(k)}\) は小さい方から \(k\) 番目の値。順序統計量と呼ぶ。)
中央値は「絶対誤差の和を最小にする点」である。 理由: \(g(c) = \sum|x_i - c|\) を考える。\(c\) を少し右に動かすと、\(c\) より左にあるデータ(\(L\) 個とする)との距離は増え、右にあるデータ(\(R\) 個)との距離は減るので、\(g\) の変化は \(L - R\) に比例する。 \(L < R\) なら右に動かすと減り、\(L > R\) なら左に動かすと減る。減らせなくなるのは左右の個数が等しい点、すなわち中央値である。 平均が二乗誤差、中央値が絶対誤差。この対比は覚えておく価値がある。
最頻値 (mode)
最も多く現れる値。名義尺度でも使える唯一の代表値である。
どれを使うべきか
| 状況 | 使うべき代表値 | 理由 |
|---|---|---|
| だいたい左右対称 | 平均 | 情報を最も多く使う。理論も整っている |
| 大きく歪んでいる(年収など) | 中央値 | 一部の極端な値に引きずられない |
| 外れ値がある | 中央値 | 平均は 1 点で壊れる |
| カテゴリデータ | 最頻値 | 大小関係がない |
年収の例で「平均」の危うさを見る. 9 人が年収 400 万円、1 人が 1 億円(= 10000 万円)の会社を考える。万円単位で計算すると
- 平均 = \((400 \times 9 + 10000)/10 = 1360\) 万円
- 中央値 = 400 万円
「平均年収 1360 万円の会社」は嘘ではないが、10 人中 9 人にとって現実離れした数字である。 所得や資産、Web の滞在時間、地震の規模など、右に長い裾を引く分布では中央値の方が実感に合う。 「平均」と書いてあったら、まず分布の形を疑う癖をつけたい。
その他の平均
| 名前 | 定義 | 使うとき |
|---|---|---|
| 幾何平均 | \(\left(\prod_{i=1}^n x_i\right)^{1/n}\) | 成長率・倍率の平均 |
| 調和平均 | \(n / \sum (1/x_i)\) | 速度など「単位あたり」の平均 |
| トリム平均 | 上下 \(k\)% を捨てて平均 | 外れ値対策。スポーツの採点方式 |
幾何平均が要る場面. ある投資が 1 年目に +100%(2 倍)、2 年目に −50%(0.5 倍)だったとする。 算術平均を取ると \((100 - 50)/2 = +25\)% だが、実際の資産は \(2 \times 0.5 = 1\) 倍、つまり増減ゼロである。 正しいのは幾何平均 \(\sqrt{2 \times 0.5} = 1\)、すなわち年平均 0%。 掛け算で効くものは掛け算で平均するのが鉄則である。
調和平均が要る場面. 行きは時速 60 km、帰りは時速 30 km で同じ道を往復した。平均速度は? 算術平均の 45 km/h ではない。距離を \(d\) とすると総時間は \(d/60 + d/30 = d/20\)、 総距離は \(2d\) なので平均速度は \(2d/(d/20) = 40\) km/h。 これは \(2/(1/60 + 1/30) = 40\)、すなわち調和平均である。
3. ばらつきを表す
代表値だけでは足りない。「平均 170 cm」でも、全員 170 cm ぴったりの集団と、 150〜190 cm がばらけた集団ではまるで違う。
なぜ「偏差の和」ではだめなのか
素直に「平均からのズレの合計」を考えたくなるが、これは先ほど示したとおり常に 0である。
プラスのズレとマイナスのズレが打ち消し合うためだ。だから符号を消す必要がある。方法は 2 つある。
| 方法 | 結果 | 評価 |
|---|---|---|
| 絶対値を取る | 平均絶対偏差 \(\frac{1}{n}\sum \lvert x_i - \bar{x}\rvert\) | 直感的だが、絶対値は 0 で折れ曲がっていてそこで微分できず、数学的に扱いにくい |
| 二乗する | 分散 | 微分できる。理論が全部つながる。こちらが標準 |
「なぜ二乗なのか」への 4 つの答え.
- 微分できる。絶対値は 0 で折れ曲がりそこで微分できないが、二乗はどこでもなめらか。最適化の理論が全部使える。
- 足し算がきれいに成り立つ。独立な量を足したとき、分散はそのまま足せる(06 章)。絶対偏差にはこの性質がない。
- 正規分布と直結する。正規分布の式の肩に乗っているのは二乗である(08 章)。
- ピタゴラスの定理につながる。\(n\) 個の偏差を並べたものを \(n\) 次元空間の 1 本の矢印とみなすと、二乗和 \(\sum(x_i-\bar x)^2\) はその矢印の長さの二乗である(2 次元なら \(a^2 + b^2\) が斜辺の二乗、というピタゴラスの定理そのもの)。だから 分散分析(15 章)や回帰(18 章)の変動分解は、幾何学的には直角三角形の定理そのものになる。
分散 (variance)
母分散(母集団全体が分かっている場合。母集団の個体数を \(N\)、その平均を \(\mu\) とする):
標本(\(n\) 個)から母分散を推定するときは、次の \(s^2\) を使う。本シリーズで「標本分散」と言えばこの \(n-1\) で割った式を指し、後で示す性質から不偏分散とも呼ぶ(\(n\) で割る流儀もあるが、本シリーズでは使わない):
なぜ \(n-1\) で割るのか(完全な導出)
これは統計を学ぶ人が最初につまずく定番の疑問である。きちんと導出する。
直感から: 分散は「\(\mu\) からのズレ」を測りたい。しかし \(\mu\) は未知なので、代わりに \(\bar{x}\) を使う。 ところが \(\bar{x}\) はそのデータ自身から計算した値であり、 先ほど示したとおり \(\bar{x}\) は「二乗誤差を最小にする点」である。 つまり \(\bar{x}\) からのズレは、真の \(\mu\) からのズレより必ず小さくなる。 だから \(n\) で割ると分散を過小評価してしまう。それを補正するのが \(n-1\) である。
式で: ここからは、標本の各値 \(x_i\) を「母集団からくじ引きで選ばれた、取り直すたびに変わる値」とみなす。 そのような値について「取り直しを無限に繰り返したときの平均」を期待値 \(E[\cdot]\) と書く(正確な定義は 06 章。ここでは「くじを引き直したときの平均的な値」と読めばよい)。 \(x_i\) は母集団から選ばれた 1 個なので \(E[x_i] = \mu\)、\(E[(x_i-\mu)^2] = \sigma^2\)(母集団全体で平均すれば母平均・母分散になる)。まず恒等式を作る。
展開する。
中央の項は「偏差の和 = 0」で消える。よって
両辺の期待値を取る。\(E[(x_i-\mu)^2] = \sigma^2\)、また \(\bar{x}\) の分散は \(\sigma^2/n\) である(09 章で導出するが、ここでは事実として使う)ので \(E[(\bar{x}-\mu)^2] = \sigma^2/n\)。
したがって
自由度という見方. \(n\) 個の偏差 \(x_i - \bar{x}\) には \(\sum(x_i-\bar{x})=0\) という1 本の拘束がある。 つまり \(n-1\) 個決まれば残り 1 個は自動的に決まる。 自由に動ける個数が \(n-1\) しかないので、\(n-1\) で割る——これが「自由度」という言葉の意味である。 この考え方は t 分布(08 章)、分散分析(15 章)、回帰(19 章)でそのまま再登場する。
標準偏差 (standard deviation)
分散は「二乗した単位」(cm を測ったなら cm²)なので直感が働かない。 平方根を取って元の単位に戻したものが標準偏差である。実務で「ばらつき」と言えばふつうこれを指す。
その他のばらつき指標
| 名前 | 定義 | 特徴 |
|---|---|---|
| 範囲 | 最大 − 最小 | 単純。外れ値に完全に支配される |
| 四分位範囲 (IQR) | \(Q_3 - Q_1\)(データを小さい順に並べ、下から 1/4 の位置の値が第 1 四分位数 \(Q_1\)、3/4 の位置が第 3 四分位数 \(Q_3\)。中央値は 2/4 の位置。位置が整数でないときの補間には流儀があり、ソフトで値が少し違うことがある) | 中央 50% の幅。外れ値に強い |
| MAD | \(\text{med}(\lvert x_i - \text{med}(x)\rvert)\) | 中央絶対偏差。極めて頑健 |
| 変動係数 (CV) | \(s/\bar{x}\) | 単位に依存しない相対的ばらつき。比例尺度でのみ意味を持つ |
変動係数が要る場面. 体重(平均 60 kg、SD 6 kg)と身長(平均 170 cm、SD 6 cm)。 SD はどちらも 6 だが、単位が違うので比べられない。 CV は \(6/60 = 0.10\) と \(6/170 = 0.035\) となり、体重の方が相対的に約 3 倍(正確には 2.8 倍)ばらついていると言える。
4. 標準化 (z スコア)
平均を引いて(中心を 0 に)、標準偏差で割る(ばらつきを 1 に)。 これで単位が消える。テストの点も身長も、同じ物差しで比べられるようになる。
確認: \(\bar{z} = \frac{1}{n}\sum \frac{x_i - \bar{x}}{s} = \frac{1}{s}\cdot\frac{1}{n}\sum(x_i - \bar{x}) = 0\)。 分散は、\(\bar z = 0\) なので \(z_i - \bar z = z_i\) となり、\(\frac{1}{n-1}\sum (z_i - \bar z)^2 = \frac{1}{n-1}\sum z_i^2 = \frac{1}{s^2}\cdot\frac{1}{n-1}\sum(x_i-\bar{x})^2 = \frac{s^2}{s^2} = 1\)。
偏差値との関係. 日本の偏差値は \(50 + 10z\) である。 平均を 50、標準偏差を 10 に置き直しただけの z スコアだと分かれば、 「偏差値 70 = 平均より 2 標準偏差上」とすぐ読める。 正規分布なら上位約 2.3% にあたる(08 章)。
5. 分布の形
歪度 (skewness) — 左右の非対称さ
三乗なので符号が残る。
| 歪度 | 形 | 例 | 平均と中央値の関係 |
|---|---|---|---|
| 正(右に裾) | 右に長い尾 | 年収、都市人口、待ち時間 | 平均 > 中央値 |
| 0 | 左右対称 | 身長、測定誤差 | 平均 ≈ 中央値 |
| 負(左に裾) | 左に長い尾 | 満点近くに集まる試験 | 平均 < 中央値 |
尖度 (kurtosis) — 裾の重さ
(\(-3\) は、08 章で学ぶ正規分布——左右対称な釣鐘型の分布——の四乗の平均がちょうど 3 になる(08 章で計算する)ので、それを基準の 0 にするための調整。超過尖度と呼ぶ。)
正の尖度は「中心が尖っていて、裾が重い」ことを意味する。 裾が重いとは「極端な値が正規分布より起こりやすい」ということで、金融のリターンなどで実際に観測される。 これを見落とすと、めったに起きないはずの暴落が想定より頻繁に起きて破綻する。
6. 可視化
ヒストグラム
区間(ビン)ごとに個数を数えて棒にする。ビン幅の選び方で見え方が激変するのが最大の注意点。
- 細かすぎる → 凸凹だらけでノイズしか見えない
- 粗すぎる → 山が 2 つあるのに 1 つに見える
目安の公式(どれも出発点であって絶対ではない):
| 名前 | ビン幅または個数 |
|---|---|
| スタージェスの公式 | ビン数 \(= 1 + \log_2 n\) |
| スコットの公式 | 幅 \(= 3.49 s n^{-1/3}\) |
| フリードマン・ダイアコニス | 幅 \(= 2\text{IQR}\cdot n^{-1/3}\) |
必ず複数のビン幅で描くこと. 1 つの幅だけ見て「単峰だ」と決めつけると、 2 つの集団が混ざっているのを見逃す。実務では混ざり物を見つけることが最大の収穫であることが多い。
箱ひげ図 (box plot)
- 箱 = \(Q_1\) から \(Q_3\)(中央 50%)、中の線 = 中央値
- ひげ = 箱から外へ伸ばし、\(Q_1 - 1.5\text{IQR}\) から \(Q_3 + 1.5\text{IQR}\) の範囲に入っている実際のデータ点のうち、最も外側の点で止める(範囲の端の値そのものではない)
- その外の点 = 外れ値候補
複数グループを横に並べて比較するのに向く。ただし分布が 2 山でも箱ひげ図では分からないので、 ヒストグラムやバイオリンプロットと併用したい。
1.5 IQR という数字はどこから来たのか. 正規分布のとき、この範囲の外に落ちる確率は約 0.7% である。 つまり「正規分布ならめったに出ない位置」を機械的に印すための、経験的だが根拠のある閾値である。 外れ値と判定されても、それが「間違ったデータ」という意味ではないことに注意。 入力ミスかもしれないし、本物の珍しい観測かもしれない。中身を見ずに捨てるのは統計ではなく捏造である。
7. チェビシェフの不等式 — 分布の形を仮定しない保証
分布がどんな形でも成り立つ、非常に強い(そして緩い)不等式がある。 ここは 3 節 の「なぜ \(n-1\)」と同じく、値を「くじ引きで決まる値」として扱う。母集団から 1 個を選んだときの値を \(X\)(大文字で書く。06 章の確率変数)とし、 \(P(\cdot)\) は「その出来事が起きる割合(確率)」、\(\mu, \sigma\) は母平均・母標準偏差である。母分散は「\((X-\mu)^2\) の全個体での平均」なので \(\sigma^2 = E[(X-\mu)^2]\) と書ける(3 節 の \(\frac{1}{N}\sum(x_i-\mu)^2\) と同じもの)。
導出: 母集団の個体を「\(\mu\) から \(k\sigma\) 以上離れている個体」とそれ以外に分ける。\((X-\mu)^2\) の全個体での平均 \(\sigma^2\) は、離れている個体だけの分を足した平均以上である(他の個体の分は 0 以上なので、落としても平均は減るだけ):
ここで \(\mathbb{1}(\cdot)\) は「条件が成り立てば 1、成り立たなければ 0」の記号で、掛けることで離れている個体だけを残している。 2 つ目の不等号は、離れている個体では \((X-\mu)^2 \geq (k\sigma)^2\) なので、その個体の割合 \(P(\cdot)\) に \((k\sigma)^2\) を掛けた値以上になるから。 両辺を \(k^2\sigma^2\) で割れば結論を得る。∎
| \(k\) | チェビシェフの保証 | 正規分布なら実際は |
|---|---|---|
| 2 | 外側は 25% 以下 | 4.6% |
| 3 | 外側は 11.1% 以下 | 0.27% |
緩いが、それが価値である. チェビシェフは「どんな分布でも」成り立つ代わりに、かなり甘い保証しか与えない。 逆に言えば、分布の形を知っていれば桁違いに鋭いことが言える。 だからこそ 07 章〜08 章で分布を学ぶ意味がある。
8. まとめ
| 概念 | 式 | 一言で |
|---|---|---|
| 平均 | \(\bar{x} = \frac{1}{n}\sum x_i\) | 重心。二乗誤差を最小にする点 |
| 中央値 | 真ん中の値 | 絶対誤差を最小にする点。外れ値に強い |
| 分散 | \(s^2 = \frac{1}{n-1}\sum (x_i-\bar{x})^2\) | ばらつき。\(n-1\) は自由度 |
| 標準偏差 | \(s = \sqrt{s^2}\) | 元の単位に戻したばらつき |
| z スコア | \((x-\bar{x})/s\) | 単位を消す。平均 0・分散 1 |
| 歪度 | 三乗の平均 | 左右の非対称さ |
| 尖度 | 四乗の平均 − 3 | 裾の重さ |
- 偏差の和は必ず 0。だから二乗する。二乗するから微分でき、理論が全部つながる。
- \(n-1\) で割るのは、\(\bar{x}\) を使った時点でズレを過小評価しているから。自由度が \(n-1\) しかない。
- 要約する前に必ず絵を描く。数字だけを見て判断すると、次章のアンスコムの四重奏に必ずやられる。