統計 02 · 記述統計 — 中心・ばらつき・分布の形

Chapter 02

記述統計 — 中心・ばらつき・分布の形

この章がなぜ必要なのか——「たくさんの数字」を「少しの数字」に潰す.

1000 人の身長データがある。1000 個の数字をそのまま眺めても何も分からない。 人間が一度に把握できるのはせいぜい数個である。

そこで「この 1000 個は、だいたい 170 のあたりに、±6 くらいの幅で散らばっている」と要約する。 1000 個の情報を 2 個(中心とばらつき)に圧縮したわけだ。 当然、圧縮すれば情報は失われる。何を残し何を捨てたのかを自覚することが、この章の本当のテーマである。

そして、この章で出てくる「平均」と「分散」は、以降のすべての章で主役を張り続ける。 ここでの理解の深さが、そのまま後半の理解の深さになる。

この章で使う既出の用語(定義は各リンク先). 記述統計(01 章 1 節)、母集団・標本・標本サイズ \(n\)・母平均 \(\mu\)・母分散 \(\sigma^2\)(01 章 2 節)、名義尺度・比例尺度(01 章 4 節)

1. Σ 記号の読み方(ここだけ先に)

統計の式は \(\sum\) だらけになるので、最初に潰しておく。

\[ \sum_{i=1}^{n} x_i = x_1 + x_2 + \cdots + x_n \]

「\(i\) を 1 から \(n\) まで動かして、\(x_i\) を全部足せ」という命令である。それだけ。

以降で何度も使う 3 つの性質を確認しておく(どれも「足し算の順番を入れ替えてよい」だけの話である)。範囲が自明なときは \(\sum_{i=1}^{n}\) を単に \(\sum\) と書く。この章では常に \(i = 1\) から \(n\) までの和である。

性質式意味
定数倍は外に出る\(\sum c x_i = c \sum x_i\)全部 2 倍してから足す = 足してから 2 倍
和は分けられる\(\sum (x_i + y_i) = \sum x_i + \sum y_i\)縦に足すか横に足すかの違い
定数の和は個数倍\(\sum_{i=1}^{n} c = nc\)\(c\) を \(n\) 個足す

2. 中心を表す — 代表値

平均 (mean)

\[ \bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i \]

最もよく使われる代表値。物理的には「データを数直線に置いたときの重心(つり合いの支点)」である。

なぜ重心なのか(導出): 平均からの偏差の総和を計算してみる。

\[ \sum_{i=1}^{n}(x_i - \bar{x}) = \sum x_i - \sum \bar{x} = n\bar{x} - n\bar{x} = 0 \]

つまり平均より上にはみ出した分と、下に足りない分が、ちょうど打ち消し合う。 数直線上の位置 \(x_i\) に同じ重さのおもりを置き、支点を \(c\) に置くと、各おもりがシーソーを回そうとする力の大きさは支点からの距離 \(x_i - c\) に比例する(てこの原理)。 その合計 \(\sum(x_i - c)\) が 0 になる支点がつり合いの点で、上の計算はそれが \(c = \bar x\) だと言っている。これがシーソーのつり合う点=重心である。この「偏差の和は 0」という事実は、この先何度も使う。

平均が持つもう一つの顔: 二乗誤差を最小にする点

「代表値 \(c\) を 1 つ決めて、全データをそれで代表させる。ズレの二乗和を最小にする \(c\) は何か」を解いてみる。

\[ f(c) = \sum_{i=1}^{n}(x_i - c)^2 \]

\(c\) で微分して 0 と置く。

\[ \frac{df}{dc} = \sum_{i=1}^{n} 2(x_i - c)(-1) = -2\left(\sum x_i - nc\right) = 0 \]
\[ \Longrightarrow \quad c = \frac{1}{n}\sum x_i = \bar{x} \]

二階微分は \(f''(c) = 2n > 0\) なので、これは確かに最小値である。

\[ \boxed{\text{平均} = \text{二乗誤差を最小にする代表値}} \]

これが決定的に重要な理由. 統計のあらゆる場面で「二乗和を最小にする」という考えが出てくる (分散、最小二乗法、分散分析)。それらはすべてこの事実の親戚である。 18 章の回帰分析は、この式の \(c\) を「直線 \(a + bx_i\)」に置き換えただけのものになる。

中央値 (median)

データを小さい順に並べたときの真ん中の値。

\[ \text{med}(x) = \begin{cases} x_{((n+1)/2)} & (n \text{ が奇数}) \\ \dfrac{x_{(n/2)} + x_{(n/2+1)}}{2} & (n \text{ が偶数}) \end{cases} \]

(\(x_{(k)}\) は小さい方から \(k\) 番目の値。順序統計量と呼ぶ。)

中央値は「絶対誤差の和を最小にする点」である。 理由: \(g(c) = \sum|x_i - c|\) を考える。\(c\) を少し右に動かすと、\(c\) より左にあるデータ(\(L\) 個とする)との距離は増え、右にあるデータ(\(R\) 個)との距離は減るので、\(g\) の変化は \(L - R\) に比例する。 \(L < R\) なら右に動かすと減り、\(L > R\) なら左に動かすと減る。減らせなくなるのは左右の個数が等しい点、すなわち中央値である。 平均が二乗誤差、中央値が絶対誤差。この対比は覚えておく価値がある。

最頻値 (mode)

最も多く現れる値。名義尺度でも使える唯一の代表値である。

どれを使うべきか

状況使うべき代表値理由
だいたい左右対称平均情報を最も多く使う。理論も整っている
大きく歪んでいる(年収など)中央値一部の極端な値に引きずられない
外れ値がある中央値平均は 1 点で壊れる
カテゴリデータ最頻値大小関係がない

年収の例で「平均」の危うさを見る. 9 人が年収 400 万円、1 人が 1 億円(= 10000 万円)の会社を考える。万円単位で計算すると

「平均年収 1360 万円の会社」は嘘ではないが、10 人中 9 人にとって現実離れした数字である。 所得や資産、Web の滞在時間、地震の規模など、右に長い裾を引く分布では中央値の方が実感に合う。 「平均」と書いてあったら、まず分布の形を疑う癖をつけたい。

その他の平均

名前定義使うとき
幾何平均\(\left(\prod_{i=1}^n x_i\right)^{1/n}\)成長率・倍率の平均
調和平均\(n / \sum (1/x_i)\)速度など「単位あたり」の平均
トリム平均上下 \(k\)% を捨てて平均外れ値対策。スポーツの採点方式

幾何平均が要る場面. ある投資が 1 年目に +100%(2 倍)、2 年目に −50%(0.5 倍)だったとする。 算術平均を取ると \((100 - 50)/2 = +25\)% だが、実際の資産は \(2 \times 0.5 = 1\) 倍、つまり増減ゼロである。 正しいのは幾何平均 \(\sqrt{2 \times 0.5} = 1\)、すなわち年平均 0%。 掛け算で効くものは掛け算で平均するのが鉄則である。

調和平均が要る場面. 行きは時速 60 km、帰りは時速 30 km で同じ道を往復した。平均速度は? 算術平均の 45 km/h ではない。距離を \(d\) とすると総時間は \(d/60 + d/30 = d/20\)、 総距離は \(2d\) なので平均速度は \(2d/(d/20) = 40\) km/h。 これは \(2/(1/60 + 1/30) = 40\)、すなわち調和平均である。

3. ばらつきを表す

代表値だけでは足りない。「平均 170 cm」でも、全員 170 cm ぴったりの集団と、 150〜190 cm がばらけた集団ではまるで違う。

なぜ「偏差の和」ではだめなのか

素直に「平均からのズレの合計」を考えたくなるが、これは先ほど示したとおり常に 0である。

\[ \sum (x_i - \bar{x}) = 0 \]

プラスのズレとマイナスのズレが打ち消し合うためだ。だから符号を消す必要がある。方法は 2 つある。

方法結果評価
絶対値を取る平均絶対偏差 \(\frac{1}{n}\sum \lvert x_i - \bar{x}\rvert\)直感的だが、絶対値は 0 で折れ曲がっていてそこで微分できず、数学的に扱いにくい
二乗する分散微分できる。理論が全部つながる。こちらが標準

「なぜ二乗なのか」への 4 つの答え.

  1. 微分できる。絶対値は 0 で折れ曲がりそこで微分できないが、二乗はどこでもなめらか。最適化の理論が全部使える。
  2. 足し算がきれいに成り立つ。独立な量を足したとき、分散はそのまま足せる(06 章)。絶対偏差にはこの性質がない。
  3. 正規分布と直結する。正規分布の式の肩に乗っているのは二乗である(08 章)。
  4. ピタゴラスの定理につながる。\(n\) 個の偏差を並べたものを \(n\) 次元空間の 1 本の矢印とみなすと、二乗和 \(\sum(x_i-\bar x)^2\) はその矢印の長さの二乗である(2 次元なら \(a^2 + b^2\) が斜辺の二乗、というピタゴラスの定理そのもの)。だから 分散分析(15 章)や回帰(18 章)の変動分解は、幾何学的には直角三角形の定理そのものになる。

分散 (variance)

母分散(母集団全体が分かっている場合。母集団の個体数を \(N\)、その平均を \(\mu\) とする):

\[ \sigma^2 = \frac{1}{N}\sum_{i=1}^{N}(x_i - \mu)^2 \]

標本(\(n\) 個)から母分散を推定するときは、次の \(s^2\) を使う。本シリーズで「標本分散」と言えばこの \(n-1\) で割った式を指し、後で示す性質から不偏分散とも呼ぶ(\(n\) で割る流儀もあるが、本シリーズでは使わない):

\[ s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2 \]

なぜ \(n-1\) で割るのか(完全な導出)

これは統計を学ぶ人が最初につまずく定番の疑問である。きちんと導出する。

直感から: 分散は「\(\mu\) からのズレ」を測りたい。しかし \(\mu\) は未知なので、代わりに \(\bar{x}\) を使う。 ところが \(\bar{x}\) はそのデータ自身から計算した値であり、 先ほど示したとおり \(\bar{x}\) は「二乗誤差を最小にする点」である。 つまり \(\bar{x}\) からのズレは、真の \(\mu\) からのズレより必ず小さくなる。 だから \(n\) で割ると分散を過小評価してしまう。それを補正するのが \(n-1\) である。

式で: ここからは、標本の各値 \(x_i\) を「母集団からくじ引きで選ばれた、取り直すたびに変わる値」とみなす。 そのような値について「取り直しを無限に繰り返したときの平均」を期待値 \(E[\cdot]\) と書く(正確な定義は 06 章。ここでは「くじを引き直したときの平均的な値」と読めばよい)。 \(x_i\) は母集団から選ばれた 1 個なので \(E[x_i] = \mu\)、\(E[(x_i-\mu)^2] = \sigma^2\)(母集団全体で平均すれば母平均・母分散になる)。まず恒等式を作る。

\[ \sum_{i=1}^n (x_i - \mu)^2 = \sum_{i=1}^n \left[(x_i - \bar{x}) + (\bar{x} - \mu)\right]^2 \]

展開する。

\[ = \sum (x_i - \bar{x})^2 + 2(\bar{x}-\mu)\underbrace{\sum (x_i - \bar{x})}_{= 0} + n(\bar{x}-\mu)^2 \]

中央の項は「偏差の和 = 0」で消える。よって

\[ \sum (x_i - \mu)^2 = \sum (x_i - \bar{x})^2 + n(\bar{x}-\mu)^2 \]
\[ \Longrightarrow \quad \sum (x_i - \bar{x})^2 = \sum (x_i - \mu)^2 - n(\bar{x}-\mu)^2 \]

両辺の期待値を取る。\(E[(x_i-\mu)^2] = \sigma^2\)、また \(\bar{x}\) の分散は \(\sigma^2/n\) である(09 章で導出するが、ここでは事実として使う)ので \(E[(\bar{x}-\mu)^2] = \sigma^2/n\)。

\[ E\left[\sum (x_i - \bar{x})^2\right] = n\sigma^2 - n \cdot \frac{\sigma^2}{n} = (n-1)\sigma^2 \]

したがって

\[ E\left[\frac{1}{n-1}\sum (x_i - \bar{x})^2\right] = \sigma^2 \]
\[ \boxed{n-1 \text{ で割ると期待値がちょうど } \sigma^2 \text{ になる(不偏)}} \]

自由度という見方. \(n\) 個の偏差 \(x_i - \bar{x}\) には \(\sum(x_i-\bar{x})=0\) という1 本の拘束がある。 つまり \(n-1\) 個決まれば残り 1 個は自動的に決まる。 自由に動ける個数が \(n-1\) しかないので、\(n-1\) で割る——これが「自由度」という言葉の意味である。 この考え方は t 分布(08 章)、分散分析(15 章)、回帰(19 章)でそのまま再登場する。

標準偏差 (standard deviation)

\[ s = \sqrt{s^2} \]

分散は「二乗した単位」(cm を測ったなら cm²)なので直感が働かない。 平方根を取って元の単位に戻したものが標準偏差である。実務で「ばらつき」と言えばふつうこれを指す。

その他のばらつき指標

名前定義特徴
範囲最大 − 最小単純。外れ値に完全に支配される
四分位範囲 (IQR)\(Q_3 - Q_1\)(データを小さい順に並べ、下から 1/4 の位置の値が第 1 四分位数 \(Q_1\)、3/4 の位置が第 3 四分位数 \(Q_3\)。中央値は 2/4 の位置。位置が整数でないときの補間には流儀があり、ソフトで値が少し違うことがある)中央 50% の幅。外れ値に強い
MAD\(\text{med}(\lvert x_i - \text{med}(x)\rvert)\)中央絶対偏差。極めて頑健
変動係数 (CV)\(s/\bar{x}\)単位に依存しない相対的ばらつき。比例尺度でのみ意味を持つ

変動係数が要る場面. 体重(平均 60 kg、SD 6 kg)と身長(平均 170 cm、SD 6 cm)。 SD はどちらも 6 だが、単位が違うので比べられない。 CV は \(6/60 = 0.10\) と \(6/170 = 0.035\) となり、体重の方が相対的に約 3 倍(正確には 2.8 倍)ばらついていると言える。

4. 標準化 (z スコア)

\[ z_i = \frac{x_i - \bar{x}}{s} \]

平均を引いて(中心を 0 に)、標準偏差で割る(ばらつきを 1 に)。 これで単位が消える。テストの点も身長も、同じ物差しで比べられるようになる。

\[ \bar{z} = 0, \qquad s_z^2 = 1 \]

確認: \(\bar{z} = \frac{1}{n}\sum \frac{x_i - \bar{x}}{s} = \frac{1}{s}\cdot\frac{1}{n}\sum(x_i - \bar{x}) = 0\)。 分散は、\(\bar z = 0\) なので \(z_i - \bar z = z_i\) となり、\(\frac{1}{n-1}\sum (z_i - \bar z)^2 = \frac{1}{n-1}\sum z_i^2 = \frac{1}{s^2}\cdot\frac{1}{n-1}\sum(x_i-\bar{x})^2 = \frac{s^2}{s^2} = 1\)。

偏差値との関係. 日本の偏差値は \(50 + 10z\) である。 平均を 50、標準偏差を 10 に置き直しただけの z スコアだと分かれば、 「偏差値 70 = 平均より 2 標準偏差上」とすぐ読める。 正規分布なら上位約 2.3% にあたる(08 章)。

5. 分布の形

歪度 (skewness) — 左右の非対称さ

\[ \text{skew} = \frac{1}{n}\sum \left(\frac{x_i - \bar{x}}{s}\right)^3 \]

三乗なので符号が残る。

歪度形例平均と中央値の関係
正(右に裾)右に長い尾年収、都市人口、待ち時間平均 > 中央値
0左右対称身長、測定誤差平均 ≈ 中央値
負(左に裾)左に長い尾満点近くに集まる試験平均 < 中央値

尖度 (kurtosis) — 裾の重さ

\[ \text{kurt} = \frac{1}{n}\sum \left(\frac{x_i - \bar{x}}{s}\right)^4 - 3 \]

(\(-3\) は、08 章で学ぶ正規分布——左右対称な釣鐘型の分布——の四乗の平均がちょうど 3 になる(08 章で計算する)ので、それを基準の 0 にするための調整。超過尖度と呼ぶ。)

正の尖度は「中心が尖っていて、裾が重い」ことを意味する。 裾が重いとは「極端な値が正規分布より起こりやすい」ということで、金融のリターンなどで実際に観測される。 これを見落とすと、めったに起きないはずの暴落が想定より頻繁に起きて破綻する。

6. 可視化

ヒストグラム

区間(ビン)ごとに個数を数えて棒にする。ビン幅の選び方で見え方が激変するのが最大の注意点。

目安の公式(どれも出発点であって絶対ではない):

名前ビン幅または個数
スタージェスの公式ビン数 \(= 1 + \log_2 n\)
スコットの公式幅 \(= 3.49 s n^{-1/3}\)
フリードマン・ダイアコニス幅 \(= 2\text{IQR}\cdot n^{-1/3}\)

必ず複数のビン幅で描くこと. 1 つの幅だけ見て「単峰だ」と決めつけると、 2 つの集団が混ざっているのを見逃す。実務では混ざり物を見つけることが最大の収穫であることが多い。

箱ひげ図 (box plot)

複数グループを横に並べて比較するのに向く。ただし分布が 2 山でも箱ひげ図では分からないので、 ヒストグラムやバイオリンプロットと併用したい。

1.5 IQR という数字はどこから来たのか. 正規分布のとき、この範囲の外に落ちる確率は約 0.7% である。 つまり「正規分布ならめったに出ない位置」を機械的に印すための、経験的だが根拠のある閾値である。 外れ値と判定されても、それが「間違ったデータ」という意味ではないことに注意。 入力ミスかもしれないし、本物の珍しい観測かもしれない。中身を見ずに捨てるのは統計ではなく捏造である。

7. チェビシェフの不等式 — 分布の形を仮定しない保証

分布がどんな形でも成り立つ、非常に強い(そして緩い)不等式がある。 ここは 3 節 の「なぜ \(n-1\)」と同じく、値を「くじ引きで決まる値」として扱う。母集団から 1 個を選んだときの値を \(X\)(大文字で書く。06 章の確率変数)とし、 \(P(\cdot)\) は「その出来事が起きる割合(確率)」、\(\mu, \sigma\) は母平均・母標準偏差である。母分散は「\((X-\mu)^2\) の全個体での平均」なので \(\sigma^2 = E[(X-\mu)^2]\) と書ける(3 節 の \(\frac{1}{N}\sum(x_i-\mu)^2\) と同じもの)。

\[ P(\lvert X - \mu \rvert \geq k\sigma) \leq \frac{1}{k^2} \]

導出: 母集団の個体を「\(\mu\) から \(k\sigma\) 以上離れている個体」とそれ以外に分ける。\((X-\mu)^2\) の全個体での平均 \(\sigma^2\) は、離れている個体だけの分を足した平均以上である(他の個体の分は 0 以上なので、落としても平均は減るだけ):

\[ \sigma^2 = E[(X-\mu)^2] \geq E\left[(X-\mu)^2 \cdot \mathbb{1}(\lvert X-\mu\rvert \geq k\sigma)\right] \geq (k\sigma)^2 P(\lvert X-\mu\rvert \geq k\sigma) \]

ここで \(\mathbb{1}(\cdot)\) は「条件が成り立てば 1、成り立たなければ 0」の記号で、掛けることで離れている個体だけを残している。 2 つ目の不等号は、離れている個体では \((X-\mu)^2 \geq (k\sigma)^2\) なので、その個体の割合 \(P(\cdot)\) に \((k\sigma)^2\) を掛けた値以上になるから。 両辺を \(k^2\sigma^2\) で割れば結論を得る。∎

\(k\)チェビシェフの保証正規分布なら実際は
2外側は 25% 以下4.6%
3外側は 11.1% 以下0.27%

緩いが、それが価値である. チェビシェフは「どんな分布でも」成り立つ代わりに、かなり甘い保証しか与えない。 逆に言えば、分布の形を知っていれば桁違いに鋭いことが言える。 だからこそ 07 章〜08 章で分布を学ぶ意味がある。

8. まとめ

概念式一言で
平均\(\bar{x} = \frac{1}{n}\sum x_i\)重心。二乗誤差を最小にする点
中央値真ん中の値絶対誤差を最小にする点。外れ値に強い
分散\(s^2 = \frac{1}{n-1}\sum (x_i-\bar{x})^2\)ばらつき。\(n-1\) は自由度
標準偏差\(s = \sqrt{s^2}\)元の単位に戻したばらつき
z スコア\((x-\bar{x})/s\)単位を消す。平均 0・分散 1
歪度三乗の平均左右の非対称さ
尖度四乗の平均 − 3裾の重さ