統計 01 · 統計とは何か — 母集団・標本・変数の型

Chapter 01

統計とは何か — 母集団・標本・変数の型

この章がなぜ必要なのか——「計算を始める前に負けている」を避ける.

統計の失敗の大半は、難しい計算を間違えたせいではない。 データの取り方が間違っていたか、扱っている数字の種類を取り違えていたせいで起きる。

どんなに精密な検定をしても、集めたデータが偏っていれば結論は偏る。 「郵便番号」の平均を計算しても意味がない(番号は地域に付けたただのラベルで、大小に意味がない。4 節)のに、コンピュータは平気で計算してくれる。

この章は計算をしない。その代わり、この先のすべての計算が意味を持つための前提を固める。 地味だが、ここを飛ばすと後の章がすべて砂上の楼閣になる。

1. 統計は何をする学問なのか

出発点: 全部は調べられない

日本人の平均身長を知りたいとする。理想は 1 億 2000 万人を全員測ることだ。 だが現実には不可能である。時間も金も足りない。

そこで、たとえば 1000 人を選んで測る。その 1000 人の平均が 170.2 cm だったとする。 ここで問いが生まれる。

日本人全体の平均も 170.2 cm だと言ってよいのか? 言えないなら、どこまでなら言えるのか?

この問いに答えるのが統計学である。統計学は、一部を見て全体を語るときに、 どれだけの誤差——ここでは「一部から計算した値」と「全体の本当の値」のずれ——を覚悟すべきかを、 「ずれは ±0.4 cm 以内におさまる」のような数値の形で定量化する技術だと言ってよい(その計算のしかたは 09 章〜11 章で学ぶ)。

2 つの統計

種類何をするか例
記述統計 (descriptive)手元のデータそのものを要約するこの 1000 人の平均は 170.2 cm、ばらつき(標準偏差、02 章で定義)は 5.8 cm
推測統計 (inferential)手元のデータから、その背後にある全体を推し量る日本人全体の平均は 169.8〜170.6 cm の間だろう(この幅の作り方と「95%」という信頼の度合いの意味は 11 章で学ぶ)

02 章〜03 章が記述統計、09 章以降が推測統計である。 そして推測統計を可能にする言語が確率(04 章〜08 章)である。

なぜ確率が必要になるのか. 1000 人を選び直せば、平均は 170.2 ではなく 169.9 になるかもしれない。 選び方によって答えが揺れる。この揺れの大きさを見積もるには、 「揺れ」そのものを数式で扱う道具——確率——が要る。 これが「統計を学ぶのになぜ確率から始めるのか」の答えである。

2. 母集団と標本

定義

用語意味
母集団 (population)本当に知りたい対象の全体。日本人全員、工場の全製品、ある薬を飲みうる全患者
標本 (sample)実際に観測した一部。測った 1000 人、抜き取った 50 個
標本サイズ (sample size) \(n\)標本に含まれる個体数
母数(パラメータ)母集団の特徴を表す数。母平均 \(\mu\)(ミュー。全員の平均)、母分散 \(\sigma^2\)(シグマ二乗。全員のばらつき。計算式は 02 章)など。未知
統計量 (statistic)標本から計算できる数。標本平均 \(\bar{x}\)(エックスバー。測った人の平均)、標本分散 \(s^2\)(測った人のばらつき)など。既知
標準偏差分散の平方根 \(\sigma = \sqrt{\sigma^2}\)、\(s = \sqrt{s^2}\)。ばらつきを元の単位(cm なら cm)で表したもの(02 章)

「母数」という言葉の注意. 日常語で「母数が大きい」と言うとき、多くの人は「分母」「全体の個数」の意味で使っている。 だが統計学の専門用語としての母数 = パラメータ = 母集団の特徴量(母平均など)であって、個数ではない。 個数を言いたいときは「母集団のサイズ」と言うのが安全である。

母集団は「無限」でもよい

工場の製品なら母集団は有限個(今日作った 10 万個)だが、 「この製造プロセスが生み出しうる製品すべて」と考えると、母集団は概念上の無限集合になる。

統計では後者の考え方をよく使う。 「今日のデータ」は「このプロセスから生まれうる無限のデータ」からの標本だ、と見なすのである。 A/B テストで「今週の来訪者 1 万人」を扱うときも、その 1 万人自体が目的ではなく、 その背後にある「このサイトに来る人一般」を知りたいのだから、この見方が自然になる。

3. どう取るか — ここで勝負がつく

無作為抽出 (random sampling)

母集団のどの個体も、等しい確率で選ばれる——くじ引きのように、誰が選ばれるかに偏りがない——ようにデータを取ること(確率の正確な定義は 04 章。ここでは「くじ引き」のイメージで十分)。 これが推測統計のすべての前提である。この前提が崩れると、以降の理論はまったく保証しなくなる。

なぜ無作為でなければならないのか. 統計の理屈は「標本が母集団の縮図になっている」ことを前提に組まれている。 縮図でないなら、標本平均が母平均の近くに来る保証がどこにもない。 どれだけ \(n\) を増やしても、偏った取り方をした標本は、偏ったまま精度(取り直したときの結果の揺れの小ささ)だけ上がる。 「大量のデータがあるから正しい」は誤りである。偏りは量では治らない。

主な抽出法

方法やり方使いどころ
単純無作為抽出全員に番号を振り、乱数で選ぶ母集団リストがある
層化抽出年代・性別などで層に分け、各層から無作為に取る層ごとの構成比を保証したい。結果の揺れも小さくなる
クラスター抽出地域などの塊を無作為に選び、その中は全数調査全員のリストが無い。移動コストが高い
系統抽出名簿の \(k\) 番おきに取る実務で簡便。名簿に周期性があると危険(例: 夫婦が交互に並ぶ名簿を 2 番おきに取ると片方の性別しか選ばれない)

代表的なバイアス(ここで統計は死ぬ)

バイアス何が起きるか実例
選択バイアス選ばれ方が偏る電話調査 → 昼間家にいる人に偏る
生存者バイアス消えたものが見えない「成功した起業家の共通点」— 同じことをして失敗した人は語らない
無回答バイアス答えた人と答えない人が違う満足度調査 → 強い不満/強い満足の人だけ答える
測定バイアス測り方自体が歪む体重を自己申告させる
公表バイアス有意な結果だけが世に出る17 章で詳述

有名な失敗例: 1936 年アメリカ大統領選. ある雑誌が 236 万人という当時としては桁外れの規模で調査を行い、ランドン候補の勝利を予測した。 結果はルーズベルトの圧勝で、予測は完全に外れた。

原因は標本サイズではない。調査対象を電話帳と自動車登録名簿から取ったことである。 大恐慌下で電話や車を持てたのは比較的裕福な層——つまり共和党支持に偏った層だった。 一方、正しく層化抽出を行った別の調査は、たった 5 万人でルーズベルトの勝利を当てている。

236 万 vs 5 万で、5 万が勝った。 これが「取り方は量に勝る」の最も有名な実例である。

4. 変数の型 — 何を計算してよいかが決まる

データの「種類」によって、許される計算が違う。ここを間違えると、意味のない数字が出る。

尺度水準 (scale of measurement)

水準意味許される操作例
名義尺度単なるラベル。順序も距離もない一致/不一致、頻度血液型、都道府県、郵便番号
順序尺度順序はあるが間隔は不定大小比較、中央値、順位相関満足度(5 段階)、震度、学年
間隔尺度間隔に意味がある。ただし 0 は「量が無い」という意味ではなく、便宜的に置いた基準点にすぎない加減、平均、標準偏差摂氏温度、西暦
比例尺度0 が「無い」を意味する加減乗除、比、変動係数身長、重さ、金額、時間

(「許される操作」の列にある中央値・順位相関・平均・標準偏差・変動係数は 02 章〜03 章で定義する要約の方法。ここでは「その水準で意味を持つ計算の例」として名前だけ挙げている。)

具体的に何がまずいのか.

離散と連続

型意味例
離散 (discrete)飛び飛びの値しか取らない人数、事故件数、サイコロの目
連続 (continuous)区間内の任意の値を取りうる身長、時間、電圧

この区別は 07 章(離散分布)と 08 章(連続分布)で決定的に効いてくる。 離散では「ちょうどこの値である確率」が意味を持つが、連続ではちょうどある値になる確率は 0 になる(08 章で詳述)。

説明変数と目的変数

呼び方別名役割
目的変数 \(y\)従属変数、応答変数、被説明変数予測したい・説明したいもの
説明変数 \(x\)独立変数、共変量、特徴量予測に使うもの

別名は分野ごとの呼び方の違いで、指すものは同じである(統計では従属/独立変数、機械学習では特徴量、医学・疫学では共変量と呼ぶことが多い)。

18 章以降の回帰分析はすべてこの枠組みで動く。

5. データの形

実務で扱うデータは、ふつう次の表の形をしている。

身長 (cm)体重 (kg)性別満足度
個体 1172.365.1M4
個体 2158.951.4F2
個体 3180.178.2M5

欠測値 (missing data)

現実のデータには必ず穴がある。穴の埋め方(あるいは埋めないこと)は結論を左右する。

種類意味対応
MCAR (完全にランダムな欠測)欠測がデータと無関係削除しても偏らない
MAR (ランダムな欠測)欠測するかどうかが、観測できている他の変数の値で決まる(例: 高齢者ほど体重を答えない。年齢は分かっている)多重代入法(観測できている変数から欠測値を何通りも予測して埋め、結果を平均する方法)などで補える
MNAR (ランダムでない欠測)欠測理由が欠測値自身に依存最も厄介。統計だけでは解けない

MNAR の例. 収入調査で高所得者ほど答えない。 「答えなかった」こと自体が「高所得である」情報を持っているので、 残ったデータだけで平均を計算すると必ず過小評価になる。 これは計算では直せない。調査の設計段階でしか手が打てない。

6. 統計を使う手順(全体地図)

  1. 問いを決める — 何を知りたいのか。「何となくデータを見る」は最も失敗しやすい。
  2. データを取る — 無作為抽出。可能なら実験(24 章)。
  3. 記述する — まず必ず可視化する(02 章〜03 章)。異常値・入力ミスはここで見つかる。
  4. モデルを立てる — 背後にどんな確率的仕組みを仮定するか(04 章〜08 章)。
  5. 推定する — パラメータを推し量る(10 章〜11 章)。
  6. 検定する — 「偶然では説明しにくい」と言えるか(12 章〜17 章)。
  7. 予測・説明する — 回帰やモデル選択(18 章〜22 章)。
  8. 解釈する — 因果と相関を混同しない(24 章)。

手順 3 を飛ばしてはいけない. どんなに高度な手法も、 「ヒストグラムを描いたら 2 つの山があった」「散布図を見たら明らかに 1 点だけ外れていた」 といった事実の前では無力である。まず絵を描く。03 章のアンスコムの四重奏は、 これを一目で納得させるために作られた有名な例である。

7. よくある誤解の先回り

「データが多ければ多いほど正しい」——半分だけ正しい. 標本サイズ \(n\) を増やすと偶然によるばらつきは小さくなる(標本平均の揺れが \(1/\sqrt{n}\) に比例して減ることを 09 章で導出する)。 しかし偏り(バイアス)は \(n\) を増やしても一切減らない。 1936 年の 236 万人はまさにこれで失敗した。 ばらつきは量で治り、偏りは設計でしか治らない。

「統計的に有意 = 重要」——違う. 有意とは「偶然では説明しにくい」というだけであって、差の大きさは何も言っていない。 \(n\) を十分大きくすれば、実務上どうでもいい 0.01% の差でも有意になる(12 章)。 「偶然では説明しにくい」度合い(有意性、p 値)と、差そのものの大きさ(効果量)は別々に見る必要がある(どちらも 12 章で定義する)。

「統計は嘘をつく」——嘘をつくのは人であって統計ではない. ただし、同じデータから違う結論を作ることは実際に可能である(グラフの軸を切る、 都合のいい部分集団を選ぶ、検定を繰り返して当たりを引く)。 本シリーズは、そうした操作がどこで効くのかを明示していく。 読む側に回ったとき、それを見抜けるようになるのが本当の目標である。

8. まとめ