Chapter 01
統計とは何か — 母集団・標本・変数の型
この章がなぜ必要なのか——「計算を始める前に負けている」を避ける.
統計の失敗の大半は、難しい計算を間違えたせいではない。 データの取り方が間違っていたか、扱っている数字の種類を取り違えていたせいで起きる。
どんなに精密な検定をしても、集めたデータが偏っていれば結論は偏る。 「郵便番号」の平均を計算しても意味がない(番号は地域に付けたただのラベルで、大小に意味がない。4 節)のに、コンピュータは平気で計算してくれる。
この章は計算をしない。その代わり、この先のすべての計算が意味を持つための前提を固める。 地味だが、ここを飛ばすと後の章がすべて砂上の楼閣になる。
1. 統計は何をする学問なのか
出発点: 全部は調べられない
日本人の平均身長を知りたいとする。理想は 1 億 2000 万人を全員測ることだ。 だが現実には不可能である。時間も金も足りない。
そこで、たとえば 1000 人を選んで測る。その 1000 人の平均が 170.2 cm だったとする。 ここで問いが生まれる。
日本人全体の平均も 170.2 cm だと言ってよいのか? 言えないなら、どこまでなら言えるのか?
この問いに答えるのが統計学である。統計学は、一部を見て全体を語るときに、 どれだけの誤差——ここでは「一部から計算した値」と「全体の本当の値」のずれ——を覚悟すべきかを、 「ずれは ±0.4 cm 以内におさまる」のような数値の形で定量化する技術だと言ってよい(その計算のしかたは 09 章〜11 章で学ぶ)。
2 つの統計
| 種類 | 何をするか | 例 |
|---|---|---|
| 記述統計 (descriptive) | 手元のデータそのものを要約する | この 1000 人の平均は 170.2 cm、ばらつき(標準偏差、02 章で定義)は 5.8 cm |
| 推測統計 (inferential) | 手元のデータから、その背後にある全体を推し量る | 日本人全体の平均は 169.8〜170.6 cm の間だろう(この幅の作り方と「95%」という信頼の度合いの意味は 11 章で学ぶ) |
02 章〜03 章が記述統計、09 章以降が推測統計である。 そして推測統計を可能にする言語が確率(04 章〜08 章)である。
なぜ確率が必要になるのか. 1000 人を選び直せば、平均は 170.2 ではなく 169.9 になるかもしれない。 選び方によって答えが揺れる。この揺れの大きさを見積もるには、 「揺れ」そのものを数式で扱う道具——確率——が要る。 これが「統計を学ぶのになぜ確率から始めるのか」の答えである。
2. 母集団と標本
定義
| 用語 | 意味 |
|---|---|
| 母集団 (population) | 本当に知りたい対象の全体。日本人全員、工場の全製品、ある薬を飲みうる全患者 |
| 標本 (sample) | 実際に観測した一部。測った 1000 人、抜き取った 50 個 |
| 標本サイズ (sample size) \(n\) | 標本に含まれる個体数 |
| 母数(パラメータ) | 母集団の特徴を表す数。母平均 \(\mu\)(ミュー。全員の平均)、母分散 \(\sigma^2\)(シグマ二乗。全員のばらつき。計算式は 02 章)など。未知 |
| 統計量 (statistic) | 標本から計算できる数。標本平均 \(\bar{x}\)(エックスバー。測った人の平均)、標本分散 \(s^2\)(測った人のばらつき)など。既知 |
| 標準偏差 | 分散の平方根 \(\sigma = \sqrt{\sigma^2}\)、\(s = \sqrt{s^2}\)。ばらつきを元の単位(cm なら cm)で表したもの(02 章) |
「母数」という言葉の注意. 日常語で「母数が大きい」と言うとき、多くの人は「分母」「全体の個数」の意味で使っている。 だが統計学の専門用語としての母数 = パラメータ = 母集団の特徴量(母平均など)であって、個数ではない。 個数を言いたいときは「母集団のサイズ」と言うのが安全である。
母集団は「無限」でもよい
工場の製品なら母集団は有限個(今日作った 10 万個)だが、 「この製造プロセスが生み出しうる製品すべて」と考えると、母集団は概念上の無限集合になる。
統計では後者の考え方をよく使う。 「今日のデータ」は「このプロセスから生まれうる無限のデータ」からの標本だ、と見なすのである。 A/B テストで「今週の来訪者 1 万人」を扱うときも、その 1 万人自体が目的ではなく、 その背後にある「このサイトに来る人一般」を知りたいのだから、この見方が自然になる。
3. どう取るか — ここで勝負がつく
無作為抽出 (random sampling)
母集団のどの個体も、等しい確率で選ばれる——くじ引きのように、誰が選ばれるかに偏りがない——ようにデータを取ること(確率の正確な定義は 04 章。ここでは「くじ引き」のイメージで十分)。 これが推測統計のすべての前提である。この前提が崩れると、以降の理論はまったく保証しなくなる。
なぜ無作為でなければならないのか. 統計の理屈は「標本が母集団の縮図になっている」ことを前提に組まれている。 縮図でないなら、標本平均が母平均の近くに来る保証がどこにもない。 どれだけ \(n\) を増やしても、偏った取り方をした標本は、偏ったまま精度(取り直したときの結果の揺れの小ささ)だけ上がる。 「大量のデータがあるから正しい」は誤りである。偏りは量では治らない。
主な抽出法
| 方法 | やり方 | 使いどころ |
|---|---|---|
| 単純無作為抽出 | 全員に番号を振り、乱数で選ぶ | 母集団リストがある |
| 層化抽出 | 年代・性別などで層に分け、各層から無作為に取る | 層ごとの構成比を保証したい。結果の揺れも小さくなる |
| クラスター抽出 | 地域などの塊を無作為に選び、その中は全数調査 | 全員のリストが無い。移動コストが高い |
| 系統抽出 | 名簿の \(k\) 番おきに取る | 実務で簡便。名簿に周期性があると危険(例: 夫婦が交互に並ぶ名簿を 2 番おきに取ると片方の性別しか選ばれない) |
代表的なバイアス(ここで統計は死ぬ)
| バイアス | 何が起きるか | 実例 |
|---|---|---|
| 選択バイアス | 選ばれ方が偏る | 電話調査 → 昼間家にいる人に偏る |
| 生存者バイアス | 消えたものが見えない | 「成功した起業家の共通点」— 同じことをして失敗した人は語らない |
| 無回答バイアス | 答えた人と答えない人が違う | 満足度調査 → 強い不満/強い満足の人だけ答える |
| 測定バイアス | 測り方自体が歪む | 体重を自己申告させる |
| 公表バイアス | 有意な結果だけが世に出る | 17 章で詳述 |
有名な失敗例: 1936 年アメリカ大統領選. ある雑誌が 236 万人という当時としては桁外れの規模で調査を行い、ランドン候補の勝利を予測した。 結果はルーズベルトの圧勝で、予測は完全に外れた。
原因は標本サイズではない。調査対象を電話帳と自動車登録名簿から取ったことである。 大恐慌下で電話や車を持てたのは比較的裕福な層——つまり共和党支持に偏った層だった。 一方、正しく層化抽出を行った別の調査は、たった 5 万人でルーズベルトの勝利を当てている。
236 万 vs 5 万で、5 万が勝った。 これが「取り方は量に勝る」の最も有名な実例である。
4. 変数の型 — 何を計算してよいかが決まる
データの「種類」によって、許される計算が違う。ここを間違えると、意味のない数字が出る。
尺度水準 (scale of measurement)
| 水準 | 意味 | 許される操作 | 例 |
|---|---|---|---|
| 名義尺度 | 単なるラベル。順序も距離もない | 一致/不一致、頻度 | 血液型、都道府県、郵便番号 |
| 順序尺度 | 順序はあるが間隔は不定 | 大小比較、中央値、順位相関 | 満足度(5 段階)、震度、学年 |
| 間隔尺度 | 間隔に意味がある。ただし 0 は「量が無い」という意味ではなく、便宜的に置いた基準点にすぎない | 加減、平均、標準偏差 | 摂氏温度、西暦 |
| 比例尺度 | 0 が「無い」を意味する | 加減乗除、比、変動係数 | 身長、重さ、金額、時間 |
(「許される操作」の列にある中央値・順位相関・平均・標準偏差・変動係数は 02 章〜03 章で定義する要約の方法。ここでは「その水準で意味を持つ計算の例」として名前だけ挙げている。)
具体的に何がまずいのか.
- 郵便番号(名義)の平均を計算しても、その番号の場所には意味がない。
- 摂氏 20 度は 10 度の「2 倍暑い」ではない(間隔尺度に比は無い)。摂氏 0 度は「熱が無い」ではないからである。 ケルビン(比例尺度)なら 200 K は 100 K の 2 倍で正しい。
- 満足度 1〜5(順序)の平均を取るのは厳密には反則。 「普通(3)」と「やや満足(4)」の差が、「やや満足(4)」と「満足(5)」の差と等しい保証がない。 ただし実務では平均を取ることが多い。取るなら「等間隔と仮定した」と自覚することが大事である。
離散と連続
| 型 | 意味 | 例 |
|---|---|---|
| 離散 (discrete) | 飛び飛びの値しか取らない | 人数、事故件数、サイコロの目 |
| 連続 (continuous) | 区間内の任意の値を取りうる | 身長、時間、電圧 |
この区別は 07 章(離散分布)と 08 章(連続分布)で決定的に効いてくる。 離散では「ちょうどこの値である確率」が意味を持つが、連続ではちょうどある値になる確率は 0 になる(08 章で詳述)。
説明変数と目的変数
| 呼び方 | 別名 | 役割 |
|---|---|---|
| 目的変数 \(y\) | 従属変数、応答変数、被説明変数 | 予測したい・説明したいもの |
| 説明変数 \(x\) | 独立変数、共変量、特徴量 | 予測に使うもの |
別名は分野ごとの呼び方の違いで、指すものは同じである(統計では従属/独立変数、機械学習では特徴量、医学・疫学では共変量と呼ぶことが多い)。
18 章以降の回帰分析はすべてこの枠組みで動く。
5. データの形
実務で扱うデータは、ふつう次の表の形をしている。
| 身長 (cm) | 体重 (kg) | 性別 | 満足度 | |
|---|---|---|---|---|
| 個体 1 | 172.3 | 65.1 | M | 4 |
| 個体 2 | 158.9 | 51.4 | F | 2 |
| 個体 3 | 180.1 | 78.2 | M | 5 |
- 行 = 個体(観測単位)、列 = 変数。この形を tidy data(整然データ)と呼ぶ。
- \(n\) 行 \(p\) 列の数の並びを「\(n \times p\) のデータ行列」と呼ぶ(行列 = 数を縦横に並べた表。その計算規則は 19 章の重回帰で必要になったときに説明する)。
欠測値 (missing data)
現実のデータには必ず穴がある。穴の埋め方(あるいは埋めないこと)は結論を左右する。
| 種類 | 意味 | 対応 |
|---|---|---|
| MCAR (完全にランダムな欠測) | 欠測がデータと無関係 | 削除しても偏らない |
| MAR (ランダムな欠測) | 欠測するかどうかが、観測できている他の変数の値で決まる(例: 高齢者ほど体重を答えない。年齢は分かっている) | 多重代入法(観測できている変数から欠測値を何通りも予測して埋め、結果を平均する方法)などで補える |
| MNAR (ランダムでない欠測) | 欠測理由が欠測値自身に依存 | 最も厄介。統計だけでは解けない |
MNAR の例. 収入調査で高所得者ほど答えない。 「答えなかった」こと自体が「高所得である」情報を持っているので、 残ったデータだけで平均を計算すると必ず過小評価になる。 これは計算では直せない。調査の設計段階でしか手が打てない。
6. 統計を使う手順(全体地図)
- 問いを決める — 何を知りたいのか。「何となくデータを見る」は最も失敗しやすい。
- データを取る — 無作為抽出。可能なら実験(24 章)。
- 記述する — まず必ず可視化する(02 章〜03 章)。異常値・入力ミスはここで見つかる。
- モデルを立てる — 背後にどんな確率的仕組みを仮定するか(04 章〜08 章)。
- 推定する — パラメータを推し量る(10 章〜11 章)。
- 検定する — 「偶然では説明しにくい」と言えるか(12 章〜17 章)。
- 予測・説明する — 回帰やモデル選択(18 章〜22 章)。
- 解釈する — 因果と相関を混同しない(24 章)。
手順 3 を飛ばしてはいけない. どんなに高度な手法も、 「ヒストグラムを描いたら 2 つの山があった」「散布図を見たら明らかに 1 点だけ外れていた」 といった事実の前では無力である。まず絵を描く。03 章のアンスコムの四重奏は、 これを一目で納得させるために作られた有名な例である。
7. よくある誤解の先回り
「データが多ければ多いほど正しい」——半分だけ正しい. 標本サイズ \(n\) を増やすと偶然によるばらつきは小さくなる(標本平均の揺れが \(1/\sqrt{n}\) に比例して減ることを 09 章で導出する)。 しかし偏り(バイアス)は \(n\) を増やしても一切減らない。 1936 年の 236 万人はまさにこれで失敗した。 ばらつきは量で治り、偏りは設計でしか治らない。
「統計的に有意 = 重要」——違う. 有意とは「偶然では説明しにくい」というだけであって、差の大きさは何も言っていない。 \(n\) を十分大きくすれば、実務上どうでもいい 0.01% の差でも有意になる(12 章)。 「偶然では説明しにくい」度合い(有意性、p 値)と、差そのものの大きさ(効果量)は別々に見る必要がある(どちらも 12 章で定義する)。
「統計は嘘をつく」——嘘をつくのは人であって統計ではない. ただし、同じデータから違う結論を作ることは実際に可能である(グラフの軸を切る、 都合のいい部分集団を選ぶ、検定を繰り返して当たりを引く)。 本シリーズは、そうした操作がどこで効くのかを明示していく。 読む側に回ったとき、それを見抜けるようになるのが本当の目標である。
8. まとめ
- 統計とは、一部(標本)から全体(母集団)を推し量り、その誤差を定量化する技術。
- ギリシャ文字 \(\mu, \sigma\)(母平均・母標準偏差)は未知の真値、ラテン文字 \(\bar{x}, s\)(標本平均・標本標準偏差)は計算できる値。この対応が全編を貫く。
- どう取ったかがすべてを決める。無作為抽出が崩れたら、その先の理論は保証しない。
- 変数の型(名義・順序・間隔・比例)で、許される計算が変わる。
- ばらつきは \(n\) で減る。偏りは \(n\) では減らない。