単純無作為抽出が推定に効く理由
この問題では、単純無作為抽出(SRS)が推定に効く理由を、よくある誤解「実現した標本は必ず代表的」と対比して確認します。要点は、推定量が期待値の意味で不偏であることです。
1. 単純無作為抽出とは
大きさ $N$ の母集団から大きさ $n$ の標本を、どの大きさ $n$ の部分集合も同じ確率で選ばれるように取る方法です。名簿に番号を振り、乱数で重複なく選ぶ手続きが典型です。本問では $N=8000$、$n=400$ です。各従業員が標本に入る確率は等しく、$n/N=400/8000=0.05$ です。
2. 不偏性は「今回の標本が縮図」ではない
残業時間の母平均を $\mu$、標本平均を $\bar{X}$ と書くと、SRSの下で
$$E[\bar{X}] = \mu$$
が成り立ちます。これは「何度も抽出を繰り返したときの標本平均の平均が母平均」という意味です。1回の抽出で得た400人が、年齢・職種・残業の分布まで必ず母集団と同じになる、という保証ではありません。たまたま繁忙期のラインが多い標本になることも、逆に少ない標本になることもあります。それが標本誤差です。
代表的という語の使い方
日常語の「代表標本」は、見た目が母集団に似ていることを指しがちです。統計学がSRSに期待するのはその保証ではなく、選び方に系統的な偏りを入れないことです。希望者だけ、特定工場だけ、という選び方では $E[\bar{X}]\neq\mu$ になり得ます。SRSはその系統的ずれを、抽出の段階では持ち込みません。
3. ばらつきは別問題
不偏であっても、1回の $\bar{X}$ は $\mu$ の周りにばらつきます。ばらつきの大きさはおおむね $\sigma/\sqrt{n}$ で、標本を大きくすると小さくなり得ます。精度(ばらつき)と正確さ(偏りのなさ)は別です。SRSは後者の土台を提供し、前者は $n$ や層化などで別途設計します。
4. 各選択肢の検討
- 「実現した標本は必ず縮図」→ 誤り。これが本問で避けたい誤解です。偶然の偏りは起こります。不偏性は期待値の性質です。
- 「1人でも母平均と一致」→ 誤り。$n=1$ でも不偏にはなり得ますが、ばらつきは大きく、実現値が母平均と一致するとは限りません。
- 「選ばれる確率をわざと変える」→ 誤り。等確率であることがSRSの定義です。確率を変える設計(不等確率抽出)は別の手法で、重み付け推定が必要になります。
- 「期待値が母平均に一致する(不偏)」→ 正しい。
- 「無作為割付と同じ」→ 誤り。抽出は誰を調べるか(母集団への一般化)、割付は誰にどの処理を与えるか(因果比較)です。乱数を使う点は似ていますが、目的が違います。
名簿漏れ(標本枠のカバレッジ誤差)や無回答があれば、SRSを名乗っても $E[\bar{X}]=\mu$ は崩れます。不偏性は「枠内で等確率に選び、全員が回答する」といった前提の下での話です。
5. 不偏性と一致性を混同しない
不偏性は有限の $n$ でも $E[\bar{X}]=\mu$ が成り立つ性質です。一致性は、$n$ を大きくしたときに $\bar{X}$ が $\mu$ に確率収束する性質です。どちらも「1回の標本が必ず縮図」ではありません。400人の残業分布が8,000人の分布に似て見えるかどうかは、その回の運にも依存します。似て見えることを目で確認するのは有用ですが、SRSの理論的根拠を「見た目の代表性」に置き換えてはいけません。
名簿にいない派遣社員が母集団に含まれるなら、枠の漏れが不偏性を壊します。抽出法の名前より、誰が選ばれる確率を持ったかを先に確認します。
したがって、SRSが推定に効く理由は、標本平均の期待値が母平均に一致するという不偏性にあります。