抽出法の選択
分野: データ収集
推定目的に対して抽出法を選ぶ応用問題です。ポイントは「地域差が大きい」「全地域を回れる」という2条件です。手続きの名前を暗記するのではなく、推定の偏りと分散がどう変わるかで判断します。
1. 推定の目標
目標は全国会員の母平均です。単純無作為抽出(SRS)でも不偏推定量は作れますが、層内が均質で層間差が大きいときは、層化抽出の方が同じ $n$ でも標準誤差を小さくしやすいです。
2. 層化抽出が効く理由
層化では、既知の異質性(地域)を設計に取り込みます。各層から確実に標本を取るので、地方が偶然ほとんど入らない、という実現を避けられます。層内が均質なら、層内分散の加重和である推定分散が小さくなります。配分計算(ネイマン配分)は本問では不要です。
3. 他法が劣る理由
便宜抽出とボランティアは選択バイアスで、推定量の期待値が母平均からずれ得ます。1市だけの集落抽出は、その市が全国を代表しない系統的偏りのリスクが大きく、集落内相関が正なら精度も落ちやすいです。系統抽出は名簿に周期性があると、キャンペーン週だけが過大・過小に入ります。
4. 選択肢の検討
- 旗艦店の便宜抽出 → 誤り。都市・高関与層に偏り、全国平均の不偏性も期待できません。
- 地域を層とする層化抽出 → 正しい。異質性を層に取り込み、全地域から標本を確保できます。
- 1市の集落抽出 → 誤り。費用は安いことがありますが、本問は全地域訪問が可能で、精度が優先です。
- 周期と重なる系統抽出 → 誤り。周期構造がある名簿では系統抽出が危険です。
- ボランティア標本 → 誤り。協力しやすい人に偏り、無回答・自己選択が残ります。
層化は「層内均質・層間異質」のときに推定精度を上げやすい
無作為抽出は実現標本が必ず代表的、という意味ではありません。期待値の意味で偏りを小さくする設計です。
因果(施策の効果)を見たいなら抽出ではなく無作為割付が主役です。本問は記述母数の推定なので、標本のカバー範囲と層化が要点です。
5. 推定が壊れる経路を明示する
便宜抽出は、来店できる時間帯・旗艦店ブランド選好に標本が偏り、満足度の期待値が全国会員とずれます。ボランティアは「声を上げたい人」が過剰に入り、無回答バイアスと同型です。nを増やしても偏りの向きは残り、区間は誤った中心のまわりで狭くなるだけです。
1市の集落抽出は、その市の産業構造や競合が全国と違うとき、偏りが残ります。集落内の会員が似ている(級内相関が正)と、実効標本サイズが名目のnより小さく、精度も落ちやすいです。系統抽出は等間隔で便利ですが、名簿が週次キャンペーンと同じ周期だと、キャンペーン週だけが過大に入り点推定が振れます。
層化は因果の交絡を消す方法ではありません。本問の目標は母平均の推定精度です。施策の効果を見るなら無作為割付が別途必要です。
抽出法の選択はコストと偏りと分散の三点です。本問は予算が全地域を許すので、コスト制約で集落に逃げる理由がありません。層化は既知の異質性を分散から取り除き、偏りも「地方がゼロ件」という実現を防ぎます。SRSでも不偏ではありますが、同じnなら層化の方が精度を上げやすい、というのが2級で押さえる比較です。
層の切り方を誤ると層化の恩恵は消えます。地域差が大きいと分かっているのに年齢だけで層化しても、地域の偏りは残ります。本問は事前情報どおり地域を層に取るのが要点です。比例割当かネイマン配分かは2級の本問では不要です。まずは『既知の異質性を層にする』『全層から取る』の2点を満たす設計を選べば十分です。
正解は地域層化です。旗艦店・1市集落・周期系統・ボランティアは、いずれも全国会員の母平均に対して期待値がずれるか、既知の地域差を設計に取り込めていません。
したがって、最も適切なのは地域を層とする層化抽出です。