層化抽出を選ぶ場面
この問題では、層化抽出を選ぶ典型的な場面を、層内均質・層間異質という設計の狙いで判断します。配分の最適化計算(ネイマン配分)は使いません。
1. 層化抽出とは
母集団を、既知の属性で重ならない層(strata)に分け、各層の中で標本を取る方法です。本問では「区」が層です。全区から何世帯かずつ取るため、ある区が標本からすっぽり抜ける、という偶然を防げます。単純無作為抽出では、たまたま特定の区が厚く、別の区が薄くなることがあります。
2. なぜ精度が上がりやすいか
利用率が区によって違うなら、区を無視した全体のばらつきには「区内のばらつき」と「区間のばらつき」が混ざります。層化して各区から取る設計では、区間の差は層の重み(各区の世帯数の比)として確定的に入れられます。推定の誤差に効くのは主に層の中のばらつきです。区内の世帯が似た利用率を持ち、区の間で利用率が違うとき、層内分散は小さく、同じ $n$ でも全体推定の精度が上がりやすくなります。
層化が効く条件
- 層内は均質:同じ区内の世帯は、利用率が比較的近い
- 層間は異質:区によって利用率が違う
- 層は事前に分かる:住民基本台帳など、抽出前に区が分かる
層が結果と無関係(どの区も利用率が同じ)なら、層化の精度上の利点は小さく、実施の手間だけが残ることがあります。
3. 比例割当という実務
各層の標本サイズを層の大きさに比例させる方法を比例割当と呼びます。区の世帯数が多いほど多く調べます。2級の範囲では、この考え方で十分です。分散が層ごとに大きく違うときに標本を厚い層へ寄せるネイマン配分は、準1級寄りの最適化であり、本問では使いません。層化の価値は「ネイマンを使うこと」ではなく、「異質な層を設計に入れること」です。
4. 各選択肢の検討
- 「層内均質・層間異質なら精度を上げやすい」→ 正しい。本問の区別利用率の見込みにそのまま対応します。
- 「ネイマン配分を使わなければ層化は無意味」→ 誤り。比例割当の層化でも、層をまたぐ偶然の偏りを抑えられます。ネイマンは必須ではありません。
- 「無回答バイアスが消える」→ 誤り。層化は抽出の設計です。届いた調査票に答えない人が、関心の低い層に偏れば、偏りは残ります。
- 「全数調査と同じ精度が常に保証」→ 誤り。層化は標本調査の一種です。精度は上がり得ますが、全員を調べたことにはなりません。
- 「層の大きさが違うと抽出してはならない」→ 誤り。層の大きさが違うのは普通です。比例割当はむしろその違いを明示的に使います。
層化は「区ごとの利用率」を副次的に報告したいときにも向きます。単純無作為では、小さい区の標本が極端に少なくなり、区の推定が不安定になり得ます。
5. 単純無作為抽出と比べて何が変わるか
単純無作為抽出でも、長期的には各区から取る人数の期待値は区の大きさに比例します。しかし1回の調査では、小さい区が極端に少なくなることがあります。層化して比例割当にすると、その偶然を設計で止められます。費用が限られているときこそ、ばらつきの大きい「区をまたぐ成分」を誤差に残さない方が、同じ予算で全市の利用率を安定して推定できます。
層化は無回答や誘導質問を直しません。区の中で答えない人が偏れば、層化していても全市推定はずれます。抽出設計と測定・回収設計は分けて点検します。
層の切り方を誤ると、層化の利点は消えます。例えば利用率と無関係な「世帯主の名字の五十音」で層を切っても、層内は均質になりません。本問の区は、住宅形態と利用率の両方に関係し得ると事前に見込まれているので、層として意味があります。
したがって、層化を選ぶ理由は、層内が均質で層間が異質なときに、層をまたいだばらつきを設計で抑えやすいことです。