抽出法と母比率区間と一般化の限界
分野: データ収集
本問は統合問題です。つなぐ論点は、(1) 抽出法(任意参加=非確率標本)、(2) 母比率CIの計算が表すもの、(3) 一般化の限界(選択バイアスはnでは消えない)です。計算自体は正しくても、推定対象がすり替わると報告書は誤りになります。
1. 抽出法の診断
メルマガ読者のうち任意参加した400人は、全顧客リストからの無作為抽出ではありません。読まない顧客、開封しない顧客、答えない顧客が系統的に抜けます。これはボランティア標本です。追加のモデルを置かない限り、任意参加標本には確率抽出分布もデザインベースの95%被覆も保証されません。層化抽出でも系統抽出でもありません。
2. 区間が表すもの
回答者400人の標本比率は22%です。無作為標本を仮定して機械的に計算した正規近似幅は約±4ポイントですが、この幅は任意参加による選択バイアスを含まず、全顧客に対する95%被覆を保証しません。検算すると $\hat{p}=88/400=0.22$、$SE=\sqrt{0.22\times0.78/400}\approx0.0207$、$1.96\times SE\approx0.041$ で [0.179, 0.261] は公式の適用として妥当です。しかしWald区間の前提は、その400人が目標母集団からの無作為標本に近いことです。この区間は回答者400人の記述と、無作為抽出を仮定したモデル上の区間にすぎません。カバレッジ誤差・無回答バイアスは幅に入りません。
3. 一般化
nを増やしても、同じ募集経路なら選択バイアスの方向は残り、区間は狭くなるだけです。狭いことは、全顧客を捉えていることを意味しません。全国の全顧客へ書くなら、無作為抽出か、少なくとも既知の枠からの確率標本と、無回答の感度分析が必要です。
4. 3論点の接続
CIの公式を覚えても、抽出が目標母集団と結び付いていなければ「推定したp」の意味が変わります。正しい報告書は「回答者400人の標本比率は22%。無作為標本を仮定して機械的に計算した正規近似幅は約±4ポイントだが、この幅は任意参加による選択バイアスを含まず、全顧客に対する95%被覆を保証しない」です。
5. 選択肢の検討
- nが大きいから全国OK → 誤り。偏りはnで消えません。
- 0.20を含むから真値は20% → 誤り。含むことは「その値が矛盾しない」程度です。
- 層化抽出である → 誤り。任意参加です。
- 回答者400人の記述と、無作為抽出を仮定したモデル上の区間にすぎず全顧客へは一般化できない → 正しい。
- 回答者が多ければ選択バイアス消滅 → 誤り。同じ自己選択が残ります。
信頼区間は「正しく抽出された標本の」誤差
幅が狭いことと、狙った母集団を捉えていることは別です。まず枠と回答過程を書いてから区間を貼る。
無回答を減らす、読者と非読者の補助情報で校正する、などは改善策ですが、本問の報告書文面はすでに一般化が過大です。
6. 報告書の書き直し例
誤:「全国の全顧客の購入意向は18〜26%。」正:「メルマガ調査の回答者400人では申込意向が22%(正規近似の95%CI 18〜26%)。ただし任意参加のため、非読者・非回答者を含む全顧客の母比率とは限らない。」
区間の公式は確率標本の標本誤差用です。任意参加による選択バイアスは幅に入りません。n=400でSEが約2ポイントと小さいこと自体は、無作為抽出を仮定した計算上の幅が狭いというだけです。選択バイアスは大数の法則では消えません。
層化・系統・集落の名前を当てはめる問題ではなく、目標母集団と枠の不一致を指摘する統合問題です。016の計算力を、デザインの限界に接続します。
統合の採点ポイントは、任意参加という抽出、機械的に計算した区間が選択バイアスを含まないこと、全顧客への一般化が目標母集団のすり替えであること、の3点です。0.20を含むことは真値が20%である証明ではなく、層化抽出でもありません。選択バイアスは回答者を増やしても消えません。
したがって、最も適切なのは回答者400人の記述と無作為抽出を仮定したモデル上の区間にすぎず、全顧客へは一般化できない、という指摘です。