選択バイアスの識別
この問題では、選択バイアスを、誰が標本に入る機会を持ったかという観点から識別します。アプリのヘビーユーザー限定という場面で見ます。
1. 対象母集団と実際の標本枠
発表の対象は「登録ユーザー全体」の満足度です。しかし調査票は週5回以上起動した人にしか届きません。起動が週1回の人、登録しただけで使っていない人は、選ばれる確率が0です。標本枠が対象母集団より狭いとき、枠の外はどれだけ乱数を使っても入りません。これがカバレッジの欠けであり、選択バイアスの典型です。
2. なぜ推定がずれるか
ヘビーユーザーは、アプリに不満があれば既に削除している可能性が低く、機能を使いこなして満足が高い層に偏りやすいです。逆に、不満だが習慣で開いている層、という偏りもあり得ます。いずれにせよ、満足度が利用頻度と相関するなら、ヘビーユーザーの平均は全体の平均と系統的にずれます。ずれの向きはデータから自動修正されません。
選択バイアスと他のバイアスの切り分け
- 選択バイアス:誰が標本に入るかが、推定したい変数と関係して偏る
- 無回答バイアス:枠には入ったが答えない人が、内容と関係して偏る
- 測定バイアス:入って答えた人への聞き方・機器が系統的にずれる
本問の主問題は、調査票を送る前に低頻度層を除外していることです。回答率が高くても、送っていない人の情報は入りません。
3. 件数では消えない
ヘビーユーザーが1万人答えても、それは「よく使う人の1万人」です。標本誤差(偶然のばらつき)は小さくなり得ますが、選択による系統的ずれは残ります。大標本は精密な誤答にもなり得ます。
4. 各選択肢の検討
- 「測定機器の系統的誤差」→ 誤り。機器の校正は測定バイアスです。本問は誰に送ったかの問題です。
- 「ヘビーユーザーから送っているので無作為抽出」→ 誤り。無作為抽出は対象母集団の枠の中で等確率に近づける操作です。枠をヘビーユーザーに狭めた時点で、全体に対するSRSではありません。
- 「件数が多ければ偏りは消える」→ 誤り。選択バイアスは $n$ では消えません。
- 「低頻度層が入れず、全体への推定が系統的にずれる選択バイアス」→ 正しい。
- 「反復不足の実験」→ 誤り。これは標本調査の選択の問題であり、実験計画の反復ではありません。