系統抽出の周期性リスク
この問題では、系統抽出が便利な一方で、名簿に周期があると推定が壊れるリスクを、工場のシフト周期という具体例で識別します。
1. 系統抽出の手続き
大きさ $N$ から $n$ 件取るとき、間隔 $k \approx N/n$ を決め、1から $k$ の乱数で開始位置 $r$ を選び、$r, r+k, r+2k, \ldots$ と等間隔に取ります。本問では $N=6000$、$n=200$ なので $k=30$ です。開始だけ乱数にすれば、多くの場合、各記録が選ばれる機会を持ち、SRSに近い簡便法として使われます。名簿を全部乱数ソートするより実装が楽です。
2. 周期と間隔が噛み合うとき
記録が「A, B, C, A, B, C, …」と3件周期で並んでいるとします。抽出間隔 $k=30$ は3の倍数です。開始がAなら、30件先もA、その先もA、というように同じシフトだけが標本に入ります。開始がBならBばかりです。夜勤Cの不良率が日勤と違う(照明、疲労、検査員の交代)なら、標本の不良率は母集団の不良率から系統的にずれます。これが周期性リスクです。
$$k \text{ が周期 } 3 \text{ の倍数} \Rightarrow \text{選ばれるシフトが開始位置で固定される}$$
系統抽出は「等間隔」ゆえに周期に弱い
SRSなら、A・B・Cが標本に混ざるのが普通です。系統抽出は並び順の規則をそのまま標本に転写します。並びがほぼランダムなら害は小さいですが、シフト・曜日・番地の偶奇など、人が作った名簿は周期を持ちやすいです。開始を乱数にしても、1つの系統の内部では周期が保存されます。開始がAならAばかり、という偏りは、その回の標本では消えません。
3. 実務での対処
間隔を周期と互いに素に近い値にする、名簿を抽出前に乱順へ並べ替える、層化してシフトを層にする、などが考えられます。本問で問われているのは計算ではなく、「周期×等間隔」が特定グループの過剰抽出になる、という診断です。
4. 各選択肢の検討
- 「確率抽出ではないので推定できない」→ 誤り。無作為開始の系統抽出は確率抽出の一種です。問題は周期との共鳴であり、「推定が定義できない」ことではありません。
- 「周期と重なると特定シフトばかり選ばれ、推定がずれ得る」→ 正しい。
- 「$n$ を増やせば偏りは必ず消える」→ 誤り。$k$ が周期の倍数のまま $n$ を増やすと、同じシフトをさらに厚く取るだけで、欠けたシフトは入りません。偏りは標本誤差ではなく系統的誤差です。
- 「目的は無作為割付」→ 誤り。系統抽出は標本の選び方です。処理の割付ではありません。
- 「最初の1件を固定すればよい」→ 誤り。開始を固定すると、どの系統を取るかが主観や都合に依存し、偏りが増えます。開始の無作為化は必要ですが、それだけでは周期リスクは消えません。
5. 開始の無作為化が守ることと守らないこと
1から30の乱数で開始位置を選べば、30本の系統のどれかが等確率で選ばれます。周期3と間隔30が共鳴している場合、その30本は「Aばかり」「Bばかり」「Cばかり」のグループに分かれます。無作為開始は、どのグループを取るかを公平にしますが、選ばれた系統の内部が単一シフトであることは変えません。公平なくじで偏った系統を引く、という構造です。
名簿を抽出前にシャッフルすれば周期は壊れ、系統抽出はSRSに近くなります。シフトを層にして層内で系統抽出するのも有効です。警戒すべきなのは、並び順を信じたまま等間隔を適用することです。
したがって、最も警戒すべきは、抽出間隔がシフト周期と重なり、特定シフトばかりが選ばれることです。