フィッシャー3原則:無作為化の役割
この問題では、無作為化(無作為割付)の役割を、交絡を必ず同一にするという過剰な主張から切り離して理解します。正しい表現は、系統的偏りを避け、平均的に均衡させることです。
1. コールセンターでの交絡
契約率はスクリプトだけでなく、オペレーターの経験、時間帯(夜間は検討が短い)、商品の種類にも依存します。経験の長い人にAを固定すると、A群の契約率が高くても、スクリプトの効果なのか経験の効果なのか分かりません。これが交絡です。乱数でA/Bを割り当てると、経験年数も時間帯も、一方のスクリプトへ意図的に寄せられません。
2. 「必ず同じ」ではない
80件の着信を乱数で分けると、A群の平均経験年数が7.2年、B群が6.5年、という差は起こり得ます。無作為化は、その差をゼロに固定する装置ではありません。しかし「経験が長い人はA」という規則がないため、差の向きは偶然に左右され、繰り返せば平均的には均衡します。未知の要因(その日の体調、顧客の属性)についても、測っていなくても同じ論理が働きます。これが無作為化の強みです。
平均的均衡と、実現した1回の実験
- 保証すること:割付規則が処理と交絡を結び付けない。期待値の意味で群間の背景が釣り合う
- 保証しないこと:1回の実験で経験年数・性別・時間帯が数値まで一致する
小さな実験では偶然の不均衡が目立ちます。そのときは層別無作為化(経験年数で層を切ってから層内で乱数割付)や、共変量の確認を併用します。それでも「必ず同一」ではありません。
3. 反復・局所管理との分担
無作為化は偏りの向きを偶然にします。反復は、その偶然も含めた誤差を見積もります。時間帯が契約率を大きく動かすと分かっているなら、時間帯をブロックにしてブロック内でA/Bを無作為化するのが局所管理です。無作為化はブロックの代わりにはなりませんが、ブロックに入れなかった要因の系統的偏りを平均的に薄めます。
4. 各選択肢の検討
- 「交絡因子の値を必ず同じに揃える」→ 誤り。本問が避けるべき誤解です。実現値の一致は保証されません。
- 「系統的偏りを避け、平均的に均衡させる」→ 正しい。
- 「標本サイズを減らす計算技法」→ 誤り。標本サイズ設計は別問題です。無作為化は偏りの制御です。
- 「観察研究でも因果が識別できる」→ 誤り。無作為化は処理を割り当てる実験の操作です。観察研究にラベルを貼るものではありません。
- 「応答率を100%にする」→ 誤り。無回答は別問題です。割付が無作為でも、後から応答が偏ればバイアスは生じます。
5. 経験年数で層を切ってから割付する
経験が契約率を大きく動かすと分かっているなら、経験年数で層(またはブロック)を作り、層の中でA/Bを乱数割付します。これは局所管理と無作為化の併用です。層内では経験が近く、層をまたいだ経験差は比較の誤差から外れます。それでも「経験年数が分まで一致」は保証されません。無作為化の文言は、常に平均的均衡です。
「経験の長い人にA」は、層化ではなく処理と交絡を結び付ける規則です。層化は比較の場を揃えること、希望や勤続で処理を決めることは選択です。名前が似ていても役割は逆です。
1回の割付で経験年数に差が出ても、それは無作為化の失敗ではありません。失敗は、差が規則から生まれたときです。「長い人にA」は規則、「乱数でA/B」は偶然です。報告では、割付後の経験年数の分布を表で確認し、大きな不均衡があれば層別解析を検討します。
無作為化の成功は「群の平均が小数点まで一致したか」ではなく、「割付規則が処理と背景を結び付けていないか」で判定します。藤沢の例では、着信ごとの乱数がその規則です。
したがって、無作為化の役割は、交絡を必ず同一にすることではなく、系統的偏りを避けて群間差を平均的に均衡させることです。