交絡因子の識別
この問題では、交絡因子を定義どおりに識別します。交絡因子は、関心のある説明変数と結果変数の両方に影響し得る第三の変数です。結果そのものや、単なるID、標本サイズではありません。
1. 交絡の構造
関心のある説明変数を $X$(リモート手当の有無)、結果を $Y$(離職)とします。交絡因子 $C$ は、$X$ と $Y$ の両方に矢印を持ち得る変数です。
$$X \leftarrow C \rightarrow Y$$
このとき、$C$ を無視して $X$ と $Y$ の関連を見ると、$C$ の効果が $X$ の効果に混ざります。L社では、通勤時間が長い人に手当が出やすいので、$C=$ 通勤時間は $X$ に影響します。同時に、長い通勤は負担や転居の誘因になり、離職 $Y$ にも関係し得ます。手当を受け取った人の離職率が低く見えても、手当の効果ではなく「もともと通勤が短い/長い層の違い」かもしれません。あるいは手当群に長距離通勤者が集まり、離職率が高く見える、という逆の歪みもあり得ます。
2. 交絡と中間変数・結果の違い
離職した月は、離職という結果の記録時点であり、手当支給の原因ではありません。結果の属性を交絡と呼ぶのは定義から外れます。社員番号は割り当てられたラベルで、通常は手当にも離職にも実質的な影響を持ちません。標本サイズは精度の話であり、交絡の有無を決めません。$n$ が大きくても交絡は残ります。
交絡因子のチェックリスト
- 説明変数より「上流」または同時に決まる第三の変数か
- 処理(手当)の受けやすさに関係するか
- 結果(離職)にも、処理を経由しない経路で関係し得るか
- 結果そのものや、処理の下流(中間変数)を交絡と取り違えていないか
中間変数(手当が満足度を上げ、満足度が離職を下げる、の満足度)を「交絡として調整」すると、知りたい効果まで消すことがあります。本問の通勤時間は上流の候補であり、中間変数ではありません。
3. 観察研究での含意
通勤時間を測って回帰に入れれば、その交絡は弱められます。しかし未測定の交絡(家族の転勤、職場の人間関係)は残ります。交絡因子を正しく指名できることは、後の調整分析の出発点です。指名を間違えると、無関係な変数を入れたり、結果を説明変数側に置いたりします。
4. 各選択肢の検討
- 「離職した月が交絡」→ 誤り。結果の時点であり、手当の原因ではありません。
- 「通勤時間が手当と離職の両方に関係し得る」→ 正しい。
- 「社員番号が交絡」→ 誤り。識別子は通常、両方の原因になりません。
- 「離職そのものが交絡」→ 誤り。離職は結果変数です。
- 「交絡は $n$ の別名」→ 誤り。交絡は変数間の構造、$n$ は標本の大きさです。
5. 交絡を外すと関連が消えることもある
通勤時間で層別すると、同じ通勤時間の中では手当と離職の関連が弱まる、という結果もあり得ます。そのときは、見かけの関連の多くが通勤時間経由だった、と読めます。逆に層別しても関連が残るなら、手当固有の経路が残っている可能性があります。どちらにせよ、観察研究の層別・回帰は「候補の交絡を1つ処理した」段階です。
社員番号や離職月を交絡と呼ぶ誤りは、定義の「両方に影響する第三の変数」を外しています。結果の属性や無意味なIDをモデルに入れても、交絡の制御にはなりません。
手当の支給ルールが通勤時間に依存している、と問題文が明示している点が識別の手がかりです。ルールが分からなくても、通勤時間が長い人ほど手当を受けやすい、という関連が見えれば交絡の候補になります。定義に当てはまる変数を選ぶ問題です。
したがって、交絡因子の候補として最も適切なのは通勤時間です。