無作為割付と群差の区間・p値から因果を判断する
分野: 検定
本問は統合問題です。つなぐ論点は、(1) 無作為割付による因果の識別、(2) 差の信頼区間、(3) p値です。どれか一つだけでは不十分で、3つを同じ結論に整合させる必要があります。
1. デザイン:無作為割付
希望に関係なく割り付けているので、観察研究ではありません。無作為割付は交絡を必ず同一にするのではなく、既知・未知の背景因子の系統的偏りを避け、平均的に群間を均衡させます。これにより、後で見る平均差を「処理の効果」として解釈する根拠が生まれます(外的妥当性は別問題)。
2. 推定:差のCI
群ごとの区間 [65.1,71.7] と [58.0,64.4] は重なりませんが、本問の判定の本体は差の区間 [2.6, 11.8] です。0を含まないので、有意水準5%の両側検定と整合します。群CIの非重なりは参考情報であり、因果の定義ではありません。
3. 検定:p値
p=0.002 は「$H_0:$ 平均差0 が真のとき、これ以上に極端な差が出る確率」が0.2%という意味です。効果が大きいこと(実質的重要性)でも、$H_0$ が真である確率でもありません。n=80+80 なので、中程度の差でもpは小さくなり得ます。実質的な大きさは差7.2点と区間の位置で判断します。
4. 3論点の接続
識別(割付)がなければ、たとえpが小さくても交絡の可能性があります。区間とpがあっても、割付が観察なら因果は弱いです。本問は識別・推定・検定が揃っているので、「この実験の条件下で平均点を上げた」と言えます。一般の社員全体や別企業への外挿、長期効果、欠測がある場合は追加の議論が必要です。
5. 選択肢の検討
- 割付+差のCIが0を含まない+p小 → 正しい。3要素を接続しています。
- 群CIの非重なりだけが因果根拠 → 誤り。重なりは有意性の十分条件に近く、因果の識別ではありません。
- 観察研究なので因果不可 → 誤り。無作為割付の実験です。
- 全員が7点改善 → 誤り。平均の話であり、個人差があります。
- pが小さい=効果量大=実務必須 → 誤り。pは証拠の強さ、効果量と実務的重要性は別です。
因果はデザイン、有意性は差の区間とp、大きさは点推定
図の右パネルで0を跨がないことを確認し、左の群CIだけで因果を語らない。割付が無作為であることが前提です。
無作為割付でも、割付後の脱落・非遵守・測定バイアスは因果解釈を損ないます。本問は欠測なし・割付どおり実施、という単純化です。
6. 3論点を外すとどう誤るか
割付だけ見て区間を無視すると、差が誤差の範囲かもしれません(本問では0を含まないので実際は大丈夫ですが、手順として不完全)。区間とpだけ見て観察研究だと、交絡が残ります。群CIの非重なりだけを因果と呼ぶと、識別(誰が処理を受けたか)を飛ばします。
右図の破線0より右に差の区間が丸ごとあることが、有意性の直接の視覚です。左図の群CIは平均の位置を示す補助です。p=0.002は同じ帰無仮説の別表現で、区間が0を含まないことと整合します。
平均7.2点は、テストの配点や合格線と比較して初めて実務的重要性を語れます。統計的有意と実質的有意を混ぜない、が統合問題の仕上げです。
無作為割付は「この標本内の因果」を強くします。全社員・他社への外的妥当性は、対象者の選び方(抽出)の問題として残ります。
統合の採点ポイントは、デザイン・区間・pの3語が結論に入っているかです。群CIの非重なりは補助、観察研究と言い切るのは事実誤認、全員が7点改善は平均と個人の混同、p=効果量は定義の誤りです。実験条件下での平均効果、と外的妥当性を分けて書くと、過不足のない解釈になります。
したがって、最も適切なのは無作為割付と差のCI・pを組み合わせた因果判断です。