強化学習における探索・活用トレードオフ
正解
ε-greedyなどを用い、大部分は現在の最良広告を活用しつつ、一部で未知広告を探索する。
正解になる理由
ε-greedyは強化学習の基本戦略で、既知の最良行動を活用しつつ新しい選択肢も探索します。本問のように最良広告が分かっている一方で未知広告もある場合、大部分を活用・一部を探索するバランスが適切です。具体的な割合は条件から一意に決まらないため、本質は「活用と探索の両立」にあります。
各誤答がなぜ誤りか
- 選択肢4: 純粋活用は新しい最適解を見逃し、環境変化に対応できない。
- 選択肢1: 均等配信は機会損失が大きく、ビジネス価値を著しく低下させる。
- 選択肢3: 完全ランダムは既知の良い選択肢を無視し、不必要な損失を招く。