G検定(JDLA) 練習問題 61:強化学習
強化学習や多腕バンディット問題における「探索と利用のトレードオフ」に関する説明として、正しいものはどれか。
- 過去の経験から最も良いとわかっている行動を選択することと、まだ評価が定まっていない未知の行動を試すことのバランスをとる課題。
- 学習済みのモデルを別のタスクに適用する際に、新しいデータを学習させる割合と、過去のモデルの知識を保持する割合を調整する課題。
- 複雑な環境下で学習を進める際、報酬の設計を細かく設定することと、最終的な目標のみを与えてAIに試行錯誤させることのトレードオフ。
- 限られた計算資源の中で、より精度の高い行動を選択するために計算時間をかけるか、精度を犠牲にして即座に行動を決定するかの課題。
- エージェントが環境から受け取る報酬を最大化するために、短期的な報酬を重視するか、長期的な報酬の合計を重視するかのバランスの課題。
正解と解説を見る
正解:過去の経験から最も良いとわかっている行動を選択することと、まだ評価が定まっていない未知の行動を試すことのバランスをとる課題。
強化学習における「探索と利用のトレードオフ(ジレンマ)」とは、過去の経験から得た最良の行動をとることと、未知の可能性を探る行動をとることのバランスに関する課題であり、正解は該当する説明です。
【正解の理由】
エージェントが報酬を最大化するためには、既知の最も良い行動(利用:Exploitation)だけを取り続けると局所解に陥る可能性があり、新しい行動を試す(探索:Exploration)ことも必要不可欠となるためです。
【不正解の理由】
• 「新しいデータを学習させる割合と、過去の知識を保持する割合」という説明は、破滅的忘却や転移学習における課題であり誤り
• 「報酬の設計を細かく設定することと、最終的な目標のみを与えることのトレードオフ」という説明は、報酬成形(Reward Shaping)に関する課題であり誤り
• 「計算時間をかけるか、精度を犠牲にして即座に行動するか」という説明は、推論速度と精度のトレードオフであり誤り
• 「短期的な報酬を重視するか、長期的な報酬を重視するか」という説明は、割引率(Discount Factor)の設定に関する課題であり誤り