G検定(JDLA) 練習問題 7:強化学習/Q学習
強化学習における「Q学習(Q-learning)」の特徴について、正しいものはどれか。
- 実際の行動選択とは異なる方策に基づいて価値を更新する、オフポリシー型の手法である
- 教師あり学習の一種であり、あらかじめ正解ラベルが付与されたデータセットを用いて学習を行う
- Q学習では環境のモデル(状態遷移確率や報酬関数)を事前に完全に知っている必要がある
- Q学習は必ず連続値の状態・行動空間のみを対象とし、離散的な状態・行動には適用できない
- Q学習では価値関数を更新せず、方策関数を直接勾言法で最適化する手法である
Qraftユーザーの成績:難易度 Eランク(レーティング1088)・正答率 65%(15/23回正解)
レーティングは解いた人の実力と正誤から算出する難しさ(初期値1200)。ランクはその全問題中の順位(S+が最難関、F-が最易)
正解と解説を見る
正解は「エージェントが実際に選択した方策とは異なる方策(グリーディな方策)に基づいて価値を更新する、方策オフ型(オフポリシー)の手法である」です。
【正解の理由】
Q学習では、エージェント(=環境の中で行動を選ぶ主体)が実際に行動を選ぶ際には探索を含む方策を使う一方、Q値(行動価値)を更新する際には常にその時点で最も価値が高いと推定される行動を選ぶ「グリーディな方策」(=欲張り法、常に一番良さそうな選択肢を選ぶ方策という意味)を使います。このように実際に行動を選ぶ方策と価値更新に使う方策が異なる手法を「方策オフ型(オフポリシー、=行動の方針と学習の方針が別々という意味)」と呼び、Q学習はこれに分類されます。
【不正解の理由】
• 「教師あり学習の一種であり、あらかじめ正解ラベルが付与されたデータセットを用いて学習を行う」という説明は誤りです。Q学習は正解ラベルを使わず、環境との試行錯誤を通じて報酬を最大化するように学習する強化学習の手法です。
• 「Q学習では環境のモデル(状態遷移確率や報酬関数)を事前に完全に知っている必要がある」という説明は誤りです。Q学習は環境のモデルを必要としない「モデルフリー」(=環境の仕組みを事前に知らなくても、実際に行動した経験だけから学習できるという意味)な手法です。
• 「Q学習は必ず連続値の状態・行動空間のみを対象とし、離散的な状態・行動には適用できない」という説明は誤りです。基本的なQ学習はむしろ離散的な状態・行動空間を前提とする手法です。
• 「Q学習では価値関数を更新せず、方策関数を直接勾配法で最適化する手法である」という説明は誤りです。これは方策勾配法の特徴であり、Q学習は価値関数(Q値)そのものを更新していく手法です。