Qraft(クラフト) 資格・学習クイズアプリ

G検定(JDLA) 練習問題 44:強化学習:方策勾配法

強化学習における「方策勾配法(Policy Gradient)」の特徴として、正しいものはどれか。

  1. エージェントが取るべき行動の確率分布である方策(=ポリシー)をパラメータ化し、報酬が最大となるように直接更新する手法。
  2. エージェントが各状態で得られる将来の価値を正確に推定し、その価値関数のテーブルをひたすら更新していくオーソドックスな手法。
  3. エージェントが環境の完全な物理モデルをあらかじめ構築し、シミュレーションを通じて最適な行動を一意に決定するモデルベースな手法。
  4. エージェントが過去の成功体験のみを記録した大容量のメモリを用意し、そこから最も類似した状況の行動を直接コピーする安全な手法。
  5. エージェントが人間の専門家の操作履歴を教師データとして与えられ、それと全く同じ行動を再現するように誤差を最小化していく手法。

Qraftユーザーの成績:難易度 Dランク(レーティング1128)・正答率 75%(9/12回正解)
レーティングは解いた人の実力と正誤から算出する難しさ(初期値1200)。ランクはその全問題中の順位(S+が最難関、F-が最易)

正解と解説を見る
正解:エージェントが取るべき行動の確率分布である方策(=ポリシー)をパラメータ化し、報酬が最大となるように直接更新する手法。

強化学習において、方策(どの状態でどの行動を取るべきかというルール・確率分布)をニューラルネットワークなどで直接パラメータ化し、期待報酬が大きくなる方向にパラメータを更新していく手法を方策勾配法(Policy Gradient)と呼びます。

【正解の理由】
エージェントの方策を直接関数で表現・パラメータ化し、それを直接最適化(更新)していくという方策勾配法の特徴を正しく説明しているため正解です。

【不正解の理由】
• 「エージェントが各状態で得られる将来の価値を正確に推定し、その価値関数のテーブルをひたすら更新していくオーソドックスな手法」という説明は、Q学習などの価値ベース(行動価値関数ベース)の手法であり誤り
• 「エージェントが環境の完全な物理モデルをあらかじめ構築し、シミュレーションを通じて最適な行動を一意に決定するモデルベースな手法」という説明は、モデルベース強化学習や動的計画法などの説明であり、モデルフリーな方策勾配法の説明として誤り
• 「エージェントが過去の成功体験のみを記録した大容量のメモリを用意し、そこから最も類似した状況の行動を直接コピーする安全な手法」という説明は、メモリベースのエピソード記憶や模倣学習に近い概念であり誤り
• 「エージェントが人間の専門家の操作履歴を教師データとして与えられ、それと全く同じ行動を再現するように誤差を最小化していく手法」という説明は、模倣学習(行動クローニングなど)の説明であり、報酬に基づく方策勾配法とは異なるため誤り

← 前の問題問題一覧次の問題 →
アプリで解いてレーティングを上げる(無料・登録不要)