G検定(JDLA) 練習問題 60:深層学習アーキテクチャ
深層学習アーキテクチャの一つである「GRU(Gated Recurrent Unit)」に関する説明として、正しいものはどれか。
- LSTMと同様に時系列データを扱うが、入力ゲートと忘却ゲートを「更新ゲート」として統合し、パラメータ数を削減した構造を持つ。
- CNNをベースにした時系列モデルであり、局所的な特徴抽出に特化しているため、パラメータ数を大幅に削減しつつ高速な学習を行う。
- LSTMよりもさらに複雑なゲート機構を追加することで、より長期間の文脈を記憶できるように設計された大規模な言語モデルである。
- Transformerで提案された自己注意機構を応用したものであり、時系列データを並列処理することで学習速度を向上させている。
- RNNの弱点である勾配消失を防ぐために、活性化関数としてステップ関数を導入し、計算コストを最小限に抑えたシンプルな構造を持つ。
正解と解説を見る
正解:LSTMと同様に時系列データを扱うが、入力ゲートと忘却ゲートを「更新ゲート」として統合し、パラメータ数を削減した構造を持つ。
深層学習における時系列モデル「GRU(Gated Recurrent Unit)」は、LSTMの構造を簡略化し、パラメータ数を減らしつつ同等の性能を目指したモデルであり、正解はこの内容の通りです。
【正解の理由】
GRUは、LSTMに存在する「入力ゲート」「忘却ゲート」「出力ゲート」のうち、入力と忘却の役割を「更新ゲート」に統合するなどの工夫により、計算コストを下げたRNN(再帰型ニューラルネットワーク)の一種です。
【不正解の理由】
• 「CNNをベースにした時系列モデル」という説明は誤り(GRUはRNNの派生であり、CNNベースではない)
• 「より長期間の文脈を記憶できるように設計された大規模な言語モデル」という説明は誤り(ゲート機構を追加して複雑化したのではなく、簡略化している)
• 「自己注意機構を応用したもの」という説明は、Transformerに関するものであり誤り
• 「活性化関数としてステップ関数を導入」という説明は誤り(GRUもLSTMと同様にシグモイド関数やtanhなどを用いており、ステップ関数ではない)