G検定(JDLA) 練習問題 9:アンサンブル学習/ブースティング
アンサンブル学習の代表的な手法である「ブースティング(Boosting)」について、正しいものはどれか。
- 弱学習器を逐次的に構築し、前の学習器が誤分類したデータに重みを大きくして次の学習器を学習させることで精度を高めていく手法である
- 複数の学習器を独立かつ並列に学習させ、その予測結果を単純に平均あるいは多数決するだけの手法であり、学習器間に依存関係はない
- ブースティングでは全ての学習器が同一の訓練データを同じ重みで用いるため、誤分類データへの対処は行われない
- ブースティングは決定木を用いることができず、線形モデルにのみ適用可能な手法である
- ブースティングは教師なし学習の手法であり、クラスタリング結果を統合するために用いられる
Qraftユーザーの成績:難易度 Cランク(レーティング1153)・正答率 69%(11/16回正解)
レーティングは解いた人の実力と正誤から算出する難しさ(初期値1200)。ランクはその全問題中の順位(S+が最難関、F-が最易)
正解と解説を見る
正解は「弱学習器を逐次的に構築し、前の学習器が誤分類したデータに重みを大きくして次の学習器を学習させることで精度を高めていく手法である」です。
【正解の理由】
ブースティング(Boosting)は、弱学習器(=単体では精度の低い簡易なモデル)を1つずつ順番に学習させ、直前のモデルが誤分類したデータの重みを大きくして次のモデルの学習に反映させることで、全体として精度の高いモデルを構築する手法です。代表的な手法にAdaBoostやGradient Boostingがあります。
【不正解の理由】
• 「複数の学習器を独立かつ並列に学習させ、その予測結果を単純に平均あるいは多数決するだけの手法であり、学習器間に依存関係はない」という説明は誤りです。これはバギング(Bagging、=データを複数回サンプリングして複数のモデルを並列に学習させる手法)の特徴であり、ブースティングとは異なります。
• 「ブースティングでは全ての学習器が同一の訓練データを同じ重みで用いるため、誤分類データへの対処は行われない」という説明は誤りです。ブースティングの本質は、誤分類データの重みを逐次的に増やしていく点にあります。
• 「ブースティングは決定木を用いることができず、線形モデルにのみ適用可能な手法である」という説明は誤りです。実際には決定木を弱学習器として用いることが多い手法です。
• 「ブースティングは教師なし学習の手法であり、クラスタリング結果を統合するために用いられる」という説明は誤りです。ブースティングは主に教師あり学習の枠組みで用いられる手法です。