G検定(JDLA) 練習問題 26:クラスタリング手法(k-means法)
教師なし学習の代表的な手法である「k-means法(k平均法)」について、正しいものはどれか。
- 各データ点を最も近い重心に割り当てる処理を繰り返して収束させるクラスタリング手法である
- 教師データのラベルを用いて回帰係数を最小二乗法で求める手法である
- 決定木を多数組み合わせて多数決を取ることでクラス分類を行う手法である
- データの次元を削減するために分散が最大となる方向へ射影を行う手法である
- 隠れ層を持つニューラルネットワークを用いて非線形な分類境界を学習する手法である
正解と解説を見る
正解:各データ点を最も近い重心に割り当てる処理を繰り返して収束させるクラスタリング手法である
k-means法は、事前に指定したクラスタ数kに従い、各データ点を最も近い重心に割り当てる処理と重心の再計算を繰り返すことでクラスタリングを行う代表的な教師なし学習アルゴリズムである。
【正解の理由】
k-means法は初期のクラスタ重心をランダムに設定した後、「各データ点を最も近い重心のクラスタに割り当てる」「各クラスタの重心を再計算する」という処理を、重心の変化が収束するまで繰り返すアルゴリズムである。
【不正解の理由】
• 「教師データのラベルを用いて回帰係数を最小二乗法で求める」は線形回帰の説明であり誤り
• 「決定木を多数組み合わせて多数決を取る」はランダムフォレストなどのアンサンブル学習の説明であり誤り
• 「分散が最大となる方向へ射影する」は主成分分析(PCA)の説明であり誤り
• 「隠れ層を持つニューラルネットワークを用いて非線形な分類境界を学習する」は多層パーセプトロンなどの説明であり、k-means法とは異なる手法である