G検定(JDLA) 練習問題 62:自然言語処理
自然言語処理における単語分散表現の手法「FastText」の特徴として、正しいものはどれか。
- 文脈に応じて同じ単語でも異なるベクトルを割り当てることができるため、多義語の意味を文脈から正確に区別して学習できる手法である。
- 単語の出現頻度のみに基づいてベクトルを計算するシンプルな手法であり、大規模なコーパスでも計算コストを低く抑えられる手法である。
- 長い文章の意味を一つのベクトルに圧縮することに特化しており、文書分類や要約などのタスクにおいて極めて高い性能を発揮する手法である。
- 単語をさらに細かいサブワード(文字のN-gram)に分割して学習するため、学習データにない未知語や表記揺れに対しても強い手法である。
- 単語の共起関係を行列として表現し、特異値分解を用いて次元を削減することで、単語間の意味的な類似度を高精度に計算できる手法である。
正解と解説を見る
正解:単語をさらに細かいサブワード(文字のN-gram)に分割して学習するため、学習データにない未知語や表記揺れに対しても強い手法である。
単語分散表現の手法である「FastText」は、単語をサブワード(文字N-gram)に分割して学習することで、未知語や表記揺れに対応できるという特徴があり、正解はこの内容の通りです。
【正解の理由】
Word2Vecの拡張として提案されたFastTextは、単語を構成する文字の連続(N-gram)を考慮してベクトルを生成するため、学習データに出現しなかった単語でもサブワードの情報を合成して表現を計算できます。
【不正解の理由】
• 「多義語の意味を文脈から正確に区別して学習できる」という説明は、ELMoやBERTなどの文脈を考慮する手法に関するものであり誤り
• 「単語の出現頻度のみに基づいてベクトルを計算するシンプルな手法」という説明は、Bag-of-WordsやTF-IDFなどの説明であり誤り
• 「長い文章の意味を一つのベクトルに圧縮することに特化」という説明は、Doc2VecやSentence-BERTなどの説明であり誤り
• 「単語の共起関係を行列として表現し、特異値分解を用いて次元を削減する」という説明は、LSA(潜在的意味解析)などの手法であり誤り