G検定(JDLA) 練習問題 47:自然言語処理:単語の重要度計算
自然言語処理における単語の重要度を評価する手法である「TF-IDF」について、正しいものはどれか。
- 特定の文書内で頻出する単語ほど重要度が高くなり、かつ多くの文書に登場する単語ほど重要度が低く評価される仕組みである。
- 単語の意味や文脈を低次元の密なベクトルとして表現し、単語同士の類似度をコサイン類似度などの計算で求める手法である。
- 文書中に存在するすべての単語の出現順序を保持したまま、系列データとしてニューラルネットワークに直接入力する技術である。
- 単語の出現頻度のみを絶対的な基準として評価し、冠詞や前置詞などのストップワードに最も高い重みを与えるアルゴリズムである。
- 大規模なコーパスを用いて単語の共起確率を計算し、文法の誤りや不自然な表現を自動的に修正するために用いられる評価指標である。
Qraftユーザーの成績:難易度 S+ランク(レーティング1436)・正答率 29%(10/35回正解)
レーティングは解いた人の実力と正誤から算出する難しさ(初期値1200)。ランクはその全問題中の順位(S+が最難関、F-が最易)
正解と解説を見る
正解:特定の文書内で頻出する単語ほど重要度が高くなり、かつ多くの文書に登場する単語ほど重要度が低く評価される仕組みである。
TF-IDFは、特定の文書で頻繁に出現する単語(TF:単語の出現頻度)ほど重要とみなしつつ、多くの文書に共通して出現する単語(IDF:逆文書頻度)は重要度を下げるという計算手法です。
【正解の理由】
特定の文書で多く使われ、かつ他の文書であまり使われない単語ほど、その文書を特徴づける重要な単語として高く評価されるため正しいです。
【不正解の理由】
• 「単語の意味や文脈を低次元の密なベクトルとして表現し、類似度を計算する」という説明は、Word2Vecなどの単語分散表現に関するものであるため誤り
• 「文書中に存在する単語の出現順序を保持したまま、系列データとしてネットワークに入力する」という説明は、RNN(再帰型ニューラルネットワーク)などの系列モデルに関するものであるため誤り
• 「出現頻度のみを絶対的な基準とし、冠詞や前置詞に最も高い重みを与える」という説明は、TF-IDFがまさに防ごうとしている事態(ありふれた単語の過大評価)であり誤り
• 「大規模なコーパスを用いて単語の共起確率を計算し、文法の誤りを修正する」という説明は、n-gramモデルや言語モデルの一般的な用途でありTF-IDF自体の説明として誤り