G検定(JDLA) 練習問題 28:自然言語処理:前処理(トークン化・サブワード分割)
自然言語処理におけるトークン化(形態素解析・サブワード分割)について、正しいものはどれか。
- BPEは出現頻度の高い文字の組を反復的に結合してサブワード単位の語彙を構築する手法である
- 日本語は単語間にスペースがあるため、英語よりも形態素解析が容易である
- トークン化は文章をベクトル化した後に行う処理であり、モデルの学習後に実施される
- サブワード分割を用いると未知語(Out-of-Vocabulary)の問題が発生しやすくなる
- 形態素解析は文章の感情極性(ポジティブ・ネガティブ)を直接判定する処理である
正解と解説を見る
正解:BPEは出現頻度の高い文字の組を反復的に結合してサブワード単位の語彙を構築する手法である
BPE(Byte Pair Encoding)は、頻出する文字・文字列のペアを繰り返し結合してサブワード単位の語彙を作る手法で、BERTやGPTなど多くの言語モデルの前処理に使われている。
【正解の理由】
BPEはまず全ての文字を個別のトークンとして扱い、コーパス中で最も頻繁に隣接する文字(または文字列)のペアを新しいトークンとして結合する処理を繰り返すことで、頻出語は少ないトークンで、稀な語はより細かいサブワードで表現できる語彙を構築する。
【不正解の理由】
• 「日本語は単語間にスペースがあるため形態素解析が容易」は誤り。日本語は分かち書きされないため、英語より形態素解析が難しいとされる
• 「トークン化はベクトル化した後に行う」は順序が逆であり誤り。トークン化は文章を単語やサブワードに分割する前処理で、その後にベクトル化(埋め込み)が行われる
• 「サブワード分割を用いると未知語の問題が発生しやすくなる」は誤り。むしろサブワード分割は未知語を既知のサブワードの組み合わせで表現できるため、未知語問題を緩和する手法である
• 「形態素解析は感情極性を直接判定する」は誤り。形態素解析は単語の分割と品詞付与などを行う処理であり、感情分析とは別のタスクである