G検定(JDLA) 練習問題 41:自然言語処理:BLEUスコア
自然言語処理タスクにおける評価指標である「BLEUスコア」に関する説明として、正しいものはどれか。
- 正解となる参照訳との間で共通して出現するN-gram(=連続するN個の単語のまとまり)の割合を計算し、翻訳の精度を評価する。
- 正解となる参照訳との間で文法的な構造の完全な一致度合いを詳細な構文解析木を用いて計算し、翻訳の精度を客観的に評価する。
- 正解となる参照訳との間で各単語の意味的な類似度を高度な分散表現モデルを用いて計算し、翻訳の滑らかさを客観的に評価する。
- 正解となる参照訳との間で翻訳にかかる総計算量と出力までの平均遅延時間を厳密に測定し、翻訳システムの処理効率を評価する。
- 正解となる参照訳との間で複数の専門家が主観的に下した5段階のスコアを統計的に平均化し、翻訳の自然さを客観的に評価する。
Qraftユーザーの成績:難易度 Bランク(レーティング1221)・正答率 59%(20/34回正解)
レーティングは解いた人の実力と正誤から算出する難しさ(初期値1200)。ランクはその全問題中の順位(S+が最難関、F-が最易)
正解と解説を見る
BLEUスコアは、機械翻訳の評価指標として広く用いられ、生成された翻訳と人間の参照訳との間でN-gram(=連続するN個の単語のまとまり)がどれくらい一致しているかに基づいてスコアを算出します。
【正解の理由】
機械翻訳の品質を自動的かつ定量的に評価するために、人間が作成した参照訳(正解となるテキスト)と機械の出力結果の間で、共通して出現するN-gramの割合を計算するというBLEUスコアの基本的な仕組みを述べているため正しいです。
【不正解の理由】
• 「正解となる参照訳との間で文法的な構造の完全な一致度合いを詳細な構文解析木を用いて計算し、翻訳の精度を客観的に評価する」という説明は、BLEUスコアの計算方法として誤り
• 「正解となる参照訳との間で各単語の意味的な類似度を高度な分散表現モデルを用いて計算し、翻訳の滑らかさを客観的に評価する」という説明は、単語の一致を見るBLEUではなく、意味的な評価手法(METEORやBERTScoreなど)の特徴であり誤り
• 「正解となる参照訳との間で翻訳にかかる総計算量と出力までの平均遅延時間を厳密に測定し、翻訳システムの処理効率を評価する」という説明は、翻訳の質ではなくシステムパフォーマンスの評価であり誤り
• 「正解となる参照訳との間で複数の専門家が主観的に下した5段階のスコアを統計的に平均化し、翻訳の自然さを客観的に評価する」という説明は、人手評価(MOSなど)の特徴であり、自動評価指標であるBLEUスコアの説明として誤り