MLM(Masked Language Model) (G検定)

MLM(Masked Language Model)

1. 定義と概要

MLM(Masked Language Model)とは、日本語ではマスク言語モデルとも呼ばれ、入力文中の一部の単語(トークン。文章をモデルが扱える単位に分割した、単語や部分的な単語のかたまりのこと)を[MASK]という記号などで隠し(マスクし)、隠された部分に元々何の単語が入っていたかを前後の文脈から予測させる事前学習タスクです。

たとえば「今日は[MASK]が降ったので傘をさした」という文が与えられた場合、モデルは前後の単語から[MASK]部分に「雨」が入ると予測します。国語の穴埋め問題に似た形式で学習が進むと考えると分かりやすいでしょう。BERTの事前学習では入力トークンの15%が予測対象として選ばれ、選ばれたトークンの扱い方には一様ではない内訳が定められています。

従来の自然言語処理(コンピュータに人間の言葉を処理させる技術分野)では、タスクごとに大量のラベル付きデータ(正解や分類の情報があらかじめ付けられたデータ)を用意し、一からモデルを学習させる必要がありました。そこで、ラベルのない大量のテキストから汎用的な言語理解を先に獲得させる事前学習(個別のタスクに取り組む前に、大量の文章データを使ってモデルに基礎的な言語の力を身につけさせる学習工程)という考え方が広がります。

BERTはMLMとNSP(2つの文が連続する関係にあるかどうかを判定する、BERTのもう一つの事前学習タスク)という2つの事前学習タスクを組み合わせることで、文脈を双方向に理解する言語モデルを実現しました。その後は少量のデータで個別タスクに合わせて調整するファインチューニング(事前学習済みのモデルを、少量のデータで特定の用途向けに追加調整する工程)によって、様々な自然言語処理タスクで高い性能を発揮するようになったという流れがあります。

2. 試験対策ポイント

MLMはBERTの事前学習を構成する2つのタスクの一つであり、もう一つのNSPとセットで扱われる重要なテーマです。MLMは単語(トークン)単位の予測であるのに対し、NSPは2つの文が連続するかどうかを判定する文単位の判断であり、対象とする粒度が異なります。この粒度の違いは、両者を取り違えやすい点です。

MLMは前後両方向の文脈を利用して単語を予測するため、モデルは双方向(前の文脈と後ろの文脈の両方を同時に読んで判断すること)の言語理解を獲得します。過去の単語列のみから次の単語を予測する一方向型のモデルとの対比で説明される点であり、BERTを特徴づける中心的な論点です。

BERTの事前学習では、予測対象に選ばれた入力トークンが次の内訳で扱われます。

予測対象トークンの扱い 割合
[MASK]トークンへ置き換える 80%
ランダムな別の単語へ置き換える 10%
元の単語のまま保持する 10%

この数値の細部まで押さえておきたいところです。単に「単語を隠して予測する」という理解だけでなく、置き換え方が一様ではない点まで押さえておくと、選択肢の細かい違いにも対応しやすくなります。

3. 関連概念との比較・相違点

MLMと混同されやすい2つのタスクは、何を予測するかと、どちらの方向の文脈を使うかという2つの軸で並べると見分けやすくなります。

タスク 予測・判定するもの 使う文脈の方向
MLM 文中で隠された単語(トークン) 隠した単語の前後両方=双方向
NSP 2つの文が連続する関係にあるかどうか 文と文のつながり
GPT系の次単語予測 次に来る単語 それまでに出現した左側のみ=一方向

MLMとNSPとの最大の違いは、扱う対象の粒度にあります。MLMは文中の単語(トークン)を隠して予測する単語レベルのタスクであるのに対し、NSPは2つの文が連続する関係にあるかどうかを判定する文レベルのタスクです。

BERTの事前学習はこの2つを組み合わせて構成されており、片方だけを指してBERTの事前学習と説明する記述は誤りになります。単語の穴埋めか、文と文のつながりの判定かという対象の違いを軸に整理すると、両者の役割を取り違えにくくなります。

GPT系モデルの次単語予測との違いは、文脈をどちらの方向から使うかにあります。GPTに代表されるモデルは、それまでに出現した単語列、つまり左側の文脈のみから次の単語を予測する一方向型です。これに対しBERTのMLMは、隠した単語の前後両方の文脈を使って予測する双方向型です。

この違いは、文章を書き進めるように生成するタスクにはGPT系が向き、文章全体の意味を読み取って理解するタスクにはBERT系が向くという、得意分野の違いにつながっています。単語レベルか文レベルかというNSPとの軸、双方向か一方向かというGPTとの軸の両方を押さえると、MLMの位置づけが立体的に見えてきます。

4. ビジネス・実務での活用シナリオ

検索エンジンの分野では、検索クエリと文書双方の文脈をMLMで事前学習したBERT系モデルが読み取ることで、キーワードの表面的な一致だけでなく検索意図に沿った検索結果の並び替えに活用されています。単語の並びだけでなく前後の文脈まで踏まえて意味を捉えられるからこそ、利用者が本当に求めている情報に近い結果を上位に示せます。

カスタマーサポートの現場では、問い合わせ文章の意味をMLMで学習した言語モデルが読み取り、FAQの中から関連度の高い回答候補を抽出する仕組みに応用されています。表現が多少違っていても、文脈から意味の近さを判断できるため、定型的なキーワード検索より柔軟な対応が可能になります。

文書校正や入力支援の分野でも、MLMの仕組みは技術的な土台になっています。文中の一部を周囲の文脈から予測するという性質は、誤字脱字の検出や変換候補の提示など、文脈に応じた語句補完機能に生かされています。人が書いた文章のどこが不自然かを、前後のつながりから見抜く働きに近いといえます。

5. 要点まとめ

  • MLMは文中の一部の単語(トークン)をマスクし、前後の文脈から元の単語を予測させる事前学習タスクであり、BERTの事前学習を構成する2つのタスクの一つです。
  • もう一つのNSPは2つの文が連続するかを判定する文レベルのタスクであり、MLMは単語レベルの予測という点で対象の粒度が異なります。
  • MLMは前後双方向の文脈を用いるため、過去の単語列のみから次の単語を予測するGPT系の一方向型のモデルとは、文脈の使い方が異なります。

6. 確認問題

問1MLMは、文中の一部の単語をマスクし、前後の文脈から元の単語を予測させる事前学習タスクである。

解答・解説をみる

○ 正しい

MLM(Masked Language Model)の定義そのものです。BERTの事前学習を構成する2つのタスクの一つであり、もう一つのNSPとセットで整理しておきたい関係です。

問2MLMは、2つの文が連続する関係にあるかどうかを判定するタスクであり、NSPと同じ内容のタスクである。

解答・解説をみる

× 誤り

2つの文が連続するかどうかを判定するのはNSPの定義であり、MLMではありません。正しくは、MLMは単語(トークン)単位の予測、NSPは文単位の判定というように対象の粒度が異なります。

問3GPTのような次単語予測モデルは過去の文脈(左側)のみから次の単語を予測する一方向型であるのに対し、BERTのMLMは前後の文脈を利用する双方向型である。

解答・解説をみる

○ 正しい

GPT系は一方向型、BERTのMLMは双方向型という文脈の使い方の違いを述べた記述であり、正しい内容です。この違いが両モデルの得意分野の違いにもつながっています。