1. 定義と概要
NSP(Next Sentence Prediction)とは、日本語では次文予測とも呼ばれ、BERT(2018年にGoogleが発表した、文脈理解に優れる事前学習済みの自然言語処理モデル)の事前学習で用いられる2つのタスクの一つです。事前学習とは、特定の作業に取りかかる前に、大量の文章を使ってモデルの基礎的な言語能力を先に鍛えておく学習段階を指します。
2つの文(文Aと文B)を入力として与え、文Bが文Aの直後に続く文かどうかを二値分類(2つの選択肢のどちらに当てはまるかを判定する処理)で予測させます。学習データは、コーパス(AIの学習に使うために集めた大量の文章のデータ集合)から実際に連続する2文を50%の確率で、無関係な文書からランダムに選んだ2文を残り50%の確率で用意します。
文頭に付ける[CLS]トークン(文全体の情報をまとめる目印として文の先頭に付ける特殊な記号)の出力表現をもとに、連続する文か無関係な文かを判定する仕組みです。
従来の言語モデルの事前学習は、文中の単語同士の関係を捉えることには優れていたものの、文と文の関係、いわゆる談話レベルのつながりを学習する仕組みを持っていませんでした。
質問応答(QA)とは、質問文に対して文章の中から答えとなる箇所を見つけ出す処理を指します。自然言語推論(NLI)とは、2つの文の意味の関係を推論(ある情報をもとに結論を導き出す処理)によって判定するタスクです。これらや文書要約のように複数の文にまたがる理解を要するタスクでは、文同士のつながりを捉える力が結果を左右します。
MLM(Masked Language Model)とは、文中の一部の単語を隠して元の単語を当てさせる学習タスクを指します。BERTは、このMLMと並行してNSPを導入し、文脈の一貫性を捉える力を事前学習の段階から養う設計にしました。
2. 試験対策ポイント
G検定では、BERTの事前学習がMLMとNSPという2つのタスクの組み合わせで構成されるという基本構成をまず押さえておきたいところです。MLMは文中の一部の単語を隠して元の単語を当てさせる単語(トークン)レベルの学習であるのに対し、NSPは2つの文が連続するかどうかを判定する文レベルの学習であるという対比が中心的な論点です。
NSPの入力形式は、[CLS]トークンに文Aと文Bを続けて並べ、区切りの記号を挟んで連結する形をとります。この[CLS]トークンの出力表現から、連続する文か無関係な文かを二値分類で判定します。学習データの作り方も具体的な仕組みとして押さえておきたく、実際に連続する文とランダムに選んだ無関係な文をおよそ半々ずつ用意する点が特徴です。
NSPによって養われる文同士の関係を捉える力は、自然言語推論や質問応答、文書要約といった複数の文にまたがる理解を要する下流タスク(事前学習の後に、個別の目的に合わせて取り組むタスク)の性能向上に活かされます。
後続の研究では、RoBERTa(BERTの学習方法を見直して改良した後続のモデル)がNSPを取り除いた事前学習でも同等以上の性能を示し、NSPの必要性に疑問が投げかけられました。「RoBERTa」以降のモデルとの比較でも整理しておきたい論点です。
3. 関連概念との比較・相違点
MLMとの最大の違いは、学習対象の単位です。BERTの事前学習を支える2つのタスクを、観点ごとに並べると次のように整理できます。
| 観点 | MLM | NSP |
|---|---|---|
| 学習の単位 | 単語(トークン)レベル | 文レベル |
| 学習の内容 | 文中の一部の単語を隠して元の単語を当てる | 2つの文が連続するかどうかを判定する |
| 養われる力 | 単語の意味を捉える力 | 文脈の一貫性を捉える力 |
BERTの事前学習ではこの2つが並行して行われ、単語の意味を捉える力と文脈の一貫性を捉える力を同時に養う設計になっています。単語同士のつながりを見るMLMと、文同士のつながりを見るNSPは、学習の粒度が異なる点で区別されます。
自然言語推論や質問応答といった下流タスクとの違いは、工程上の位置づけにあります。NSPは事前学習の段階で行われる補助的なタスクであるのに対し、自然言語推論や質問応答は、事前学習を終えたモデルをファインチューニング(事前学習を終えたモデルを、特定のタスク専用に追加で調整する学習)して解く目的の処理にあたります。
NSPで養われた文同士の関係を捉える力は、自然言語推論や質問応答の性能向上へと転移するという関係にあります。事前学習の段階で身につけた土台の力を、個別の目的に合わせて仕上げていく流れと捉えると、両者の役割の違いが見えてきます。
4. ビジネス・実務での活用シナリオ
検索エンジンやFAQ応答システムでは、質問文と回答候補の文が対応関係にあるかどうかを判定する場面があります。NSPで養われる文同士のつながりを捉える力は、この判定の土台となる領域であり、検索結果の関連文書判定やFAQ応答システムの精度向上に活かされています。ある質問に対してどの文章が実際に答えとして続くのかを見極める力は、NSPが担う「連続する文かどうか」を判定する仕組みと重なります。
文書要約や対話システムの分野でも、NSPで培われた力が下地になります。複数の文にまたがる文脈の一貫性を捉える必要がある要約生成や、対話システム(利用者との会話に応じて応答を返す仕組み)の応答選択では、事前学習の段階で養われた文レベルの理解力が働きます。前後の文脈と自然につながる応答を選び出す処理は、NSPが扱う文と文の関係の見極めと同じ土台の上に成り立っています。
5. 要点まとめ
- NSPとは、BERTの事前学習で用いられる2つのタスクの一つで、2つの文が連続する文かどうかを二値分類で判定させるタスクです。
- MLMが単語(トークン)レベルの穴埋め学習であるのに対し、NSPは文レベルのつながりを学習する点が対比され、自然言語推論や質問応答などの下流タスクに活きます。
- 後続の研究である「RoBERTa」では、NSPを取り除いても性能が同等以上になることが示され、NSPの必要性に疑問が投げかけられました。
6. 確認問題
問1NSPとは、2つの文が与えられたとき、後の文が前の文の直後に続く文であるかどうかを判定する事前学習タスクである。
解答・解説をみる
○ 正しい
NSP(Next Sentence Prediction/次文予測)の定義そのものにあたります。BERTの事前学習で用いられる2つのタスクの一つです。
問2BERTの事前学習はNSPのみで構成されており、文中の単語を隠して当てさせる学習は行われない。
解答・解説をみる
× 誤り
正しくはBERTの事前学習はMLMとNSPの2つを組み合わせて行われます。文中の単語を隠して当てさせる学習はMLMの役割で、NSPと取り違えやすい論点です。
問3後続の研究では、NSPを取り除いた事前学習でも同等以上の性能が得られたとする報告があり、NSPの必要性に疑問が呈された。
解答・解説をみる
○ 正しい
「RoBERTa」の研究で、NSPを除いた設定でも下流タスクの性能が同等以上になる実験結果が示され、NSPの効果に疑問が呈された経緯にあたります。

