事前学習(自然言語) (G検定)

事前学習(自然言語)

1. 定義と概要

事前学習(自然言語)とは、正解ラベルの付いていない大量のテキストデータ、いわゆるラベルなしデータ(正解や分類が付いていない、生のままのデータ)を用いて、モデルに言語の文法・語彙・文脈といった一般的な性質をあらかじめ学習させる工程です。人間があらかじめ正解を付けたデータを使う教師あり学習(人が用意した正解ラベルをもとにモデルを訓練する方法)とは異なり、事前学習では自己教師あり学習(データ自体から自動で問題と正解を作り出して学習させる方法)という方式を使います。

たとえば文中の一部の単語を隠してその単語を当てさせたり、直前までの文脈から次に来る単語を予測させたりすることで、入力データ自体から疑似的な問題と正解を作り出します。この工程で得た汎用的な言語表現は、その後、少量のデータで個別タスク向けに調整するファインチューニング(事前学習済みのモデルを少量のデータで個別のタスク向けに微調整すること)と組み合わせて使われます。

BERT(Google社が開発した、文章を双方向から読んで理解する事前学習モデル。詳細は別記事で扱います)やGPT(OpenAIが開発した、文章を前から順に読んで次の単語を予測する事前学習モデル。詳細は別記事で扱います)は、この事前学習とファインチューニングという2段階の方式を自然言語処理(コンピュータに人間の言葉を扱わせる技術分野)に広めた代表的なモデルです。

従来の自然言語処理は、タスクごとに個別のモデルをゼロから学習する方式が中心で、タスクの数だけ大量のラベル付きデータを用意する必要がありました。

2018年前後にBERTやGPTが登場し、大量のラベルなしテキストで事前学習した汎用モデルを土台に、少量データのファインチューニングだけで様々なタスクに対応できることが示されました。以降、事前学習済みモデルを基盤にして個別タスクへ調整していく開発スタイルが自然言語処理の主流になっています。

2. 試験対策ポイント

G検定では、事前学習が正解ラベルのない大量のテキストデータを使う自己教師あり学習によって行われる点が重要な論点です。人間が正解ラベルを付ける教師あり学習との違いが取り違えやすい点です。

事前学習で得た汎用的な言語表現を、少量のラベル付きデータで個別タスク向けに調整するファインチューニングと組み合わせる2段階の流れが基本です。事前学習で得たパラメータ(モデル内部の数値。学習によって少しずつ調整される値)をファインチューニングの初期値として使う関係も、対になる知識として押さえておきたいところです。

BERTやGPTは、事前学習の考え方を自然言語処理に定着させた代表的なモデルとして、関連づけて整理しておきたいポイントです。各モデル固有の仕組みは別の記事に譲ります。

事前学習で得た知識を別のタスクに転用する枠組み全体は転移学習(ある分野で身につけた知識を別の分野に活かす学習の枠組み)と呼ばれます。事前学習とファインチューニングの組み合わせは、この転移学習を実現する具体的な手段の一つとして位置づけられます。事前学習・ファインチューニング・転移学習の三者の関係は、混同しやすい組み合わせです。

3. 関連概念との比較・相違点

事前学習とファインチューニングの最大の違いは、使うデータの量と役割にあります。事前学習は大量のラベルなしデータを使って汎用的な言語知識を身につける工程で、ファインチューニングは事前学習済みモデルのパラメータを初期値として、少量のラベル付きデータで個別タスク向けに調整する工程です。使うデータと担う役割を並べると、次のように対応します。

観点 事前学習 ファインチューニング
使うデータ 正解ラベルのない生のテキスト 個別タスク向けのラベル付きデータ
データの量 大量 少量
果たす役割 汎用的な言語知識を身につける 個別のタスク向けに調整する

両者は対になる役割分担であり、事前学習だけでは特定のタスクに直接対応できず、ファインチューニングだけでは大量のデータと計算資源が必要になってしまいます。

転移学習との違いは、指している範囲の広さにあります。転移学習は、ある領域で得た知識を別の領域に転用する学習の枠組み全体を指す上位概念です。事前学習とファインチューニングの組み合わせは、この転移学習を実現する具体的な手段の一つに位置づけられます。事前学習は転移学習という大きな枠組みの中の一工程であり、両者は上位概念と具体的手法という関係にあります。

事前学習の中身は、採用する具体的なタスクによって異なります。BERTは文中の一部の単語を隠してその単語を当てさせるマスク言語モデル(文中の一部の単語を隠し、その単語を当てさせる学習方式)を使います。一方でGPTは、直前までの文脈から次に来る単語を予測させる次単語予測(直前までの文脈から次に来る単語を予測させる学習方式)を使います。

この違いは、文脈をどう読むかの違いにそのままつながります。

モデル 事前学習のタスク 文脈の読み方
BERT マスク言語モデル 文章を前後両方向から読む
GPT 次単語予測 文章を前から順にしか読まない

事前学習タスクの選び方が、モデルの文脈理解の性格を決めるという関係になります。各モデルの詳細な仕組みは別の記事で扱います。

4. ビジネス・実務での活用シナリオ

検索エンジンの分野では、事前学習済みの言語モデルを使って検索クエリの意図を文脈込みで理解する取り組みが進んでいます。単語の表記揺れや言い回しの違いがあっても、事前学習によって得られた汎用的な言語理解をもとに関連性の高いページを返せるようになります。

カスタマーサポートの現場では、事前学習済みモデルを自社のFAQ(よくある質問と回答をまとめたもの)や問い合わせ履歴でファインチューニングする取り組みが広がっています。専門用語や社内特有の言い回しに対応したチャットボット(文字や音声で人と対話するプログラム)を、少量のデータで構築できる点が実務上の利点です。

医療や法務など専門文書を扱う分野でも、事前学習済みモデルの活用が進んでいます。汎用の事前学習済みモデルを専門文書でファインチューニングすることで、少ない専門データでも文書分類や要約の精度を高められます。専門知識を一から学習させる場合に比べて、必要なデータ量と開発期間を抑えられる点が実務上の意義です。

5. 要点まとめ

  • 事前学習は、正解ラベルのない大量のテキストデータを使う自己教師あり学習によって、言語の一般的な性質をあらかじめモデルに学習させる工程です。
  • 事前学習で得た汎用的な言語表現を、少量のラベル付きデータで個別タスク向けに調整するファインチューニングと組み合わせる2段階の流れが基本です。
  • BERT・GPTはこの事前学習とファインチューニングの方式を自然言語処理に広めた代表的なモデルで、両者の組み合わせは転移学習の実現手段の一つに位置づけられます。

6. 確認問題

問1事前学習は、正解ラベルの付いていない大量のテキストデータを用いた自己教師あり学習によって行われる。

解答・解説をみる

○ 正しい

事前学習は人間が付けた正解ラベルを使わず、入力データ自体から疑似的な問題と正解を作り出す自己教師あり学習によって行われます。

問2事前学習で得られたモデルのパラメータは、ファインチューニングの初期値として利用される。

解答・解説をみる

○ 正しい

事前学習で得た汎用的な言語表現をもとに、少量のラベル付きデータで個別タスク向けに調整するのがファインチューニングです。

問3事前学習は個々のタスクに特化した少量のデータを使って行われ、ファインチューニングで大規模なラベルなしコーパス(学習に使う大量の文章データの集まり)から汎用的な言語知識を習得する。

解答・解説をみる

× 誤り

正しくは逆の関係です。事前学習は大規模なラベルなしデータで汎用的な言語知識を習得する工程、ファインチューニングは少量のタスク別データで個別タスク向けに調整する工程です。役割を入れ替えた記述は、取り違えやすい典型です。