1. 定義と概要
BERT(Bidirectional Encoder Representations from Transformers)とは、2018年10月にGoogle社が発表した、事前学習済みの自然言語処理モデルです。自然言語処理とは、人間が使う言葉をコンピュータに理解させる技術分野です。
構造の面では、Transformer(文章中の単語同士の関係性に注目して処理する、深層学習のネットワーク構造)のうち、入力された文章を意味を保ったまま数値の情報に変換する仕組み(エンコーダ)を積み重ねた形をとります。文中の各単語を前後(左右)双方向の文脈から同時に捉える点が核心です。
学習の進め方も特徴的です。事前学習(大量の一般的な文章データを使い、汎用的な言語の理解力を先に身につけさせる学習段階)と、ファインチューニング(事前学習済みのモデルを、少量の専用データで個別のタスク向けに調整する仕上げの学習)という、2段階の構成をとります。
BERT登場以前の自然言語処理モデルは、word2vec(文章中の単語を、意味の近さを反映した数値の並びに変換する初期の代表的な手法)のような単語単位の表現や、GPTのように左から右へ一方向で文脈を処理するモデルが主流でした。文全体の双方向の関係性を同時に捉えることは難しいという課題を抱えていました。
BERTは、文中の単語の一部を隠して前後の文脈から元の単語を予測させる学習を通じて、双方向の文脈理解を実現しました。発表当時、GLUE(複数の自然言語理解タスクをまとめて評価する、モデル比較用のベンチマーク)をはじめとする各種ベンチマークでそれまでの手法を上回るスコアを記録し、自然言語処理における事前学習モデルの活用を大きく広げる転換点になりました。
2. 試験対策ポイント
BERTの核心となるのが、Transformer構造のうちエンコーダ部分のみを積み重ねた構造を持ち、文中の各単語を前後双方向の文脈から同時に捉える点です。これは、変換した情報から次に来る単語を1つずつ生成していく仕組み(デコーダ)のみを使い、左から右へ一方向で処理するGPTとの対比が、この構造を理解するうえでの中心的な論点です。
事前学習で用いられるのが、MLM(マスク言語モデル)とNSP(次文予測)という2つのタスクです。それぞれが何を学ばせるための仕組みなのかを並べると、次のように整理できます。
| 事前学習のタスク | 学習させる内容 |
|---|---|
| MLM(マスク言語モデル) | 文章中の一部の単語を隠して、前後の文脈から元の単語を予測させる学習方法 |
| NSP(次文予測) | 2つの文が本来連続する関係にあるかどうかを判定させる学習方法 |
BERTはこの2つのタスクを組み合わせて事前学習に用いており、それぞれの仕組みの詳細は個別のテーマとして扱われます。MLM(マスク言語モデル)は、単語のレベルで文脈を捉える力を養う仕組み、NSP(次文予測)は文と文のつながりを捉える力を養う仕組みという整理で押さえると、役割の違いが見えやすくなります。
BERTは、事前学習とファインチューニングの2段階構成をとり、ある課題で学習した知識を別の課題に応用する枠組み(転移学習)によって、同一の事前学習済みモデルを質問応答や文書分類など複数のタスクに応用できます。発表時には、GLUEをはじめとする各種ベンチマークで、それまでの手法を上回るスコアを記録しました。
3. 関連概念との比較・相違点
BERTとGPTとの最大の違いは、Transformer構造のどちらの部分を使うかという点にあります。BERTはエンコーダ部分のみを積み重ね、文中の単語を前後双方向の文脈から同時に読み取るため、文章の意味を正確に理解する自然言語理解のタスクに向いています。一方、GPTはデコーダ部分のみを使い、それまでに出てきた単語列から次の単語を左から右へ一方向に予測していく構造を持つため、文章を新しく生み出す文章生成のタスクに向いています。
両者の関係を、使う部分・文脈の読み方・向いているタスクという3つの軸で並べると次のようになります。
| 観点 | BERT | GPT |
|---|---|---|
| 使うTransformerの部分 | エンコーダ部分のみ | デコーダ部分のみ |
| 文脈の読み方 | 前後双方向から同時に読み取る | 左から右へ一方向に予測する |
| 向いているタスク | 文章の意味を捉える自然言語理解 | 文章を新しく生み出す文章生成 |
たとえば、文章の感情を分類したり、文書に書かれた意図を読み取ったりする作業では、文全体の前後関係を同時に踏まえられるBERTの構造が生きます。反対に、文章の続きを生成したり、対話の応答を作ったりする作業では、それまでの文脈だけをもとに次の語を順番に紡いでいくGPTの構造が向いています。この、双方向で理解するBERTと一方向で生成するGPTという対比は、得意なタスクの違いに直結します。
BERTの構造を踏襲しながら、パラメータ(モデル内部で学習によって調整される数値)の数や計算コストを抑えた派生モデルも存在します。ALBERTは、複数の層で同じパラメータを使い回す仕組みなどによって軽量化を図ったモデルです。「DistilBERT」は、大きなモデルの知識をより小さなモデルに引き継がせて軽量化する手法(蒸留)を用いて作られたモデルです。
こうした軽量化モデルが登場した背景には、BERT自体のパラメータの多さによる計算コストの高さがあります。骨格となる構造を保ちながら効率化を図る取り組みが、ALBERTや「DistilBERT」のような派生モデル群として進んでいます。
4. ビジネス・実務での活用シナリオ
検索エンジンの分野では、Google社が検索クエリの文脈理解にBERTを組み込み、前置詞や接続詞を含む自然な言い回しの検索意図を解釈する精度を高めました。従来のキーワード一致中心の検索では、助詞ひとつで意味が変わるような自然な問いかけを正しく解釈することが難しく、文脈を踏まえた理解の仕組みが検索エンジンの精度向上に欠かせない要素になっています。
カスタマーサポートの分野では、問い合わせ文の意図分類やFAQ検索に、ファインチューニング済みのBERTベースのモデルが用いられています。事前学習の段階で汎用的な言語理解をすでに獲得しているため、少量の学習データでも高い精度の自動応対を実現でき、タスクごとにモデルをゼロから作り直す手間を抑えられます。
文書分類・情報抽出の分野では、契約書やレビュー文の感情分析・分類タスクに、BERTベースのモデルの知識を転移学習させる活用が進んでいます。同一の事前学習済みモデルを土台にできるため、タスクごとにゼロからモデルを学習させる手間を省き、業務ごとに異なる文書の分類作業を効率化できます。
5. 要点まとめ
- BERTはTransformer構造のエンコーダ部分を使い、単語の前後双方向の文脈を同時に捉える事前学習済みの自然言語モデルという点が核心です。
- 事前学習ではMLM(マスクした単語の予測)とNSP(2つの文の連続性判定)の2つのタスクを組み合わせ、その後ファインチューニングで個別のタスクに適応させます。
- デコーダ部分のみで一方向の処理を行うGPTとは対をなす存在で、ALBERTや「DistilBERT」などの軽量化を図った派生モデルもBERTの構造を踏襲しています。
6. 確認問題
問1BERTは、Transformer構造のうちエンコーダ部分のみを用いて構築されており、文中の単語を前後双方向の文脈から同時に捉える構造を持つ。
解答・解説をみる
○ 正しい
BERTの核心は、エンコーダ部分を積み重ねた双方向の文脈理解にあります。左から右へ一方向で処理するデコーダ部分のみのGPTとの対比が、この構造を理解する切り口になります。
問2BERTの事前学習では、文中の一部の単語を隠して予測させるMLMと、2つの文の連続性を判定させるNSPという2つのタスクを組み合わせて用いる。
解答・解説をみる
○ 正しい
MLMとNSPという2つのタスクを組み合わせて使う点は、BERTの事前学習における要点のひとつです。それぞれの仕組みの詳細は、個別のテーマとして扱われます。
問3GPTはBERTと同様にTransformer構造のエンコーダ部分を用いており、双方向に文脈を捉える構造を持つ。
解答・解説をみる
× 誤り
正しくは、GPTはデコーダ部分のみを用い、左から右へ一方向に処理する構造を持ちます。BERTはエンコーダ部分で双方向、GPTはデコーダ部分で一方向という対比が入れ替えられた誤り方です。

