1. 定義と概要
言語モデルとは、単語や文字の並び(文)に対して、その並びがどれくらい起こりやすいかを確率として表すモデルです。多くの場合、直前までの文脈が与えられたときに次に来る単語の生起確率(ある事柄が実際に起こる確率のこと)を計算する仕組みとして定式化されます。例えば「今日は天気が」に続く単語として「良い」が来る確率は、「魚」が来る確率よりも高いと計算するのが言語モデルの働きです。
従来、音声認識や機械翻訳の中で次に来る単語を予測する仕組みとして、直前のn-1個の単語(または文字)から次の単語の確率を推定する n-gram 言語モデルが使われてきました。この手法は、マルコフ仮定(次に起こることは直前の一部の情報だけで決まるとみなす単純化の考え方)にもとづいています。
ただし固定長の文脈しか見られず、学習データに現れなかった単語の並びの確率をうまく推定できないスパース性の問題(データが偏りまばらになる問題)が課題でした。窓の外にある情報は参照できず、一度も見たことのない並びには確率を割り当てにくい、という二重の制約です。
そこで、分散表現(単語の意味を多次元の数値の並びで表す方法)として単語を扱うニューラル言語モデルが登場しました。この仕組みにより、次元の呪い(データの次元が増えるほど必要なデータ量が爆発的に増えてしまう現象)を緩和しつつ、より長い文脈を扱えるようになりました。
2018年以降は、膨大なテキストとパラメータ(モデル内部で学習によって調整される数値)の数で事前学習(大量のデータを使って、先にモデルの基礎的な能力を学習させておく工程)するニューラル言語モデルが登場します。これが大規模言語モデル(LLM。膨大な文章データと多くのパラメータで学習した、規模の大きなニューラル言語モデルのこと)と呼ばれる系譜です。
2. 試験対策ポイント
単語列に確率を割り当て、次に来る単語を予測する仕組みとして定式化される点が、言語モデルの基本的な考え方です。「言語モデルとは何をするものか」という定義そのものの理解が、発展の流れをたどるうえでの土台になります。
この考え方を最初に実装した n-gram 言語モデルは、直前のn-1個の単語(または文字)から次の単語の確率を推定する手法です。呼称の詳細や単語単位・文字単位の違いは別のテーマとして扱われますが、固定長の文脈しか見られない点と、学習データにない単語列の確率を推定しにくいスパース性の問題は、言語モデルの発展を理解するうえで押さえておきたい制約です。
ニューラル言語モデルは、分散表現を使って単語を扱うことで、スパース性の問題を緩和できます。より長い文脈や複雑なパターンも捉えられるのが特徴です。
この仕組みを実装する構造としては、RNN(過去の情報を順番に記憶しながら処理する仕組み)と LSTM(その記憶を長く保てるように改良した仕組み)が挙げられます。単語同士の関連度に注目して処理するトランスフォーマー(Transformer)と呼ばれる構造も加わり、それぞれの仕組みの詳細は別のテーマとして扱われます。
大規模言語モデル(LLM)は、膨大なテキストデータと多数のパラメータで事前学習するニューラル言語モデルの延長線上にある存在です。GPT・BERT がその代表例にあたります。個々のモデルの特徴は既出記事に譲り、言語モデルの系譜における位置づけのみをここで扱います。
3. 関連概念との比較・相違点
n-gram 言語モデルとの最大の違いは、扱える文脈の長さと未知の並びへの強さです。直前n-1語という固定長の窓にしか依存できない n-gram 言語モデルに対し、ニューラル言語モデルは分散表現を使うことで、より長い文脈と学習データにない単語列も扱いやすくなります。
学習データに一度も現れなかった単語の並びでも、意味が近い単語同士をまとめて捉えられる分散表現のおかげで、ニューラル言語モデルは確率をゼロにせず計算できるのが強みです。
大規模言語モデル(LLM)との違いは、概念の広さにあります。言語モデルは単語列に確率を割り当てる仕組みそのものを指す一般的な呼び方であるのに対し、LLM は膨大なパラメータとデータ量で事前学習した特定の言語モデル群を指す呼び名です。
言語モデルという大きな枠の中に LLM が含まれる、包含関係として捉えられます。両者が同じ意味で使われる場面もありますが、厳密には規模による呼び分けです。
三つの呼び名を発展の順に並べると、違いが見取り図として整理できます。
| モデル | 扱える文脈 | 特徴と課題 |
|---|---|---|
| n-gram 言語モデル | 直前n-1語という固定長の窓 | マルコフ仮定にもとづく統計的手法。学習データにない単語列の確率を推定しにくいスパース性の問題を抱える |
| ニューラル言語モデル | より長い文脈や複雑なパターン | 分散表現で単語を扱い、スパース性の問題を緩和する |
| 大規模言語モデル(LLM) | ニューラル言語モデルの延長線上 | 膨大なテキストデータと多数のパラメータで事前学習する。GPT・BERT が代表例 |
上から下へ進むほど、扱える文脈が広がり、学習に使うデータとパラメータの量も大きくなる流れです。
4. ビジネス・実務での活用シナリオ
スマートフォンや IME(日本語入力などでひらがなを漢字に変換する入力支援ソフト)の予測変換・入力候補の表示は、言語モデルが計算した続きの単語の確率をもとに、自然な並びを提示する応用にあたります。候補が的確に絞り込まれるほど入力の手間が減り、変換候補の精度そのものが日々の使い勝手を左右する要素です。
音声認識では、音として似通った複数の候補の中から、文として自然な並びを言語モデルが選び出す後段の処理が組み込まれています。同音異義語や聞き取りにくい音の並びも、前後の文脈をふまえて自然な候補へ絞り込めるかどうかが、認識結果の精度、ひいては使う側の体感的な信頼感を左右する分かれ目です。
大規模言語モデルを用いたチャットボット(人との対話を自動で行うプログラム)や要約サービスは、次に来る単語を逐次予測して文をつなげていく言語モデルの仕組みを土台にしています。一語ずつの予測を積み重ねる仕組みであるため、応答や要約文が途中で破綻せず一貫した文章としてまとまるかどうかは、この予測の精度にかかっています。
5. 要点まとめ
- 言語モデルは、単語や文字の並びがどれくらい起こりやすいかを確率で表し、次に来る単語を予測するモデルです。
- n-gram 言語モデル(固定長の文脈にもとづく統計的手法)から、分散表現でより長い文脈を扱えるニューラル言語モデルへという発展の流れが柱になります。
- 2018年以降の大規模言語モデル(LLM)はこの延長線上にあり、GPT・BERT がその代表例です。
6. 確認問題
問1言語モデルとは、単語や文字の並びに対して、その並びがどれくらい起こりやすいかを確率として表すモデルである。
解答・解説をみる
○ 正しい
単語や文字の並びに確率を割り当て、次に来る単語を予測するという働きこそが言語モデルの中身であるため、この命題は正しいといえます。n-gram からニューラル、大規模言語モデルへと手法は移り変わっても、この基本的な働きそのものは変わらない共通の土台です。
問2n-gram 言語モデルは、直前のn-1個の単語から次の単語の確率を推定する手法であり、マルコフ仮定にもとづいている。
解答・解説をみる
○ 正しい
固定長の直前の単語列だけから次の単語の確率を推定する仕組みそのものが、マルコフ仮定にもとづく n-gram 言語モデルの特徴です。
問3n-gram 言語モデルは、ニューラル言語モデルに比べてより長い文脈を柔軟に扱うことができ、学習データにない単語列に対しても高い精度で確率を推定できる。
解答・解説をみる
× 誤り
スパース性の問題により、学習データにない単語列の確率をうまく推定できないのが n-gram 言語モデルの弱点です。正しくは、分散表現を用いるニューラル言語モデルのほうが、より長い文脈と未知の並びに強いという関係になります。

