単語バイグラム (G検定)

単語バイグラム

1. 定義と概要

単語バイグラムとは、テキストを単語単位に分割したうえで、隣り合う2つの単語の組を1つの単位として切り出す手法です。単語Nグラムにおいてnの値を2とした特殊ケースにあたります。

具体例を挙げると、「私は自然言語処理に興味があります」を分かち書き(文章の単語と単語の間に区切りを入れること)した場合、「私/は/自然言語処理/に/興味/が/あります」という単語列が得られます。この単語列から隣接する2語ずつを組にした結果が、「私-は」「は-自然言語処理」「自然言語処理-に」「に-興味」「興味-が」「が-あります」という単語バイグラムの列です。

単語の出現の有無や頻度だけに注目し、語順を無視して扱う考え方はBag-of-Words(文中の単語の出現有無や頻度だけに注目し、語順を無視してテキストを表現する手法)と呼ばれます。この見方では、「猫が犬を追いかけた」と「犬が猫を追いかけた」のように単語の並びが入れ替わっただけの文を区別できません。隣り合う2語をひとまとまりとして扱う単語バイグラムは、直前の1語という最小限の並びの情報を単位に取り込むことで、この課題の一部に対応する位置づけにあります。

2. 試験対策ポイント

まず整理しておきたいのは、単語バイグラムが単語Nグラムでn=2とした場合を指し、隣接する2つの単語をひとまとまりの単位として扱う点です。1語ずつ独立に扱うユニグラムでは、「機械学習」や「自然言語」のような隣接する2語からなる複合的な言い回しが別々の単語に分離されてしまいます。単語バイグラムであれば、こうした言い回しを1つのまとまりとして扱えるようになり、局所的な語順の情報を特徴量(機械学習モデルに入力する、データを数値で表した特徴の集合)に取り込めるのが利点です。

一方で、組を単位にする分だけ扱う語の組み合わせの種類、つまり語彙は1語単位のユニグラムより多くなります。個々の組み合わせの出現頻度がまばらになる、いわゆるスパース(データの組み合わせパターンが多すぎて、個々の出現回数がまばらで少なくなっている状態)な状態になりやすい点は、あわせて整理しておきたい制約です。実務では文脈の広さと組み合わせの多さ、つまりスパース化のバランスから、nを2から3程度に留める使われ方がよく見られます。

単語バイグラムの呼称は、nの値によって名称が変わる単語Nグラムの体系のうち、n=2に対応する一例です。ユニグラムやトライグラム(単語Nグラムでn=3の場合。隣接する3つの単語をひとまとめにした単位)との呼び分けも、あわせて整理しておきたいところです。

3. 関連概念との比較・相違点

ユニグラムとの最大の違いは、語順の情報を保持できるかどうかにあります。ユニグラムは単語を1語ずつ独立に扱うため、語順の情報を保持できません。これに対して単語バイグラムは、隣接する2語を組にすることで、局所的な語順の情報を保持できます。

「機械学習」のような2語からなる複合的な言い回しも、ユニグラムでは別々の単語に分かれてしまいますが、単語バイグラムなら1つのまとまりとして認識できる点が、両者を分ける実質的な違いです。

トライグラムとの違いは、文脈の広さとデータの疎さのバランスにあります。トライグラムは3語分のより広い文脈を捉えられる一方、組み合わせの種類が単語バイグラムよりさらに増え、データがスパースになりやすいのが特徴です。

単語バイグラムは2語分の文脈にとどめることで、組み合わせの増加を抑えやすくなります。nの値ごとの呼び分けと特徴を整理すると、次のように対応します。

呼称 nの値 扱う単位 特徴
ユニグラム 1 単語を1つずつ独立に扱う 語順の情報を保持できない
単語バイグラム 2 隣り合う2つの単語の組 局所的な語順を保持でき、組み合わせの増加も抑えやすい
トライグラム 3 隣接する3つの単語のまとまり より広い文脈を捉えられるがデータがスパースになりやすい

どちらを選ぶかは、語順情報の広さと組み合わせの多さのどちらを優先するかで決まり、単語バイグラムはその中間的な位置づけです。

4. ビジネス・実務での活用シナリオ

入力補完や予測変換(IME)の分野では、直前の1語をもとに次に来やすい単語を単語バイグラムの統計から推定し、変換候補の提示に活用されています。1語だけの統計では捉えにくい、直前の語とのつながりを反映できるため、入力の手間を減らす体験につながる仕組みです。

検索エンジンや情報検索の分野では、検索クエリを単語バイグラム単位で捉えることで、「機械学習」のような複合語をひとまとまりの意味単位として認識できます。単語1語ずつの一致だけでは拾いきれない、関連性の高い検索結果につなげやすくなるのが強みです。

テキスト分類やスパム検知の分野では、単語1語だけでは捉えにくい隣接語の組み合わせパターンを特徴量に加えることで、文脈を反映した分類が可能になります。特定の単語の並びが特徴的に出現するパターンを手がかりに加えられるため、単語の出現有無だけを見る手法よりも精度を高めやすくなる点は、単語バイグラムならではの効果です。

5. 要点まとめ

  • 単語バイグラムは単語Nグラムのn=2にあたり、隣り合う2つの単語をひとまとまりの単位として扱う手法です。
  • ユニグラムでは失われる語順の一部を保持でき、「機械学習」のような複合的な言い回しを1つの特徴として扱えるようになる一方、組み合わせが増えデータが疎になりやすくなります。
  • トライグラムと比べると文脈の広さは狭いものの組み合わせの増加は抑えやすく、実務では扱いやすさとのバランスからn=2からn=3程度がよく使われます。

6. 確認問題

問1単語バイグラムは、単語Nグラムにおいてnの値を2とした場合を指し、隣接する2つの単語をひとまとまりの単位として扱う。

解答・解説をみる

○ 正しい

単語バイグラムは単語Nグラムのn=2にあたる特殊ケースであり、隣接する2語をひとまとまりの単位として扱う点が定義の中心になります。

問2単語バイグラムはユニグラムと同様に、単語を1つずつ独立に扱うため語順の情報を保持できない。

解答・解説をみる

× 誤り

正しくは逆で、ユニグラムは単語を1語ずつ独立に扱うため語順を保持できないのに対し、単語バイグラムは隣接する2語を組にすることで局所的な語順の情報を保持できます。

問3単語バイグラムはトライグラムと比べて、扱う単語の組み合わせの種類が少なく、データがスパースになりにくい傾向がある。

解答・解説をみる

○ 正しい

nが大きいほど組み合わせの種類は急増しデータが疎になりやすいため、n=2の単語バイグラムはn=3のトライグラムよりスパース化の度合いを抑えやすくなります。