文字トライグラム (G検定)

文字トライグラム

1. 定義と概要

文字トライグラムとは、テキストを文字単位で分割したうえで、隣り合う3文字の組を1つの単位として、1文字ずつずらしながら切り出す手法です。文章をまとまりの文字数(N)で区切って取り出す文字Nグラムのうち、Nの値を3とした場合にあたります。「自然言語処理」という6文字に文字トライグラムを適用すると、先頭から1文字ずつずらしながら「自然言」「然言語」「言語処」「語処理」という3文字ずつの組が4個得られます。

隣り合う2文字の組を単位とする文字バイグラム(直前の1文字分のつながりしか取り込めない手法)に対し、文字トライグラムは連続する3文字をひとまとまりとして扱います。これにより、直前の2文字分のつながりという一回り長い並びの情報を特徴量(AIがパターンを学習する際の手掛かりとなる数値化されたデータの特徴)として扱えます。

一方で、組を単位にする文字数が増えるほど出現しうる文字の組み合わせの種類、すなわち次元(文字の組み合わせパターンの種類の数)は急激に増加し、個々の出現回数はまばら(疎・スパースな状態)になりやすい傾向です。安定して扱うには、文字バイグラム以上に大きなデータ量が求められます。

2. 試験対策ポイント

まず押さえておきたいのは、文字トライグラムが、隣り合う文字を一定数ずつまとめて取り出す考え方のうちNの値を3とした場合を指す言葉であり、隣接する3文字をひとまとまりの単位として1文字ずつずらしながら切り出す点です。

文字を1つずつ独立に扱う文字ユニグラム(N=1の場合)、隣接する2文字をひとまとめにする文字バイグラム(N=2の場合)との呼称の対応もあわせて整理したいところです。

文字バイグラムでは直前の1文字分のつながりしか捉えられないのに対し、文字トライグラムは直前の2文字分のつながりを単位に取り込めます。この結果、識別力(文章やカテゴリを見分ける力)が文字バイグラムより高くなります。

一方で制約もあり、扱う組み合わせの種類(次元)は文字バイグラムよりさらに増え、おおむね文字の種類の数の3乗規模に達します。組み合わせが増えるほど個々の出現頻度はまばらになりやすく、必要なデータ量や計算コストの負担も文字バイグラムより大きくなる点が、文字トライグラムのトレードオフ(一方を追うともう一方が犠牲になる関係)です。

代表的な活用先として、言語判定(文書がどの言語で書かれているかをコンピュータが統計的に判別すること)があわせて整理されます。表記ゆれ(送り仮名や漢字・かなの書き方が揺れて複数の表記になること)があっても、部分的な文字の並びの一致から関連文書を拾える検索も同様です。より長い文字の並びを手掛かりにできる分、文字バイグラムより判別の手掛かりが豊富になります。

文字単位で切り出す文字トライグラムに対し、単語を単位にする単語トライグラムは、分割の単位が異なる点をあわせて押さえておきたいところです。

3. 関連概念との比較・相違点

文字バイグラムとの最大の違いは、捉えられる文字の並びの長さと、次元・データ量の負担のトレードオフにあります。観点ごとに並べると関係がはっきりします。

観点 文字バイグラム 文字トライグラム
取り込めるつながり 直前の1文字分 直前の2文字分
識別力 トライグラムより低い バイグラムより高い
次元・データ量の負担 相対的に小さい 文字の種類の数の3乗規模まで増える

捉える情報量を優先するか扱いやすさを優先するかが、この2つを使い分ける際の軸です。

単語トライグラム(分かち書き、つまり文章を単語ごとに区切る処理を前提に、連続する3つの単語を組にする手法)との最大の違いは、分割の単位が文字か単語かという点にあります。単語トライグラムは形態素解析(辞書と文法規則を使って文章を単語に分割し、品詞なども判定する処理)を経て単語の区切りを決めるのに対し、文字トライグラムは単語の境界判定を経ずに連続する3文字を組にします。

この違いは、得意な場面の違いにもつながります。単語トライグラムは意味のまとまりを保ちやすい一方、辞書に無い未知語には弱いのが弱点です。文字トライグラムは未知語や表記ゆれに強い代わりに、単語としての意味のまとまりは保持しません。

4. ビジネス・実務での活用シナリオ

言語判定・多言語コンテンツ管理の分野では、文字トライグラムの出現頻度パターンを特徴量にすることで、文書がどの言語で書かれているかを統計的に判別する手掛かりになります。文字バイグラムより長い並びを捉えられるため、言語ごとの特徴をより豊富に手掛かりにできる点が強みです。

全文検索・表記ゆれに強い検索の分野では、文字トライグラムでインデックス(検索を高速化するためにあらかじめ作っておく検索用のデータ構造)を作成します。送り仮名や漢字・かなの書き方の揺れがあっても、部分的な3文字の並びの一致から関連文書を拾いやすくなります。単語単位の検索では取りこぼしやすい文書も拾えるため、検索漏れを抑えられる点が実務上のメリットです。

著者推定・文体分析やスパムフィルタの分野でも、文字トライグラムの出現頻度は、書き手固有の文体的な傾向や迷惑メールらしい文体を統計的に判別する手掛かりになります。文字バイグラムより細かい並びを捉えられる一方、必要なデータ量の負担が大きくなる点は留意したいところです。

5. 要点まとめ

  • 文字トライグラムは、まとまりの文字数(N)を3とした場合であり、隣り合う3文字の組を1文字ずつずらしながら切り出す手法です。
  • 文字バイグラムより長い文字の並びを捉えられるため識別力が上がる一方、組み合わせの種類(次元)が増えて必要なデータ量・計算コストの負担が大きくなります。
  • 言語判定や表記ゆれに強い検索など、より長い文字の並びの特徴を手掛かりにする場面で活用されます。

6. 確認問題

問1文字トライグラムとは、まとまりの文字数(N)を3とした場合であり、隣り合う3文字の組を1文字ずつずらしながら切り出す手法である。

解答・解説をみる

○ 正しい

文字トライグラムは、まとまりの文字数(N)を3とした特殊なケースで、隣接する3文字を単位として1文字ずつずらしながら切り出す手法です。文字を1つずつ扱う文字ユニグラム、隣接する2文字を単位にする文字バイグラムと並ぶ呼び方の一つにあたります。

問2文字トライグラムは文字バイグラムと比べて、扱う文字の組み合わせの種類(次元)が少なく、データが疎になりにくい。

解答・解説をみる

× 誤り

正しくは逆の関係にあります。文字トライグラムは文字バイグラムより組み合わせの種類(次元)が増え、データが疎になりやすくなります。より長い文字の並びを捉えられて識別力が上がる代わりに、必要なデータ量や計算コストの負担が大きくなるというトレードオフがあります。

問3文字トライグラムは、文書がどの言語で書かれているかを統計的に判別する言語判定などで活用される。

解答・解説をみる

○ 正しい

文字トライグラムの出現頻度パターンを特徴量にすることで、文書がどの言語で書かれているかを統計的に判別する手掛かりになります。送り仮名や表記の揺れに強い検索でも活用されます。