1. 定義と概要
文字ユニグラムとは、文字Nグラムにおいて値を1とした場合であり、文章を1文字ずつ独立した最小単位として区切って扱う手法のことです。連続する文字同士のつながり、つまり並び順はいっさい考慮せず、それぞれの文字を単独で切り出します。
たとえば「東京都」という3文字を文字ユニグラムに分解すると、「東」「京」「都」という1文字ずつの単位になります。文字バイグラムであれば「東京」「京都」のように2文字ずつのまとまりになる一方、文字ユニグラムは常に1文字単位にとどまるのが特徴です。
文字Nグラムは、値を大きくするほど隣接する文字のつながり、つまり局所的な文脈を捉えやすくなります。一方で、文字の組み合わせの種類が急激に増えてデータが疎(スパース。組み合わせのパターンが多すぎて、個々の出現回数がまばらで少なくなっている状態)になりやすいというトレードオフも持ちます。
文字ユニグラムはこの値を最小の1とした極限のケースであり、扱う次元(文字の組み合わせパターンの種類の数)は、文中に登場する文字の異なり数が上限です。そのため文字バイグラム・トライグラム以上に比べて次元が小さく済み、データが疎になりにくいという性質を持つ一方、文字の並びや隣接関係の情報を完全に失うため、単独ではどの文字がどの文字の後に来るかという文脈情報をまったく捉えられません。
2. 試験対策ポイント
まず整理しておきたいのは、文字ユニグラムが文字Nグラムで値を1としたケースであるという位置づけです。同じ枠組みで値を2とすれば文字バイグラム、3とすれば文字トライグラムと呼び名が変わり、値が大きくなるほど一度に扱う文字数が増えていきます。この呼称の対応は、文字Nグラムを扱ううえでの基本用語としてあわせて押さえておきたいところです。
文字ユニグラムの最大の特徴は、文字の並び、つまり隣接関係の情報を完全に失う点にあります。文字を1つずつ独立に扱うため、使われている文字の集合と出現回数が同じであれば、並び順が違う文字列でも区別できません。たとえば「いろは」と「はろい」は、文字ユニグラムとして見るかぎり同じ3種類の文字から成る点で違いが表れません。
一方で、扱う次元は文中の文字の異なり数にとどまるため、組み合わせの種類が少なく済み、データが疎になりにくいという裏返しの利点があります。計算量やメモリの面でも扱いやすく、単独では文脈情報をほとんど捉えられない分、実務では文字バイグラム以上と組み合わせて使う運用が多い点も押さえどころです。
文字単位で区切るため、単語の境界を判定する形態素解析(文章を単語ごとに分割し、品詞などを判定する処理)を経ずに使える点は、文字Nグラム全般に共通する特徴です。文字ユニグラムは1文字ずつに分解する分、単語としての意味的なまとまりをまったく保持できません。
3. 関連概念との比較・相違点
文字バイグラム・文字トライグラムとの最大の違いは、文字の並び、つまり隣接関係を捉えられるかどうかという点です。バイグラム以上は連続する複数の文字をひとまとまりとして扱うことで局所的なつながりを保持できるのに対し、文字ユニグラムは1文字ずつ独立に扱うためこの情報を完全に失います。代わりに文字ユニグラムは次元が小さく、データが疎になりにくいという利点を持ちます。
単語ユニグラムとの最大の違いは、分割の単位が文字か単語かという点です。単語ユニグラムは分かち書き(文章の単語と単語の間に区切りを入れること。形態素解析を前提とします)を経て単語1つを最小単位とし、文字ユニグラムは単語の境界判定を経ずに文字1つを最小単位とします。未知語(辞書に載っていない新しい言葉や固有名詞)への強さも含めた対比は次のとおりです。
| 観点 | 文字ユニグラム | 単語ユニグラム |
|---|---|---|
| 意味のまとまり | 保持しない | 単語として保てる |
| 未知語・表記ゆれ | 強い | 未知語に弱い |
意味のまとまりを手放す代わりに未知語や表記ゆれに強い、というのが文字ユニグラムの立ち位置です。
4. ビジネス・実務での活用シナリオ
言語判定や文字種分析の分野では、文字ユニグラムの出現頻度、つまり使われている文字の分布だけで、ひらがな・漢字・アルファベットのどれが多いかといった大まかな文字種の傾向や、どの言語で書かれた文書かを推定する手掛かりに使われます。文字の並びを考慮しない分、計算の負荷を抑えたまま文書全体の傾向をひとまず把握できる点が、この用途で選ばれる理由です。
全文検索や表記ゆれの照合を行う場面でも、文字ユニグラムは下準備の役割を担います。文字バイグラム以上と組み合わせる前段として、まず文字ユニグラムの出現頻度で文書全体の大まかな類似度や文字の偏りを把握し、詳細な照合に進む前の一次的な絞り込みに使われます。次元が小さいために計算量を抑えられ、大量の文書を一度にふるいにかける段階に適した手法です。
OCR(画像に写った文字をコンピュータが読み取り、テキストデータに変換する技術)の出力結果に含まれる文字ユニグラムの出現頻度を集計し、通常の文書とかけ離れた文字分布から誤認識の疑いがある箇所を検知する使い方もあります。1文字単位の頻度というシンプルな指標であるため、大量の出力結果を高速に走査し、異常箇所を絞り込めます。
5. 要点まとめ
- 文字ユニグラムは文字Nグラムで値を1とした場合であり、文章を1文字ずつ独立した単位として区切り、文字の並び(隣接関係)の情報を完全に失います。
- 扱う次元は文中の文字の異なり数にとどまるため、文字バイグラム・トライグラム以上に比べてデータが疎になりにくいですが、単独では文脈をほとんど捉えられません。
- 単語ユニグラムとは分割の単位(文字か単語か)で異なり、実務では文字バイグラム以上と組み合わせて使われることが多くあります。
6. 確認問題
問1文字ユニグラムとは、文字Nグラムで値を1とした場合であり、文章を1文字ずつ独立した単位として扱う。
解答・解説をみる
○ 正しい
文字ユニグラムは値を1とした文字Nグラムの呼び名で、文字同士のつながりを考慮せず1文字ずつ独立に切り出します。値を2にすれば文字バイグラム、3にすれば文字トライグラムと呼び名が変わります。
問2文字ユニグラムは文字バイグラムやトライグラムと同様に、隣接する文字のつながり、つまり並び順の情報を保持できる。
解答・解説をみる
× 誤り
正しくは、文字ユニグラムは1文字ずつ独立に扱うため、隣接する文字のつながりの情報を完全に失います。連続する複数の文字をまとめて扱うことで局所的なつながりを保持できるのは、値が2以上の文字バイグラム以上です。
問3文字ユニグラムが扱う次元、つまり組み合わせの種類は、文中に登場する文字の異なり数にとどまるため、文字バイグラム・トライグラム以上と比べてデータが疎になりにくい。
解答・解説をみる
○ 正しい
文字ユニグラムは数える単位が文字1つで済み、組み合わせの種類が文字の異なり数の範囲にとどまります。そのため、値を大きくするほど疎になりやすい文字バイグラム・トライグラムに比べて、データが疎になりにくくなります。

