1. 定義と概要
単語ユニグラムとは、単語Nグラムにおいてn=1とした場合、すなわち文章を単語単位に分割したうえで単語ひとつずつを独立した最小単位として扱う手法のことです。連続する単語同士のつながり、つまり語順はいっさい考慮せず、それぞれの単語を単独で切り出します。
たとえば「私は自然言語処理に興味があります」を分かち書き(単語と単語の間に区切りを入れること)すると「私/は/自然言語処理/に/興味/が/あります」となり、この一語ずつがそのまま単語ユニグラムです。単語バイグラム(n=2の単語Nグラム)なら「私は」「は自然言語処理」のように2語ずつのまとまりになりますが、単語ユニグラムは常に1語単位にとどまります。
単語Nグラムは、nを大きくするほど語順や文脈を捉えやすくなる一方、単語の組み合わせが急激に増え、データが疎(スパース。組み合わせパターンが多すぎて個々の出現回数がまばらで少なくなっている状態)になりやすい関係にあります。単語ユニグラムはこのnを最小の1とした場合にあたり、語順は保持できない代わりに、数える単位が単語ひとつずつで済むため疎になりにくいという性質を持ちます。
この出現頻度をそのまま特徴量(機械学習モデルに入力する、データを数値で表した特徴の集合)として使う発想は、単語の出現回数だけを数えるBag-of-Words(BoW)と同じです。Bag-of-Words(BoW)とは、文中の単語の出現有無や頻度だけに注目し、語順を無視してテキストを数値化する手法のことです。単語ユニグラムの頻度集計はBoWと実質的に同じ処理として扱われます。
2. 試験対策ポイント
単語ユニグラムは、単語Nグラムでn=1としたケースが出発点になります。nの値によって呼び方が変わるため、次の対応関係を基本用語としてそのまま押さえておきたいところです。
| nの値 | 呼び方 | まとめて扱う単語数 |
|---|---|---|
| n=1 | 単語ユニグラム | 1語 |
| n=2 | 単語バイグラム | 連続する2語 |
| n=3 | 単語トライグラム | 連続する3語 |
単語ユニグラムの最大の特徴は、語順の情報を完全に失う点にあります。単語を1つずつ独立に扱うため、「猫が犬を追う」と「犬が猫を追う」のように単語の並びが入れ替わった文でも、使われている単語の集合と出現回数が同じであれば区別できません。この点は取り違えやすいところです。
一方、nを2以上としたバイグラムやトライグラムと違い、数える単位が単語1つで済むため組み合わせの種類が語彙の範囲にとどまり、データが疎になりにくい利点があります。大量の学習データを必要とせず、少ないデータでも各単語の出現頻度を安定して推定しやすい性質です。
単語ユニグラムの出現頻度を特徴量にする発想は、BoWと実質的に同じ扱いになります。単純集計に加え、出現頻度に重み付けを加えるTF-IDF(単語の出現回数に加え、その単語が他の文書にもどれだけ出現するかで重み付けする手法)の基礎単位でもあります。
すべての単語が互いに独立に出現するという仮定のもとで、各単語の出現確率だけからテキストの生成確率を求める最も単純な言語モデル(単語や文字の並びがどれくらい自然かを確率で表すモデル)は、ユニグラム言語モデルと呼ばれます。
3. 関連概念との比較・相違点
単語バイグラムや単語トライグラムとの最大の違いは、語順を保てるかどうかという点にあります。バイグラム以上は連続するn語をひとまとまりとして扱うことで、前後の単語のつながり、つまり局所的な語順を部分的に保持できる形式です。
これに対して単語ユニグラムは単語を1つずつ独立に扱うため、語順の情報を完全に失います。その代わり、単語ユニグラムは組み合わせの種類が少なく済み、データが疎になりにくいため、少ない学習データでも扱いやすい裏返しの利点を持ちます。
BoWとの関係は、対立ではなく処理としての一致にあります。BoWは文書を単語の袋とみなし、語順を無視して各単語の出現回数だけを数える手法であり、これは単語ユニグラムという単位で単語の出現頻度を数える操作と同じ結果になります。単語ユニグラムはn=1の単語Nグラムという捉え方、BoWは単語の出現回数だけを見る捉え方であり、異なる切り口から同じ表現にたどり着いている関係です。
4. ビジネス・実務での活用シナリオ
テキスト分類やスパムフィルタの分野では、メールやレビュー文から単語ユニグラムの出現頻度を特徴量にしたベクトルを作り、迷惑メール判定やジャンル分類の入力に使います。語順を考慮しない分、実装が容易で計算コストも低く、複雑なモデルに進む前にまず試すベースラインの手法として位置づけられます。
検索エンジンや情報検索の分野では、文書に含まれる単語ユニグラムごとに、その単語を含む文書を紐づけた索引、つまり転置インデックス(単語ごとに、その単語を含む文書を対応づけて記録した索引)を作る土台として使われます。単語単位で索引を作ることで、キーワード検索の際に該当する文書を高速に絞り込めます。
頻出語分析やワードクラウドの分野でも、単語ユニグラムは有効です。アンケートの自由記述やSNS投稿から出現頻度を集計し、頻出キーワードやトピックの傾向を可視化する一次的な分析に使われます。細かい文脈までは追えない一方、大量のテキストから傾向をざっと把握する用途には手軽さが利点です。
5. 要点まとめ
- 単語ユニグラムは単語Nグラムでn=1とした場合であり、文章を単語ひとつずつの独立した単位として扱い、語順の情報を完全に失います。
- 単語バイグラム・単語トライグラム(n=2以上)と異なり組み合わせの種類が少なく済むためデータが疎になりにくく、少ない学習データでも扱いやすいという裏返しの利点があります。
- 単語ユニグラムの出現頻度を数える操作はBag-of-Words(BoW)と実質的に同じ扱いになり、単純な頻度集計やTF-IDFの基礎単位としても使われます。
6. 確認問題
問1単語ユニグラムとは、単語Nグラムにおいてn=1とした場合であり、単語ひとつずつを独立した単位として扱う。
解答・解説をみる
○ 正しい
単語ユニグラムはnの値を1とした単語Nグラムの呼び方で、単語同士のつながりを考慮せず1語ずつ独立に切り出します。n=2は単語バイグラム、n=3は単語トライグラムと呼ばれます。
問2単語ユニグラムは単語バイグラムやトライグラムと同様に、連続する単語の並び(語順)の情報を保持できる。
解答・解説をみる
× 誤り
正しくは単語ユニグラムは単語を1つずつ独立に扱うため語順の情報を完全に失います。連続するn語をまとめて扱うことで局所的な語順を保持できるのは単語バイグラム以上です。
問3単語ユニグラムは単語バイグラムやトライグラムと比べて組み合わせの種類が少なく済むため、データが疎になりにくく少ない学習データでも扱いやすい。
解答・解説をみる
○ 正しい
単語ユニグラムは数える単位が単語1つで済み組み合わせの種類が語彙の範囲にとどまるため、nを大きくするほど疎になりやすいバイグラム・トライグラムに比べてデータが疎になりにくくなります。

