文書分類 (G検定)

文書分類

1. 定義と概要

文書分類とは、与えられた文章を、あらかじめ定義された複数のカテゴリのうちどれか1つ、または複数に割り当てるタスクです。分類先のカテゴリにはラベルが付き、文章とラベルの組み合わせが学習の元データとなります。ラベルとは、データに付けられた正解の分類名です。

身近な例で考えると輪郭がつかみやすくなります。代表例として、ニュース記事を政治・スポーツ・エンタメなどのジャンルへ振り分ける処理や、受信したメールが迷惑メールかどうかを判定するスパムフィルタが挙げられます。

従来、大量の文書をカテゴリごとに整理する作業は人手で行われてきましたが、扱う文書量の増加に伴い、機械学習によって自動でカテゴリを割り当てる仕組みが求められるようになりました。文書分類は、正解ラベル付きのデータから規則を学ぶ教師あり学習の枠組みで実現され、自然言語処理(コンピュータに人の言葉を扱わせる技術分野)の応用タスクの中でも基本的な位置づけにあります。

2. 試験対策ポイント

文書分類は、教師あり学習の代表的なタスクとして整理できます。正解カテゴリであるラベルが付いた訓練データから、文章をどのカテゴリへ割り当てるべきかという規則を学習する点が、この分類の骨格です。

分類の前段として、文章を数値の列(ベクトル)に変換する特徴表現が必要になります。代表的な3つは、文章の何を手がかりに数値へ置き換えるかが異なります。

特徴表現 数値化の考え方
Bag-of-Words(BoW) 単語の出現回数だけを数えて数値化する。並び順は考慮しない
TF-IDF その文書によく出て、他の文書にはあまり出ない単語ほど重要とみなして重み付けする
単語埋め込み 「word2vec」などの手法で、似た意味の単語を近い数値ベクトルとして表し、単語の意味的な近さを捉える

どれを使うかは、文章のどこを手がかりにしたいかで変わります。Bag-of-Words(BoW)は、語の並びを捨てて回数だけを見る素朴な数え方にあたります。TF-IDFは、その文書らしさを重みとして反映させたい場面で使われます。この3つの特徴表現は、あわせて整理しておきたい論点です。

分類アルゴリズムとしては、ナイーブベイズ(単語の出現確率をもとにカテゴリを推定するシンプルな確率モデル)が広く使われてきました。SVM(サポートベクターマシン)は、データをカテゴリごとに分ける境界線を求める手法で、こちらも古典的な手法として知られています。

近年は「BERT」(あらかじめ大量の文章で学習しておき、文の意味を文脈込みで捉えられる言語モデル)のような深層学習のモデルによる分類も扱われ、評判分析(感情分析。文章がポジティブかネガティブかを判定するタスク)は極性のカテゴリに絞った文書分類の一種として整理されます。あわせて、GLUE(自然言語理解に関する複数のタスクをまとめた評価用のベンチマーク集)には、文の分類タスクが含まれる点も、関連する論点として押さえておきたいところです。

3. 関連概念との比較・相違点

評判分析との関係は、包含関係として整理できます。評判分析は、判定するカテゴリをポジティブ・ネガティブという極性に絞った文書分類の一種であり、文書分類という大きな枠組みの中に評判分析が含まれる形になります。カテゴリの数や種類を限定しない一般的な文書分類に対して、評判分析はカテゴリの設計をあらかじめ極性の2つ(場合によっては中立を含めた3つ)に絞り込んだ特殊形にあたります。

自然言語推論(2つの文の関係が含意・矛盾・中立のどれかを判定するタスク)との最大の違いは、判定の対象となる文章の数です。文書分類は1つの文章を受け取り、それをあらかじめ定めたカテゴリのどれかへ割り当てるタスクですが、自然言語推論は前提文と仮説文という2つの文を受け取り、その関係を判定するタスクです。どちらも文章にカテゴリやラベルを割り当てる点は共通していますが、入力が1つの文か2つの文かという点で対象の設計が異なります。

クラスタリング(正解ラベルを与えずデータの似ているもの同士を自動でグループ分けする手法)との違いは、カテゴリをあらかじめ人が定義するかどうかという点にあります。文書分類は、正解カテゴリ付きの訓練データから規則を学ぶ教師あり学習であり、分類先のカテゴリはあらかじめ決まっています。一方でクラスタリングは教師なし学習(正解ラベルを使わずに学習する方式)の枠組みで、正解ラベルを与えずにグループの数や意味を分析の結果として導き出す点が、文書分類とは対照的です。

ここまでの3つの違いは、対象と、カテゴリの決め方という2つの軸で並べると見通しがよくなります。

概念 判定の対象 カテゴリの決め方
文書分類 1つの文章 あらかじめ人が定義する(教師あり学習)
評判分析 1つの文章 極性の2つ、中立を含めれば3つに絞って定義する
自然言語推論 前提文と仮説文の2つの文 含意・矛盾・中立のどれかを判定する
クラスタリング 正解ラベルのないデータ 与えずに、分析の結果として導き出す(教師なし学習)

いずれも文章やデータに区分を与える処理ですが、対象が1つの文章かどうか、区分を先に決めるかどうかで見分けられます。

4. ビジネス・実務での活用シナリオ

メール・セキュリティの分野では、受信メールを迷惑メールか通常メールかに自動判定するスパムフィルタが、文書分類の代表的な活用例です。単語の出現パターンから迷惑メールらしさを推定するナイーブベイズなど、古典的な分類手法が長く使われてきました。大量に届くメールを人手で一件ずつ確認する負担を減らし、悪質なメールによる被害を未然に防ぐ役割を担っています。

メディア・ポータルの分野では、配信するニュース記事を政治・経済・スポーツ・エンタメなどのジャンルへ自動で振り分ける仕組みに、文書分類が使われています。記事の内容から適切なカテゴリを瞬時に判定できれば、編集担当者が一件ずつジャンルを割り振る作業から解放され、記事配信の運用工数を削減できます。

カスタマーサポートの分野では、寄せられた問い合わせ内容のテキストを内容カテゴリごとに自動分類し、担当部署への一次振り分けにかかる時間を短縮する取り組みが進んでいます。問い合わせの内容を人が読んで振り分ける工程を減らせれば、対応までの待ち時間が短くなり、顧客満足度の向上にもつながります。

5. 要点まとめ

  • 文書分類は、あらかじめ定義したカテゴリのどれかに文章を割り当てる教師あり学習のタスクです。Bag-of-Words(BoW)や「TF-IDF」で文章を数値化したうえで、ナイーブベイズやSVM、深層学習のモデルで分類します。
  • 評判分析は、ポジティブ・ネガティブという極性のカテゴリに限定した文書分類の一種です。自然言語推論は、1つの文ではなく2つの文の関係を判定する、別のタスクにあたります。
  • クラスタリングとの違いは、カテゴリをあらかじめ定義する教師あり学習か、データから自然にグループが分かれる教師なし学習かという点にあります。

6. 確認問題

問1文書分類は、あらかじめ定義されたカテゴリのいずれかに文章を割り当てる教師あり学習のタスクである。

解答・解説をみる

○ 正しい

文書分類は、正解カテゴリ(ラベル)が付いた訓練データから規則を学ぶ教師あり学習の代表例です。分類の前段では、文章を数値ベクトルに変換する処理も必要になります。

問2評判分析(感情分析)は、文章をポジティブ・ネガティブという極性のカテゴリに分類するタスクであり、文書分類の一種として位置づけられる。

解答・解説をみる

○ 正しい

評判分析は、判定するカテゴリを極性に絞った文書分類の一種という関係にあります。文書分類という大きな枠組みの中に、評判分析が含まれる形で整理されます。

問3文書分類は、前提文と仮説文という2つの文の関係が含意・矛盾・中立のいずれにあたるかを判定するタスクである。

解答・解説をみる

× 誤り

2つの文の関係を判定するのは、自然言語推論の説明です。文書分類は1つの文章をあらかじめ定めたカテゴリへ割り当てるタスクであり、対象となる文章の数が異なります。