1. 定義と概要
TF-IDFとは、TF(その文書内での単語の出現頻度)とIDF(逆文書頻度)の2つの指標を掛け合わせ、ある単語がその文書にとってどれだけ特徴的かを数値化する手法です。TFは、1つの文書の中でその単語がどれだけ多く使われているかを、文書内の単語数に対する割合で表す指標です。
逆文書頻度(IDF)とは、その語が全文書の中でどれだけ珍しいかを表す指標で、多くの文書に共通して出てくる語ほど値が小さくなります。両者の積であるTF-IDFの値は、その文書に多く出現し、かつ他の文書にはあまり出現しない単語ほど大きくなる点が特徴です。
具体例として、あるニュース記事の中で「関税」「政権」のような特定の話題に関する語は他の記事にあまり出現しないためTF-IDFの値が高くなりやすく、「の」「する」のようにどの記事にも出やすい語は値が低くなります。
文章を機械学習で扱うには、単語を数値に変換する必要があります。最も単純な方法は各単語の出現回数をそのまま数える方法で、これはBoW(Bag-of-Words、文章に含まれる単語の出現回数をそのまま数えて数値化する手法)と呼ばれる手法です。
しかしこの方法では、助詞や一般的な動詞のようにどの文書にも高頻度で出現する語まで重要語として扱われてしまう弱点があります。TF-IDFは、単語が出現する文書の広さ(IDF)で出現頻度(TF)を補正することで、この弱点を軽減し、その文書に固有の特徴語を浮かび上がらせる重み付け手法です。
2. 試験対策ポイント
TFとIDFは、役割の異なる指標にあたります。TFは1つの文書内での出現頻度を表し、IDFは全文書の中でその語がどれだけ珍しいかを表す指標で、この区別がTF-IDFを理解するうえでの前提になります。
TF-IDFはTFとIDFの積として計算され、文書内での出現回数が多く、かつ他の文書にはあまり出現しない語ほど値が大きくなるという性質を理解するうえでの中心的な論点です。3つの指標が何を測っているのかを並べると、次のように整理できます。
| 指標 | 何を測るか | 値が大きくなる語 |
|---|---|---|
| TF | 1つの文書の中でその単語がどれだけ多く使われているか | その文書内での出現回数が多い語 |
| IDF | その語が全文書の中でどれだけ珍しいか | 一部の文書にしか出てこない珍しい語 |
| TF-IDF | 両者の積として、その文書にとってどれだけ特徴的か | 文書内に多く出て、他の文書にはあまり出ない語 |
「の」「する」のように多くの文書に共通して出てくる語は、ストップワード的な語(どの文章にも現れやすく、内容を特徴づけにくい語)と呼ばれ、IDFの値が小さくなります。その結果としてTF-IDFの重みが下がり、文書ごとの特徴語が相対的に浮かび上がる仕組みは、押さえておきたいポイントです。
単純な出現回数だけで単語を数値化する手法、すなわちBoWの弱点を補う重み付けとしての位置づけになっています。BoW・IDF・ストップワード的な語の3つの用語は、互いに関連づけて理解しておきたい関連用語の束です。BoW自体の仕組みや計算過程は、別に整理する対象です。
3. 関連概念との比較・相違点
単純な出現回数の手法であるBoWとの最大の違いは、出現回数をそのまま特徴量(機械学習にデータの特徴を数値として渡すための値)にするか、他の文書での出現しやすさ(IDF)で重みを補正するかです。BoWはどの文書にも出る一般語が高いスコアになりやすいのに対し、TF-IDFはそうした語の重みをIDFで下げます。
「の」「する」のような語はどの文書でも出現数が多くなりがちですが、TF-IDFではIDFの値が小さくなるため、最終的な重みは抑えられる仕組みです。一方で「関税」「政権」のように特定の話題でしか使われない語は、IDFの値が大きく保たれ、TF-IDFの値も高いまま残ります。この違いにより、TF-IDFは文書の内容をより的確に反映した数値表現になります。
両者の対比を観点ごとに並べると、次のようになります。
| 観点 | BoW | TF-IDF |
|---|---|---|
| 数値化の方法 | 出現回数をそのまま特徴量にする | 出現頻度をIDFで補正して重み付けする |
| 一般語の扱い | 高いスコアになりやすい | IDFが小さくなるため重みが抑えられる |
コサイン類似度とは、TF-IDFなどでベクトル化(文章を数値の並びに変換すること)した文書同士の向きの近さを比較する指標で、TF-IDFで数値化した後に使う関係にあります。
4. ビジネス・実務での活用シナリオ
検索エンジン・全文検索の分野では、検索クエリと文書それぞれをTF-IDFで数値化し、クエリに含まれる語がどれだけその文書に特徴的かをスコアとして関連度の高い順に並べ替える方法が使われます。単純な出現回数だけで並べ替えると一般語を多く含む文書が上位に来やすくなりますが、TF-IDFを使うとクエリの意図に合った文書を優先的に表示できます。
文書分類・キーワード抽出の分野では、ニュース記事の自動タグ付けやメールのカテゴリ分類に、各文書を特徴づける語をTF-IDFの値の大きさから抽出する方法が使われます。抽出した語は、分類モデル(あらかじめ決めたカテゴリに文書を振り分ける機械学習モデル)の特徴量になります。文書ごとに重要度の高い語を絞り込めるため、人手でタグを付けるより効率よく大量の文書を分類できます。
コンテンツSEO分析の分野では、自社記事と競合記事に含まれる語の重みを比較し、狙うキーワードに対してどの語が不足しているかを分析するツールの土台としてTF-IDFが使われます。競合との語の重みの差を数値で把握できるため、感覚に頼らない記事の改善につながります。
5. 要点まとめ
- TF-IDFはTF(その文書内での出現頻度)とIDF(多くの文書に出るほど値が小さくなる逆文書頻度)の積で単語の重要度を表す手法です。
- 単純な出現回数の手法の弱点、すなわちどの文書にも出る一般語まで重要語として扱われてしまう点を、IDFによる重み補正で軽減します。
- 検索エンジンの関連度スコアリングや文書分類・キーワード抽出の特徴量として使われます。
6. 確認問題
問1TF-IDFは、ある文書内での単語の出現頻度(TF)と、多くの文書に共通して出現する語ほど値が小さくなる逆文書頻度(IDF)の積で、単語の重要度を数値化する手法である。
解答・解説をみる
○ 正しい
TF-IDFの定義そのものであり、TFとIDFそれぞれの意味と、両者の積で重要度を表すという性質が対応しています。文書内での出現回数と、他の文書での珍しさという2つの軸を掛け合わせている点が要になります。
問2TF-IDFにおいて、多くの文書に共通して出現する語ほどIDFの値は小さくなり、その語の重みは下がる。
解答・解説をみる
○ 正しい
IDFは文書全体の中でその語がどれだけ珍しいかを表す指標であり、「の」「する」のようにどの文書にも出やすい語ほど値が小さくなります。この補正により、文書に固有の語が相対的に目立ちやすくなります。
問3TF-IDFは単語の出現回数だけを特徴量として扱うため、どの文書にも高頻度で出現する一般的な語ほど重要度が高く評価される。
解答・解説をみる
× 誤り
正しくは、TF-IDFはIDFによって多くの文書に共通する語の重みを下げる手法です。出現回数だけをそのまま特徴量として扱い、一般語も高スコアになりやすいのは、TF-IDFではなく単純な出現回数の手法であるBoWの性質です。

