ウェブマイニング (G検定)

ウェブマイニング

1. 定義と概要

ウェブマイニングとは、データマイニング(大量のデータから統計学や機械学習の手法で規則性やパターンを見つけ出す技術)の技術を、ウェブサイトの構造やウェブ上のデータに適用し、有用な情報や知識、パターンを抽出する技術です。データマイニングの対象データをウェブに限定した派生分野という位置づけにあります。

具体例としては、掲示板やブログ、商品レビューサイトの投稿から意見や評判を抽出する分析、ECサイトのアクセスログから商品同士の関連性を見つける分析、検索エンジンがページ間のリンク構造から重要度を算出する処理などが挙げられます。いずれも、ウェブという場所に日々たまっていくデータを材料にしている点が共通しています。

データマイニングは、もともと企業内に蓄積された顧客データベースやPOSデータのような構造化データを主な対象としていました。しかしインターネットの普及とともに、ウェブページのテキストやリンク構造、アクセスログといった膨大かつ多様な形式のデータがウェブ上に蓄積されるようになりました。

こうしたウェブ特有のデータ形式を扱う分析技術として、データマイニングから派生する形でウェブマイニングが発展した、という流れにあります。

2. 試験対策ポイント

対象とするデータの種類による3つの分類は、押さえておきたいポイントです。分析対象ごとに整理すると、次の3つに分かれます。

分類 分析の対象になるデータ
ウェブコンテンツマイニング ウェブページのテキストや画像、動画などの内容そのもの
ウェブ構造マイニング ページ間のハイパーリンク構造
ウェブ利用マイニング アクセスログやクリック履歴などの利用者の行動データ

同じウェブマイニングという枠組みの中でも、何を分析対象にするかによって手法や目的が異なる点は、取り違えやすい点です。名称と対象データの組み合わせを、言葉の意味からたどれる形にしておくと迷いにくくなります。

ウェブ構造マイニングの代表例として扱われるのがPageRank(リンク構造をもとにしたページ評価の仕組み)です。多くの質の高いページからリンクされているページほど重要度が高いという考え方に基づき、リンク構造から各ページの重要度を算出するアルゴリズムで、検索結果の順位づけに応用されています。

ウェブ利用マイニングは、アクセスログやクリック履歴を分析する分野です。似た嗜好を持つ利用者どうしの行動を参考にする協調フィルタリング(似た好みを持つ利用者どうしの行動を参考におすすめを決める手法)に応用される点は、あわせて整理しておきたいところです。レコメンデーション(利用者の好みに合わせておすすめの商品や情報を提示する仕組み)に応用される点も同様です。

データマイニングとの関係も、あわせて見ておきたい論点です。ウェブマイニングはデータマイニングの技術をウェブ上のデータに適用対象を絞った派生分野という関係にあり、対象をテキストデータに絞ったテキストマイニング(文章データを対象にしたデータマイニングの一分野)と並ぶ位置づけにあります。

オントロジー研究との関連でも扱われる論点があります。完全な正確性よりも実用性を優先するライトウェイト・オントロジー(完全な正確性よりも実用性を優先して知識を整理する考え方)という考え方があります。これは、あらゆる知識を人手で網羅的かつ厳密に整備しようとするヘビーウェイト・オントロジー(あらゆる知識を人手で網羅的かつ厳密に整備しようとする考え方)と対比されます。

代表例が、一般常識を人手ですべてデータベース化しようとしたCycプロジェクト(一般常識を人手ですべてデータベース化しようとした、ヘビーウェイト・オントロジーの代表的な取り組み)です。ウェブ上の膨大なデータを扱うウェブマイニングとは、実用性を優先するライトウェイト・オントロジーのほうが相性がよいアプローチとして紹介されます。

3. 関連概念との比較・相違点

データマイニングとの最大の違いは、対象データの範囲にあります。データマイニングは分析対象を限定しない総称であるのに対し、ウェブマイニングはウェブページ・リンク構造・アクセスログなどウェブ上のデータに対象を絞った派生分野という包含関係にあります。

データマイニング一般の代表的な分析手法の詳しい説明は、対象を限定しないデータマイニングという概念そのものの解説に譲り、本記事ではウェブに特化したデータをどう扱うかという点に焦点を当てます。

テキストマイニングとの関係も整理が必要です。どちらもデータマイニングを対象データの種類で絞った派生分野ですが、テキストマイニングは対象をテキストデータ全般に絞るのに対し、ウェブマイニングは対象をウェブ上のデータに絞るという違いがあります。

ウェブコンテンツマイニングはページ内テキストの分析にテキストマイニングの手法を応用する関係にあり、両者は重なり合う部分を持ちながらも対象範囲の広さが異なります。3つの呼び名を、対象範囲の広さの順に並べると違いがはっきりします。

分野 分析対象の範囲
データマイニング 対象を限定しない総称
テキストマイニング テキストデータ全般
ウェブマイニング ウェブページ・リンク構造・アクセスログなど、ウェブ上のデータ

3分類どうしの使い分けも、押さえておきたいポイントです。ウェブコンテンツマイニングはページの内容そのもの、ウェブ構造マイニングはページ間のリンク構造、ウェブ利用マイニングは利用者の行動ログを対象とし、それぞれ情報抽出・重要度評価・行動予測という異なる分析目的を持ちます。

対象データが違えば得られる知見の種類も変わるため、目的に応じてどの分類の技術を使うかを見分ける視点は、理解するうえでの中心的な論点です。

4. ビジネス・実務での活用シナリオ

検索エンジンの分野では、PageRankアルゴリズムに代表されるウェブ構造マイニングの技術でページ間のリンク構造を分析し、検索結果の表示順位を決定しています。多くの質の高いページからリンクされているかどうかを重要度の指標にすることで、単なるキーワードの一致だけでは測れないページの信頼性を評価できるようになりました。

EC・小売の分野では、ウェブ利用マイニングでアクセスログやクリック履歴を分析し、協調フィルタリングを用いたレコメンデーションで購買を後押しする取り組みが広がっています。利用者一人ひとりの閲覧履歴から似た嗜好を持つ他の利用者の行動を参考にすることで、担当者の経験だけに頼らない形でおすすめ商品を提示できます。

マーケティング・カスタマーサポートの分野では、ウェブコンテンツマイニングで掲示板やSNS、レビューサイトの投稿テキストを分析し、商品やサービスに対する評判や意見を把握する取り組みが行われています。膨大な投稿の中から人手では拾いきれない声を自動的に集約できるため、商品改善や顧客対応の材料として活用されています。

5. 要点まとめ

  • ウェブマイニングとは、データマイニングの技術をウェブ上のデータに適用し、有用な情報やパターンを抽出する技術で、データマイニングを対象データの種類で絞った派生分野です。
  • 対象データの種類によってウェブコンテンツマイニング(ページの内容)、ウェブ構造マイニング(リンク構造。PageRankアルゴリズムなど)、ウェブ利用マイニング(アクセスログ等の行動データ)の3つに分類されます。
  • 完全な正確性より実用性を優先するライトウェイト・オントロジーという考え方と関連が深く、Cycプロジェクトのようなヘビーウェイト・オントロジーと対比されます。

6. 確認問題

問1ウェブマイニングとは、データマイニングの技術をウェブ上のデータに適用し、有用な情報やパターンを抽出する技術のことである。

解答・解説をみる

○ 正しい

ウェブマイニングの定義そのものです。データマイニングを対象データの種類でウェブに絞った派生分野という位置づけにあります。

問2ウェブマイニングは対象データの種類によって、ウェブコンテンツマイニング・ウェブ構造マイニング・ウェブ利用マイニングの3つに分類される。

解答・解説をみる

○ 正しい

3分類の説明そのものです。ページの内容、リンク構造、利用者の行動データという異なる対象で使い分けられます。

問3PageRankアルゴリズムはウェブ利用マイニングの代表例であり、利用者のアクセスログを分析してページの重要度を算出する仕組みである。

解答・解説をみる

× 誤り

PageRankアルゴリズムはウェブ構造マイニングの代表例です。正しくは、リンク構造(どのページからリンクされているか)に基づいて重要度を算出するもので、アクセスログを扱うウェブ利用マイニングとは異なる分類にあたります。