1. 定義と概要
データマイニングとは、大量に蓄積されたデータの中から、統計学や機械学習などの手法を用いて、これまで知られていなかった規則性・関連性・パターンを見つけ出す技術です。分析の対象をどこまで絞るかによって呼び名が変わるため、まず呼称と対象の対応を整理します。
| 呼称 | 分析の対象 | 位置づけ |
|---|---|---|
| データマイニング | 対象を限定しないデータ全般 | 総称 |
| テキストマイニング | 文章データ | 対象を絞った派生分野 |
| ウェブマイニング | ウェブページやアクセスログなどウェブ上のデータ | 対象を絞った派生分野 |
派生分野といっても別物の技術ではなく、扱うデータの種類が違うだけで、規則性を見つけ出すという狙いは共通しています。
具体例としては、スーパーの購買データから一緒に買われやすい商品の組み合わせを見つける相関ルール抽出(バスケット分析。「Aを買った人はBも買いやすい」という組み合わせを見つけ出す手法)が挙げられます。もう一つの例が、クレジットカードの利用パターンから不正利用の兆候を検知する異常検知(通常のパターンから外れたデータを見つけ出す手法)です。これらはいずれも、購買データや取引データといった実務で日常的に生まれる情報から、新しい知見を引き出す典型例です。
データマイニングという研究領域は、1989年に開催された「Knowledge Discovery in Databases」と題するワークショップに起源をたどれます。略称のKDD(データベースから知識を発見する一連のプロセス全体を指す用語)は、当時「データマイニング」という呼び方に否定的なニュアンスもあったため、研究者の間でより中立的な呼称として使われた経緯があります。
企業や社会に蓄積されるデータ量が飛躍的に増えるにつれて、人手では気づきにくい規則性やパターンを自動的に見つけ出す技術としての需要が高まっていきました。現在では、小売・金融・医療をはじめとする幅広い業界で、データマイニングが日常的な業務の一部として活用されています。
2. 試験対策ポイント
まず押さえておきたいのは、テキストマイニング・ウェブマイニングとの関係です。データマイニングは分析対象を限定しない総称であり、対象をテキストに絞ればテキストマイニングと呼ばれ、ウェブページやアクセスログなどウェブ上のデータに絞ればウェブマイニングと呼ばれるという包含関係にあります。この関係は、範囲の広いほうから狭いほうへと絞り込む形で整理できます。
代表的な手法は4つあります。一つ目は、一緒に起こりやすい事柄の組み合わせを見つける相関ルール抽出(バスケット分析)です。二つ目は、似た特徴を持つデータをグループ分けするクラスタリング(似た特徴を持つデータどうしをグループに分ける手法)です。
三つ目は、あらかじめ決めたカテゴリにデータを振り分ける分類(あらかじめ決めたカテゴリのどれに当てはまるかをデータごとに振り分ける手法)で、四つ目は数値を予測する回帰分析(過去のデータをもとに数値を予測する手法)です。これら4つの手法は、G検定でセットで扱われます。どの手法を選ぶかは、見つけたい規則性の種類や、扱うデータの形式によって変わります。
機械学習との関係も試験対策の論点です。データマイニングは大量のデータから知識を発見するプロセス全体を指す概念で、機械学習はそのプロセスの中で使われる分析手法の一つという位置づけにあります。
統計解析との違いも扱われます。統計解析は、あらかじめ仮説を立てて検証する仮説検証型(あらかじめ立てた仮説が正しいかどうかをデータで確かめるアプローチ)です。これに対しデータマイニングは、仮説を立てずデータの中から新しい規則性を探索する探索型(仮説を立てずにデータの中から新しい規則性を探すアプローチ)のアプローチという対比があります。
相関ルール抽出の説明でよく引用される「おむつを買った客はビールも一緒に買う傾向があった」という米国のスーパーの逸話は、データマイニングという概念を広めるきっかけになったとされます。ただし店頭でおむつとビールを近くに陳列して売上が伸びたという裏付けは確認されておらず、都市伝説的に語られている面があります。
3. 関連概念との比較・相違点
データマイニングは、隣接する概念と並べたときに位置づけがはっきりします。比べる相手ごとに、何を軸にした違いなのかを先に整理します。
| 比べる相手 | 違いの軸 | 違いの内容 |
|---|---|---|
| 機械学習 | 指し示す範囲の広さ | データマイニングは知識を発見するプロセス全体、機械学習はその中で使われる分析手法の一つ |
| 統計解析 | データへの向き合い方 | 統計解析は仮説を立てて検証する仮説検証型、データマイニングは仮説を立てず規則性を探す探索型 |
| ウェブマイニング | 対象データの種類 | ウェブマイニングはウェブ上のデータに対象を限定した派生分野、データマイニングは対象を問わない総称 |
機械学習との違いは、範囲の広さとして捉えると分かりやすくなります。データを集め、目的に応じた手法を選び、結果を解釈して活用につなげるまでの一連の流れがデータマイニングであり、その途中の分析ステップを機械学習が担います。たとえば、集めたデータをクラスタリングでグループ分けする作業は機械学習の範囲に含まれますが、そこから得た知見を業務改善につなげる工程まで含めるとデータマイニング全体になります。
統計解析との違いは、データへの向き合い方の方向性にあります。統計解析はあらかじめ仮説を立て、それが正しいかどうかをデータで検証する仮説検証型のアプローチです。これに対しデータマイニングは、仮説を立てずにデータの中から新しい規則性や関連性を探し出す探索型のアプローチという点で異なります。
この違いは、進め方を思い浮かべると具体的になります。「気温が上がると売上が伸びるはずだ」という仮説を検証するのが統計解析的な進め方であるのに対し、購買データそのものを眺めて未知の組み合わせを見つけ出すのがデータマイニングの進め方です。
ウェブマイニングは、データマイニングのうちウェブページやアクセスログなどウェブ上のデータに対象を限定した派生分野です。対象をウェブに絞ることで、ウェブページの構造やアクセスログといった、ウェブ特有のデータ形式に適した分析手法が用いられます。データマイニングという枠組み自体は分析対象を問わない総称であり、対象を絞ったものにテキストマイニングやウェブマイニングがあるという関係にあります。
4. ビジネス・実務での活用シナリオ
小売業では、POSデータ(レジで記録される販売実績のデータ)に相関ルール抽出(バスケット分析)を適用し、一緒に買われやすい商品の組み合わせを見つけ出す取り組みが進んでいます。見つかった組み合わせは売り場のレイアウト変更や、ネット通販での同時提案(レコメンド)に活用され、顧客が気づいていなかった需要を掘り起こすことにつながります。
こうした分析は、担当者の勘や経験だけに頼っていた売り場づくりを、データに基づく意思決定へと変えていく役割を果たします。
金融業界では、クレジットカードの利用パターンにクラスタリングや異常検知を適用し、通常の利用傾向から外れた取引を不正利用の兆候として検知する仕組みが使われています。人が一件ずつ確認する量をはるかに超える取引データの中から怪しい兆候を自動的に絞り込めるため、被害の拡大を早期に食い止めることができます。
医療分野では、過去の診療データにクラスタリングを適用し、似た症例のグループを把握する取り組みが行われています。患者ごとの傾向に応じた治療方針を検討する材料となり、経験則だけに頼らないデータに基づいた判断を医療従事者に提供する役割を果たします。こうした分析結果は、医師や医療スタッフが患者ごとの状態を多角的に把握するための補助情報として役立てられています。
5. 要点まとめ
- データマイニングとは、大量のデータから統計学や機械学習の手法を用いて規則性やパターンを見つけ出す技術で、対象をテキストに絞ればテキストマイニング、ウェブに絞ればウェブマイニングと呼ばれます。
- 相関ルール抽出・クラスタリング・分類・回帰分析が代表的な手法で、機械学習はデータマイニングのプロセスの中で使われる分析手法の一つという関係にあります。
- 仮説を立てて検証する統計解析に対し、データマイニングは仮説を立てずにデータから新しい規則性を探索するアプローチという違いがあります。
6. 確認問題
問1データマイニングとは、大量のデータの中から統計学や機械学習の手法を用いて、これまで知られていなかった規則性やパターンを見つけ出す技術のことである。
解答・解説をみる
○ 正しい
データマイニングの定義そのものです。分析対象をテキストに絞ればテキストマイニング、ウェブに絞ればウェブマイニングと呼ばれます。
問2データマイニングは、あらかじめ仮説を立てて、それが正しいかどうかをデータで検証する仮説検証型のアプローチである。
解答・解説をみる
× 誤り
仮説を立てて検証するのは統計解析のアプローチです。正しくは、データマイニングは仮説を立てずデータの中から新しい規則性を探索する探索型のアプローチという点で異なります。
問3相関ルール抽出(バスケット分析)は、一緒に購入されやすい商品の組み合わせを見つけ出す手法で、小売業のレコメンド機能などに活用されている。
解答・解説をみる
○ 正しい
相関ルール抽出はデータマイニングの代表的な手法の一つで、購買データの分析に広く使われています。

