クラスタリング (G検定)

クラスタリング

1. 定義と概要

クラスタリングとは、正解ラベルを与えずに、データ同士の類似性や距離をもとに、似た性質を持つデータをクラスタ(類似した性質を持つデータをまとめたグループのこと)と呼ばれる集まりにまとめる、教師なし学習の代表的な手法です。例えば、ECサイトの購買履歴データから、似た嗜好を持つ顧客同士を自動的にグループ化する場面で使われます。

従来、データのグループ分けは業務上の基準や担当者の経験則に基づいて人手で設計されてきました。扱うデータ量や変数が増えるほど、人がグループ分けの基準を見出すことは難しくなります。

そこで注目されているのが、正解ラベルのないデータから機械が自らパターンや構造を見つけ出す教師なし学習(=正解の手本なしに機械自身がパターンを見つける学び方)で、その代表的なタスクの一つがクラスタリングです。

教師なし学習には、クラスタリングのほかに、特徴量(データの性質を表す項目)を少数の指標に圧縮する次元削減や、商品の同時購買の傾向を見つけるアソシエーション分析(バスケット分析)もあります。クラスタリングは、その中で「データをグループに分ける」役割を担う位置づけにあります。

2. 試験対策ポイント

まず整理しておきたいのは、クラスタリングが教師なし学習に分類される代表的なタスクであるという位置づけです。同じ教師なし学習の主要タスクとして、次元削減(主成分分析など)やアソシエーション分析が並び、クラスタリングはこれらと並ぶ手法として整理されます。

手法は大きく二つに大別されます。一つは、似ているデータを段階的に結合していく階層クラスタリング(似ているデータ同士を段階的に結合していき、最終的に一つの大きなグループになるまで併合を繰り返す手法)です。この結合の過程は、デンドログラム(階層クラスタリングでデータが結合していく過程を表した樹形図)と呼ばれる図で表されます。

もう一つは、あらかじめクラスタ数を指定してデータを振り分ける非階層クラスタリング(あらかじめグループの数を指定したうえで、データをその数のグループに振り分ける手法)です。代表的な手法はk-means法(あらかじめ指定したクラスタ数に対して、各データを最も近い中心点のクラスタへ割り当てる手法)です。

もう一つの区分軸が、データの所属のさせ方によるハードクラスタリングとソフトクラスタリングの違いです。ハードクラスタリング(各データが必ず一つのクラスタだけに割り当てられる分け方)はk-means法に代表され、各データは一つのクラスタにのみ属します。一方、ソフトクラスタリング(各データが複数のクラスタに属する度合いを確率で表す分け方)は混合ガウスモデルに代表されます。

混合ガウスモデルとは、データが複数の正規分布(釣り鐘型の分布)の組み合わせから生まれていると仮定し、各データが各クラスタに属する確率を推定する手法です。各データは複数のクラスタに一定の確率で属します。この二つの区分と具体例の組み合わせは、取り違えやすい点です。

ここまでの二つの区分軸を一枚にまとめると、次のようになります。

区分の軸 一方 もう一方
結合の進め方 階層クラスタリング。段階的に結合し、その過程をデンドログラムで表す 非階層クラスタリング。クラスタ数を先に指定して振り分ける。代表はk-means法
データの所属のさせ方 ハードクラスタリング。各データは一つのクラスタにのみ属する。代表はk-means法 ソフトクラスタリング。各データは複数のクラスタに確率で属する。代表は混合ガウスモデル

二つの軸は別々のものさしのため、k-means法のように「非階層でハード」と両方の軸に登場する手法もあります。軸ごとに分けて覚えると、手法名と区分の対応が結びつきやすくなります。

3. 関連概念との比較・相違点

関連概念の中でも比較の軸になるのが、分類(教師あり学習)との違いです。分類は、事前に正解ラベルを与えたデータで学習し、新しいデータがどのカテゴリに属するかを予測する教師あり学習(=正解つきデータから未知データの予測を学ぶ方式)の手法です。これに対してクラスタリングは、ラベルのないデータの類似性から、データ自体が持つグループ構造を発見する手法です。

最大の違いは、教師データの有無とゴールの違いにあります。分類が「未知のデータを既存のカテゴリに当てはめる予測」を目的とするのに対し、クラスタリングは「データそのものが持つ構造をあぶり出すグルーピング」を目的とします。

もう一つの比較対象が、同じ教師なし学習に属する次元削減(データの性質を表す多数の項目を、少数の指標に圧縮して要約する手法)です。クラスタリングも次元削減も正解ラベルを必要としない点は共通していますが、目的は異なります。クラスタリングはデータを似た者同士のグループに分ける「グルーピング」を目的とするのに対し、次元削減は多数の特徴量を少数の指標に圧縮する「特徴の要約」を目的とします。

次元削減の代表的な手法には主成分分析(データのばらつきが最大になる方向を軸に情報を要約する手法)があり、クラスタリングの前処理として特徴量を絞り込む目的で組み合わされる場面もあります。この二つは同じ教師なし学習という枠組みに属しながら、担う役割が異なる関係にあります。

三つの手法を、学習の枠組みと目的の二つの軸で並べると次のように整理できます。

手法 学習の枠組み 目的
クラスタリング 教師なし学習 データそのものが持つ構造をあぶり出すグルーピング
分類 教師あり学習 未知のデータを既存のカテゴリに当てはめる予測
次元削減 教師なし学習 多数の特徴量を少数の指標に圧縮する特徴の要約

枠組みが同じでも目的が違う組み合わせ、目的が近くても枠組みが違う組み合わせがあるため、二つの軸を切り離して確認すると取り違えにくくなります。

4. ビジネス・実務での活用シナリオ

マーケティングの分野では、購買履歴や属性データをもとに顧客をクラスタリングし、似た嗜好を持つ顧客層ごとに広告やキャンペーンの内容を出し分ける顧客セグメンテーションに活用されています。全顧客に同じ訴求をするより、グループごとに異なるメッセージを届けるほうが反応率は高まる傾向にあります。

店舗・小売の現場でも、来店頻度や購入商品の傾向でクラスタリングを行い、優良顧客層と離反予備軍の層を識別したうえで、それぞれに異なるアプローチを設計する取り組みが進んでいます。優良顧客には特典を厚くし、離反予備軍には再来店を促す施策を打つといった具合に、層ごとの対応を分ける根拠としてクラスタリングの結果が使われています。

画像処理の分野では、画像の画素値をクラスタリングして近い色をまとめることで色数を減らす減色処理に応用されています。ここでは、非階層クラスタリングの代表手法であるk-means法が使われ、あらかじめ指定した色数のクラスタに各画素を割り当てることで、画像の容量を抑えながら見た目の劣化を最小限にとどめます。

5. 要点まとめ

  • クラスタリングは正解ラベルなしにデータの類似性でグループ分けを行う、教師なし学習の代表的なタスクという位置づけにあります。
  • 分類(教師あり学習)とは、ラベルの有無と目的(未知データの予測かグループ構造の発見か)で区別されます。
  • 手法は階層クラスタリングと非階層クラスタリングに大別され、データの所属のさせ方によってハードクラスタリングとソフトクラスタリングにも分かれます。

6. 確認問題

問1クラスタリングは、事前に与えられた正解ラベルをもとにデータを学習し、新しいデータがどのカテゴリに属するかを予測する手法である。

解答・解説をみる

× 誤り

この説明は分類(教師あり学習)のものです。クラスタリングは正解ラベルを持たないデータの類似性から、データ自体が持つグループ構造を機械が発見する教師なし学習の手法という点で異なります。

問2クラスタリングは教師なし学習に分類される手法であり、特徴量を圧縮する次元削減(主成分分析など)とは目的が異なる。

解答・解説をみる

○ 正しい

クラスタリングは「グルーピング」、次元削減は「特徴の要約」が目的であり、同じ教師なし学習でも役割が異なります。

問3ハードクラスタリングでは各データが必ず一つのクラスタにのみ割り当てられるのに対し、ソフトクラスタリングでは各データが複数のクラスタに属する度合い(確率)で表現される。

解答・解説をみる

○ 正しい

ハードクラスタリングの代表はk-means法、ソフトクラスタリングの代表は混合ガウスモデルです。所属のさせ方の違いがこの二つの区分の軸になります。