ソフトクラスタリング (G検定)

ソフトクラスタリング

1. 定義と概要

ソフトクラスタリングとは、各データを単一のクラスタへ排他的に割り当てるのではなく、複数のクラスタに対する所属の度合いを確率や重みという連続値で持つことを許容するクラスタリング手法の総称です。代表例のひとつである混合ガウスモデル(GMM)とは、複数の釣鐘型の分布(正規分布)を重ね合わせてデータ全体の形を表現するモデルです。

もう一つの代表例が、k-means法を拡張したファジィc-means法(k-means法を拡張し、データが複数のグループに部分的に所属できるようにした手法)です。例えば1本の映画を「アニメ」と「アクション」の両方に一定の割合で分類するような、柔軟な分け方にあたります。

従来、k-means法(データを指定した数のグループに、最も近い中心点ごとに1つだけ割り当てる代表的な分類手法)に代表されるクラスタリングは、各データをどれか1つのグループへ確定的に割り振るハードクラスタリングが基本でした。しかし現実のデータは境界が曖昧で、1つのデータが複数の性質を併せ持つ場合、無理に1グループへ押し込むと情報が失われます。そこで、所属の度合いを確率や連続値で表現するソフトクラスタリングが、より柔軟なデータ表現の手段として位置づけられています。

2. 試験対策ポイント

理解するうえで中心になるのは、ハードクラスタリングとの対比軸です。1つのデータを1つのクラスタへ確定的に0か1かで割り当てるのがハードクラスタリングで、複数のクラスタへの所属度を連続値で表すのがソフトクラスタリングという整理になります。

代表アルゴリズムとしては、正規分布の重ね合わせでデータ分布をモデル化する混合ガウスモデル(GMM)と、k-means法を拡張して中心からの距離をもとに所属度を0〜1の連続値で持たせるファジィc-means法が挙げられます。両者は並べて理解しておきたい手法です。

混合ガウスモデルは、モデルを特徴づける数値であるパラメータ(平均や分散など、調整によってモデルの形を決める値)を、EMアルゴリズム(答えが分からない値を、仮の推定と修正の繰り返しで少しずつ正解に近づけていく計算手順)で推定します。両者はともに代表的なソフトクラスタリング手法という位置づけです。

あわせて、k-means法はGMMにおいて各クラスタの分散(データのばらつきの大きさを表す統計量)や共分散(クラスタの向きや広がり方を表す統計量)を制限したモデルにあたります。所属を確率でなく0か1かに単純化した特殊ケースと解釈できるという関係も、取り違えやすい点として重要です。

教師なし学習(正解ラベルを与えずに、データの構造やグループ分けをコンピュータ自身に見つけさせる学習方式)の文脈では、トピックモデル(文章がどんな話題で構成されているかを確率的に推定する手法)にも触れておきます。文書は複数のトピックに確率的に所属すると考えます。その代表手法である潜在的ディリクレ配分法(LDA。1つの文書が複数のトピックを確率的な割合で持つと仮定して分析する代表的なトピックモデル)は、ソフトクラスタリングと同じ考え方を文書分類に応用した発展形として位置づけられます。

3. 関連概念との比較・相違点

ハードクラスタリングとの最大の違いは、所属の表現方法にあります。ハードクラスタリングは1つのデータを1つのクラスタへ確定的に0か1かで割り当てる方式で、k-means法がその代表例です。一方、ソフトクラスタリングは複数のクラスタへの所属度を確率や重みという連続値で表現するため、クラスタの境界付近にあるデータの曖昧さをそのまま情報として残せます。例えば、ある顧客データがクラスタAに70%、クラスタBに30%所属するといった表現は、ハードクラスタリングでは扱えません。

同じソフトクラスタリングの代表例である混合ガウスモデルとファジィc-means法も、所属度の求め方という点で違いがあります。混合ガウスモデルは、データが各クラスタの確率分布から生成された尤度(もっともらしさ)に基づいて所属度を計算するのに対し、ファジィc-means法はクラスタ中心からの距離をもとに所属度を計算します。前者は分布の形を仮定した確率的なアプローチ、後者は距離を基準にした幾何学的なアプローチという関係にあります。

3つの代表手法の違いは、所属の表し方と所属度の求め方という2つの軸で並べると整理しやすくなります。

手法 所属の表し方 所属度の求め方
k-means法(ハードクラスタリング) 1つのクラスタへ確定的に0か1かで割り当てる 最も近いクラスタ中心へ割り当てる
混合ガウスモデル 複数のクラスタへの所属を確率で持つ 各クラスタの確率分布から生成された尤度に基づく
ファジィc-means法 複数のクラスタへの所属度を0〜1の連続値で持つ クラスタ中心からの距離に基づく

同じ「複数への所属を認める」手法でも、確率分布を仮定するか距離を基準にするかで計算の中身が変わる点が、両者を見分ける手がかりになります。

4. ビジネス・実務での活用シナリオ

マーケティング・顧客セグメンテーションの分野では、1人の顧客が「価格重視」と「品質重視」の両方の傾向を併せ持つ場合があります。ソフトクラスタリングを使えば、両方のセグメントへの所属度をスコアとして持たせられるため、複数の施策を組み合わせた訴求設計に活用できます。

レコメンデーション・商品分類の分野でも同じ発想が生きます。映画や商品のジャンル分類では、1つの作品が複数ジャンルの要素を持つ場合があります(アニメとアクションの両方など)。所属度に応じて複数カテゴリのおすすめ導線へ反映すれば、単一ジャンルへの割り当てでは拾いきれない需要に応えられます。

製造業の品質管理では、クラスタ境界付近で所属確率が僅差のデータを「判定保留」として扱う運用が見られます。確定分類を避けて人手確認に回すことで、誤判定のリスクを抑えられます。

5. 要点まとめ

  • ソフトクラスタリングは1つのデータが複数のクラスタへ確率・所属度で同時に所属できる手法で、確定的に1グループへ割り当てるハードクラスタリングと対をなします。
  • 代表例は混合ガウスモデル(EMアルゴリズムでパラメータ推定)とファジィc-means法(距離ベースの所属度)で、両者は所属度の求め方が異なります。
  • k-means法は混合ガウスモデルの特殊ケースと解釈でき、トピックモデル・LDAも同じ考え方を文書分類に応用した発展形として位置づけられます。

6. 確認問題

問1ソフトクラスタリングでは、1つのデータが複数のクラスタに対して確率や所属度という形で同時に所属することが許容される。

解答・解説をみる

○ 正しい

ソフトクラスタリングの定義そのものです。代表例は混合ガウスモデルとファジィc-means法で、いずれも所属度を連続値として持たせます。

問2ハードクラスタリングでは、各データはいずれか1つのクラスタにのみ排他的に割り当てられる。

解答・解説をみる

○ 正しい

k-means法に代表される、確定的な0か1かの割り当てがハードクラスタリングの特徴です。ソフトクラスタリングとの対比軸になります。

問3k-means法は混合ガウスモデルよりも柔軟にクラスタの形状や所属の重なりを表現できるため、ソフトクラスタリングの代表例として扱われる。

解答・解説をみる

× 誤り

k-means法は各データを最も近いクラスタ中心1つに確定的に割り当てるハードクラスタリングの代表例です。正しくは、混合ガウスモデルの方が楕円形のクラスタ形状や所属の重なりを柔軟に表現でき、k-means法はその特殊ケースと解釈されます。