ハードクラスタリング (G検定)

ハードクラスタリング

1. 定義と概要

ハードクラスタリングとは、教師なし学習(正解データを与えず、データの中にある傾向や似ているもの同士をコンピュータ自身に見つけさせる学習方法)のクラスタリングのうち、各データを必ずいずれか1つのクラスタにのみ割り当てる手法です。所属の有無は「0」か「1」の明確なラベルで表現され、あるデータが同時に複数のクラスタに属することはありません。

代表例はk-means法(あらかじめ分けたいグループの数を決めておき、データの重心を計算しながらグループ分けを繰り返す手法)です。もう一つの代表例は階層的クラスタリング(似ているデータ同士を段階的に併合していく手法)で、併合の過程はデンドログラム(データがどの段階でどう併合されたかを枝分かれの図で表した樹形図)として可視化できます。

クラスタリングは、正解ラベルを与えずにデータの類似性に基づいてグループ分けする教師なし学習の代表的な手法です。初期のクラスタリング手法の多くは、各データを単一のクラスタへ一意に割り当てる設計、つまりハードクラスタリングとして考案されました。

一意に割り当てる設計では、境界付近に位置するデータや、複数の性質を併せ持つデータをどう扱うかが課題として残りました。この課題への応答として、所属を確率で表すソフトクラスタリングが発展したという文脈で語られます。

2. 試験対策ポイント

まず整理したいのは、ハードクラスタリングの定義そのものです。各データを必ず1つのクラスタにのみ割り当て、所属ラベルが「0」か「1」の二値で表現される点が土台になります。

代表アルゴリズムは、非階層クラスタリングに分類されるk-means法と、階層的クラスタリングの2系統です。それぞれの分け方の特徴は次のように対応します。

系統 代表アルゴリズム 分け方の特徴
非階層クラスタリング k-means法 クラスタ数kを事前に指定し、重心を更新しながらデータを分割する
階層的クラスタリング ウォード法などによる併合 併合の過程をデンドログラムとして可視化できる

ウォード法とは、クラスタ内のばらつきが最も小さくなるように併合していく代表的な結合方法です。2系統の違いは、クラスタ数を先に決めるか、併合の過程をたどってから決めるかという点に表れます。

ソフトクラスタリングとの対比も重要な論点です。ソフトクラスタリングの代表例である混合ガウスモデル(GMM。各グループを釣鐘型の確率分布とみなし、データがどのグループに属するかを確率で計算する手法)は、1つのデータが複数のクラスタに属する度合いを確率、つまり連続値で表します。ハードとソフトの違いは、所属の割り当て方式が一意か確率的かという点にあります。

ハードクラスタリングの特徴は、各データの所属が一意で解釈が単純なこと、そして計算負荷が相対的に軽いことです。一方で、境界付近のデータや複数のグループにまたがる性質を持つデータの曖昧さを表現できない制約があります。この特徴と制約は、メリットと限界としてセットで理解しておきたい点です。

3. 関連概念との比較・相違点

ソフトクラスタリングとの最大の違いは、所属の表現方法にあります。ハードクラスタリングは各データを1つのクラスタへ一意に割り当て、所属ラベルを0か1で表します。対してソフトクラスタリングは、複数クラスタへの所属を確率という連続値で表現します。

両者を観点ごとに並べると、違いがどこにあるかがはっきりします。

観点 ハードクラスタリング ソフトクラスタリング
所属の割り当て 1つのクラスタへ一意に割り当てる 複数のクラスタへの所属を認める
所属ラベル 0か1の二値 確率を表す連続値
代表例 k-means法・階層的クラスタリング 混合ガウスモデル

同じ「クラスタに分ける」という目的でも、境界の扱い方が根本的に異なる点が、この2つを分ける軸になります。

分類(あらかじめ用意された正解ラベルをもとに、新しいデータがどのカテゴリに当てはまるかを予測する教師あり学習の手法)との違いは、正解ラベルの有無にあります。

分類は事前に与えられた正解ラベルを学習してカテゴリを予測するのに対し、ハードクラスタリングは正解ラベルなしに、データの類似性だけからグループを一意に切り分ける教師なし学習の手法です。同じ「グループ分け」という結果は似ていても、学習の前提がまったく異なります。

4. ビジネス・実務での活用シナリオ

マーケティングの分野では、購買履歴や属性データをもとに顧客を明確なセグメントへ一意に分け、セグメントごとに異なるキャンペーンを設計する場面でハードクラスタリングが使われます。1人の顧客が1つのセグメントに定まるため、施策の担当や予算配分の線引きが明確になります。

店舗・エリア戦略の分野では、商圏データが似た店舗をひとまとめのグループへ分類し、出店候補地の選定や既存店の分類を一意な区分で管理する場面に応用されます。一意な区分に固定できるため、出店エリアごとの担当や施策の比較検討が地域をまたいでもぶれずに進められます。

品質管理や製造業の分野では、製品の検査データをいくつかの明確な品質グループへ分割し、不良傾向のパターンをグループ単位で追跡・改善する用途に使われます。1つの製品データが複数のグループにまたがって扱われることはないため、原因追跡の担当ラインを一意に特定できます。

5. 要点まとめ

  • ハードクラスタリングは各データを必ず1つのクラスタにのみ割り当てる手法で、所属は0/1の明確なラベルで表現されます。
  • 代表アルゴリズムはk-means法(非階層)と階層的クラスタリング(デンドログラムで可視化)の2系統です。
  • 所属を確率で表すソフトクラスタリング(代表例は混合ガウスモデル)との対比、および正解ラベルを使う分類(教師あり学習)との違いは、取り違えやすいポイントです。

6. 確認問題

問1ハードクラスタリングでは、各データは必ずいずれか1つのクラスタにのみ割り当てられる。

解答・解説をみる

○ 正しい

ハードクラスタリングの定義そのもので、所属は0/1の二値で表現されます。この一意な割り当てが、確率で所属を表すソフトクラスタリングとの最大の違いです。

問2k-means法はハードクラスタリングの代表的な手法であり、あらかじめクラスタの数を指定して分割する。

解答・解説をみる

○ 正しい

k-means法は非階層クラスタリングの代表例で、クラスタ数kを事前に指定し、重心を更新しながら分割します。階層的クラスタリングとあわせて2系統で覚えておく対象です。

問3ハードクラスタリングでは、各データが複数のクラスタに所属する確率を連続値のラベルとして持つ。

解答・解説をみる

× 誤り

所属を確率、つまり連続値で表すのはソフトクラスタリング(代表例は混合ガウスモデル)の特徴です。正しくは、ハードクラスタリングは所属を0か1の一意なラベルで表し、複数クラスタへの確率的な所属は表現しません。