教師なし学習 (G検定)

教師なし学習

1. 定義と概要

教師なし学習とは、正解ラベルが付いていないデータを用いて、データそのものが内包する構造や類似性、関連性を機械が自ら見つけ出す機械学習の学習方式です。

たとえば、ECサイトの購買履歴データに正解を与えずに投入すると、似た嗜好を持つ顧客の集まりや、よく同時に買われる商品の組み合わせを機械が自動的に発見します。人が「こういう基準で分けてほしい」という正解を教えなくても、データそのものの性質から規則性が浮かび上がる点が特徴です。

教師あり学習は、入力と正解ラベルの対を大量に用意して学習させるため、高い精度を狙える一方で、アノテーション(データに正解ラベルを人手で付与する作業)に専門知識と時間がかかりコストが高くなりがちです。しかし世の中には、正解ラベルの付いていない生データのほうが圧倒的に多く存在します。そこで、ラベル付けの手間をかけずにデータ自体からパターンや構造を見出す教師なし学習が、機械学習のもう一つの柱として位置づけられてきました。

教師あり学習・教師なし学習・強化学習という機械学習の3分類のうち、教師なし学習は正解を教えずにデータの中身を整理し要約する役割を担います。ラベル付けのコストをかけずに大量のデータを扱えることが、この学習方式が注目される背景にあります。

2. 試験対策ポイント

教師なし学習の代表的なタスクは、クラスタリング・次元削減・アソシエーション分析の3つです。それぞれが何をする手法で、どの役割を担うのかという対応で押さえておくと混同しにくくなります。

代表的なタスク 何をする手法か 役割
クラスタリング(似た性質を持つデータ同士をグループにまとめる手法) データを似た者同士に分ける グルーピング
次元削減(データの持つ情報をできるだけ保ったまま、少数の指標へと要約する手法) 多数の特徴量(データのどこに注目すればよいかを示す指標や要素)を少数の指標に圧縮する 特徴の要約
アソシエーション分析(データの中から『Aと一緒にBが起きやすい』という関係を見つける手法。購買データに適用したものはバスケット分析と呼ばれる) データ間の同時発生の関連性を見つける 関連性の発見

なお、データをグループ分けするk-means法や、次元削減の代表的な手法である主成分分析(多数の特徴量の情報をできるだけ保ちながら、少数の合成変数にまとめる統計的な手法)といった個別の手法も存在します。これらの具体的な計算手順は、別のテーマとして扱われます。

教師あり学習との評価方法の違いも取り違えやすい点です。教師あり学習は、正解ラベルとモデルの予測を突き合わせて、予測がどれだけ一致したかを示す正解率(モデルの予測が正解ラベルと一致した割合を示す指標)などの指標で評価できます。一方、教師なし学習には正解ラベルが存在しないため、出力されたグループ分けや要約結果が妥当かどうかは人が解釈して判断する必要があります。

メリットとしては、正解ラベルを用意するアノテーション作業が不要なため、大量の生データをそのまま学習に使える点が挙げられます。半教師あり学習(少量の正解ラベル付きデータと大量のラベルなしデータを組み合わせて学習する方式)は、この教師なし学習と教師あり学習の中間に位置する方式として区別されます。

応用面では、通常のパターンから外れたデータを検出する異常検知(通常のデータのパターンから外れたデータを見つけ出す仕組み)が挙げられます。ほかにも、購買データの相関から商品を推薦するレコメンドの土台として、クラスタリングやアソシエーション分析が使われる点にも触れておきます。

3. 関連概念との比較・相違点

教師あり学習との違いは、ラベルの有無・学習の目的・評価のしやすさという3つの観点で整理できます。

観点 教師あり学習 教師なし学習
ラベル 正解ラベル付きデータを使う ラベルのないデータを使う
学習の目的 入力と出力の対応関係を学習し、未知データを予測する データそのものが持つ構造やパターンを見出す
評価 正解ラベルとの一致度で精度を客観的に評価できる 正解が存在せず、結果の妥当性は人の解釈に委ねられる

予測という明確な正解を目指す教師あり学習に対し、教師なし学習はデータの中に隠れている関係性を掘り起こす作業にあたります。正解が用意されていない分、出力されたまとまりや要約に意味があるかどうかは、人が読み解いて確かめることになります。同じデータをクラスタリングしても、分け方の粒度によって結果の見え方が変わるため、分析者による解釈の比重が大きくなります。この評価方法の違いは、教師なし学習を理解するうえで欠かせない視点です。

半教師あり学習との違いは、ラベル利用量の位置づけにあります。教師なし学習はラベルを一切使わず、教師あり学習は全データにラベルを用いるのに対し、半教師あり学習は少量のラベル付きデータのみを併用する中間的な方式にあたります。3つの方式は、ラベルの量という一本の軸の上に並ぶ関係にあります。ラベル付けのコストと精度のバランスをどう取るかによって、どの方式を選ぶかが変わってきます。

4. ビジネス・実務での活用シナリオ

金融業界では、クレジットカードの利用データから通常の購買パターンをデータの構造として学習し、そこから外れる取引を異常検知する仕組みが使われています。不正利用は事前に「どのような形で起きるか」を正解として定義しにくいため、正解ラベルを必要としない教師なし学習の性質が生きる領域です。新しい手口による不正が現れても、通常のパターンからの逸脱として検知できる柔軟さも実務上の強みです。

小売・EC業界では、購買データにアソシエーション分析を適用し、同時に購入されやすい商品の組み合わせを発見する取り組みが広がっています。発見された組み合わせは商品陳列の見直しやレコメンド表示に反映され、人が仮説を立てる前にデータ側から関連性が浮かび上がる点に価値があります。担当者の経験だけでは気づきにくい組み合わせが見つかることも珍しくありません。

製造業では、設備の稼働センサーデータの構造を教師なし学習で学習し、通常の稼働状態から逸脱したデータを検知することで、故障の予兆をとらえる予知保全に活用されています。正常な稼働パターンさえ学習できれば、故障事例という稀な正解データを大量に集めずに異常の兆候をとらえられる点が実務上の利点です。設備ごとに壊れ方が異なる現場でも、正常状態の学習だけで幅広く対応できます。

5. 要点まとめ

  • 教師なし学習は、正解ラベルのないデータから構造・パターンを見出す学習方式で、代表的なタスクはクラスタリング・次元削減・アソシエーション分析です。
  • 教師あり学習とはラベルの有無・学習の目的・評価のしやすさの3点で異なり、正解ラベルがない分、結果の解釈は人の判断に委ねられます。
  • アノテーション不要というメリットを持ち、異常検知や商品レコメンドの土台として活用されます。ラベルを一部だけ併用する半教師あり学習とは区別されます。

6. 確認問題

問1教師なし学習は、正解ラベルの付いていないデータから、データそのものが持つ構造やパターンを見出す学習方式である。

解答・解説をみる

○ 正しい

教師なし学習の定義そのものです。クラスタリング・次元削減・アソシエーション分析が代表的なタスクにあたります。

問2教師なし学習は、教師あり学習と同様に、モデルの出力を正解ラベルと突き合わせることで精度を客観的に評価できる。

解答・解説をみる

× 誤り

正しくは、教師なし学習には正解ラベルが存在しないため、出力結果が妥当かどうかは人が解釈して判断する必要があります。正解ラベルとの一致度で評価できるのは教師あり学習の特徴です。

問3教師なし学習の代表的なタスクには、データをグループ分けするクラスタリング、特徴量を圧縮する次元削減、データ間の関連性を見つけるアソシエーション分析がある。

解答・解説をみる

○ 正しい

3つのタスクはそれぞれグルーピング、特徴の要約、関連性の発見という異なる役割を担い、異常検知やレコメンドの土台として活用されます。