クラス分類 (G検定)

クラス分類

1. 定義と概要

クラス分類とは、入力データがあらかじめ定義された複数のカテゴリ(クラス)のうちどれに属するかを予測する教師あり学習(正解ラベルが付いたデータを使ってモデルを学習させる方式)の手法です。予測には、正解ラベル付きの教師データ(正解がすでに分かっているデータ)を用います。

代表的な例として、メールが迷惑メールか否かを判定する処理、手書き数字が0から9のどれに当たるかを識別する処理、画像に写る動物が犬・猫・鳥のどれかを見分ける処理が挙げられます。

教師あり学習は、予測したい対象である目的変数(モデルが予測しようとする対象の値)が離散値(カテゴリのように飛び飛びの値)か連続値(数値のように切れ目なく続く値)かで大きく2種類に分かれます。目的変数が離散値のときに使われるのがクラス分類で、連続値のときに使われるのが回帰です。

分類するクラスの数によって、クラス分類はさらに二値分類(データを2つのクラスのどちらかに振り分ける分類)と多クラス分類(データを3つ以上のクラスのどれかに振り分ける分類)に区分されます。

2. 試験対策ポイント

まず押さえておきたいのは、二値分類と多クラス分類の区別、そして出力層の活性化関数との対応関係です。二値分類はクラス数が2つの場合を指し、出力層にはシグモイド関数(出力を0から1の確率に変換する関数)が使われます。一方、多クラス分類は3つ以上のクラスに分ける場合を指し、出力層にはソフトマックス関数(複数のクラスそれぞれの確率を、合計が1になるように出力する関数)が使われます。

クラス数・活性化関数・学習に使う誤差の対応関係を並べると、次のようになります。

区分 クラス数 出力層の活性化関数 学習に使う交差エントロピー誤差
二値分類 2つ シグモイド関数 バイナリ交差エントロピー
多クラス分類 3つ以上 ソフトマックス関数 カテゴリカル交差エントロピー

クラス数と活性化関数の組み合わせを取り違えないことが、この分野の重要なテーマです。表の左端から右端まで、横一列がそのまま一組の知識になっていると捉えると覚えやすくなります。

代表的なアルゴリズムとしては、ロジスティック回帰(名前に回帰と付くが実際には分類に使われるモデルで、確率を計算してクラスを判定する手法)、サポートベクターマシン(SVM。クラスの境界をデータからできるだけ離して引く分類アルゴリズム)、決定木(条件分岐を繰り返してデータを振り分けていく分類手法)が挙げられます。

ほかに、k近傍法(新しいデータに近い既存データの多数決でクラスを決める手法)、ニューラルネットワーク(人間の脳の神経回路を模した構造で入力から出力への変換を学習するモデル)も代表的な手法です。これらの名称と特徴の対応関係を整理しておきたいところです。

分類の学習には交差エントロピー誤差(予測した確率と正解との差を測る損失関数)が用いられます。予測した確率が正解からどれだけずれているかを数値にして、そのずれが小さくなるようにモデルを調整していく仕組みです。

分類結果の評価には正解率(全体のうち予測が当たった割合)・適合率(陽性と予測したデータのうち実際に陽性だった割合)といった指標が使われます。

再現率(実際に陽性だったデータのうち正しく陽性と予測できた割合)・F値(適合率と再現率のバランスを1つの数値にまとめた指標)・混同行列(予測結果と実際の正解の組み合わせを集計した表)も代表的な評価指標です。それぞれの計算方法は個別の論点として扱われるため、本記事では位置づけの紹介にとどめます。

3. 関連概念との比較・相違点

回帰との最大の違いは、予測する目的変数が離散値か連続値かという点にあります。何を予測しようとしているのかを軸に並べると、次のように整理できます。

手法 予測する目的変数 具体例
クラス分類 離散値。あらかじめ定義されたカテゴリのどれに属するか メールが迷惑メールかどうかを判定する
回帰 連続値。数量そのものを連続した値として予測する 来月の売上金額を予測する

目的変数の性質を見極めることが、クラス分類と回帰を使い分ける出発点になります。

多クラス分類との違いは、扱うクラスの数と、それに対応する出力層の活性化関数にあります。クラス分類全体の中で、クラス数が2つの場合を二値分類、3つ以上の場合を多クラス分類と呼びます。

二値分類の出力層にはシグモイド関数が使われ、多クラス分類の出力層にはソフトマックス関数が使われるという対応関係も、この2つを区別するうえで欠かせない知識です。二値分類か多クラス分類かという区分は、あくまでクラス分類という大きな枠組みの内側にある区分であり、回帰との違いとは異なる軸で捉える必要があります。

4. ビジネス・実務での活用シナリオ

金融の分野では、クレジットカードの利用履歴を「正常」「不正」の2クラスに分類するクラス分類が使われています。取引データが発生するたびにリアルタイムで不正利用を検知できれば、被害が広がる前に取引を止められ、企業と利用者双方の損失を抑えられます。

医療の分野では、画像診断支援AIが病変を「良性」「悪性」に分類する用途で活用されています。医師がすべての画像を一から確認する負担を、AIによる一次スクリーニング(大まかな振り分け)が引き受けることで、限られた医療リソースを重症度の高い症例に重点的に配分できます。

カスタマーサポートの分野では、問い合わせ内容を「料金」「解約」「不具合」「契約」などの複数クラスに分類する仕組みが使われています。内容に応じて対応部署へ自動的に振り分けることで、担当者への引き継ぎにかかる手間が減り、顧客が回答を得るまでの応答時間が短縮されます。

5. 要点まとめ

  • クラス分類はあらかじめ定義されたカテゴリにデータを割り当てる教師あり学習で、クラス数により二値分類と多クラス分類に分かれます。
  • 代表的なアルゴリズムはロジスティック回帰・SVM・決定木・k近傍法・ニューラルネットワークで、出力層の活性化関数は二値分類がシグモイド関数、多クラス分類がソフトマックス関数という対応関係にあります。
  • 回帰との違いは目的変数が離散値か連続値かという点にあり、予測対象の性質に応じて回帰とクラス分類を使い分けます。

6. 確認問題

問1クラス分類は、あらかじめ定義された複数のカテゴリ(クラス)のいずれかにデータを割り当てる教師あり学習の手法である。

解答・解説をみる

○ 正しい

クラス分類は正解ラベル付きの教師データを用いて学習する教師あり学習に分類され、既知のカテゴリへの割り当てを行います。二値分類と多クラス分類のどちらもこの枠組みに含まれます。

問2多クラス分類の出力層では一般にシグモイド関数が、二値分類の出力層では一般にソフトマックス関数が用いられる。

解答・解説をみる

× 誤り

正しくは逆の対応関係にあります。二値分類の出力層にはシグモイド関数、多クラス分類の出力層にはソフトマックス関数が用いられます。クラス数と活性化関数の組み合わせは取り違えやすい点です。

問3クラス分類と回帰はともに教師あり学習に属するが、クラス分類は離散値(カテゴリ)を、回帰は連続値を予測するという違いがある。

解答・解説をみる

○ 正しい

目的変数が離散値ならクラス分類、連続値なら回帰を用いるのが基本的な使い分けです。予測対象の性質を見極めることが、両者を選ぶ出発点になります。