1. 定義と概要
分類問題とは、教師あり学習が扱うタスクのうち、入力データを事前に定義された複数の離散的なカテゴリ(クラス)のいずれかに割り当てることを目的とするタスク(問題設定)です。たとえば、メールが迷惑メールか否かを判定する処理や、検査画像から良品と不良品を見分ける処理、応募者を合格・不合格に振り分ける処理が代表例にあたります。いずれも、あらかじめ用意された選択肢のどれか一つを選ぶ形で答えが返る点が共通しています。
教師あり学習が扱うタスクは、予測したい出力の性質によって大きく2種類に分かれます。出力が離散値(とびとびの値。カテゴリのように区切られた値)であるものが分類問題で、出力が連続値(切れ目なく続く数値)であるものが回帰問題です。
分類問題という言葉自体はこのタスクの型を指す上位の概念にあたり、クラス数による区分や、それを実現する代表的なアルゴリズムは、この枠組みの中の個別テーマとして扱われます。この出力の性質による大枠の分類は、教師あり学習全体を捉えるうえでの土台になります。
2. 試験対策ポイント
まず整理したいのは、分類問題が教師あり学習の2大タスクの一方に位置づけられ、もう一方の回帰問題と対をなす関係にあるという大枠です。出力が離散値か連続値かという違いが、両者を区別する軸になります。
分類問題を解く代表的なアルゴリズムには、ロジスティック回帰(確率を計算してクラスを判定する手法)、決定木(条件分岐を繰り返して分類する手法)、k近傍法(近くのデータの多数決で判定する手法)などがあります。サポートベクターマシン(SVM)とは、クラスの境界をデータからできるだけ離して引く分類アルゴリズムです。
各手法の詳しい仕組みや、クラス数による区分である二値分類(データを2つのクラスのどちらかに振り分ける分類)・多クラス分類(データを3つ以上のクラスのどれかに振り分ける分類)の違いは、本記事では位置づけの紹介にとどめます。
分類問題の評価には、正解率(全体の予測のうち正しく分類できた割合)、適合率(正と予測したもののうち実際に正しかった割合)、再現率(実際に正であるもののうち正しく拾えた割合)が用いられます。あわせて、F値(適合率と再現率のバランスを1つの数値にまとめた指標)や混同行列(予測結果と実際の正解の組み合わせを集計した表)という指標も使われます。これらは、回帰問題で使われる評価指標とは別の体系として整理されています。
分類問題では、不均衡データ(クラスごとのデータ件数に大きな偏りがあるデータ)が評価をゆがめる要因になります。少数派クラスの割合が極端に低いデータでは、正解率だけを見ると高い数値が出ても実態を反映しない場合があります。この場合の対処法として、オーバーサンプリング(少数派クラスのデータを人工的に増やす手法)とアンダーサンプリング(多数派クラスのデータを減らして偏りを抑える手法)がセットで扱われます。
3. 関連概念との比較・相違点
回帰問題との最大の違いは、予測する出力の性質にあります。分類問題は離散値を、回帰問題は連続値を予測の対象とし、評価指標もそれぞれ別の体系で整えられています。
分類問題では正解率・適合率・再現率・F値・混同行列が使われるのに対し、回帰問題では平均二乗誤差(予測値と実際の値のズレの大きさを測る指標)や決定係数(モデルがデータのばらつきをどれだけ説明できるかを示す指標)などが使われます。両者の対応を並べると、次のようになります。
| 観点 | 分類問題 | 回帰問題 |
|---|---|---|
| 予測する出力 | 離散値(とびとびのカテゴリ) | 連続値(切れ目なく続く数値) |
| 主な評価指標 | 正解率・適合率・再現率・F値・混同行列 | 平均二乗誤差・決定係数 |
出力の種類が変われば、評価の物差しそのものも入れ替わるという関係にあります。予測結果が当たっているかどうかの数え方が、カテゴリと数値では成り立たないためです。
もう一つの対比が、二値分類と多クラス分類です。これらは分類問題というタスクの型全体の中で、クラス数による下位区分にあたります。区分ごとに使われる活性化関数(ニューロンの出力をクラスの確率などに変換する関数)や代表アルゴリズムの詳しい対応関係は、別のテーマとして扱われます。分類問題という言葉は、こうした下位区分や個々のアルゴリズムをまとめて指す、より上位のタスク種別にあたります。
4. ビジネス・実務での活用シナリオ
人事・採用の分野では、応募者データから合格・不合格を予測する採用選考支援システムが、離散的な合否判定を行う分類問題として設計されています。書類選考の一次振り分けをモデルに任せることで、担当者が確認すべき件数を絞り込み、選考にかかる工数を抑える効果が見込めます。
小売・EC分野では、顧客の購買履歴から継続利用・離反の2クラスに分類する離反予測モデルが使われています。離反傾向の高い顧客を早い段階で見分けられるため、フォロー施策を絞り込んだタイミングで打てるようになります。
製造業では、検査データから良品・不良品を判定する外観検査モデルが分類問題として構築されています。不良品のデータは良品に比べて少なくなりやすく、不均衡データになりやすい領域です。そのため、正解率だけでなく再現率もあわせて確認しながら運用する体制が取られており、不良品の見逃しを防いで市場への流出リスクを抑える効果が見込めます。
5. 要点まとめ
- 分類問題は教師あり学習における2大タスクの一方で、出力が離散的なカテゴリであることが回帰問題との違いにあたります。
- 評価には正解率・適合率・再現率・F値・混同行列が使われ、不均衡データでは正解率だけを見ると実態を反映しない場合があります。
- 具体的な実現方法(二値分類・多クラス分類の区分、ロジスティック回帰やサポートベクターマシン(SVM)などの代表アルゴリズム)は、分類問題という枠組みの中の一分野として位置づけられます。
6. 確認問題
問1分類問題は教師あり学習における2つの主要なタスクの一方で、出力が離散的なカテゴリであるものを指す。
解答・解説をみる
○ 正しい
教師あり学習は出力の性質によって分類問題と回帰問題に大別され、分類問題は離散値(カテゴリ)を予測するタスクにあたります。もう一方の回帰問題は連続値を予測の対象とする点で区別されます。
問2分類問題の評価指標である正解率は、クラスごとのデータ件数に偏りがある不均衡データにおいても、常に性能を正しく反映する。
解答・解説をみる
× 誤り
正しくは、不均衡データでは少数派クラスをすべて見逃しても正解率が高く出る場合があり、性能を正しく反映しないことがあります。適合率・再現率・F値・混同行列とあわせて確認する必要があります。
問3回帰問題は出力が連続値であるのに対し、分類問題は出力が離散値であるという違いがあり、それぞれ異なる評価指標が用いられる。
解答・解説をみる
○ 正しい
分類問題では正解率・適合率・再現率・F値・混同行列、回帰問題では平均二乗誤差や決定係数などが使われ、出力の性質に応じて評価指標の体系が異なります。

