1. 定義と概要
教師あり学習とは、特徴量(データのどこに注目すればよいかを示す指標や要素)と呼ばれる入力データと、それに対応する正解の情報(教師データ・ラベル)のペアをモデルに与えて学習させる方式です。学習を終えたモデルは、正解が分かっていない新しいデータに対しても予測できるようになることを目指します。
イメージしやすい例としては、過去の物件の広さや築年数と実際の家賃額のペアから家賃を予測するモデルや、迷惑メールか否かがラベル付けされたメール文面から新着メールを判定するモデルが挙げられます。どちらも、人が用意した正解付きのデータが学習の出発点になっている点は共通です。
機械学習は、学習データに正解ラベルが与えられるかどうかによって大きく方式が分かれ、教師あり学習・教師なし学習・強化学習の3つに大別されます。教師あり学習は、人があらかじめ正解を付与したデータから入力と出力の対応関係を学ばせる方式で、画像認識や需要予測など幅広い場面で使われています。
教師あり学習が目指すのは、学習に使ったデータそのものを覚えることではなく、学習に使っていない未知のデータに対しても正しく予測できる汎化性能(未知のデータに対しても正しく予測できる能力)を身につけさせることです。
2. 試験対策ポイント
教師あり学習が扱うタスクは、出力が連続値(数値そのもの)を予測する回帰問題と、出力が離散値(あらかじめ定義されたカテゴリ)を予測する分類問題の2つに大別されます。この対応関係は、次のように並べると整理しやすくなります。
| タスク | 予測する出力 | 具体例 |
|---|---|---|
| 回帰問題 | 連続値(数値そのもの) | 物件の広さや築年数から家賃額を予測する |
| 分類問題 | 離散値(あらかじめ定義されたカテゴリ) | メール文面から迷惑メールかどうかを判定する |
回帰問題・分類問題それぞれの評価指標や個別アルゴリズムの詳細は別記事に譲りますが、出力が連続値なら回帰、離散値なら分類という対応関係は取り違えやすい点です。
代表的なアルゴリズムは、線形回帰(データの傾向を1本の直線で近似して数値を予測する手法)、ロジスティック回帰(名前に回帰と付くものの、実際には分類に使われるモデル)、決定木(条件分岐を繰り返してデータを予測・分類していく手法)の3つです。さらに、サポートベクターマシン(SVM。クラスの境界線をデータからできるだけ離して引く手法)、k近傍法(新しいデータに近い既存データの多数決や平均で予測する手法)、ランダムフォレスト(複数の決定木の予測を組み合わせて精度を高める手法)も代表的な手法として挙げられます。決定木のように回帰・分類の両方に応用できる手法がある点も押さえておきたいポイントです。
学習の目的は、訓練データを丸暗記することではなく、汎化性能を高めることにあります。学習データにのみ過剰に適合し、未知データへの精度が落ちる状態は過学習(オーバーフィッティング。学習データに適合しすぎて、未知のデータへの予測精度が落ちてしまう現象)と呼ばれます。過学習を検出する代表的な手法が交差検証(クロスバリデーション。データを学習用と検証用に分けて複数回モデルを評価する手法)で、過学習とあわせて整理しておきたいところです。
教師あり学習を行うには、入力データに正解ラベルを人手で付与するアノテーション(データに正解ラベルを人手で付与する作業)という前工程が必要です。このラベル付けにかかるコストは、教師あり学習を使ううえで踏まえておきたい制約です。ラベル付けコストの制約から、少量のラベル付きデータで済ませる半教師あり学習のような手法も派生しています。
3. 関連概念との比較・相違点
教師なし学習(正解ラベルを持たないデータから、データ自体が持つ構造やパターンを発見する学習方式)との最大の違いは、正解ラベルの有無と学習の目的にあります。教師あり学習は人が用意した正解ラベルをもとに未知データへの予測を学ぶのに対し、教師なし学習は与えられたデータそのものから特徴やまとまりを見つけ出そうとします。
教師なし学習の代表的な手法にはクラスタリング(似た性質のデータ同士をグループにまとめる手法)があり、購買履歴から似た傾向の顧客層をグループ分けするような場面で使われます。
強化学習との違いは、学習の手がかりにあります。教師あり学習は個々の入力に対する正解ラベルを直接与えられます。これに対し強化学習は、エージェント(環境の中で行動を選び学習する主体)が環境とのやり取りで得られる報酬(行動の良し悪しを数値で示すフィードバック)を手がかりに、正解が明示されないまま良い行動方針を試行錯誤で学びます。
ピンポイントの正解を与えられる教師あり学習と、間接的な評価指標から学ぶ強化学習という対比は、G検定で区別が求められる論点です。3つの方式を同じ観点で並べると、違いは次のように整理できます。
| 学習方式 | 学習の手がかり | 学習で目指すこと |
|---|---|---|
| 教師あり学習 | 入力と正解ラベルのペア | 未知データへの予測 |
| 教師なし学習 | 正解ラベルのないデータそのもの | データの構造やまとまりの発見 |
| 強化学習 | 環境から得られる報酬 | 良い行動方針の獲得 |
学習の手がかりが何かという1つの軸で見比べておくと、3方式の区別で迷いにくくなります。
4. ビジネス・実務での活用シナリオ
金融業界では、過去の取引履歴に「不正」「正常」のラベルを付けた教師データから分類モデルを学習し、新しい取引をリアルタイムで審査してクレジットカードの不正利用を検知する仕組みに活用されています。ここでいう分類モデル(データを特定のカテゴリに振り分けるモデル)は、不正か正常かの二択を判定する役割を担います。人手による確認だけでは処理しきれない取引量を、モデルが即座にふるい分けることで被害の拡大を防いでいます。
不動産業界では、過去の物件の広さ・立地・築年数と実際の家賃額をペアにした教師データから回帰モデル(連続した数値を予測するモデル)を学習し、新規物件の家賃を予測する査定支援に使われています。担当者ごとの経験や勘に頼っていた査定作業に、データに基づいた客観的な基準を与える役割を果たします。
製造業では、過去の検査画像に「良品」「不良品」のラベルを付けた教師データから分類モデルを学習し、新しい製品画像を判定する外観検査の自動化に使われています。人の目視検査では見落としや疲労による精度のばらつきが避けられませんが、モデルによる判定は一定の基準で処理を続けられる点が強みです。
5. 要点まとめ
- 教師あり学習は、入力データと正解ラベルのペアから未知データへの予測を学ぶ機械学習の方式で、扱うタスクは出力が連続値の回帰問題と、出力が離散値(カテゴリ)の分類問題に大別されます。
- 代表的なアルゴリズムには線形回帰・ロジスティック回帰・決定木・SVM・k近傍法・ランダムフォレストなどがあり、目的は訓練データの丸暗記ではなく未知データに対する汎化性能を高めることにあります。
- 教師なし学習は正解ラベルなしにデータの構造を発見し、強化学習は報酬を手がかりに行動方針を学ぶ点で、教師あり学習とは学習の手がかりが異なります。
6. 確認問題
問1教師あり学習は、入力データとそれに対応する正解ラベルのペアを使ってモデルを学習させる方式である。
解答・解説をみる
○ 正しい
教師あり学習の定義そのものです。学習を終えたモデルは、未知のデータに対しても正しく予測できる汎化性能の獲得を目指します。
問2教師あり学習で扱うタスクのうち、出力が連続値を予測する問題を分類問題、出力が離散値(カテゴリ)を予測する問題を回帰問題と呼ぶ。
解答・解説をみる
× 誤り
正しくは名称が逆で、出力が連続値を予測する問題を回帰問題、出力が離散値(カテゴリ)を予測する問題を分類問題と呼びます。名称と出力の型の対応関係は取り違えやすい点です。
問3強化学習は、エージェントが環境とのやり取りで得られる報酬を手がかりに行動方針を学ぶ点で、個々の入力に対する正解ラベルを直接与えられる教師あり学習とは学習の手がかりが異なる。
解答・解説をみる
○ 正しい
教師あり学習は正解ラベルというピンポイントの正解を与えられるのに対し、強化学習は報酬という間接的な評価指標をもとに試行錯誤で学ぶ点で区別されます。

