1. 定義と概要
半教師あり学習とは、正解ラベルが付いた少量のデータと、正解ラベルが付いていない大量のデータを組み合わせて学習するアプローチです。たとえば、専門医が診断ラベルを付けた少数の医療画像と、ラベルのない大量の医療画像を組み合わせて、疾患を検出するモデルを構築する場面が挙げられます。ラベル付きデータだけを使う場合と比べて、手元にある情報をより広く生かせる点が、この手法の特徴です。
従来の教師あり学習(すべてのデータに正解ラベルを付けて学習する手法)では、精度を高めるために大量の正解ラベル付きデータが必要でした。しかし、アノテーション(データに正解ラベルを人手で付与する作業)には専門知識や時間がかかり、コストが高くなりがちです。
一方でラベルのない生データは比較的集めやすいため、少量のラベル付きデータと大量のラベルなしデータの両方から学習する半教師あり学習は、アノテーションコストと精度のバランスを取る手法として位置づけられます。
ラベルなしデータからは、クラスタ仮定(似た性質のデータは同じ集団に属しやすいという、分布に関する仮定)という手がかりを学習に生かします。専門医の目を頼りにできる範囲が限られていても、周辺の未診断データを補助的に取り込める点が、この位置づけを支えています。
2. 試験対策ポイント
G検定では、半教師あり学習のメリットが重要な論点になります。アノテーションコストを削減できる点と、ラベル付きデータのみで学習する通常の教師あり学習より精度が高まる場合がある点の2つが、その内容です。ラベル付けの手間を抑えながら精度も狙えるという二面性が、この手法が注目される背景にあります。
代表的な手法は、自己訓練(セルフトレーニング。疑似ラベルを付与しながら学習を繰り返す手法)と共訓練(コートレーニング。2種類の特徴量で別々に学習した2つのモデルが互いに情報を補い合う手法)の2つです。それぞれの進め方を並べると、次のようになります。
| 手法 | 学習の進め方 |
|---|---|
| 自己訓練 | ラベル付きデータで学習した初期モデルが、予測の確信度が高いラベルなしデータに疑似ラベル(モデル自身の予測結果を仮の正解として使うラベル)を付与し、それを教師データに加えて再学習を繰り返す |
| 共訓練 | 同じデータに対する2つの異なる特徴量(データの特徴を数値などで表した情報)の組で別々の分類器を学習させ、一方が確信度高く予測したラベルなしデータを、もう一方の分類器の学習に補い合う |
2つの手法はいずれも、ラベルなしデータの予測結果を教師データ代わりに使い回す発想を土台にしています。モデル自身の予測を次の学習材料にしていく、という共通の構図です。
デメリットとして扱われるのが確証バイアス(誤った予測を正解と思い込んだまま学習を続け、誤りが積み重なって強化されてしまう現象)です。ラベル付きデータに偏りがある場合や、初期モデルの予測誤りが疑似ラベルとして混入した場合に、精度が悪化する原因となります。
もう一つ、取り違えやすい点として自己教師あり学習との違いがあります。半教師あり学習は人間が付与した少量の正解ラベルを使いますが、自己教師あり学習は人間のラベルを一切使わず、データ自体から解くべき問題(疑似タスク)を作って事前学習を行う手法です。ラベルを人が付けるかどうかという一点が、この2つを分ける軸になっています。
3. 関連概念との比較・相違点
半教師あり学習は、正解ラベルをどう使うかという軸で近い概念と並べると、位置づけがはっきりします。
| 手法 | 正解ラベルの使い方 |
|---|---|
| 教師あり学習 | すべてのデータに人手で付与したラベルを使う |
| 半教師あり学習 | 一部のデータに人手で付与した少量のラベルを使う |
| 教師なし学習 | 正解ラベルを一切使わない |
| 自己教師あり学習 | 人間のラベルを使わず、データ自体から疑似タスクを作る |
教師あり学習との最大の違いは、学習に使うラベル付きデータの量にあります。教師あり学習は全データにラベルが必要ですが、半教師あり学習は一部のみで済みます。少量のラベルで済むぶん、アノテーションにかける労力を抑えられる関係にあります。
教師なし学習(正解ラベルを一切使わずデータの構造を発見する手法)との違いは、ラベルの有無と目的にあります。教師なし学習は、似た性質のデータをグループに分けるクラスタリング(データをいくつかの集団に分ける手法)などによって、データの構造そのものを発見する手法です。一方の半教師あり学習は、少量のラベルを手がかりに予測タスクを解く点で、目的が異なります。
自己教師あり学習との最大の違いは、ラベルの出所にあります。半教師あり学習は人間が付与した少量の正解ラベルを使うのに対し、自己教師あり学習は人間のラベルを使わず、データ自体から疑似タスクを生成して事前学習を行う手法です。名称は似ていますが、ラベルを人が付けるかどうかという軸で明確に区別されます。
4. ビジネス・実務での活用シナリオ
医療の画像診断分野では、専門医による診断ラベル付けに時間と専門知識を要し、コストが高くなりがちです。そこで、少数のラベル付き画像と大量の未診断画像を組み合わせることで、疾患検出モデルの精度を高める取り組みが進んでいます。専門医の稼働を最小限に抑えながら精度を積み上げられる点が、この分野で採用される理由です。
テキスト分類や迷惑メール検知の現場では、人手で分類済みのメールが少数にとどまる一方、大量の未分類メールが日々蓄積されます。これらを組み合わせて学習させることで、分類精度を実務レベルまで引き上げられます。判定基準そのものが日々変化するメール分類の性質にも、ラベルなしデータを柔軟に取り込める半教師あり学習の枠組みが合っています。
音声認識の分野でも、同様の発想が生かされています。書き起こし済み音声データの作成には時間がかかるため、少量の書き起こし済みデータと大量の未書き起こし音声を組み合わせてモデルを構築する手法が採られています。書き起こし作業者の負担を抑えつつ、認識対象となる音声のバリエーションを広く反映できる点が利点です。
5. 要点まとめ
- 半教師あり学習は、少量のラベル付きデータと大量のラベルなしデータを組み合わせて学習し、アノテーションコストを抑えながら精度向上を狙う手法です。
- 代表的な手法は自己訓練(疑似ラベルの付与と再学習)と共訓練(2つの特徴量による分類器の相互補完)で、ラベル付きデータの偏りは確証バイアスによる精度悪化につながります。
- 自己教師あり学習とは別の手法であり、半教師あり学習は人間が付与した少量の正解ラベルを使う点が異なります。
6. 確認問題
問1半教師あり学習は、少量のラベル付きデータと大量のラベルなしデータを組み合わせて学習する手法である。
解答・解説をみる
○ 正しい
半教師あり学習の定義そのものであり、アノテーションコストの削減という利点につながります。
問2自己訓練(セルフトレーニング)は、初期モデルが予測の確信度が高いラベルなしデータに疑似ラベルを付与し、それを教師データに加えて再学習する手法である。
解答・解説をみる
○ 正しい
半教師あり学習の代表的な手法である自己訓練の仕組みそのものです。共訓練は2つの特徴量の組で分類器を分けて学習する点で異なります。
問3自己教師あり学習は、半教師あり学習と同様に人間が付与した少量の正解ラベルを利用する手法である。
解答・解説をみる
× 誤り
自己教師あり学習は人間のラベルを一切使わず、データ自体から疑似タスクを生成して事前学習する手法です。正しくは、半教師あり学習が人間の付けたラベルを使うのに対し、自己教師あり学習はラベルを使わない点で区別されます。

