1. 定義と概要
アンダーサンプリングとは、不均衡データ(クラスごとのサンプル数に大きな偏りがあるデータ)において、データ数が多い多数派クラスから一部のサンプルを取り除き、少数派クラスとの比率を均衡に近づける手法です。多数派クラスとはサンプル数が多い方のクラス、少数派クラスとはサンプル数が少ない方のクラスを指します。
代表的な手法はランダムアンダーサンプリング(多数派クラスから無作為にサンプルを選んで削減する手法)です。たとえば不正利用が1%、正常利用が99%というクレジットカード取引データでは、正常利用のサンプルを間引き、不正利用と同程度の比率に近づける処理がこれにあたります。多い方を無作為に間引くだけという素朴さが、この手法の扱いやすさにつながっています。
従来、分類モデル(データがどのカテゴリに属するかを予測するモデル)の評価には正解率(Accuracy。全体の予測のうち正しく当てられた割合)がよく使われてきました。しかし不均衡データでは、すべてのデータを多数派クラスと予測するだけで正解率が高くなってしまい、モデルの実力を正しく測れないという課題があります。
この課題に対処するアプローチの一つが、学習データ自体のクラス比率を調整する前処理です。多数派を減らすアンダーサンプリングと、少数派を増やすオーバーサンプリング(少数派クラスのデータを増やしてバランスを取る手法)という二つの方向性が使われます。
2. 試験対策ポイント
G検定における重要な論点は、アンダーサンプリングが多数派クラスのサンプル数を削減してクラス比率を均衡させる手法であり、代表例がランダムアンダーサンプリングだという基本の整理です。まずはこの一文を、手法の名前と操作の向きがセットで思い出せる状態にしておきたいところです。
あわせて重要なテーマになるのが、この手法が持つデメリットです。多数派クラスのデータを削ることで学習に使えるデータ量そのものが減り、多数派クラスが持つ多様なパターンを学習しきれなくなります。その結果、モデルの性能低下やバイアス(データや予測結果に生じる偏り)につながるリスクがあります。
一方で、データセット全体が大きい場合には、学習に使うデータ量を絞り込むことで学習時間を短縮できるという利点にもなります。情報損失というデメリットと学習時間の短縮という利点は、表裏の関係にあります。同じ「データを削る」という一つの操作が、失うものと得るものの両方を同時に生んでいるという読み方をしておくと取り違えにくくなります。
アンダーサンプリングは、少数派クラスのデータを増やすオーバーサンプリング、およびその代表手法であるSMOTE(少数派データをk近傍法で合成して増やす手法)とセットで比較される論点です。k近傍法とは、あるデータに似た近いデータを探すアルゴリズムを指します。多数派を減らす方向と少数派を増やす方向という逆向きのアプローチであり、混同しやすい組み合わせです。
不均衡データでは、正解率だけでモデルを評価すると実態を見誤ります。すべてのデータを多数派クラスと予測しても正解率は高い数値になってしまうためです。そこで、適合率(正と予測したデータのうち実際に正だった割合)や再現率(実際に正だったデータのうち正しく予測できた割合)といった指標が重要になります。
閾値(正例と判定するかどうかを分ける基準となる値)を変えても、AUC(予測の閾値によらずモデルの性能をまとめて評価する指標)を使えばモデルの性能を評価できます。あわせて、F値(適合率と再現率の両方をバランスよく見る評価指標)との関連も整理しておきたいところです。
3. 関連概念との比較・相違点
オーバーサンプリングとの最大の違いは、多数派クラスを減らす(アンダー)か、少数派クラスを増やす(オーバー)かという逆方向の対処法である点です。不均衡データの比率を調整するという目的は共通していますが、抱えるリスクの性質は対照的です。両者の違いを軸ごとに並べると次のように整理できます。
| 観点 | アンダーサンプリング | オーバーサンプリング(代表手法SMOTE) |
|---|---|---|
| 操作の向き | 多数派クラスを減らす | 少数派クラスを増やす |
| データの扱い | 既存データの削減 | 複製や合成による新しいデータの生成 |
| 主なリスク | 情報損失によるモデル性能低下やバイアス | 同じデータの水増しによる過学習 |
過学習とは、学習データに合わせすぎて、新しいデータへの対応力が落ちる現象を指します。アンダーサンプリングは多数派クラスのデータを削るために情報損失が課題になり、オーバーサンプリングは水増しによってこの過学習を招きやすくなります。
SMOTEはオーバーサンプリングの代表的な一手法にあたります。最大の違いは、少数派データを単純に複製するのではなく、k近傍法で近いデータ同士の間に新しい合成データを生成する点です。
アンダーサンプリングが既存データの削減であるのに対し、SMOTEは新しいデータの生成によって比率を調整するという、手法としての方向性そのものが異なります。データを減らして揃えるか、データを作って揃えるかという発想の違いが、両者を分ける軸になります。
4. ビジネス・実務での活用シナリオ
金融の不正検知の現場では、クレジットカードの不正利用検知において、圧倒的多数を占める正常取引データをアンダーサンプリングし、学習データを軽量化する例があります。データ量を絞り込むことでモデルの学習時間を短縮でき、大量の取引データを扱うシステムでは計算コストの削減という効果につながります。
医療診断の分野では、まれな疾患を判定するモデルへの適用に慎重さが求められます。多数派である健常データを削りすぎると、学習データが持つパターンの多様性が失われ、疾患の見逃し(偽陰性)が増えるリスクがあるためです。
生命に関わる判定であるほど、削減する範囲の見極めが欠かせません。情報損失によるリスクと計算コストの削減という利点を比較したうえで、適用するかどうかを判断する場面になります。
製造業の外観検査工程では、大量の正常品データと少数の不良品データが混在します。正常品データを間引いて学習効率を高める一方、少数派である不良品データにはオーバーサンプリングを併用し、両者を組み合わせてバランスを取る運用が見られます。削減と増強を単独で使うのではなく、組み合わせて適用する発想が実務では意味を持ちます。
5. 要点まとめ
- アンダーサンプリングは多数派クラスのデータを削減してクラス比率を均衡させる手法で、代表例はランダムアンダーサンプリングです。
- メリットは学習データの軽量化と計算コスト削減、デメリットは情報損失によるモデル性能低下やバイアスのリスクです。
- 少数派クラスを増やすオーバーサンプリング(代表手法SMOTE)とは逆方向の対処法にあたり、不均衡データでは正解率以外の評価指標も欠かせません。
6. 確認問題
問1アンダーサンプリングは、不均衡データにおいて多数派クラスのサンプル数を削減することでクラスの比率を均衡させる手法である。
解答・解説をみる
○ 正しい
アンダーサンプリングの基本的な定義にあたります。代表例はランダムアンダーサンプリング(多数派クラスから無作為にサンプルを抽出して削減する手法)です。
問2アンダーサンプリングは少数派クラスのデータを人工的に合成して増やす手法であり、SMOTEはその代表例である。
解答・解説をみる
× 誤り
これはオーバーサンプリングおよびSMOTEの説明です。正しくは、アンダーサンプリングは多数派クラスのデータを減らす手法であり、少数派クラスを増やす手法とは逆方向にあたります。少数派を増やす手法と取り違える記述は、順序が逆になりやすい点です。
問3アンダーサンプリングでは多数派クラスのデータを削減するため、重要な情報が失われ、モデルの性能低下やバイアスにつながるリスクがある。
解答・解説をみる
○ 正しい
情報損失はアンダーサンプリングの代表的なデメリットです。データセットが大きい場合には計算コストを削減できるという利点と対になる関係にあります。

