オーバーサンプリング (G検定)

オーバーサンプリング

1. 定義と概要

オーバーサンプリングとは、不均衡データ(分類したい種類ごとの件数に大きな偏りがあるデータ)において、少数派クラス(データ件数が少ない側の分類対象)のデータを人工的に増やす処理です。これにより、多数派クラス(データ件数が多い側の分類対象)との比率を均衡に近づけます。例えば、正常例1,000件に対して異常例が10件しかないデータセットでは、10件の異常例を複製したり合成したりして数を増やします。

従来、不均衡データはそのまま学習に使う運用が一般的でした。しかし、多数派クラスに偏った予測をするモデルができやすく、少数派クラス(不正利用や異常品など実務上重要な対象であることが多い)の識別性能が著しく低下する課題があります。

対処法は、データそのものを加工するデータレベルの手法と、学習アルゴリズム側で調整するアルゴリズムレベルの手法に大別されます。データレベルの手法には、少数派を増やすオーバーサンプリングと、多数派を減らすアンダーサンプリング(多数派クラスのデータを減らしてバランスを取る手法)があります。

アルゴリズムレベルの手法には、コスト考慮学習(誤って分類したときのペナルティの重みを調整しながら学習する手法)などがあります。これらは互いに排他的ではなく、組み合わせて使う運用が一般的です。

2. 試験対策ポイント

G検定では、不均衡データへの対処法として、少数派クラスを増やすオーバーサンプリングと、多数派クラスを減らすアンダーサンプリングが対の概念として扱われます。両者はどちらもデータレベルでの調整であり、少数派クラスのデータをどう扱うかという観点で対比されます。

単純に少数派クラスのデータを複製するランダムオーバーサンプリングは、同じデータが繰り返し登場することで過学習(訓練データに合わせすぎて、新しいデータへの対応力が落ちる現象)に陥りやすいという制約を持ちます。この制約を補う代表的な改良手法がSMOTE(Synthetic Minority Over-sampling Technique)です。

SMOTEは単純複製ではなく、k近傍法(ある点に近いデータ点を参考にして特徴や分類を決める手法)を用いて、特徴量(データの特徴を数値で表した値)の空間上に少数派クラスの合成データを生成します。同じデータをそのまま増やすのではなく、近くにあるデータを手がかりに新しいデータを作り出すため、複製の繰り返しによる偏りを避けやすくなります。

不均衡データでは、正解率(全体の予測のうち正しく分類できた割合)が高くても、少数派クラスの検出性能を正しく反映しない場合があります。多数派クラスばかりを当てても全体の正解率は高く出てしまうためです。

再現率(実際に陽性であるもののうち、正しく陽性と判定できた割合)や適合率(陽性と予測したもののうち、実際に陽性だった割合)といった評価指標は、オーバーサンプリングとあわせて整理しておきたいところです。あわせて、F値(適合率と再現率のバランスを1つの数値にまとめた指標)や混同行列(予測結果と実際の分類結果をマス目に整理した表)も、不均衡データの評価でよく参照される指標です。

3. 関連概念との比較・相違点

アンダーサンプリングとの最大の違いは、少数派クラスを増やすか、多数派クラスを減らすかという方向にあります。どちらの方向にも利点と代償があり、対応関係を整理すると次のようになります。

観点 オーバーサンプリング アンダーサンプリング
調整の方向 少数派クラスのデータを増やす 多数派クラスのデータを減らす
利点 元のデータが持つ情報量を保てる 学習にかかるコストを抑えられる
伴うリスク データ数が増える分の計算コスト増と過学習 多数派クラスの情報損失やバイアス

つまりオーバーサンプリングは情報を足す方向、アンダーサンプリングは情報を削る方向の調整にあたります。どちらを選ぶかは、データ量や計算資源の制約に応じた判断になります。間引き方の具体的な手順は、アンダーサンプリングを扱う別記事に譲ります。

SMOTEとの関係は、対立ではなく包含です。オーバーサンプリングという上位概念の中に、単純複製によるランダムオーバーサンプリングと、k近傍法で合成データを生成するSMOTEという実装方式が存在します。手法全体を指すオーバーサンプリングと、その具体的な一手法であるSMOTEという粒度の違いは、取り違えやすい点です。合成データの作り方といった詳しい仕組みは、SMOTEを扱う別記事で解説します。

4. ビジネス・実務での活用シナリオ

金融業界の不正検知では、クレジットカードの正常取引に比べて不正取引のデータが極端に少なくなります。オーバーサンプリングで学習データを補うと、不正のパターンをモデルが学習しやすくなり、不正の見逃し(偽陰性)を減らす検知モデルの構築につながります。

製造業の異常検知では、不良品の発生率が低いために不良品データが少なくなりがちです。オーバーサンプリングでデータ数を補うことで、モデルが不良品に特有の特徴を学習しやすくなり、少ないサンプルからでも異常のパターンを捉えられるようになります。

医療診断支援の分野では、希少疾患の陽性データが少ない状況にオーバーサンプリングを適用します。少数派クラスである陽性例のデータを補うことで、見逃しを抑えた診断支援モデルの構築につながります。陽性例の特徴をモデルが学習しやすくなる分、早期発見や誤診防止といった診断精度の向上にも結びつきます。

5. 要点まとめ

  • オーバーサンプリングは、不均衡データにおいて少数派クラスのデータを増やし多数派クラスとの比率を近づける手法で、単純複製とSMOTE(k近傍法による合成データ生成)という2つの代表的な方式があります。
  • 多数派クラスを減らすアンダーサンプリングとは対の関係にあり、オーバーサンプリングは情報損失を避けられる一方、単純複製は過学習のリスクを伴います。
  • 不均衡データの評価では正解率だけでなく、再現率・適合率・F値・混同行列など複数の指標を組み合わせて確認します。

6. 確認問題

問1オーバーサンプリングは、不均衡データにおいて少数派クラスのデータ数を人工的に増やし、多数派クラスとの比率を近づける手法である。

解答・解説をみる

○ 正しい

定義そのものの確認です。少数派クラスを増やす点が、多数派クラスを減らすアンダーサンプリングとの違いになります。

問2オーバーサンプリングは、多数派クラスのデータを削減することで少数派クラスとのバランスを取る手法である。

解答・解説をみる

× 誤り

この記述はアンダーサンプリングの説明であり、オーバーサンプリングは少数派クラスを増やす手法です。正しくは、多数派クラスを減らすのがアンダーサンプリング、少数派クラスを増やすのがオーバーサンプリングという関係にあります。両者を逆向きに入れ替えた記述は、取り違えやすい点として押さえておきたいところです。

問3オーバーサンプリングの代表的な手法であるSMOTEは、少数派クラスのデータを単純に複製するのではなく、k近傍法を用いて特徴量空間上に合成データを生成する。

解答・解説をみる

○ 正しい

SMOTEは、単純複製であるランダムオーバーサンプリングの過学習リスクを補う改良手法で、k近傍法による合成データ生成が特徴です。