SMOTE (G検定)

SMOTE

1. 定義と概要

SMOTE(Synthetic Minority Over-sampling Technique)とは、不均衡データ(クラスごとのデータ件数に大きな差があるデータのこと)を補正する手法です。具体的には、少数派クラス(全体に占める件数が少ない方のクラスのこと)を増やします。既存サンプルの単純な複製ではなく、合成サンプルの生成によって増やすオーバーサンプリング(少数派クラスのデータを人工的に増やしてバランスを取る手法)である点が特徴です。

この手法は「Chawla・Bowyer・Hall・Kegelmeyer」の4名が2002年に発表した論文(学術誌『Journal of Artificial Intelligence Research』第16巻に掲載)で提案しました。

具体的には、少数派クラスのあるサンプルに対して、同じ少数派クラス内のk近傍(あるデータに近い順にk個のデータを探し出す考え方。既定はk=5)からランダムに1つを選びます。双方の特徴量(データの性質を数値で表した項目のこと)を軸にとった特徴空間(各データの特徴量を軸にとった多次元の空間)を考えます。

この空間上で2点を結ぶ線分の間にランダムな位置で新しい点を作る内挿(2つのデータ点を結ぶ線の間に新しい点を作ること)によって、合成サンプルを生成します。既存の2点の中間的な特徴を持つ、それまで存在しなかったデータ点が新たに生まれる点が特徴です。

不均衡データでは、少数派クラスの学習事例が少なく、分類モデル(データをあらかじめ決められたクラスに振り分けるモデルのこと)が多数派クラス(全体に占める件数が多い方のクラスのこと)に偏って学習されやすいという課題があります。これを補う古典的な方法として、少数派クラスのサンプルをそのまま複製するランダムオーバーサンプリング(少数派クラスの既存データをそのまま複製して増やす単純な方法)があります。

ただし、同一データの重複が増えるだけのため、モデルが特定のサンプルに過剰適合する過学習(学習データに適合しすぎて、新しいデータへの予測精度が落ちてしまう状態)を招きやすいという弱点があります。SMOTEは複製ではなく特徴空間上に新規性のある合成サンプルを生成することで、少数派クラスの分布を保ちながらこの過学習のリスクを抑える発想で考案されました。

2. 試験対策ポイント

まず整理しておきたいのは、SMOTEが「単純な複製ではなく合成サンプルを生成する」という点です。既存サンプルをそのまま複製するランダムオーバーサンプリングとの違いが、この生成方法の分かれ目です。単純な複製では同一データが増えるだけですが、SMOTEは近傍サンプルとの間に新しい合成サンプルを作るため、少数派クラスの分布に新規性を持たせられます。

合成サンプルを生成する際のk近傍探索は、同じ少数派クラスのサンプルの中で行われ、多数派クラスとの間で内挿するわけではありません。この近傍探索の対象を取り違えた記述は、対象を逆にとらえやすい点です。

不均衡データへの対処法は、多数派クラスを減らすアンダーサンプリング(多数派クラスのデータを間引いて減らしバランスを取る手法)と、少数派クラスを増やすオーバーサンプリングに大別され、SMOTEはオーバーサンプリングに位置づけられる手法です。両者は互いに排他的ではなく、組み合わせて使う場合がある点も合わせて見ておきます。

SMOTEは「Chawla」らが2002年に提案した手法で、提案者名と発表年もあわせて押さえておきたいポイントです。また、SMOTEを起点とした発展形として、境界付近のサンプルを重視するBorderline-SMOTEや、分類の難しさに応じて合成数を調整するADASYNなどの派生手法が存在し、これらの名称にも触れておきます。

3. 関連概念との比較・相違点

ランダムオーバーサンプリングとの最大の違いは、少数派サンプルの増やし方にあります。ランダムオーバーサンプリングは既存サンプルをそのまま複製するのに対し、SMOTEはk近傍のサンプル間を内挿して新しい合成サンプルを生成します。単純な複製は同一データの重複により過学習を招きやすい一方、SMOTEは特徴空間上の分布を保ちながら新規性のあるデータを生成するため、このリスクを抑えやすいという関係にあります。

アンダーサンプリングとの最大の違いは、多数派を減らすか少数派を増やすかという方向性にあります。アンダーサンプリングは多数派クラスのデータを削減してバランスを取るため、情報の一部が失われるリスクがあります。これに対し、SMOTEを含むオーバーサンプリングはデータ量を保ったまま少数派を補う方法です。ただし、オーバーサンプリング側は合成データが増える分、計算コストや過学習のリスクとのトレードオフを抱えます。

3つの手法の位置づけは、何をするかと弱点という2つの軸で並べると整理しやすくなります。

手法 何をするか 弱点
ランダムオーバーサンプリング 少数派クラスの既存サンプルをそのまま複製する 同一データの重複が増え、過学習を招きやすい
SMOTE 少数派クラス内のk近傍との間を内挿して合成サンプルを作る 合成データが増える分、計算コストとのトレードオフがある
アンダーサンプリング 多数派クラスのデータを間引いて減らす 情報の一部が失われるリスクがある

どれを選ぶかは、元データの情報を保ちたいのか、扱うデータ量を抑えたいのかという狙いによって変わってきます。

4. ビジネス・実務での活用シナリオ

金融業界のクレジットカード不正検知では、不正利用の取引が正常取引に比べて極端に少ないという不均衡データの典型的な例に直面します。SMOTEで不正取引データを合成して補うことで、不正パターンの検出漏れにあたる偽陰性(本当は陽性なのに、モデルが陰性と誤って判定してしまうこと)を抑えたモデルを学習できます。少数派である不正データが極端に少ないままでは、モデルが正常取引のパターンに偏って学習し、新しい手口の不正を見逃しやすくなるためです。

医療分野の希少疾患の診断支援では、陽性症例が少ない検査データにSMOTEを適用し、少数派の陽性パターンを補強します。まれな疾患は臨床データそのものが少なく、モデルが陰性側の特徴ばかりを学習してしまうと、実際の患者を見逃す可能性が高まります。少数派の陽性パターンを人工的に補うことは、まれな疾患の見逃しを減らす分類モデルの学習に直結する取り組みです。

製造業の設備異常検知では、不良品や設備故障の発生率が低い製造ラインで、SMOTEにより異常データを補います。異常の発生件数は正常稼働の記録に比べて圧倒的に少なく、この差を放置すると異常検知モデルが正常データばかりに偏って学習してしまいます。合成サンプルで異常側のデータを厚くすることは、実際の異常を捉え損なわない検知モデルを作るうえで欠かせない工程です。

5. 要点まとめ

  • SMOTEは、少数派クラスのサンプルを単純に複製するのではなく、同じ少数派クラス内のk近傍(既定はk=5)との間を内挿して合成サンプルを生成するオーバーサンプリング手法です。
  • 単純な複製によるランダムオーバーサンプリングと比べて、合成サンプルの新規性が過学習のリスクを抑えます。「Chawla」らが2002年に提案しました。
  • 不均衡データ対策は、多数派を減らすアンダーサンプリングと、少数派を増やすオーバーサンプリングに大別され、SMOTEはオーバーサンプリングに位置づけられます。

6. 確認問題

問1SMOTEは、少数派クラスのサンプルを単純に複製するのではなく、既存サンプルとその近傍サンプルの特徴量を内挿して新しい合成サンプルを生成する手法である。

解答・解説をみる

○ 正しい

これがSMOTEの核心です。同一データの複製ではなく、特徴空間上に新規性のある合成サンプルを作る点が、ランダムオーバーサンプリングとの違いにあたります。

問2SMOTEが合成サンプルを生成する際のk近傍探索は、少数派クラスのサンプルと多数派クラスのサンプルとの間で行われる。

解答・解説をみる

× 誤り

近傍探索の対象は多数派クラスではなく、同じ少数派クラス内のサンプルです。正しくは、少数派クラス内で近いサンプル同士を結んで内挿するという手順であり、多数派クラスとの間で内挿するわけではありません。

問3SMOTEは、「Chawla」らによって2002年に提案された、不均衡データに対するオーバーサンプリング手法の一つである。

解答・解説をみる

○ 正しい

SMOTE(Synthetic Minority Over-sampling Technique)は「Chawla・Bowyer・Hall・Kegelmeyer」が2002年の論文で提案した手法です。不均衡データ対策のうちオーバーサンプリングに分類されます。