ソフトマージン (G検定)

ソフトマージン

1. 定義と概要

ソフトマージン(ソフトマージンSVM)とは、サポートベクターマシン(SVM。データを2つのグループになるべく余裕を持たせて分ける境界線を引く分類手法)における定式化の一つです。誤分類やマージン(境界と各データ点との間の余白)の内側への侵入を一定程度許容しながら、その度合いに応じたペナルティを課す形で境界を求めます。

この境界は超平面(データを2つのグループに分ける境界となる線や面)と呼ばれます。具体例としては、ノイズや外れ値(データ全体の傾向から大きく外れた値)を含み完全にはきれいに分けられない実データの分類に、この方式が使われます。

SVMの基本形であるハードマージンは、誤分類を一切許さずに完全にデータを分離する境界を求める定式化です。しかし現実のデータには外れ値やノイズが混在するため、完全に分離できる境界を引けなかったり、境界が少数の外れ値に引きずられて不安定になったりするケースが多く見られます。

そこで誤分類やマージン侵入を一定の範囲で許容し、誤分類の度合いにペナルティを課しながら境界を求めるソフトマージンが、実務での標準的な選択として位置づけられています。ノイズを含む実データを扱う場面が多いほど、この柔軟さが生きてきます。

2. 試験対策ポイント

まず押さえておきたいのは、ソフトマージンSVMが誤分類をどのような仕組みで扱うかという点です。ソフトマージンSVMは、スラック変数(誤分類やマージンの内側への侵入の度合いを数値で表す変数)を導入し、その値に応じたペナルティを目的関数に加える形で境界を求めます。

目的関数とは、モデルが境界を決める際に最小化しようとする、誤差やペナルティをまとめた計算式のことです。スラック変数の値が大きいデータ点ほど、誤分類やマージン侵入の度合いが大きいことを意味します。

この仕組みと合わせて見ておきたいのが、パラメータ(モデルの挙動を調整するために人があらかじめ設定する数値)の一種である正則化パラメータC(誤分類をどれだけ許容するかを調整する数値)です。正則化パラメータCは、モデルの学習前に設定するハイパーパラメータの代表例に当たります。

Cの大小がモデルの性質にどう効くかは、向きを逆に覚えやすいところです。次のように対応づけて整理しておきたいポイントです。

Cの設定 誤分類への許容度 起こりやすい傾向
Cを大きくする 下がる 訓練データに厳密に適合し、過学習のリスクが高まる
Cを小さくする 上がる マージンが広がり汎化性能が高まりやすい一方、境界が粗くなる場合もある

過学習とは、訓練データに適合しすぎて未知のデータへの精度が落ちてしまう状態を指します。汎化性能とは、学習に使っていない未知のデータに対しても正しく予測できる能力のことです。

Cを極限まで大きくすると誤分類を一切許さない条件に近づき、数学的にはハードマージンSVMと一致します。ハードマージンは、ソフトマージンにおいてCが極端に大きい特殊なケースという関係にあります。

また、外れ値やノイズを含み完全には線形分離(データを1本の直線や平面で2つのグループに分けられること)できないデータに対応できる点も、ハードマージンとの実務上の違いとして押さえておきたい点です。この対応の広さこそが、ソフトマージンが標準的な定式化として扱われる理由です。

3. 関連概念との比較・相違点

ハードマージンSVMとの最大の違いは、誤分類を一切許容しないか、一定の範囲で許容するかという点にあります。ハードマージンは完全な線形分離を前提とするため、外れ値が1つ混ざるだけで境界が大きく動いてしまうという弱さを抱えます。

ソフトマージンは誤分類にペナルティを課しつつ許容するため、ノイズを含む実データにも適用できる範囲が広く、実務ではこちらが標準的な選択になります。実データには測定誤差や例外的なサンプルがつきものであるため、完全な線形分離を前提とする設計はかえって扱いにくくなる場面が多いといえます。

カーネル法(データを高次元の空間に写して、直線では分けられないデータでも分離できるようにする手法)との違いは、線形分離が難しいデータへどうアプローチするかという点にあります。ソフトマージンは分離の基準そのものを緩めて誤分類を許容する手法であるのに対し、カーネル法はデータを高次元の特徴空間に写して非線形の境界を引けるようにする手法であり、両者は狙いが異なります。

3つの考え方が何に対応する仕組みなのかを並べると、次のように整理できます。

概念 誤分類の扱い 対応する課題
ハードマージン 一切許容しない 完全に線形分離できるデータを前提とする
ソフトマージン ペナルティを課しつつ一定範囲で許容する ノイズや外れ値を含む実データ
カーネル法 誤分類の許容とは別の仕組み 直線では分けられない非線形なデータ

誤分類への許容と非線形への対応は別の問題であるため、実際のモデル構築ではソフトマージンとカーネル法が組み合わせて使われることも少なくありません。この2つは混同しやすい組み合わせであり、それぞれが何に対応する仕組みかという違いがあります。

4. ビジネス・実務での活用シナリオ

金融の与信審査や不正検知の現場では、取引データや顧客属性に例外的なケースやノイズが混在します。完全な分離を前提にせず一定の誤分類を許容するソフトマージンSVMで不正検知モデルを構築すると、外れ値に境界が引きずられることを抑えられ、汎化性能を確保しやすくなります。少数の例外的な取引に境界を合わせすぎないことが、未知の不正パターンへの対応力につながります。

製造業の外観検査でも、検査画像や信号データにはわずかなノイズが乗ります。完全分離を前提にしないソフトマージンを用い、正則化パラメータCを調整することで、過検出と見逃しのバランスを取ります。Cを厳しくしすぎると小さなノイズにまで反応して過検出が増え、緩めすぎると本来検出すべき不良を見逃すため、現場のデータに合わせた調整が欠かせません。

マーケティングの顧客セグメント分類においても、購買データには境界が曖昧なケースが含まれます。ソフトマージンであれば、多少の誤分類を許容しながら大まかな顧客グループへの分類を進められます。境界付近の少数の顧客に引きずられず、集団全体の傾向を捉えた分類ができる点が実務上の利点です。

5. 要点まとめ

  • ソフトマージンSVMは誤分類やマージン侵入を一定範囲で許容しながら境界を求める定式化で、外れ値やノイズを含み完全には線形分離できない実データに対応できます。
  • 正則化パラメータCは誤分類の許容度を調整し、Cが大きいほど誤分類に厳しく過学習のリスクが高まり、Cが小さいほど誤分類を許容してマージンが広がり汎化性能が高まりやすくなります。
  • Cを極限まで大きくすると数学的にハードマージンSVMと一致し、ハードマージンはソフトマージンの特殊なケースという関係にあります。

6. 確認問題

問1ソフトマージンSVMは、誤分類やマージンの内側への侵入をある程度許容しながら境界(超平面)を求める定式化である。

解答・解説をみる

○ 正しい

ソフトマージンは誤分類にペナルティを課しつつ一定範囲で許容する点がハードマージンとの違いであり、実データへの適用範囲の広さにつながります。

問2SVMの正則化パラメータCを大きくすると、誤分類への許容度が下がり、訓練データへの適合度が高まる分だけ過学習のリスクが高まる。

解答・解説をみる

○ 正しい

Cは誤分類の許容度を調整するハイパーパラメータで、大きくするほどハードマージンに近づき、訓練データへの適合が強まります。

問3SVMの正則化パラメータCを大きくすると、誤分類への許容度が上がり、マージンが広がって未知データへの汎化性能が高まる。

解答・解説をみる

× 誤り

正しくは、Cを大きくするほど誤分類への許容度が下がりマージンが狭まります。汎化性能が高まりやすいのはCを小さくした場合であり、Cの大小と挙動の対応を逆にした記述です。