マージン最大化 (G検定)

マージン最大化

1. 定義と概要

マージン最大化とは、SVMが学習データを2つのクラスに分ける決定境界(超平面。データを2つのグループに分けるための境界線で、扱うデータの項目が増えると平面ではなく立体的な面になります)を求める際、境界ともっとも近いデータ点との距離であるマージンが最大になるように、境界の位置を選ぶという学習の基準です。

マージンそのものの厳密な定義や図解は別記事「マージン」に譲り、ここでは、なぜこの基準を採用するのかを扱います。直感的には、2つのグループの間にできるだけ幅の広い余白を確保して境界を引く考え方にあたります。

SVMが登場する以前、学習データを分ける境界を求める手法には、パーセプトロン(データを直線的に分ける、もっとも基本的な分類アルゴリズムの一つ)などがありました。これらの手法は、データを正しく分けられる境界であれば良しとし、複数の候補のうちどれを選ぶべきかという明確な基準を持ちませんでした。

そのため、学習の終え方によって境界の位置がぶれ、未知データへの対応力にばらつきが生じやすいという課題を抱えていました。SVMは、マージンが最大になる境界を選ぶという一意の基準を導入し、この課題に対応しています。

2. 試験対策ポイント

理解するうえで中心になるのは、マージン最大化がなぜ汎化性能(学習に使っていない新しいデータに対しても正しく予測できる能力)を高めるのかという理由です。マージンを最大化した境界は、境界付近に広い余白を持つため、学習データに多少含まれるばらつきやノイズがあっても、新しいデータを誤分類しにくくなります。

境界の位置決めをこの基準で行うことが、汎化性能の向上と過学習(学習データだけに合わせすぎて新しいデータへの対応力が落ちてしまう現象)の抑制に直結する点は、SVMを理解するうえでの中心的な論点です。

現実のデータは、学習データを完全にきれいな直線や平面で分けられるとは限りません。そこで導入されているのが、マージンの内側へ一部のデータ点が入り込むことを許容するソフトマージンという考え方です。完全な分離を前提とするハードマージン(データを完全にきれいに分けられることを前提にした境界の引き方)との違いは、次のように整理できます。

用語 前提としているデータ マージン内への侵入
ハードマージン 完全にきれいに分けられるデータ 一切許容しない
ソフトマージン 完全には分けきれない現実のデータ 一部のデータ点が入り込むことを許容する

この2つは名前が似ているうえに前提が正反対なので、混同しやすい組み合わせです。また、マージン最大化と誤分類の許容とのトレードオフを調整する正則化パラメータ(マージンの広さと誤分類の許容度のバランスを調整する数値)の存在も、あわせて押さえておきたいポイントです。

また、マージン最大化の結果、決定境界の位置に実際に影響するのは境界にもっとも近い一部のデータ点であるサポートベクトル(決定境界にもっとも近い位置にあるデータ点)のみで、それ以外の大多数のデータ点は境界の位置に影響しません。全データ点が等しく境界に影響するという理解は誤りで、この点が誤りやすい区別です。

3. 関連概念との比較・相違点

パーセプトロンの学習規則との最大の違いは、境界を一意に定める基準の有無にあります。パーセプトロンは学習データを分離できる境界であれば良しとし、境界の位置そのものに基準を持ちません。これに対しSVMは、マージン最大化という明確な基準によって境界を一意に定めます。

ロジスティック回帰(データがあるクラスに属する確率を計算して分類する手法)の決定境界とも、根拠の置き方が異なります。ロジスティック回帰は、各データ点がどちらのクラスに属するかの確率を計算し、その確率の高さに基づいて境界を決めます。一方でSVMは、境界とデータ点の間の幾何学的な距離であるマージンを基準に境界を決めるという関係にあります。

3つの手法が何を根拠に境界を引くのかを並べると、違いがはっきりします。

手法 境界を決める根拠 境界の一意性
パーセプトロン データを正しく分けられること 候補が複数残り一意に定まらない
ロジスティック回帰 各データ点がクラスに属する確率 確率の計算にもとづいて決まる
SVM 境界ともっとも近いデータ点との距離 マージン最大という基準で一意に定まる

ロジスティック回帰とSVMは同じ分類問題を扱いながらも、境界を決める根拠がまったく異なるアルゴリズムとして対比されます。確率にもとづくか、幾何学的な距離にもとづくかという根拠の違いは、取り違えやすい点です。

4. ビジネス・実務での活用シナリオ

画像分類や外観検査の現場では、少量の学習データしか集められないことが珍しくありません。境界付近に余白を持たせるマージン最大化の考え方は、そうした条件下でも未知の画像パターンに対する誤判定を抑え、安定した良品・不良品判定につながっています。

外観検査で良品を誤って不良と判定してしまうと、本来不要な再検査や人の目による確認が発生し、検査工程全体の効率が下がります。反対に不良品を良品と見逃してしまうと、品質管理上の手戻りにつながります。

境界の周囲に余白を持たせておくことで、学習データにない微妙な見え方の違いに対しても判定がぶれにくくなり、こうした双方向の誤判定を抑えやすくなるという意義があります。

スパム判定などのテキスト分類でも、マージン最大化は効果を発揮します。文書データは特徴量(データの特徴を数値として表した項目)が高次元になりやすく、マージンを最大化した境界は、学習データに含まれない新しい文面パターンに対しても頑健に分類できるという性質を持ちます。特徴量の種類が多い分野ほど、境界の引き方に余白を持たせる意味が大きくなります。

5. 要点まとめ

  • マージン最大化は、SVMが決定境界を選ぶときの学習基準で、境界ともっとも近いデータ点との距離を最大にする境界を選びます。
  • マージンを広くとるほど新しいデータに対する誤分類が起きにくくなり、汎化性能が高まり過学習が抑えられます。
  • 現実のデータは完全に線形分離できないことが多く、マージン内への一部データ点の侵入を許容するソフトマージンでトレードオフを調整します。

6. 確認問題

問1マージンを最大化する目的は、未知のデータに対しても誤分類が起こりにくい、汎化性能の高い決定境界を得ることにある。

解答・解説をみる

○ 正しい

境界付近に広い余白を確保することで学習データのばらつきを吸収でき、未知データへの対応力である汎化性能が高まります。過学習の抑制にも直結する論点です。

問2マージン最大化によって決定境界の位置を決めるうえで、学習データに含まれるすべての点が境界の位置に等しく影響する。

解答・解説をみる

× 誤り

境界の位置に影響するのは境界にもっとも近い一部のデータ点であるサポートベクトルのみで、それ以外の点は境界の位置に影響しません。全データ点が等しく影響するという記述は誤りです。

問3現実のデータは完全に線形分離できないことが多いため、マージン内への一部のデータ点の侵入を許容するソフトマージンという考え方が導入されている。

解答・解説をみる

○ 正しい

ハードマージンは完全な分離を前提としますが、現実のデータでは成り立たないことが多く、ソフトマージンでマージン最大化と誤分類の許容とのトレードオフを調整します。