マージン (G検定)

マージン

1. 定義と概要

マージンとは、SVMにおいて、分類のための決定境界(クラスとクラスを分ける境界線や、超平面(3次元以上の空間における境界線を一般化した呼び方)と呼ばれる面)と、サポートベクトル(決定境界から最も近い位置にあるデータ点)との距離です。

例えば2つのクラスのデータが平面上に散らばっているとき、境界線からどちらのクラスの最も近い点までも同じ距離だけ離れている状態を保ちながら、その距離自体をできるだけ広くとろうとする対象がマージンです。境界線の左右に等しい幅の帯を広げていき、その帯をできるだけ太くする作業だと考えると、イメージをつかみやすくなります。

SVM以前の分類手法では、境界線をどこに引くかの基準があいまいで、訓練データ(学習に使う手元のデータ)をたまたま分けられる線であれば良しとする発想が中心でした。SVMは、境界線に最も近いデータ点との距離であるマージンという明確な幾何学的な量を評価基準として導入し、この距離ができるだけ広くなる境界線を選ぶという考え方に転換しました。

境界線のすぐ近くにあるデータ点ほど、わずかな特徴量(データの特徴を数値化した項目)のブレによって、誤って反対のクラスに分類されるリスクが高くなります。そのため、最も危険な点との距離を確保しておくことが、未知のデータに対しても誤分類しにくい境界線につながるという発想が背景にあります。境界の引き方を運任せにせず、距離という測れる量で決められるようになった点が、この転換の意味するところです。

2. 試験対策ポイント

まず整理しておきたいのは、マージンの定義そのもの、つまり決定境界と、それに最も近いデータ点との距離という点です。距離を測る対象は境界に最も近いデータ点であるサポートベクトルであり、全データ点との平均距離や、境界から遠くにあるデータ点との距離ではない点は取り違えやすいところです。

全データ点までの距離を平均するような発想は、外れ値(他の大多数のデータから大きく外れた値)の影響を受けやすく、SVMの考え方とは異なります。極端な位置にある1点が平均を引っ張ってしまえば、境界の善し悪しを測るものさしとして働かなくなるためです。

また、マージンが広いほど、学習に使っていない未知のデータに対しても正しく分類できる可能性が高まるという関係も重要な論点です。境界線のすぐそばを通る狭いマージンでは、新しいデータがわずかにずれただけで誤分類につながりやすくなります。

SVMは、マージンという距離の概念を軸に、サポートベクトル、マージン最大化、ハードマージン、ソフトマージンという一連の用語で構成されます。それぞれが何を指す言葉なのかを対応づけると、次のように整理できます。

用語 何を指す言葉か
マージン 決定境界と、それに最も近いデータ点との距離そのもの
サポートベクトル その距離を規定する、決定境界から最も近い位置にあるデータ点
マージン最大化 決定境界と最も近いデータ点との距離をできるだけ広くとろうとするSVMの学習の考え方
ハードマージン 誤分類を一切許容せず、データを完全に分離する境界の引き方
ソフトマージン 多少の誤分類を許容しながら、現実のデータにも対応できるようにする境界の引き方

この表のとおり、5つの用語が指す対象はそれぞれ異なります。距離そのものか、点か、原理か、許容の度合いかという区別は混同しやすい組み合わせで、名称の似た選択肢が並ぶ設問では、まずどの対象を指しているかを見極めると判断しやすくなります。

3. 関連概念との比較・相違点

サポートベクトルとの最大の違いは、マージンが決定境界とデータ点の間の距離という数量そのものを指すのに対し、サポートベクトルはその距離を規定するデータ点を指す点です。距離という量なのか、点という対象なのかという違いが取り違えやすいところです。

実際の学習では、境界線から離れた大多数のデータ点がどこにあっても結果に影響せず、境界に最も近いごく一部のサポートベクトルだけがマージンの大きさを決めます。この、少数の点だけが結果を左右するという性質は、マージンとサポートベクトルをあわせて理解するうえで欠かせない視点です。

マージン最大化との関係では、マージンが静的な距離の概念であるのに対し、マージン最大化はその距離をできるだけ広くとろうとするSVMの学習の原理・目的を指します。マージンが量、マージン最大化がその量を広げる方針という関係にあります。

加えて、ハードマージンとソフトマージンという2つの引き方も、この量をどこまで厳密に守るかという観点での違いにあたります。前者は誤分類を一切許さずに完全な分離を目指す考え方であり、後者は多少の誤分類を許容して現実のデータに対応する考え方です。名称は似ていても、マージンという距離そのものとは区別して捉える必要があります。

4. ビジネス・実務での活用シナリオ

迷惑メールフィルタの分野では、日々変化するスパムの言い回しに対応する必要があり、境界のすぐ近くでしか判定できないモデルでは、新しい言い回しのメールに対して正規メールとスパムの判定が揺れやすくなります。スパムと正規メールを分ける境界からのマージンを広く確保しておくと、これまでにない言い回しの新種メールが届いた場合でも、正規メールを誤って迷惑メールに分類するリスクを抑えやすくなります。

医療画像診断では、良性・悪性の判定境界に対するマージンが広いモデルほど、未知の患者データに対しても判定が安定しやすく、わずかな特徴量のブレによる誤診断を抑える効果につながります。症例ごとに画像の写り方には個人差があり、境界ぎりぎりでしか判定できないモデルでは、そうした個人差の影響を受けて判定が反対方向に振れやすくなります。

与信審査・金融の分野でも、融資可否を分ける境界付近の申込者データに対して、マージンが広いモデルは新規申込者の特徴のわずかな違いに引きずられにくく、審査基準の安定につながります。新規に申し込む顧客の属性は過去の審査データと完全には一致しないため、境界に近い位置でしか判定できないモデルほど、似た属性の申込者に対して結果がぶれやすくなります。

5. 要点まとめ

  • マージンとは、SVMにおいて決定境界と、それに最も近いデータ点であるサポートベクトルとの距離を指します。
  • マージンが広いほど、未知のデータに対しても誤分類しにくくなるという関係にあります。
  • SVMは、マージン・サポートベクトル・マージン最大化・ハードマージン・ソフトマージンという一連の用語で構成されます。

6. 確認問題

問1マージンとは、決定境界と、それに最も近いデータ点であるサポートベクトルとの距離を指す。

解答・解説をみる

○ 正しい

マージンは、SVMの決定境界から最も近いデータ点までの距離という定義そのものです。この距離を規定する点がサポートベクトルです。

問2マージンとは、決定境界とすべてのデータ点との平均距離を指す。

解答・解説をみる

× 誤り

正しくは、決定境界に最も近いデータ点であるサポートベクトルとの距離であり、すべてのデータ点との平均距離ではありません。距離の対象を取り違えた記述です。

問3マージンが広いほど、未知のデータに対しても正しく分類できる可能性が高まるとされる。

解答・解説をみる

○ 正しい

境界線付近の狭いマージンは新しいデータのわずかなずれで誤分類につながりやすく、広いマージンほど未知のデータへの分類が安定するという関係にあります。