サポートベクトル (G検定)

サポートベクトル

1. 定義と概要

サポートベクトルとは、SVM(サポートベクターマシン。2クラスのデータを分ける境界線を引く分類アルゴリズム)が引く決定境界(データを2つのグループに分ける境目となる線や面)に最も近い位置にあるデータ点です。各クラスからこの境界に最も近い点(1点以上)がサポートベクトルにあたり、境界とサポートベクトルの距離はマージン(決定境界とサポートベクトルの間の距離、いわば余白の広さ)と呼ばれます。

分類の境界を引く発想としては、全データ点の分布を使って境界を計算する方法も考えられます。しかし、この方法では外れ値(他の大多数のデータから大きく離れた値)や大多数の点の位置に境界が引きずられやすいという弱点があります。

SVMはこれとは逆の発想を取り、境界に最も近い少数の点だけに着目し、それ以外の大多数の点は境界の決定に関与させません。境界から離れた位置にあるデータ点の増減には影響されないという特徴も、この発想から生まれます。この「少数の点だけで境界が決まる」という性質こそが、サポートベクターマシンという名称そのものの由来になっています。

2. 試験対策ポイント

まず整理したいのは、サポートベクトルが「決定境界に最も近いデータ点」であるという位置関係と、境界とサポートベクトルの距離がマージンとして定義されるという対応関係です。この対応関係は取り違えやすい点です。

核心となる論点は、決定境界がサポートベクトルだけによって定まるという性質です。サポートベクトル以外の点をどれだけ動かしても、あるいは取り除いても境界は変化しません。

逆にサポートベクトル自体を動かせば、境界の位置も変わります。全データのうち一部の点だけで答えが決まるこの性質は、スパース(疎。全部のデータではなく少数の点だけで答えが決まる性質)な解と呼ばれ、この用語とあわせて整理しておきたいところです。

もう一つの論点は、ソフトマージン(一部の誤分類やマージンへの侵入をある程度許容する方式)における扱いです。ソフトマージンでは、境界からきれいに離れた点だけでなく、マージンの内側に入り込んだ点や誤分類された点もサポートベクトルとして扱われる場合があります。サポートベクトルは必ずしも「正しく分類された点」に限らないという理解が、ここでの要点になります。

3. 関連概念との比較・相違点

マージンとの最大の違いは、指している対象そのものです。サポートベクトルは決定境界に最も近い「点」を指す言葉であるのに対し、マージンは決定境界とサポートベクトルの間に広がる「距離」を指す言葉です。

同じ文脈で使われるため混同されやすく、両者の名称を入れ替えて記述すると誤りになります。点と距離とでは指す次元が異なるという整理が、この対比の軸になります。

サポートベクトル以外の訓練データ点との違いは、決定境界の位置に影響するかどうかという一点に尽きます。サポートベクトルだけが境界を規定する役割を持ち、それ以外の点は除去しても移動させても境界に影響しません。

三つの言葉を、指している対象と決定境界への関わり方という二つの軸で並べると、次のように整理できます。

用語 指している対象 決定境界への関わり
サポートベクトル 決定境界に最も近いデータ点 動かすと境界の位置も変わる
マージン 境界とサポートベクトルの間の距離 境界と最も近い点との間に生じる余白
それ以外の訓練データ点 境界から離れた大多数の点 動かしても取り除いても境界は変わらない

境界を決める点とそうでない点とに分かれるこの関係は、学習に使ったデータをすべて保持しなくても分類のルールを再現できるという実務上の利点にもつながります。同じ訓練データの集合に属していても、担う役割は同じではないということです。

4. ビジネス・実務での活用シナリオ

医療診断の分野では、画像や検査値から良性・悪性などを分類する場面で、境界付近に位置する紛らわしい症例がサポートベクトルにあたります。境界から離れた明白な症例には多くの時間をかけずに済む一方、こうした境界事例を専門医が重点的に確認する運用は、診断の質と業務の効率を両立させる意義を持ちます。

スパムメールや不正取引の検知では、分類が難しい境界付近のメールや取引データを継続的に追加学習させることで精度の改善につながりやすい傾向があります。一方、境界から離れた明白なデータをいくら増やしても、精度向上への寄与は小さいという関係にあります。限られた確認の手間を境界付近のデータに集中させる方が、判定精度の底上げにつながりやすいという考え方です。

小規模なシステムや組み込み機器の分野では、決定境界がサポートベクトルという少数の点だけで決まる性質が生きます。分類ルールを保持するために必要なデータ量やメモリを抑えやすく、限られたリソースでの運用に向いた特性となっています。省スペースな機器にも分類のしくみを組み込みやすいという実利は、この性質から生まれています。

5. 要点まとめ

  • サポートベクトルは決定境界に最も近いデータ点であり、境界とサポートベクトルとの距離がマージンとして定義されます。
  • 決定境界はサポートベクトルだけで定まり、それ以外の点を動かしても境界は変わらないという性質が、SVM(サポートベクターマシン)という名称の由来になっています。
  • ソフトマージンでは誤分類やマージン内に入り込んだ点もサポートベクトルとなる場合があり、境界に近い少数の点だけで学習結果が決まる発想は、通常の訓練データ点との役割の違いを示しています。

6. 確認問題

問1サポートベクトルとは、SVMが引く決定境界に最も近い位置にあるデータ点のことである。

解答・解説をみる

○ 正しい

サポートベクトルの定義そのものです。境界とサポートベクトルの距離がマージンとして定義される点も合わせて覚えておく必要があります。

問2決定境界はサポートベクトル以外のすべてのデータ点によって決まるため、境界から離れた点を動かすと境界の位置も変化する。

解答・解説をみる

× 誤り

正しくは逆で、決定境界はサポートベクトルだけで定まります。サポートベクトル以外の点を動かしても、あるいは取り除いても境界は変化しません。

問3ソフトマージンでは、マージンの内側に入り込んだ点や誤分類された点もサポートベクトルとして扱われる場合がある。

解答・解説をみる

○ 正しい

ソフトマージンは誤分類やマージン侵入をある程度許容する方式であり、そうした点もサポートベクトルに含まれ得ます。サポートベクトルは必ずしも正しく分類された点に限りません。