敵対的な攻撃 (G検定)

敵対的な攻撃

1. 定義と概要

敵対的な攻撃とは、機械学習モデルの入力データに、人間の目にはほとんど分からない程度のノイズ(摂動)を意図的に加えることで、モデルに誤った分類や判断をさせる攻撃です。

代表例として、パンダの画像に微小なノイズを加えてAIに「テナガザル」と誤認識させた事例があります。この事例は「Goodfellow」らが2014年に発表した論文で紹介されました。また、道路の「停止」標識に小さなステッカーを貼るだけで、自動運転車のAIが「制限速度45マイル」の標識と誤認識した実証実験も知られています。

AIモデルは学習データの統計的な特徴を基準に判断するため、人間には識別できない程度の微小な変化でも、モデル内部の判断基準を大きくずらすことがあります。人間の目は対象の全体的な形や意味をとらえますが、モデルが見ているのは画素の数値の並びであり、両者のとらえ方のずれが攻撃の入口になります。

深層学習(多層構造のニューラルネットワークでデータの特徴を学習する手法)による画像認識モデルが実用化される中で、この性質を悪用する攻撃が2014年前後から研究されるようになりました。自動運転や顔認証などAIの判断が安全性に直結する領域では、敵対的な攻撃は実務上のリスクとして扱われています。

2. 試験対策ポイント

まず整理したいのは、攻撃を仕掛けるタイミングによる分類です。学習済みモデルへの入力時に摂動を加えて誤分類させる攻撃は回避攻撃(Evasion Attack)と呼ばれます。一方、学習データ自体を汚染してモデルの判断基準を歪める攻撃はデータ汚染攻撃(ポイズニング攻撃)といいます。

もうひとつの軸が、攻撃者がモデルについてどれだけの情報を持っているかによる区分です。モデルの構造やパラメータ(モデルが学習によって獲得した内部の設定値)、その勾配(損失関数の値をどの方向に変えれば増減するかを示す傾き)まで把握した上で行う攻撃はホワイトボックス攻撃を指します。入力と出力の観察のみから行う攻撃はブラックボックス攻撃と呼びます。二つの軸を並べると、次のように整理できます。

区分の軸 用語 内容
攻撃のタイミング 回避攻撃(Evasion Attack) 学習が終わったAIモデルに対して入力データを少しだけ細工し、誤った答えを出させる
攻撃のタイミング データ汚染攻撃(ポイズニング攻撃) AIが学習する前のデータそのものに細工をして、学習結果をゆがめる
攻撃者の情報量 ホワイトボックス攻撃 モデルの構造やパラメータ、勾配まで把握した上で仕掛ける
攻撃者の情報量 ブラックボックス攻撃 入力と出力の観察のみを手がかりに仕掛ける

パンダの画像にノイズを加える敵対的サンプルは、この分類のうち回避攻撃に該当します。攻撃の際に鍵となるのが損失関数(AIの予測が正解からどれだけずれているかを数値で表す関数)です。ホワイトボックス攻撃の代表的な手法はFGSM(Fast Gradient Sign Method)と呼ばれます。損失関数の勾配の符号を利用して、効率よく誤認識用のノイズを生成する手法です。

敵対的学習(Adversarial Training)は、敵対的サンプルを訓練データに加えて再学習する代表的な防御手法です。通常のデータと敵対的サンプルの両方で学習させることで、モデルの頑健性(ロバスト性。多少のノイズや想定外の入力があっても、AIが正しく動き続ける強さ)を高められます。

一方で、通常の学習に加えて敵対的サンプルの生成と学習が必要になるため、学習時間が増加するというトレードオフを伴います。防御力を上げるほど学習の手間も増えるという関係は、対策を検討するうえでの前提になります。

3. 関連概念との比較・相違点

関連する攻撃手法との最大の違いは、介入するタイミングにあります。回避攻撃(敵対的サンプル)は学習が完了したモデルへの入力時に介入するのに対し、データ汚染攻撃は学習データの段階で介入します。

前者はすでに完成したモデルを一時的にだます攻撃であるのに対し、後者はモデルそのものの学習結果を長期にわたって歪める攻撃という関係にあります。影響が一回ごとの入力にとどまるか、モデルの判断基準そのものに残るかという違いです。

混同されやすい概念にディープフェイク(AI生成技術を使って作られた偽の画像や映像)がありますが、目的と対象が異なります。敵対的な攻撃はAIの分類器を誤認識させることが目的で、人間には気づきにくい微小な摂動を用います。

一方のディープフェイクは、生成技術を使って人間の視聴者そのものを欺く偽の映像や音声を作ることが目的です。だます相手がAIか人間かという点が、両者を分ける軸になります。

4. ビジネス・実務での活用シナリオ

自動運転の分野では、標識に対する物理的なステッカー攻撃の実証実験を踏まえ、画像認識モデルの頑健性をリリース前に検証するセキュリティテストが実施されています。走行中の誤認識は人命に関わるため、開発段階で敵対的サンプルを模した攻撃を想定した検証が欠かせません。

顔認証・入退室管理のシステムでも、敵対的な攻撃への備えが進んでいます。認証システムを誤認識させる敵対的パターンのリスクを想定し、なりすまし耐性を検証する評価プロセスが組み込まれています。オフィスや空港などセキュリティレベルの高い場所ほど、こうした検証の重要性は増します。

金融・不正検知の分野では、不正取引検知モデルが敵対的サンプルによって正常取引と誤判定されるリスクに備え、敵対的学習を取り入れてモデルの頑健性を高める取り組みが行われています。不正検知モデルが機能不全に陥れば金銭的な被害に直結するため、モデルの防御力を高める投資は実務上の優先課題として扱われます。

5. 要点まとめ

  • 敵対的な攻撃とは、AIモデルの入力に人間が気づきにくい微小な摂動を加え、意図的に誤分類させる攻撃の総称です。パンダをテナガザルと誤認識させた例や、標識へのステッカーで自動運転AIを誤認識させた例が代表的です。
  • 攻撃は、学習済みモデルへの入力操作による回避攻撃と、学習データを汚染するデータ汚染攻撃(ポイズニング攻撃)に分かれ、攻撃者の情報量によってホワイトボックス攻撃とブラックボックス攻撃にも区分されます。
  • 対策の敵対的学習は、敵対的サンプルを訓練に組み込んでモデルの頑健性を高める手法ですが、学習コストの増加というトレードオフを伴います。

6. 確認問題

問1敵対的な攻撃は、人間の目にはほとんど分からない程度の微小なノイズをAIモデルの入力に加えることで、誤った分類をさせる手法である。

解答・解説をみる

○ 正しい

敵対的な攻撃(Adversarial Attacks)の基本的な定義に合致します。パンダの画像にノイズを加えテナガザルと誤認識させた事例が代表例として知られています。

問2敵対的な攻撃はすべて学習データそのものを改ざんする攻撃であり、学習済みモデルへの入力を操作する攻撃は含まれない。

解答・解説をみる

× 誤り

正しくは、学習データを汚染するデータ汚染攻撃(ポイズニング攻撃)と、学習済みモデルへの入力時に摂動を加える回避攻撃の2種類に分かれます。敵対的サンプルは回避攻撃に該当し、入力操作による攻撃も含まれます。

問3敵対的学習(Adversarial Training)は、敵対的サンプルを訓練データに加えて再学習することでモデルの頑健性を高める対策手法である。

解答・解説をみる

○ 正しい

敵対的学習は代表的な防御手法です。通常データと敵対的サンプルの両方で学習することでモデルの判断境界を安定させますが、学習時間が増加するというトレードオフがあります。