偽陽性 (G検定)

偽陽性

1. 定義と概要

偽陽性(False Positive, FP)とは、分類問題において実際には陰性(Negative)であるデータを、モデルが誤って陽性(Positive)と予測したケースです。

予測結果と実際の正解を4つの組み合わせに整理した表を混同行列と呼び、偽陽性はそれを構成する4象限の1つにあたります。

用語 実際 予測 内容
真陽性(TP) 陽性 陽性 正しく陽性と予測できた
偽陽性(FP) 陰性 陽性 誤って陽性と予測した
偽陰性(FN) 陽性 陰性 誤って陰性と予測した
真陰性(TN) 陰性 陰性 正しく陰性と予測できた

たとえば、迷惑メールでない普通のメールを、フィルタが誤って迷惑メールと判定するケースが偽陽性の具体例です。この誤り方は、統計学の仮説検定における第一種の過誤(本来正しい仮説を誤って否定してしまう、統計学の判定ミスの呼び方)に対応します。

分類モデルの性能評価は、単純な正解率(Accuracy、全体の予測のうち、正しく当てられた割合を示す指標)だけでは判断を誤る場面があります。たとえば陽性データが極端に少ない不均衡なデータでは、すべてを陰性と予測しても正解率が高くなってしまうことがあるためです。

そこで、予測と実際の正解の組み合わせを4つに分解する混同行列が使われ、そのうち実際は陰性なのに誤って陽性と予測したケースが偽陽性と呼ばれます。偽陽性を減らすか、偽陰性という見逃しを減らすかは、ビジネス上のトレードオフです。適合率(陽性と予測したもののうち、実際に陽性だった割合を示す指標)・再現率(実際に陽性のもののうち、正しく陽性と予測できた割合を示す指標)という指標で評価されます。

2. 試験対策ポイント

理解するうえで中心になるのは、混同行列の4象限、真陽性(TP)・真陰性(TN)・偽陽性(FP)・偽陰性(FN)のうち、偽陽性がどの位置関係に当たるかという整理です。偽陽性は「実際は陰性なのにモデルが陽性と予測した」象限であり、逆に「実際は陽性なのにモデルが陰性と予測した」象限は偽陰性に当たります。

加えて、偽陽性は統計的仮説検定の第一種の過誤に対応し、偽陰性は第二種の過誤(本来誤っている仮説を見逃してしまう、統計学の判定ミスの呼び方)に対応するという関係にあります。この対応は方向が逆になりやすく、取り違えやすい点です。

評価指標との関係も重要な論点です。偽陽性が計算式のどこに入るかによって、指標ごとに受ける影響が変わります。

指標 計算式 偽陽性が増えると
適合率(Precision) TP÷(TP+FP) 分母が大きくなり下がる
再現率(Recall) TP÷(TP+FN) 式に含まれず変わらない
正解率(Accuracy) (TP+TN)÷(TP+TN+FP+FN) 分母だけが大きくなり下がる

適合率は偽陽性が増えるほど値が下がる指標であるのに対し、再現率の計算式に偽陽性は登場せず、偽陰性との関係が強い指標です。偽陽性と偽陰性のどちらが各指標の計算式に関わるかは、混同しやすい組み合わせです。適合率と再現率のバランスをとったF値(適合率と再現率のバランスをとった1つの指標)についても、計算式の分母・分子にTP・FP・FNのどれが入るかという理解が要点になります。

3. 関連概念との比較・相違点

偽陰性との最大の違いは、誤りの向きです。偽陽性は実際は陰性であるデータを陽性と誤判定するケースであるのに対し、偽陰性は実際は陽性であるデータを陰性と誤判定するケースを指します。同じ「予測を外す」誤りでも、どちら向きに外れているかがまったく逆になる点が、両者を区別する軸です。

第一種の過誤・第二種の過誤との最大の違いは、統計的仮説検定の用語と混同行列の用語という、由来する分野の違いです。両者は対応関係にあり、偽陽性は第一種の過誤に、偽陰性は第二種の過誤にそれぞれ対応します。

帰無仮説(統計的検定で「差がない」「効果がない」と仮に置く比較の基準となる仮説)を誤って棄却してしまう誤りが第一種の過誤であり、この構造が偽陽性と重なります。

適合率との最大の違いは、偽陽性が個々の予測結果を指す概念であるのに対し、適合率は予測全体の傾向を示す指標である点です。適合率の分母(TP+FP)には偽陽性が含まれており、偽陽性が多いほど適合率は下がるという計算式上のつながりがあります。

4. ビジネス・実務での活用シナリオ

迷惑メールフィルタでは、正常なメールを迷惑メール(陽性)と誤判定する偽陽性が起きると、重要な連絡を受信者が見逃す実害につながります。取引先からの重要なメールが迷惑メールフォルダに振り分けられ、気づかれないまま放置される事態は、業務上の損失に直結します。

医療検査では、健康な人を陽性と誤診断する偽陽性が起きると、不要な精密検査の実施や患者の心理的負担が生じます。本来は必要のない追加検査によって医療コストが増え、検査結果を待つ間の不安が患者にのしかかる点が、偽陽性の実害です。

クレジットカードの不正検知では、正常な取引を不正と誤判定する偽陽性が多いと、決済の誤ブロックが増えユーザー体験が悪化します。海外出張中に正規の買い物がことごとく止められるような状況は、顧客の離反を招く要因になります。

5. 要点まとめ

  • 偽陽性(FP)は混同行列の1マスで、実際は陰性であるデータをモデルが誤って陽性と予測したケースを指します。
  • 偽陽性は統計的仮説検定の第一種の過誤に対応し、偽陰性は第二種の過誤に対応します。誤りの向きが逆になる点が分かれ目です。
  • 偽陽性が多いと適合率(Precision)は下がります。偽陽性・偽陰性のどちらを重視するかで適合率・再現率の優先度が変わります。

6. 確認問題

問1偽陽性(False Positive)とは、実際には陰性であるデータを、モデルが誤って陽性と予測したケースを指す。

解答・解説をみる

○ 正しい

定義どおりの内容です。対して、実際には陽性であるデータをモデルが誤って陰性と予測するケースは偽陰性と呼ばれます。

問2偽陽性は、統計的仮説検定における第二種の過誤に対応する。

解答・解説をみる

× 誤り

偽陽性が対応するのは第一種の過誤です。第二種の過誤に対応するのは偽陰性であり、順序が逆になりやすい点です。

問3偽陽性の数が多くなるほど、適合率(Precision)の値は低くなる。

解答・解説をみる

○ 正しい

適合率はTP/(TP+FP)で計算されるため、偽陽性(FP)が増えると分母が大きくなり、適合率の値は下がります。