偽陰性 (G検定)

偽陰性

1. 定義と概要

偽陰性とは、実際には陽性であるデータに対して、モデルが誤って陰性と予測した場合です。

分類モデル(入力されたデータを「陽性」「陰性」のようないくつかのカテゴリーに振り分ける機械学習の仕組み)の予測結果は、混同行列(予測結果と実際の結果を4つの箱に分けて数える表)に整理できます。混同行列は、正しく当てられた真陽性・真陰性と、外れた偽陽性・偽陰性の4マスで構成されます。それぞれの位置づけは次のとおりです。

用語 実際 予測 判定
真陽性(TP) 陽性 陽性 正しい
偽陽性(FP) 陰性 陽性 誤り(誤検知)
偽陰性(FN) 陽性 陰性 誤り(見逃し)
真陰性(TN) 陰性 陰性 正しい

表の1行目にあたる真陽性は、実際も予測も陽性で一致した、正しく検出できたケースです。偽陰性とは逆に、判定が的中している点が異なります。

偽陰性は、実際が陽性でありながら予測を陰性としてしまう、表の3行目にあたる誤りです。がん検診で実際にがんがある人を「がんではない」と判定してしまうケースや、迷惑メールフィルタで実際は迷惑メールであるメールを「迷惑メールではない」と通過させてしまうケースが、その典型例です。

的中した2パターンと外れた2パターンのうち、偽陰性は本来検出すべきものを見逃す誤りにあたります。統計的仮説検定(集めたデータをもとに、立てた仮説が正しいかどうかを確率的な基準で判断する統計学の手法)の枠組みでは、第二種の過誤(本当は差があるのに「差がない」と見逃してしまう誤り)と同じ概念として扱われます。

2. 試験対策ポイント

混同行列の4マスの位置関係を読み解く力が要点になります。縦軸・横軸のどちらに予測を置き、どちらに実際の結果を置くかは資料によって配置が異なるため、予測は陽性か陰性か、実際は陽性か陰性かという組み合わせで判断する読み方を押さえておきたいところです。

また、偽陰性は第二種の過誤(β)に、偽陽性は第一種の過誤(α、本当は差がないのに「差がある」と判定してしまう誤り)に対応するという関係は取り違えやすい点です。統計的仮説検定の文脈で語られる第一種・第二種の過誤と、混同行列上の偽陽性・偽陰性が同一の概念であるという結びつけも整理しておきたいところです。

再現率(Recall、本当に陽性だったものをどれだけ正しく陽性と当てられたかの割合)は、TP/(TP+FN)という式で計算されます。分母に偽陰性が含まれるため、偽陰性を減らす取り組みは再現率を高めることに直結するという関係も重要な論点です。

偽陰性と偽陽性のどちらを重視するかは、場面によって使い分けが分かれます。病気の見逃しのように見逃しの代償が大きい場面では再現率が優先され、誤検知の代償が大きい場面では適合率(陽性と予測したものの中で、実際に陽性だった割合)が優先されるという判断軸が分かれ目になります。

3. 関連概念との比較・相違点

偽陽性との最大の違いは、誤りの向きです。偽陽性は実際は陰性であるにもかかわらず陽性と予測してしまう誤りで第一種の過誤に対応し、偽陰性は実際は陽性であるにもかかわらず陰性と予測してしまう誤りで第二種の過誤に対応します。両者は対義の関係にあり、対応表として並べて理解しておきたいところです。

真陰性との違いは、同じ陰性と予測した結果でも実際がどちらだったかという点にあります。予測が陰性で実際も陰性であれば真陰性という正しい判定になり、予測が陰性で実際は陽性であれば偽陰性という誤った判定になります。同じ「陰性と予測した」結果でも、実際の値によって正誤が分かれる点が読み分けの起点です。

再現率との関係は、計算式の分母に表れます。再現率はTP/(TP+FN)で求められるため、偽陰性が多いほど再現率は下がるという計算上の関係にあります。分子の真陽性が同じ件数でも、見逃しの件数が増えれば分母だけが大きくなり、その分だけ割合が小さくなるという仕組みです。逆に、見逃しを1件減らせばその1件は真陽性側に移るため、分子が増えて分母は変わらず、再現率は上がります。

4. ビジネス・実務での活用シナリオ

医療分野のがん検診では、実際にがんがある人を陰性と判定する偽陰性は治療の機会を逃すため代償が大きく、多少の偽陽性(過剰な精密検査)を許容してでも偽陰性を減らす、つまり再現率を優先する設計が取られます。

製造業の外観検査では、不良品を良品と誤判定する偽陰性は出荷後のクレームや事故につながります。そのため検査基準を厳しくして偽陰性を抑える運用が取られます。基準を厳しくすれば良品を不良と判定する偽陽性が増えますが、再検査の工程を挟めば取り戻せる損失にとどまるため、両者の重みは対等ではありません。

迷惑メールフィルタでは、重要なメールを迷惑メール扱いする偽陽性を避けたい場面で、逆に適合率を優先し偽陰性、つまり迷惑メールの見逃しをある程度許容する設計になります。偽陰性を厳しく抑える医療分野とは対照的な判断軸として比較されます。

5. 要点まとめ

  • 偽陰性は混同行列の1マスで、実際は陽性のデータをモデルが誤って陰性と予測する誤りです。
  • 偽陰性は第二種の過誤に対応し、偽陽性・第一種の過誤と対になる関係です。
  • 再現率の計算式(TP/(TP+FN))の分母に偽陰性が入るため、偽陰性を減らす取り組みは再現率の向上に直結します。

6. 確認問題

問1偽陰性とは、実際には陽性であるデータをモデルが誤って陰性と予測してしまう誤りである。

解答・解説をみる

○ 正しい

混同行列上、実際が陽性で予測が陰性の組み合わせが偽陰性にあたります。実際が陰性で予測が陽性の組み合わせは偽陽性であり、両者は対応関係が逆になっています。

問2偽陰性は第一種の過誤に分類される。

解答・解説をみる

× 誤り

偽陰性が対応するのは第二種の過誤です。第一種の過誤に対応するのは偽陽性であり、対応関係を逆にした記述は混同しやすい典型的な誤りです。

問3再現率(Recall)は、偽陰性(FN)の件数が増えるほど低下する。

解答・解説をみる

○ 正しい

再現率はTP/(TP+FN)で計算され、分母に偽陰性が含まれるため、偽陰性が増えるほど再現率は低下します。