真陰性 (G検定)

真陰性

1. 定義と概要

真陰性(TN: True Negative)とは、実際の値が「陰性(Negative)」であるものを、モデルが正しく「陰性」と予測した件数のことです。混同行列(実際の答えと予測結果の組み合わせを4つに分けて整理した表)を構成するTP・FP・FN・TNの4要素のうちの一つにあたります。

迷惑メール判定を例にすると、実際には迷惑メールでない普通のメールを、モデルが正しく「迷惑メールでない」と判定した件数が真陰性です。病気の診断であれば、健康な人を正しく「陰性」と判定した件数が真陰性にあたります。いずれも「何も起きていない」ことを正しく「起きていない」と言い当てた件数であり、目立ちにくい一方で件数としては最も多くなりやすい要素です。多くの実務データでは、そもそも陰性のケースが正例より多くを占めるため、真陰性の件数は他の3要素よりも膨らみやすい傾向にあります。

従来、分類モデルの性能は正解率(全体の予測のうち正しく当てられた割合)だけで語られる場面が少なくありませんでした。しかし、病気の陽性者が全体の1%しかいないような不均衡データ(陽性と陰性の件数に大きな偏りがあるデータ)では、正解率だけでは実態を見誤ります。すべてを陰性と予測し続けるだけでも正解率が高く出てしまうためです。

この「見かけの高精度」は、真陰性ばかりが積み上がることで生まれます。そこで、判定結果をTP・FP・FN・TNの4つに分解して評価する混同行列の考え方が必要になりました。真陰性はその分解された4要素の一角を占め、G検定でも2値分類の評価指標に関する問題は重要なテーマです。

2. 試験対策ポイント

まず整理したいのは、混同行列における真陰性の位置づけです。混同行列は「実際のクラス(陽性/陰性)」と「予測クラス(陽性/陰性)」を組み合わせた2×2の表で、真陰性はそのうち「実際は陰性・予測も陰性」の枠にあたります。

計算式に関する問題も重要な論点です。真陰性がどの指標の式に入り、どの指標には入らないかを並べると、対応関係がはっきりします。

指標 計算式 TNを含むか
正解率(Accuracy) (TP+TN)÷(TP+TN+FP+FN) 含む
特異度(Specificity) TN÷(TN+FP) 含む
適合率(Precision) TP÷(TP+FP) 含まない
再現率(Recall) TP÷(TP+FN) 含まない
F値 適合率と再現率の調和平均 含まない

真陰性は真陽性(実際に陽性のものを正しく陽性と判定できた件数)とともに正解率の分子、つまり正しく判定できた数を構成します。一方、適合率(陽性と予測したものの中で実際に陽性だった割合)や再現率(実際に陽性だったものの中で正しく陽性と判定できた割合)、F値(適合率と再現率のバランスを1つの数値にまとめた指標)の計算式には真陰性が登場しません。この違いは取り違えやすい典型で、TNを含むか含まないかが、指標を見分けるときの分かれ目になります。

特異度(実際に陰性だったものの中で正しく陰性と判定できた割合)も押さえておきたい指標です。特異度はTN/(TN+FP)で計算され、実際に陰性であるものをどれだけ正しく陰性と判定できたかを示します。実際に陽性であるものをどれだけ正しく陽性と判定できたかを示す再現率と対をなす関係にあります。

また、真陰性は第一種の過誤(本当は陰性なのに誤って陽性と判断してしまう誤り)や第二種の過誤(本当は陽性なのに誤って陰性と判断してしまう誤り、見逃しにあたる)とあわせて整理しておきたいところです。真陰性自体は誤りではなく、正しい陰性判定である点がポイントです。

3. 関連概念との比較・相違点

真陽性との最大の違いは、対象となる実際のクラスです。真陽性は実際に陽性であるものを正しく陽性と判定できた件数を指し、真陰性は実際に陰性であるものを正しく陰性と判定できた件数を指します。どちらもモデルの予測が的中した場合を表す点は共通していますが、対応するクラスが逆になる関係にあります。

偽陽性(実際は陰性なのに誤って陽性と判定してしまった件数)との最大の違いは、予測が的中したかどうかです。真陰性と偽陽性はどちらも実際は陰性のケースを扱いますが、真陰性は予測が的中した場合、偽陽性は誤って陽性と予測してしまった場合にあたります。

偽陰性(実際は陽性なのに誤って陰性と判定してしまった、見逃しにあたる件数)との最大の違いも、予測結果の正誤です。真陰性は正しい陰性判定である一方、偽陰性は誤った陰性判定を指し、両者は予測結果の正誤が逆になる関係にあります。真陽性・偽陽性・偽陰性のいずれと比べても、真陰性を分ける軸は「対象クラス」と「予測の的中・不的中」の2つに整理できます。

4. ビジネス・実務での活用シナリオ

医療のがん検診では、健康な受診者を正しく「異常なし」と判定できた件数が真陰性にあたります。真陰性が多いほど、不要な精密検査や再検査による受診者の身体的・金銭的負担を抑えられます。

迷惑メールフィルタでは、通常の業務メールを正しく「迷惑メールでない」と判定できた件数が真陰性です。真陰性が少ないと、重要な業務メールが誤って迷惑メール扱いされ、受信トレイに届かないリスクが高まります。日々やり取りされるメールの大半は迷惑メールではないため、この判定を安定して当て続けられるかどうかが、フィルタの使い勝手を大きく左右します。

与信審査や不正検知の分野では、問題のない正常な取引を正しく「不正でない」と判定できた件数が真陰性となります。真陰性が高いほど、正常な顧客への過剰な取引停止や確認連絡を避けられます。医療・メール・与信のいずれの事例でも、真陰性の多さは無用なコストや負担の軽減につながる点で共通しています。

5. 要点まとめ

  • 真陰性(TN)は、実際に陰性であるものを正しく陰性と予測できた件数で、混同行列を構成するTP・FP・FN・TNの4要素の一つです。
  • 正解率の計算式(TP+TN)/全体にはTNが含まれますが、適合率・再現率・F値の計算式にはTNは登場しません。
  • 特異度(TN/(TN+FP))は「陰性を正しく見抜く力」を示す指標で、「陽性を正しく見抜く力」を示す再現率と対の関係にあります。

6. 確認問題

問1真陰性(TN)とは、実際の値が陰性であるものを、モデルが正しく陰性と予測した件数のことである。

解答・解説をみる

○ 正しい

真陰性は混同行列の4要素の一つで、実際は陰性・予測も陰性という「正しい陰性判定」を表します。正解率の計算式にも含まれる要素です。

問2適合率(Precision)の計算式には、真陰性(TN)の値が含まれる。

解答・解説をみる

× 誤り

適合率はTP/(TP+FP)で計算され、TNは含まれません。正しくはTNが含まれるのは正解率(Accuracy)の計算式であり、これは取り違えやすい典型です。

問3特異度(Specificity)は、実際に陰性であるものを正しく陰性と判定できた割合を示す指標で、TN/(TN+FP)で計算される。

解答・解説をみる

○ 正しい

特異度は真陰性を用いた指標で、実際に陽性であるものを正しく陽性と判定できた割合を示す再現率と対をなす関係にあります。