1. 定義と概要
適合率(Precision)とは、分類モデル(データを「正例」か「負例」かに振り分けるAIモデル)が「正例(陽性)」と予測したデータのうち、実際に正例だったものの割合を示す指標です。式は 適合率 = TP ÷ (TP + FP) で表されます。
TP(真陽性、正しく「正例」と当てた件数)とFP(偽陽性、本当は違うのに誤って「正例」と判定してしまった件数)が式を構成し、この割合が高いほど、誤って正例と判定してしまうケースが少ないことを意味します。たとえば、迷惑メールフィルタが「迷惑メール」と判定したメール100件のうち90件が実際に迷惑メールだった場合、適合率は90%になります。
従来、分類モデルの性能は正解率(全データのうち正しく判定できた割合を示す指標)だけで測られることが多くありました。しかし正解率は、正例と負例の件数に偏りがある不均衡データ(正例と負例の件数に大きな偏りがあるデータ)では実態を見誤らせます。一例として、病気の人が1%しかいないデータで全員を「陰性」と予測しても、正解率は99%になってしまいます。
この場合、モデルは陽性と陰性を区別する判断を実質的に行っておらず、本来見つけるべき陽性者を一人も検出できていません。つまり、正解率が高くても、モデルが実際に役立っているとは限りません。そこで、モデルが「正」と判定したものの精度に着目する適合率と、実際の正例をどれだけ取りこぼさなかったかに着目する再現率(本物の正解データのうちどれだけ見つけられたかを示す指標)という、正例に焦点を当てた指標が重視されるようになりました。
2. 試験対策ポイント
まず整理しておきたいのは、適合率の計算式 TP÷(TP+FP) を混同行列(予測と実際の結果の組み合わせを4つに分けて集計した表)の4要素と結びつける視点です。真陽性(TP)・偽陽性(FP)に加え、偽陰性(FN、本当は正例なのに見逃してしまった件数)・真陰性(TN、正しく「負例」と判定した件数)を合わせた4要素の関係が要点になります。
適合率の分母は「予測が正例であるデータ全体」であり、「実際に正例であるデータ全体」(再現率の分母)との取り違いは、混同しやすいところです。この違いを正しく区別できるかどうかが、選択肢の正誤を分けるポイントになります。
適合率と再現率はトレードオフの関係にあります。判定の閾値(予測を「正」と判定するかどうかの境界となる基準値)を厳しくすると適合率は上がり再現率は下がりやすく、閾値を緩めると再現率は上がり適合率は下がりやすいという関係性が、両者を使い分けるうえでの軸になります。
そのため、どちらか一方だけを高めればよいわけではなく、目的に応じたバランスが求められます。誤検知(偽陽性)を避けたい場面では適合率、見逃し(偽陰性)を避けたい場面では再現率を重視するという使い分けも、事例をもとに整理しておきたいところです。
適合率と再現率のバランスを1つの数値にまとめた指標であるF値(適合率と再現率の調和平均)は、両者とセットで理解しておきたい指標です。加えて、偽陽性は統計学の第一種の過誤(本当は正しいことを誤って否定してしまう誤り)、偽陰性は第二種の過誤(本当は間違っていることを誤って見逃してしまう誤り)に対応するという、統計学用語との橋渡しも押さえておきたいポイントです。
3. 関連概念との比較・相違点
再現率との最大の違いは、分母の取り方にあります。観点ごとに並べると、両者の役割の違いがはっきりします。
| 観点 | 適合率 | 再現率 |
|---|---|---|
| 計算式 | TP÷(TP+FP) | TP÷(TP+FN) |
| 分母の意味 | 正例と予測した件数 | 実際に正例だった件数 |
| 測っているもの | 予測の的中率 | 取りこぼしの少なさ |
| 重視される場面 | 誤検知を避けたい場面 | 見逃しを避けたい場面 |
適合率は予測が正例のうち実際に正例だった割合を示すのに対し、再現率は実際に正例のうち予測で当てられた割合を示します。両者はトレードオフの関係にあり、一方を高めようとすると他方が下がりやすいという性質を持ちます。そのため、両者を単独ではなく組み合わせて評価する視点が重要になります。
正解率との最大の違いは、着目する範囲です。正解率は全データのうち正誤問わず当てた割合(TP+TN)÷全体で計算されるのに対し、適合率は正例と予測したものだけに着目します。不均衡データでは正解率が実態を見誤らせやすく、そうした場面では正解率だけでなく適合率や再現率をあわせて確認する必要があります。
4. ビジネス・実務での活用シナリオ
迷惑メールフィルタでは、「迷惑メール」と判定したメールのうち実際に迷惑メールだった割合、つまり適合率が低いと、重要な取引メールを誤って迷惑メール扱い(偽陽性)してしまい業務に支障が出ます。誤って重要なメールを迷惑メール扱いにするコストは、迷惑メールを見逃すコストよりも大きいと判断されるため、適合率を重視した閾値設計が行われます。
金融の不正検知では、「不正取引」と判定した取引のうち実際に不正だった割合が低いと、正常な取引を誤って止めてしまい顧客体験を損ないます。誤って取引を止めてしまうと顧客の信頼を損ない、正常なビジネスの継続を妨げるため、誤検知のコストが大きい場面では適合率が重視される傾向にあります。
医療診断支援では事情が異なります。がん検診のように見逃し(偽陰性)が命に関わる場面では、適合率よりも再現率、つまり見逃しを減らすことが優先されます。病気を見逃すことは治療の機会を失うことに直結するため、多少の誤検知が増えても再現率を優先する判断がなされます。適合率が重視される場面との対比は、実務での指標選びの軸になります。
5. 要点まとめ
- 適合率とは、モデルが正例と予測したもののうち実際に正例だった割合で、式はTP÷(TP+FP)で表されます。
- 適合率と再現率はトレードオフの関係にあり、誤検知(偽陽性)を避けたい場面では適合率、見逃し(偽陰性)を避けたい場面では再現率が重視されます。
- 正解率は不均衡データで実態を見誤らせやすく、適合率・再現率・F値といった正例に着目した指標が併用されます。
6. 確認問題
問1適合率とは、モデルが正例と予測したデータのうち、実際に正例だったものの割合を示す指標であり、式はTP÷(TP+FP)で表される。
解答・解説をみる
○ 正しい
適合率の定義そのものです。TPは真陽性(正しく正例と当てた件数)、FPは偽陽性(本当は負例なのに正例と誤判定した件数)を指します。
問2適合率の分母は「実際に正例であるデータの総数」であり、再現率の分母と同じ意味を持つ。
解答・解説をみる
× 誤り
正しくは、適合率の分母は「予測が正例であるデータの総数」(TP+FP)です。「実際に正例であるデータの総数」(TP+FN)は再現率の分母であり、両者の取り違いは取り違えやすい典型です。
問3誤検知(偽陽性)を避けたい場面では適合率が重視され、見逃し(偽陰性)を避けたい場面では再現率が重視される。
解答・解説をみる
○ 正しい
迷惑メールフィルタや不正検知のように誤検知のコストが大きい場面は適合率、がん検診のように見逃しのコストが大きい場面は再現率が重視されます。

