F値 (G検定)

F値

1. 定義と概要

F値(F1スコア、F-measure)とは、二値分類モデル(データを陽性・陰性の2つのクラスに分ける予測モデル)の評価指標のひとつで、適合率(Precision。陽性と予測したものの中で実際に陽性だった割合)と再現率(Recall。実際に陽性だったものの中で正しく陽性と予測できた割合)の調和平均によって算出される値です。

調和平均とは、逆数の平均をさらに逆数にした平均の求め方で、小さい値の影響を強く受けます。計算式は「F値=2×適合率×再現率÷(適合率+再現率)」で表され、0から1の範囲を取り、1に近いほど良いモデルとされます。たとえば適合率0.8、再現率0.6のモデルでは、F値は約0.69になります。

適合率と再現率のどちらか一方が0になると、分子の掛け算がゼロになるため、F値も0まで下がります。逆に両方が1であればF値も1になり、片方だけが高くても数値は伸びず、両方の指標が高い水準でそろって初めて1に近づく仕組みです。この性質があるため、F値の数値を見るだけで、適合率と再現率の両方が高い水準にあるかどうかをひと目で把握できます。

従来、機械学習モデルの性能は正解率(Accuracy。すべての予測のうち正しく当てられた割合)だけで評価する発想が一般的でした。しかし、データに偏り(陽性と陰性のデータ数に大きな差があるクラスの不均衡)があると、正解率は実態を正しく反映しないという課題があります。

そこで適合率と再現率という2つの指標が使われるようになりましたが、この2つはトレードオフの関係にあり、片方だけを見ると評価が偏ってしまいます。両者をバランスよく1つの数値に集約する指標として、F値が用いられています。適合率と再現率をそれぞれ別々に見比べる手間を省き、モデルどうしの優劣を1つの数値で判断できる点も、F値が広く使われる理由のひとつです。

2. 試験対策ポイント

まず押さえておきたいのは、F値の計算式が算術平均ではなく調和平均である点です。F値=2×適合率×再現率÷(適合率+再現率)という式は調和平均にあたり、算術平均とは異なり片方の指標が極端に低いと全体の値も低く出るという性質を持ちます。

この違いは、実際の数値を並べると分かりやすくなります。

適合率 再現率 算術平均 F値(調和平均)
0.7 0.7 0.70 0.70
0.8 0.6 0.70 0.69
1.0 0.1 0.55 0.18

3行目のように片方が極端に低い場合、算術平均では0.55と中程度に見えますが、F値は0.18まで下がります。この性質があるため、適合率だけ、あるいは再現率だけが高くても、他方が低ければF値は高評価になりません。極端に偏ったモデルを見かけ上高く評価してしまうリスクを抑えられる点が、調和平均が採用されている理由です。

適合率と再現率はトレードオフの関係にあり、F値はこのバランスを1つの数値で見るために使われるという位置づけがここでの要点です。あわせて、予測と実際の正解を4パターンに分けて集計する混同行列(TP・TN・FP・FNの4分類表)との対応関係も押さえておきたいポイントです。

適合率は偽陽性(実際は陰性なのに陽性と誤って判定してしまうこと)を減らすほど、再現率は偽陰性(実際は陽性なのに陰性と誤って判定してしまうこと)を減らすほど1に近づくという関係にあります。混同行列のどのマスがどちらの指標に関わるかを整理しておくと、問題文の読み違いを防げます。

実務での使い分けも整理しておきたいところです。がん検診では見逃し、つまり偽陰性を避けたいため再現率が重視され、スパムフィルタでは誤検出、つまり偽陽性を避けたいため適合率が重視されます。両者をバランスよく見たい場面でF値が使われるという対応関係は、取り違えやすい点です。

3. 関連概念との比較・相違点

正解率(Accuracy)との最大の違いは、クラスの不均衡データへの強さにあります。正解率は全予測に対する正答の割合で計算がシンプルですが、陽性と陰性のデータ数に大きな偏りがあるデータでは実態を反映しにくいという弱点があります。

F値は適合率・再現率のバランスを見るため、不均衡データでも性能を適切に評価できます。この違いは、正解率とF値のどちらが問題文の状況に合うかという点で混同しやすい組み合わせです。

適合率・再現率との最大の違いは、指標が単体か総合かという点にあります。適合率・再現率はそれぞれ個別の指標でトレードオフの関係にあるのに対し、F値はこの2つを調和平均で1つにまとめた総合指標です。適合率・再現率のどちらか一方の数値だけを根拠に「良いモデル」と判断すると誤りやすく、その誤りを防ぐ役割をF値が担っています。

4. ビジネス・実務での活用シナリオ

医療分野のがん検診AIでは、見逃し、つまり偽陰性を避けたいため再現率が優先されます。ただし再現率だけを追い求めると過剰な誤検出が増えやすく、そのバランスを確認する場面でF値が併用されます。見逃しと誤検出の両方を踏まえて性能を判断できる点が、F値をあわせて見る意義です。

スパムメールフィルタでは、重要なメールを誤ってスパム判定してしまう偽陽性を避けたいため適合率が優先されます。一方で、フィルタ全体としての総合的な性能を比較する場面では、F値が使われます。適合率だけでは見落とされる取りこぼしの多さも、F値なら反映できます。

需要予測や異常検知の分野では、正常データが大多数を占める不均衡データが扱われることが多く、正解率だけでは性能を見誤りやすくなります。こうした場面では、複数のモデルを比較する際の指標としてF値が使われます。少数派である異常データの検出精度を見落とさずに済む点が、正解率にはないF値の強みです。

5. 要点まとめ

  • F値は適合率と再現率の調和平均で、2×適合率×再現率÷(適合率+再現率)という式で算出されます。
  • 適合率と再現率はトレードオフの関係にあり、F値は両者をバランスよく評価するための指標として使われます。
  • 正解率が不均衡データに弱いのに対し、F値は偏ったデータでもモデルの性能を適切に比較できます。

6. 確認問題

問1F値は適合率と再現率の相加平均(算術平均)ではなく、調和平均によって算出される。

解答・解説をみる

○ 正しい

F値=2×適合率×再現率÷(適合率+再現率)という式は調和平均にあたり、算術平均と異なり片方の指標が極端に低いと全体の値も低く出る性質を持ちます。

問2適合率と再現率は常に同じ方向に変化するため、一方を高めればもう一方も自動的に高くなる。

解答・解説をみる

× 誤り

正しくは、適合率と再現率はトレードオフの関係にあり、一方を高めようとすると他方が下がりやすい関係です。この関係を1つの数値でバランスよく評価するためにF値が使われます。両者が常に同じ方向に動くという記述は誤りです。

問3F値は、正解率だけでは判断が難しいクラスが不均衡なデータにおいても、モデルの性能を比較する際に有用な指標である。

解答・解説をみる

○ 正しい

正解率は不均衡データでは実態を反映しにくいのに対し、F値は適合率・再現率のバランスを見るため、不均衡データでの精度評価に有用です。