1. 定義と概要
混同行列とは、二値分類(答えを「陽性」か「陰性」かの2択に分ける分類問題)モデルの予測結果を、実際のクラスと予測したクラスの組み合わせで4つに分けて集計した表のことで、誤差行列とも呼ばれます。
実際の姿は、次のような2行2列の表です。
| 予測=陽性 | 予測=陰性 | |
|---|---|---|
| 実際=陽性 | 真陽性(TP) | 偽陰性(FN) |
| 実際=陰性 | 偽陽性(FP) | 真陰性(TN) |
4つのマス目が指す中身は次のとおりです。真陽性(TP)は実際に陽性のものを正しく陽性と判定した件数、真陰性(TN)は実際に陰性のものを正しく陰性と判定した件数です。偽陽性(FP)は本当は陰性なのに誤って陽性と判定してしまった件数、偽陰性(FN)は本当は陽性なのに誤って陰性と判定してしまった件数で、見逃しに当たります。
病気の検査(陽性=病気あり)を例にすると、TPは病気ありを正しく判定したケース、FPは健康なのに病気ありと誤判定したケース、FNは病気なのに見逃してしまうケースにそれぞれ当たります。
従来、分類モデルの性能は正解率(全データのうち正しく判定できた割合を示す指標)だけで語られる場面が多くありました。しかし、陽性データが極端に少ない不均衡データ(陽性と陰性の件数に極端な偏りがあるデータ。例えば病気の陽性率が1%しかないデータ)では、全件を陰性と予測するだけで正解率が99%になってしまい、実態を見誤らせます。
そこで、TP・TN・FP・FNの内訳を分けて可視化する混同行列が、正解率・適合率・再現率・F値といった各指標を導く評価の出発点として重視されるようになりました。
2. 試験対策ポイント
混同行列を理解するうえでの中心的な論点は、4つのマス目(TP・TN・FP・FN)の意味と、表の行が「実際のクラス」、列が「予測したクラス」に対応するという読み方です。
資料によっては行と列の向きが入れ替わって示される場合もあり、見出しがどちらの軸を指しているかを確認することも欠かせません。マス目の名称と件数の対応関係を取り違えると、後続の指標計算もすべてずれてしまうため、まず表の軸を正しく読み取ることが出発点になります。
混同行列のTP・TN・FP・FNからは、次の4つの評価指標がすべて導かれます。
| 指標 | 計算式 | 何を測るか |
|---|---|---|
| 正解率 | (TP+TN)÷全体 | 全体でどれだけ当たったか |
| 適合率 | TP÷(TP+FP) | 陽性と予測した中の的中率 |
| 再現率 | TP÷(TP+FN) | 本当の陽性を取りこぼさなかった割合 |
| F値 | 適合率と再現率の調和平均 | 両者のバランス |
F値の調和平均とは、単純な平均とは異なり、値が小さい方に強く引っ張られる平均の求め方のことです。適合率と再現率のどちらか一方が極端に低いと、F値全体も低くなる性質があります。
各指標の分子・分母をマス目と結びつけて説明できるかが、あわせて整理しておきたい関連用語の束になっています。とくに適合率と再現率は、分母が「陽性と予測した件数」か「実際に陽性だった件数」かで視点が分かれます。
さらに、偽陽性(FP)は統計学における第一種の過誤(本当は正しいことを誤って否定してしまう誤り)、偽陰性(FN)は第二種の過誤(本当は間違っていることを誤って見逃してしまう誤り)に対応するという用語の橋渡しも重要な論点です。両者はトレードオフの関係にあり、一方を減らそうとすると他方が増えやすい性質があります。
不均衡データでは正解率だけで評価を誤る典型パターンがあり、正解率が高くても偽陰性(見逃し)が多い場合がある点が、混同行列の内訳確認を前提とする理由になっています。判定基準(閾値。陽性と陰性を分ける境界となる値)を変えることで偽陽性と偽陰性の件数は変動するため、どちらを重視するかによって基準の設定方針も変わります。
3. 関連概念との比較・相違点
混同行列と正解率の最大の違いは、混同行列がTP・TN・FP・FNという4要素すべての内訳を示す表そのものであるのに対し、正解率はそこから導かれる単一の指標である点にあります。
正解率は不均衡データで見かけ上高くなる性質があり、正解率だけで判断せず混同行列の内訳を確認することが評価の前提になります。両者は「表」と「表から計算される数値」という関係にあり、正解率だけを見て混同行列を確認しないと、不均衡データでの誤判定を見落とす原因になります。
ROC曲線・AUCとの最大の違いは、集計する対象の広さにあります。混同行列は特定の判定基準(閾値)1点での集計結果を示すのに対し、ROC曲線(判定基準を変えたときの見分け精度の変化をグラフにしたもの)は閾値を変化させたときの推移を表します。
ここでの推移とは、真陽性率(実際の陽性のうち正しく陽性と判定できた割合で、再現率と同じ考え方)と偽陽性率(実際の陰性のうち誤って陽性と判定してしまった割合)の変化を指します。AUC(ROC曲線の下側の面積を数値化した、モデルの識別力を表す指標)は、その面積によってモデル全体の識別力を数値化します。
混同行列が1つの判定基準における結果の断面であるのに対し、ROC曲線とAUCは判定基準を動かしたときの全体的な傾向を評価する点で役割が異なります。
4. ビジネス・実務での活用シナリオ
医療診断の現場では、病気の検査AIの判定結果を混同行列で確認し、偽陰性(病気の見逃し)を減らす方向に判定基準を調整する取り組みが進んでいます。見逃しを減らすことは、検査の安全性を高めることに直結します。判定基準を偽陰性が減る方向に寄せると偽陽性が増え、健康な人に再検査の負担がかかる場合もあるため、混同行列の内訳を踏まえたバランス調整が求められます。
迷惑メール・不正検知の分野では、スパムフィルタや与信の不正検知において、偽陽性(正規メールや正常取引を誤ってブロックしてしまうこと)と偽陰性(不正の見逃し)のバランスを混同行列で把握します。業務影響の少ない判定基準を設計するうえで、この内訳の把握が判断材料になります。重要な取引や連絡を誤ってブロックする偽陽性が多いシステムは利用者の信頼を損ねるため、業務の性質に応じた基準設計が欠かせません。
製造業の外観検査では、AIによる不良品検知において、良品を不良と誤判定する偽陽性のコストと、不良品を見逃す偽陰性のコストを混同行列で比較します。検査ラインの判定基準は、この両者のコスト比較を踏まえて設計されます。不良品の見逃しが後工程や出荷後のトラブルに直結する製品では、多少の偽陽性を許容してでも偽陰性を抑える設計が選ばれる場合があります。
5. 要点まとめ
- 混同行列は分類モデルの予測結果を真陽性(TP)・真陰性(TN)・偽陽性(FP)・偽陰性(FN)の4マスに分けて集計した表で、正解率・適合率・再現率・F値はすべてこの4マスから計算されます。
- 偽陽性(FP)は第一種の過誤、偽陰性(FN)は第二種の過誤に対応し、両者はトレードオフの関係にあります。
- 不均衡データでは正解率だけでは評価を誤るため、混同行列の内訳確認がG検定・実務双方で評価の出発点になります。
6. 確認問題
問1混同行列における偽陽性(FP)とは、実際は陰性であるデータを誤って陽性と予測した件数を指す。
解答・解説をみる
○ 正しい
この記述はFPの定義そのものです。統計学における第一種の過誤に対応する概念として、あわせて整理しておきたい用語です。実際は陰性であるデータを陽性側に誤判定した件数を指す点で、真陽性(TP)とは区別されます。
問2正解率(Accuracy)は、陽性データの件数が極端に少ない不均衡データにおいても、モデルの性能を正しく評価できる指標である。
解答・解説をみる
× 誤り
不均衡データでは、全件を陰性と予測するだけで正解率が高くなってしまう典型的な誤りパターンがあります。正しくは、混同行列の内訳から適合率・再現率など複数の指標を併用して評価する必要があります。この誤りパターンは、陽性データの割合が極端に低い医療・不正検知の場面でとくに起こりやすい傾向があります。
問3偽陰性(FN)は統計学における第二種の過誤に対応し、実際は陽性であるデータを誤って陰性と判定した件数を表す。
解答・解説をみる
○ 正しい
FNと第二種の過誤の対応関係を示す記述です。病気の見逃しなどが典型例で、偽陽性(第一種の過誤)とはトレードオフの関係にあります。第一種と第二種、どちらの過誤に対応するかは取り違えやすい典型です。

