1. 定義と概要
第一種の過誤(Type I error)とは、統計的仮説検定(データをもとに、立てた仮説が正しいかどうかを確率的に判断する統計的な手法)における過誤の一種です。本来は真実である帰無仮説(「差がない」「効果がない」と仮に立てておく、比較のベースとなる仮説)を、誤って棄却してしまうことを指します。
機械学習の二値分類における混同行列(予測と実際の正解を4パターンに分けて集計する表)では、実際は陰性(Negative)であるものを誤って陽性(Positive)と予測してしまう偽陽性(False Positive, FP)に対応します。
俗に「あわてんぼうの誤り」と呼ばれ、この過誤が起こる確率はα(アルファ)で表されます。αは仮説検定であらかじめ定める有意水準(帰無仮説を誤って棄却してしまう確率の上限としてあらかじめ決めておく基準値。例えば5%)と一致します。実際には効果のない新薬を「効果がある」と誤って判定してしまうケースが典型例です。
統計的仮説検定は、まず「差がない」「効果がない」とする帰無仮説を立て、得られたデータが偶然でどの程度起こりにくいかを確率的に評価する枠組みです。検定結果には一定確率で誤りが混じり、帰無仮説が真なのに棄却してしまう誤り(第一種の過誤)と、帰無仮説が偽なのに棄却できない誤り(第二種の過誤)の2種類に分類されます。
この仮説検定の考え方が機械学習の二値分類の評価に応用され、混同行列における偽陽性(FP)・偽陰性(FN。実際は陽性なのに誤って陰性と判定してしまうこと)という呼び方と対応づけられるようになりました。
2. 試験対策ポイント
まず整理しておきたいのは、第一種の過誤が起こる確率と有意水準の対応関係です。第一種の過誤は帰無仮説が真であるのに誤って棄却してしまう誤りで、確率はα(有意水準)で表されます。有意水準は通常5%や1%に設定され、その値がそのまま第一種の過誤の許容上限になるという対応関係が重要な論点です。
第一種の過誤と第二種の過誤は、俗称・確率記号・混同行列との対応をまとめて覚えておきたい組み合わせです。
| 観点 | 第一種の過誤 | 第二種の過誤 |
|---|---|---|
| 内容 | 真である帰無仮説を棄却してしまう | 偽である帰無仮説を棄却できない |
| 俗称 | あわてんぼうの誤り | ぼんやり者の誤り |
| 確率記号 | α(有意水準) | β |
| 混同行列での対応 | 偽陽性(FP) | 偽陰性(FN) |
| 結びつく評価指標 | 適合率 | 再現率 |
表の下2行、とくに混同行列との対応は取り違えやすい箇所です。偽陽性(FP)は第一種の過誤に、偽陰性(FN)は第二種の過誤に、それぞれ対応します。
第一種の過誤(α)と第二種の過誤(β)はトレードオフの関係にあります。有意水準αを厳しく(小さく)設定するほど検出力(本当に効果や差があるときに、それを正しく検出できる確率。1-βで表されます)が下がりやすい関係にあります。評価指標との結びつきも重要で、適合率(陽性と予測したものの中で実際に陽性だった割合)は偽陽性を減らすほど1に近づき、再現率(実際に陽性だったものの中で正しく陽性と予測できた割合)は偽陰性を減らすほど1に近づきます。第一種の過誤の抑制は適合率の向上と、第二種の過誤の抑制は再現率の向上と結びつきます。
3. 関連概念との比較・相違点
第二種の過誤との最大の違いは、誤りが向く方向にあります。第一種の過誤は「本当は起きていないことを誤って検知する誤り」で、あわてんぼうの誤りと呼ばれます。第二種の過誤は「本当は起きていることを見逃す誤り」で、ぼんやり者の誤りと呼ばれます。
両方の確率を同時にゼロへ近づけることはできず、一方を下げるともう一方が上がりやすいトレードオフの関係にあります。有意水準を厳しくして第一種の過誤を抑えようとすると、見逃しにあたる第二種の過誤が増えやすくなるため、一方だけを都合よく減らせる関係ではありません。
混同行列の偽陽性・偽陰性との最大の違いは、指す文脈にあります。第一種の過誤・第二種の過誤は統計的仮説検定の用語で、偽陽性・偽陰性は機械学習の分類結果を表す用語です。同じ現象を異なる文脈から指す対応関係にあり、第一種の過誤は偽陽性に、第二種の過誤は偽陰性に、それぞれ対応します。
「第一種の過誤は偽陰性に対応する」のように対応を入れ替えた記述は混同しやすく、統計用語と機械学習用語のどちらの立場から述べているかを見分ける視点が取り違えやすい点です。
4. ビジネス・実務での活用シナリオ
医療検診の現場では、健康な人を誤って「陽性」と判定してしまう第一種の過誤が起こり得ます。がん検診などでこの過誤が生じると、不要な精密検査につながり、患者は心理的な負担を抱えます。医療機関側にも、追加の医療費増加という負担が生じます。陽性と判定した人のうち実際に疾患がある人の割合、すなわち適合率が下がるほど、限られた検査資源が誤判定への対応に割かれる割合も大きくなります。
スパムメールフィルタでは、重要な取引先からのメールを誤って迷惑メールと判定してしまう第一種の過誤が起こり得ます。この過誤が生じると、本来届くべき連絡を受信者が見逃してしまい、ビジネス上の機会損失につながります。判定基準を厳しくするほどこの過誤は増えやすくなる一方、基準を緩めると本物の迷惑メールを見逃す第二種の過誤が増えやすくなり、判定基準の置き方は両者のバランスの上に成り立っています。
マーケティング施策のA/Bテストでは、実際には効果がない新施策を「効果あり」と誤って判定してしまう第一種の過誤が起こり得ます。この過誤が生じると、根拠のない施策に予算を投じ続けるリスクが生じます。複数の指標を同時に検証する場合、いずれか一つで第一種の過誤が生じる確率は単一の検定よりも高くなりやすく、一度の検証結果だけで施策の採否を決めない運用も広がっています。
5. 要点まとめ
- 第一種の過誤は帰無仮説が真であるのに誤って棄却してしまう過誤で、確率はα(有意水準)で表され、混同行列の偽陽性(FP)に対応します。
- 俗称「あわてんぼうの誤り」と呼ばれ、対になる第二種の過誤(ぼんやり者の誤り、偽陰性、確率β)とはトレードオフの関係にあります。
- 第一種の過誤を減らす取り組みは適合率の向上、第二種の過誤を減らす取り組みは再現率の向上と結びつきます。
6. 確認問題
問1第一種の過誤とは、帰無仮説が実際には真であるのに、それを誤って棄却してしまう過誤のことである。
解答・解説をみる
○ 正しい
第一種の過誤の定義そのものです。この過誤が起こる確率はα(有意水準)で表されます。
問2第一種の過誤は、混同行列における偽陰性(FN)に対応する。
解答・解説をみる
× 誤り
正しくは第一種の過誤は偽陽性(FP)に対応します。偽陰性(FN)に対応するのは第二種の過誤で、対応関係を取り違える記述は混同しやすい典型です。
問3第一種の過誤(確率α)と第二種の過誤(確率β)は、一方の確率を下げるともう一方の確率が上がりやすいトレードオフの関係にある。
解答・解説をみる
○ 正しい
有意水準αを厳しく設定するほど検出力(1-β)が下がりやすく、両者を同時に小さくすることは難しい関係にあります。

