1. 定義と概要
交差エントロピー誤差関数とは、分類問題においてモデルが予測した確率分布(起こりうる結果それぞれに、足すと1になるように割り振った確率の一覧)と正解の確率分布とのズレを数値化する指標です。この指標は損失関数(モデルの予測のズレを数値化し、学習の際に小さくすることを目指す関数)の一種で、クロスエントロピー誤差とも呼ばれます。
式の形は、扱う分類の種類によって2通りに分かれます。二値分類(2つのクラスのどちらに当てはまるかを判定する問題)ではL=-[y log p+(1-y)log(1-p)](yは正解ラベルの0または1、pはモデルが出力した正解が1である予測確率)という式で表されます。
多クラス分類(3つ以上のクラスのどれに当てはまるかを判定する問題)では、正解クラスをone-hotベクトル(正解のクラスだけを1、それ以外を0にして表現したベクトル)で表します。この表現を使うとL=-Σ t_k log y_k(t_kはk番目のクラスが正解なら1・それ以外は0、y_kはモデルがk番目のクラスと予測した確率)という式になります。多クラス分類の式は、one-hot表現によって正解クラス以外の項が消えるため、正解クラスの予測確率にだけ着目した式に帰着します。
対数(log)とは、ある数を底の何乗にすると元の数になるかを表す計算のことです。多クラス分類の式は、正解クラスに対してモデルが出した予測確率にこの対数をとり、符号を反転させた値と実質的に同じになります。対数は0に近い値ほど絶対値が大きな負の値をとり、1に近づくほど0に近づくという性質を持ちます。
交差エントロピー誤差はこの対数の符号を反転させることで、正解クラスへの予測確率が1に近いほど誤差が0に近づき、0に近いほど誤差が急激に大きくなる(理論上は無限大に発散する)という非対称な誤差の測り方を実現しています。
例えば犬・猫・鳥の3クラス分類で正解が犬のとき、モデルが犬である確率を0.9と予測すれば誤差は-log(0.9)≈0.105と小さく、0.1としか予測できなければ誤差は-log(0.1)≈2.303と大きくなります。この「確信を持って外したときに誤差が急激に大きくなる」設計により、分類問題の学習で標準的に用いられる損失関数として位置づけられています。
2. 試験対策ポイント
G検定の試験対策として重要な論点は、正解クラスに対するモデルの予測確率の対数をとり、符号を反転させる(マイナスをつける)という定義の手順です。予測確率が1に近づくほど誤差は0に近づき、0に近づくほど誤差は急激に大きくなるという非対称性は、まず押さえておきたいポイントです。
この性質は、モデルが確信を持って外した予測に対して誤差が急激に大きくなる関係にもつながります。正解が犬の画像に対してモデルが「猫である確率0.95・犬である確率0.05」のように自信を持って誤った予測をした場合、-log(0.05)≈3.0という大きな誤差が生じ、モデルへの修正圧力が強くかかる関係にあります。
分類問題では、扱うクラスの数によって使う式と出力層の活性化関数の組み合わせが決まります。二値分類ではシグモイド関数(入力を0から1の間の1つの値に変換する関数)の出力と、多クラス分類ではソフトマックス関数(複数の値を合計が1になる確率分布に変換する関数)の出力と組み合わせて誤差を計算するのが標準的な構成です。この対応関係を整理すると次のようになります。
| 分類の種類 | 出力層の活性化関数 | 誤差の式 |
|---|---|---|
| 二値分類 | シグモイド関数 | L=-[y log p+(1-y)log(1-p)] |
| 多クラス分類 | ソフトマックス関数 | L=-Σ t_k log y_k(one-hotベクトルによる表現) |
多クラス分類の式は正解クラス以外の項がt_k=0のため消え、正解クラスの予測確率にのみ着目した式に帰着する関係にあります。この帰着によって、多クラス分類の誤差はモデルが正解クラスにどれだけ高い確率を割り当てられたかだけで決まる形になります。
回帰問題で標準的に使われるMSE(平均二乗誤差)を分類問題にそのまま適用すると、学習が遅くなるという論点も試験対策の対象です。交差エントロピー誤差はシグモイド関数・ソフトマックス関数と組み合わせたとき、勾配(損失関数の値をどの方向にどれだけ動かせば小さくできるかを示す傾きの大きさ)が「予測確率と正解の差」というシンプルな形になります。
この形になることで、大きく外しているときほど大きな修正がかかる関係にあります。この勾配をもとに、勾配降下法(損失関数の値を少しずつ小さくするようにモデルのパラメータ(モデル内部の調整可能な数値)を調整していく最適化の手法)でモデルの重みが更新されます。
3. 関連概念との比較・相違点
MSE(平均二乗誤差)との最大の違いは、回帰向けか分類向けかという役割の違いにあります。MSEは数値の当てはまりを測る回帰問題向けの指標・損失関数であるのに対し、交差エントロピー誤差は確率分布どうしのズレを測る分類問題向けの損失関数です。
分類問題にMSEをそのまま損失関数として使うと、シグモイド関数・ソフトマックス関数の出力と組み合わせた際に、大きく外している場面で勾配がほぼゼロに近づき、学習が停滞しやすいという弱点があります。これに対し交差エントロピー誤差の勾配は「予測確率と正解の差」というシンプルな形になり、外れが大きいときほど修正量も大きくなる関係にあります。この勾配の性質の違いから、分類問題では交差エントロピー誤差の方が学習が速く進みやすいと位置づけられています。
ここまでの違いを軸ごとに並べると、両者の役割分担がはっきりします。
| 比較の軸 | MSE(平均二乗誤差) | 交差エントロピー誤差 |
|---|---|---|
| 想定する問題 | 回帰問題 | 分類問題 |
| 測っているもの | 数値の当てはまり | 確率分布どうしのズレ |
| 大きく外したときの勾配 | ほぼゼロに近づき学習が停滞しやすい | 予測確率と正解の差として大きく残る |
扱う問題が回帰か分類かによってどちらの損失関数を選ぶかが変わる、という基本的な役割分担がこの比較の軸になっています。
4. ビジネス・実務での活用シナリオ
画像認識・EC分野では、商品画像を複数カテゴリに振り分ける多クラス分類を行うモデルの学習に交差エントロピー誤差が使われます。ソフトマックス関数の出力と組み合わせて重みを調整し、誤分類が多いカテゴリの精度改善を優先的に進める運用が一般的です。
迷惑メール・不正検知の分野では、メールが迷惑メールかどうかを判定する二値分類を行うモデルに、シグモイド関数の出力と交差エントロピー誤差の二値分類の式が使われます。自信を持って見逃した迷惑メールに大きな誤差を与えることで、モデルの改善を促す仕組みになっています。
医療画像診断支援の分野では、疾患の有無を判定する二値分類を行うモデルの学習に交差エントロピー誤差が用いられます。確信を持って誤診した症例ほど大きな誤差として扱われるため、危険な誤判定を減らす方向にモデルが調整される関係にあります。
5. 要点まとめ
- 交差エントロピー誤差関数は、正解クラスに対する予測確率の対数をとり符号を反転させた、分類問題向けの損失関数です。予測確率が1に近いほど誤差は0に近づき、0に近いほど誤差は急激に大きくなります。
- 二値分類の式L=-[y log p+(1-y)log(1-p)]と、one-hotベクトルを使う多クラス分類の式L=-Σ t_k log y_kの2つの形があり、それぞれシグモイド関数・ソフトマックス関数の出力と組み合わせて使われます。
- 回帰向けのMSEを分類問題にそのまま使うと大きな誤りに対して勾配が縮小し学習が停滞しやすいのに対し、交差エントロピー誤差は外れが大きいほど修正量も大きくなるため、分類問題では学習が速く進みやすいという役割の違いがあります。
6. 確認問題
問1交差エントロピー誤差は、正解クラスに対するモデルの予測確率の対数をとり、その符号を反転させることで計算される。
解答・解説をみる
○ 正しい
定義そのものです。予測確率が1に近いほど誤差は0に近づき、0に近いほど誤差は急激に大きくなります。
問2交差エントロピー誤差は、モデルが誤った予測に自信を持っているほど、誤差の値は小さく計算される。
解答・解説をみる
× 誤り
正しくは逆です。自信を持って誤った予測ほど正解クラスへの予測確率が0に近づき、対数の性質により誤差は急激に大きくなります。確信度と誤差の大小関係を取り違えた記述です。
問3多クラス分類ではソフトマックス関数の出力、二値分類ではシグモイド関数の出力と組み合わせて交差エントロピー誤差を計算するのが標準的な構成である。
解答・解説をみる
○ 正しい
分類問題の出力層の活性化関数として、多クラス分類ではソフトマックス関数、二値分類ではシグモイド関数の出力を受け取り、交差エントロピー誤差でズレを数値化する組み合わせが標準的に使われます。

