1. 定義と概要
エントロピー(情報エントロピーやシャノンエントロピーとも呼ばれます)とは、確率分布(どの結果がどれくらいの確率で起こるかをまとめたもの)の不確実性(結果がどれになるか予測しにくい度合い)を数値化する指標です。クロード・シャノン(情報理論を確立した数学者・工学者)が1948年に確立した情報理論(情報を数量として扱い、伝達や圧縮の仕組みを研究する学問分野)における中心的な考え方のひとつです。
確率変数(とりうる値ごとに確率が対応づけられた変数)Xについて、H(X)= -Σp_i log2(p_i)(p_iは各事象の生起確率)で定義されます。対数(log。ある数を底の何乗にすると元の数になるかを表す計算)の底を2にとると、単位はビット(情報量を測る単位で、0か1で表せる情報1つ分に相当する)になります。
例えば、コインを1回投げて表裏が半々の確率(p=0.5、0.5)で出る場合はエントロピーが最大の1ビットとなり、必ず表が出るコイン(p=1、0)ではエントロピーは0になります。結果が読めないほど値が大きくなる指標だと捉えると、感覚がつかみやすくなります。
従来、情報の量を客観的に測る統一的な尺度は存在しませんでした。シャノンは1948年の論文『通信の数学的理論』で情報理論を確立し、通信で伝わる情報の不確実性を数値化する指標としてエントロピーを定式化しました。
この呼称は、統計力学における同名の概念と数式の形が一致することから、数学者フォン・ノイマン(20世紀を代表する数学者)の助言を受けて採用されたという逸話が伝えられていますが、史実かどうかについては諸説あります。
現在は情報理論の枠を超え、機械学習の分野でも、データを分ける基準やモデルの学習に使う計算式の設計など、幅広い場面で応用されています。
2. 試験対策ポイント
G検定における重要な論点のひとつが、エントロピーの最小値と最大値の条件です。分布の状態ごとに値の動きを並べると、次のとおりです。
| 分布の状態 | 不確実性 | エントロピーの値 |
|---|---|---|
| ある事象の確率が1で、残りが0 | 結果が確定しているためない | 最小値0 |
| すべての事象が等確率(一様分布) | 最も大きい | 最大値。2択なら1ビット |
確率が1つの結果に集中しているときは、結果が確定していて不確実性がないため、値は最小の0になります。反対に、すべての事象が等確率で起こる一様分布(起こりうるすべての結果が同じ確率で起こる状態)のとき、不確実性が最も大きくなり最大値をとります。2択の場合の最大値は1ビットで、この最小・最大の条件は取り違えやすい点です。
決定木(データを条件分岐で振り分けて分類・予測するモデル)の学習では、分割前後のエントロピーの減少量を表す情報利得(データを分割した前後でエントロピーがどれだけ減ったかを表す量)を使います。情報利得が最大になる特徴量(分類や予測の手がかりとなるデータ上の各項目)を選んで枝分かれさせます。ID3やC4.5といったアルゴリズムがこの考え方を採用しています。
CARTというアルゴリズムでは、エントロピーの代わりにジニ不純度(決定木のノードにどれだけ異なるクラスが混ざっているかを測るもう一つの指標)が使われますが、不純度や情報利得の計算手順そのものは別のテーマとして扱われます。
交差エントロピー(クロスエントロピー。正解の分布と予測の分布のズレを測る指標)は、分類問題の損失関数(モデルの予測がどれだけ間違っているかを数値化する関数)として使われます。エントロピーが1つの分布の不確実性を測るのに対し、交差エントロピーは2つの分布を比較する点が異なります。
また、情報エントロピーと熱力学的エントロピー(物理学で使われる、物質やエネルギーの乱雑さを表す概念)は数式の形が似ていますが、指し示す対象が異なる別概念です。前者は情報の不確実性、後者は物理的な乱雑さ・不可逆性を表し、両者は混同しやすい組み合わせです。
3. 関連概念との比較・相違点
エントロピーは、役割の似た指標や名前を共有する概念と並べて登場します。混同しやすい3つを並べると、次のとおりです。
| 指標 | 何を測るか | エントロピーとの違い |
|---|---|---|
| ジニ不純度 | 決定木のノードの混ざり具合 | 確率の2乗の和1-Σp_i^2で計算する。2値分類での最大値は0.5 |
| 交差エントロピー | 正解分布と予測分布のズレ | 1つではなく2つの分布を比べる。分類問題の損失関数として使われる |
| 熱力学的エントロピー | 物質やエネルギーの乱雑さ・不可逆性 | 数式の形は似ているが、指し示す対象が物理量である別概念 |
ジニ不純度との最大の違いは、不確実性の計算式にあります。どちらも決定木のノードの混ざり具合(不純度)を測る指標ですが、エントロピーは対数を使ったH(X)= -Σp_i log2(p_i)で、ジニ不純度は確率の2乗の和を使った1-Σp_i^2で計算されます。2値分類での最大値も、エントロピーは1、ジニ不純度は0.5と異なります。
交差エントロピーとの最大の違いは、測る対象が1つの分布か2つの分布かという点です。エントロピーは1つの確率分布自身の不確実性を測るのに対し、交差エントロピーは正解分布と予測分布という2つの分布のズレを測ります。分類問題の損失関数として使われるのは交差エントロピーの方です。
熱力学的エントロピーとの最大の違いは、指し示す対象そのものです。数式の形は類似していますが、情報エントロピーは確率分布の不確実性を表すのに対し、熱力学的エントロピーは物質やエネルギーの乱雑さや不可逆性を表す物理量です。名称は共通していても、両者は別の概念として扱われます。
4. ビジネス・実務での活用シナリオ
機械学習モデルの開発では、分類モデル(データをあらかじめ決めたクラスに振り分けるモデル)の学習で交差エントロピー損失を最小化するように重みを調整します。損失が下がるほど、モデルの予測が正解の分布に近づいたことを確認できるため、学習の進み具合を判断する指標として使われます。
情報セキュリティの分野では、ファイルやログのエントロピーを測定し、値が高いデータを検知の手がかりにします。暗号化や圧縮されたデータはエントロピーが高くなる傾向があり、通常とは異なる高いエントロピー値を示すファイルの出現は、ランサムウェアやマルウェアの兆候を見つける糸口になります。
マーケティング分析では、顧客の購買履歴から次の行動を予測する決定木モデルの分割基準にエントロピーが使われます。購買パターンが特定の傾向に偏っている顧客層かどうかを定量的に判別できるため、施策を打つべき層の絞り込みに役立ちます。
5. 要点まとめ
- エントロピーは確率分布の不確実性(乱雑さ)を数値化した指標で、H(X)= -Σp_i log2(p_i)で求められ、単位はビットです。
- 確率が1つの結果に集中しているとき最小値0を、すべての結果が等確率のとき最大値をとります。
- 決定木の分割基準に使われる情報利得や、分類問題の損失関数である交差エントロピーなど、エントロピーを応用した指標が複数存在します。
6. 確認問題
問1エントロピーは、確率分布が一様であるほど値が大きくなり、事象が偏っているほど値が小さくなる。
解答・解説をみる
○ 正しい
エントロピーはすべての事象が等確率のとき最大値をとり、特定の事象に確率が集中するほど値は0に近づきます。不確実性の大きさを表す指標という定義に対応する性質です。
問2エントロピーは、ある事象が起こる確率が1(残りの確率が0)のとき、最大値をとる。
解答・解説をみる
× 誤り
確率が1に集中している状態は結果が確定しており不確実性がないため、エントロピーは最小値0をとります。正しくは、すべての事象が等確率の一様分布のときに最大値をとります。条件と値を取り違えやすい論点です。
問3情報エントロピーと熱力学的エントロピーは数式の形が似ているが、指し示す対象は異なる別の概念である。
解答・解説をみる
○ 正しい
情報エントロピーと熱力学的エントロピーは、数式の形は似ているものの指し示す対象が異なります。前者は情報の不確実性、後者は物理的な乱雑さ・不可逆性を表す別概念であり、ここでの要点は両者を同一視しない区別です。名称が共通する背景には数式の類似性にまつわる逸話もありますが、史実かどうかは諸説あります。

