1. 定義と概要
情報量(自己情報量、選択情報量とも呼ばれます)とは、ある事象が起こったと知ることで得られる情報の多さを、その事象が起こる確率(生起確率)をもとに数値化したものです。事象xの自己情報量はI(x) = -log2 P(x)という式で表されます。P(x)は事象xが起こる確率、logは対数(ある数を底の何乗にすると元の数になるかを表す計算)のことで、ここでは底を2にとっています。
式が示すとおり、確率が低い、つまり起こりにくい事象ほど値は大きくなる仕組みです。身近な事象で確かめると、確率と自己情報量の対応は次のようになります。
| 事象 | 生起確率P(x) | 自己情報量I(x) |
|---|---|---|
| サイコロで1の目が出る | 1/6 | 約2.585ビット |
| コインで表が出る | 1/2 | 1ビット |
| 必ず起こる事象 | 1 | 0 |
サイコロの値はI(x) = -log2(1/6)、コインの値はI(x) = -log2(1/2)を計算したものです。単位のビットは情報量を測る単位で、0か1で表せる情報1つ分に相当します。起こることが確実な確率1の事象は、知らされても新たに得られるものがないため0になります。
従来、情報の伝わりやすさや価値を客観的に測る統一的な尺度はありませんでした。クロード・シャノン(情報理論を確立した数学者・工学者)は1948年の論文で、事象の生起確率をもとに情報の量を数値化する枠組みである情報理論(情報を数量として扱い、伝達や圧縮の仕組みを研究する学問分野)を確立しました。
自己情報量はこの情報理論における最も基礎的な量にあたり、事象1回分の情報の多さを表す指標として位置づけられます。これをすべての事象について確率分布(どの結果がどれくらいの確率で起こるかをまとめたもの)全体で平均した値が、エントロピー(確率分布全体の不確実性を表す、自己情報量の平均値)と呼ばれる指標になります。
2. 試験対策ポイント
自己情報量の式に対数を使う理由としては、複数の独立した事象が同時に起こったときの情報量を足し算だけで求められる性質(加法性)と、確率が下がるほど値が単調に増える性質を同時に満たす点が挙げられます。確率のままでは事象が増えるほど掛け算が続いて扱いにくくなるため、対数をとることで計算がしやすくなるという事情です。
あわせて整理しておきたいのが、対数の底によって単位が変わる点です。底と単位の対応は次のとおりです。
| 対数の底 | 単位 |
|---|---|
| 2 | ビット |
| e(自然対数) | ナット |
| 10(常用対数) | ハートレー |
情報理論の学習では、底2・単位ビットを基本として扱うことが多いところです。式に出てくるlog2という表記も、底を2にとっていることを示しています。
自己情報量とエントロピーの違いは取り違えやすい論点です。自己情報量は事象1回分についての情報量を表すのに対し、エントロピーは確率分布全体にわたる自己情報量の期待値(起こりうる結果とその確率を掛けて足し合わせた平均的な見込み値)、つまり平均情報量を表します。ある事象1回のI(x)と、分布全体のH(X)を混同しない区別が大切です。
自己情報量の考え方は、ハフマン符号化(出現頻度に応じて文字に割り当てる符号の長さを変え、データを圧縮する技術)などのデータ圧縮技術の理論的な土台にもなっています。出現確率が高い、つまり自己情報量が小さい記号には短い符号を、出現確率が低い、つまり自己情報量が大きい記号には長い符号を割り当てることで、全体の符号長の期待値を最小化する仕組みです。
3. 関連概念との比較・相違点
エントロピーとの最大の違いは、個別の値か全体の平均かという点にあります。自己情報量は事象1回分の情報量I(x) = -log2 P(x)を表すのに対し、エントロピーH(X)は確率分布全体にわたる自己情報量の期待値、つまり平均情報量を表します。
例えばサイコロを1回振って1の目が出たときのI(x)は約2.585ビットという個別の値です。これに対し、6つの目それぞれのI(x)を出現確率で重みづけして平均した値がエントロピーH(X)にあたり、算出の起点が「1回分の実現値」か「起こりうる全体の平均」かという違いに対応します。
自己情報量が個別の値、エントロピーがその平均という関係にあり、この対応を入れ替えて覚えてしまうと本末が逆転してしまいます。
相互情報量との最大の違いは、測る対象が1つの事象か2つの物事の関わりかという点にあります。自己情報量は1つの事象単体が持つ情報の量を測るのに対し、相互情報量(2つの物事がどれだけ情報を共有しているかを表す指標)は、一方を知ることで他方の不確実性がどれだけ減るかを測る指標です。
この違いは、自己情報量が1つの物事を単独で見る視点であるのに対し、相互情報量は2つの物事の関係を見る視点である点に由来します。着目する対象が1つか2つかを手がかりにすると整理しやすい論点です。個別の事象を見るか、物事どうしの関係を見るかという視点の違いとして整理できます。
4. ビジネス・実務での活用シナリオ
IT・データ圧縮の分野では、ハフマン符号化などの圧縮技術で、出現確率の高い、つまり自己情報量の小さい文字に短い符号を、出現確率の低い、つまり自己情報量の大きい文字に長い符号を割り当てる設計が使われています。よく出てくる文字ほど短い符号で済ませることで、全体のデータ量を効率よく削減できる仕組みです。
情報セキュリティやシステム監視の現場では、通常のログでは起こりにくい、つまり生起確率が低く自己情報量が大きい事象をアラートの手がかりとして扱う考え方が使われます。普段はほとんど発生しないアクセスパターンや通信ほど情報量が大きいとみなし、想定外の挙動を検知する仕組みの土台になっています。
コンテンツ配信や推薦システムの領域では、利用者にとって意外性の高い、つまり予測しにくい情報ほど価値が高いという評価の発想に、自己情報量の考え方が応用されます。予測どおりの情報だけを届けるのではなく、確率の低い意外な情報を適度に織り交ぜる設計は、ニュース配信や推薦の精度を左右する要素になっています。
5. 要点まとめ
- 自己情報量(選択情報量)は、事象の生起確率をもとに情報の多さを数値化した指標で、I(x) = -log2 P(x)で求められ、確率が低い事象ほど値が大きくなります。
- 対数を使うのは複数事象の情報量を足し算で扱える性質(加法性)のためで、底2の単位はビットです。
- 自己情報量は事象1回分の情報量、エントロピーはその期待値(平均情報量)という関係にあり、両者を取り違えないことが大切です。
6. 確認問題
問1自己情報量は、事象の生起確率が低い(珍しい)ほど大きな値をとる。
解答・解説をみる
○ 正しい
自己情報量はI(x) = -log2 P(x)で定義され、確率P(x)が小さいほど値が大きくなります。珍しい事象ほど情報量が大きいという定義に対応します。
問2自己情報量の単位は、対数の底を2にとった場合、ビットと呼ばれる。
解答・解説をみる
○ 正しい
対数の底によって単位は変わり、底2の場合はビット、自然対数(底e)の場合はナット、常用対数(底10)の場合はハートレーと呼ばれます。情報理論では底2・単位ビットを基本として扱うことが多いところです。
問3エントロピーは事象1回分の自己情報量を指し、自己情報量は確率分布全体にわたる情報量の期待値(平均)を指す。
解答・解説をみる
× 誤り
正しくは逆の関係にあります。自己情報量が事象1回分の情報量I(x)を表し、エントロピーはその期待値である平均情報量H(X)を表します。両者の役割を入れ替えた記述は取り違えやすい典型です。

