情報利得 (G検定)

情報利得

1. 定義と概要

情報利得とは、ある特徴量(予測に使うデータの各項目。例えば年齢や年収など)でデータを分割したときに得られる「不純度の減少量」を表す指標です。決定木の中でデータのまとまりや分岐点を表す一つ一つの点をノードと呼び、情報利得は次の式で計算されます。情報利得=分割前ノードの不純度-分割後の子ノードの不純度の加重平均(各子ノードのサンプル数の割合で重み付けした平均)。

不純度とは、ノードの中にいろいろなクラスのデータがどれだけ混ざっているかを示す度合いのことです。代表的な指標は、エントロピー(不純度を数値化する代表的な指標の一つ)とジニ不純度(不純度を数値化するもう一つの代表的な指標)の2つで、それぞれ何を数値化しているかが異なります。

不純度の指標 数値化している内容
エントロピー データの散らばり具合
ジニ不純度 ランダムに選んだデータを誤って分類してしまう確率

いずれも具体的な計算式はここでは扱いません。どちらの指標を使う場合でも、分割によって不純度が大きく下がるほど情報利得は大きくなり、その分割はクラスをよく分けられた良い分割と評価されます。

決定木は、ある基準でデータを条件分岐によって繰り返し分割し、木構造の分類・予測モデルを作る機械学習アルゴリズムです。分割の候補は特徴量やしきい値の組み合わせで無数にあり、どの分割が良いかを数値で評価する必要があります。

その代表的な評価指標が情報利得です。決定木の学習では候補となる分割ごとに情報利得を計算し、最も大きい分割を選ぶという操作をノードごとに繰り返して木を成長させます。

2. 試験対策ポイント

情報利得の計算式(分割前ノードの不純度から分割後の子ノードの不純度の加重平均を引いた値)と、決定木の学習ではこの値が最大になる特徴量・しきい値の組み合わせが選ばれるという原理は、あわせて整理しておきたいところです。

ID3・C4.5・CART(決定木を作るための代表的なアルゴリズムの名称)が何を分割基準に採用するかという対応関係も重要な論点です。

アルゴリズム 分割基準 補足
ID3 エントロピーに基づく情報利得 多くの値をとる特徴量に分割が偏りやすい
C4.5 情報利得比(gain ratio) ID3の改良版で、上記の偏りを補正した指標
CART ジニ不純度の減少 誤分類の確率がどれだけ下がるかで分割を評価する

アルゴリズム名と指標名をセットで覚えておくと、選択肢で組み合わせが入れ替えられていても気づきやすくなります。

子ノードの不純度を単純平均ではなく加重平均で扱う理由も、あわせて重要な論点です。単純平均をとると、サンプル数の少ない子ノードの不純度が実態以上に結果へ影響し、少数サンプルに偏った分割が不当に高く評価されてしまいます。

また、情報利得が0に近い、あるいは0になる場合は、分割してもクラスの混ざり具合がほとんど変わらない、実質的に意味のない分割であるという解釈が試験で扱われます。

情報利得を使って木を深く成長させ続けると、過学習(訓練データに合わせすぎて、新しいデータへの対応力が落ちてしまう現象)が起こりやすくなります。この対策として、木の深さの制限や情報利得のしきい値設定、そして生成後の枝刈り(プルーニング。育ちすぎた決定木の一部を切り落として単純にし、過学習を防ぐ処理)といった手法を押さえておきたいところです。

3. 関連概念との比較・相違点

ジニ不純度に基づく分割基準との最大の違いは、採用する不純度の指標と、それに対応するアルゴリズムです。情報利得はエントロピーの減少量として説明されることが多く、ID3で使われます。C4.5はこれを発展させた情報利得比を使います。

一方でCARTは、ジニ不純度の減少、つまりランダムに選んだデータを誤分類する確率がどれだけ下がるかを基準に分割を選びます。どちらも分割前後の不純度の差という発想は共通していますが、指標そのものは別物です。

決定木との違いは、部分と全体の関係にあります。情報利得は、決定木が各ノードでどの分割を選ぶかを判断するための評価指標の一つに過ぎません。決定木は、その評価指標を使ってデータを繰り返し分割し、木構造のモデルを組み上げる学習アルゴリズム全体を指します。

そのため、情報利得を知っているだけでは決定木の全体像はつかめず、分割を繰り返して木を育てる仕組みとあわせて理解する必要があります。

4. ビジネス・実務での活用シナリオ

与信審査の分野では、年収や借入件数、返済履歴など複数の項目の中から情報利得が大きい項目を優先して分岐に採用し、返済遅延の可能性を予測する決定木モデルが使われます。分岐の根拠をノードごとにたどれるため、なぜその判断に至ったかを人が追いやすいという利点があります。

医療・臨床の意思決定支援でも、情報利得は活用されています。問診項目の中から情報利得が大きい症状の有無を優先して分岐させることで、少ない質問数で診断の絞り込み精度を高める支援ツールに応用されています。

マーケティングの顧客離脱予測では、顧客属性や利用履歴の中から解約と最も強く関連する項目、すなわち情報利得が大きい項目を特定します。この情報利得の大きさが、施策対象の絞り込みや特徴量選択の判断材料になります。

情報利得が大きい項目に絞り込むことで、離脱予測モデルに投入する特徴量を減らしながら予測精度を落とさずに済むという効果があります。

5. 要点まとめ

  • 情報利得は決定木の分割の良さを測る指標で、分割前ノードの不純度から分割後の子ノードの不純度の加重平均を引いた値として計算されます。
  • 決定木の学習は、候補となる分割の中から情報利得が最大になる特徴量・しきい値を選ぶ操作を繰り返すアルゴリズムで、ID3はエントロピー(情報利得)、C4.5は情報利得比、CARTはジニ不純度を分割基準として使います。
  • 子ノードの不純度は単純平均ではなくサンプル数の比率で重み付けした加重平均で計算するため、少数サンプルへの偏った分割が過大評価されない仕組みになっています。

6. 確認問題

問1情報利得は、分割前のノードの不純度から、分割後の子ノードの不純度の加重平均を引いた値として計算される。

解答・解説をみる

○ 正しい

情報利得の定義そのものです。分割前後の不純度の差が大きいほど、その分割は良い分割と評価されます。

問2決定木の学習では、候補となる分割の中から情報利得が最大になる特徴量・しきい値の組み合わせが選ばれる。

解答・解説をみる

○ 正しい

決定木はノードごとに分割候補の情報利得を比較し、最大となる分割を選んで木を成長させます。この選択操作をノードごとに繰り返すのが決定木の学習です。

問3情報利得の計算で子ノードの不純度を平均する際は、子ノードの数だけで単純平均され、各子ノードのサンプル数の違いは考慮されない。

解答・解説をみる

× 誤り

正しくは、子ノードのサンプル数の割合で重み付けした加重平均を使います。単純平均だと、サンプル数の少ない子ノードの不純度が実態以上に結果へ影響してしまいます。