不純度 (G検定)

不純度

1. 定義と概要

不純度(Impurity)とは、決定木(質問を繰り返しながらデータを枝分かれさせて分類や予測を行うモデル)のノード(決定木の分岐点にあたる、データのまとまり)内に含まれるデータが、どれだけ複数のクラスに混ざっているかを表す指標です。ノード内のデータが単一クラスのみで構成される場合、不純度は最小の0になり、複数のクラスが混ざるほど値は大きくなります。

代表的な指標はジニ不純度とエントロピー(不純度を測るもう一つの代表的な指標)で、ジニ不純度は「ジニ不純度=1−Σp_i²」(p_iはノード内であるクラスiが占める割合)という式で計算されます。

決定木は、データを条件で繰り返し分割しながら木構造で分類や予測を行うモデルです。決定木には、データが属するクラスを予測する分類木(決定木のうち、データが属するクラスを予測する種類の木)と、数値を予測する回帰木(決定木のうち、数値を予測する種類の木)があり、不純度は主に分類木の分割基準として使われます。

分割を繰り返す中では、どの条件で分割するのが適切かを判断する基準が必要になります。そこで各分割候補について、特徴量(分類や予測の手がかりとなるデータの項目)ごとにノード内のクラスの混ざり具合、つまり不純度を計算します。そして、分割後の子ノードの不純度が最も小さくなる特徴量と閾値(データを分割する境目となる値)を選ぶという考え方に、不純度という指標が使われます。

CART(分類木・回帰木を作る代表的なアルゴリズムの略称)はジニ不純度を既定の分割基準として用います。ID3・C4.5(決定木を作る代表的なアルゴリズムの一種)などのアルゴリズムはエントロピーを用います。

2. 試験対策ポイント

まず押さえておきたいのは、ジニ不純度の計算式「1−Σp_i²」(p_iはノード内であるクラスiの割合)と、ノードが単一クラスのみのときに0になるという性質です。この式は、各クラスの割合を2乗して合計した値を1から引く計算で、複数のクラスが均等に混ざるノードほど値は大きくなります。

決定木の分割では、分割前後の不純度の差である情報利得(分割によって不純度がどれだけ減ったかを表す量)が最大になる特徴量と閾値を選びます。これは、分割後の子ノードの不純度の加重平均(各グループのデータ数に応じて重みをつけた平均)が最小になる条件を選ぶことと同じ関係にあります。

あわせて、CARTアルゴリズムはジニ不純度を分割基準の既定とし、ID3・C4.5などのアルゴリズムはエントロピーを用いるという、指標とアルゴリズムの対応関係も試験の論点です。

不純度はクラスを予測する分類木の分割基準であり、数値を予測する回帰木では分散(データのばらつきの大きさを表す指標)などの異なる指標が使われます。木の種類と分割の基準は次のように対応します。

木の種類 予測する対象 分割の基準
分類木 データが属するクラス 不純度(ジニ不純度・エントロピー)
回帰木 数値 分散などの異なる指標

この対応を押さえておくと、回帰木の分割にも不純度を使うと述べた記述が誤りだと判断できます。ジニ不純度・エントロピー・情報利得・分類木といった関連用語は、あわせて理解しておきたい語句です。

3. 関連概念との比較・相違点

エントロピーとの最大の違いは、同じ不純度の指標でありながら計算式が異なる点にあります。式と、それを既定の分割基準として用いる代表的なアルゴリズムは次のように対応します。

指標 計算式 既定の分割基準として用いる代表例
ジニ不純度 1−Σp_i² CART
エントロピー −Σp_i log2 p_i ID3・C4.5

どちらも値が小さいほどノードが純粋であることを示す点は共通しています。ただし、ジニ不純度のほうが計算が軽いため、実務やG検定でも既定の指標として扱われることが多くなっています。エントロピーの詳しい計算や情報理論的な意味づけは、別記事「エントロピー」で扱います。

情報利得は、不純度そのものではなく、分割によって不純度がどれだけ減少したかを表す量という関係にあります。決定木は情報利得が最大になる分割を選ぶため、不純度が「混ざり具合を測る指標」であるのに対し、情報利得は「その指標がどれだけ改善したかを表す量」という位置づけです。

この関係は、分割後の子ノードの不純度の加重平均が小さいほど情報利得が大きくなるという形で表れます。詳しい計算方法は別記事「情報利得」で扱います。

4. ビジネス・実務での活用シナリオ

金融の与信審査では、顧客属性を条件に分割していく決定木で貸し倒れリスクの高低を分類し、各分割でジニ不純度が下がる条件を優先して審査ルールを組み立てます。不純度が小さい分割を選ぶことで、リスクの高い顧客と低い顧客を明確に切り分けたルールが得られ、審査の判断根拠が明確になります。

マーケティングの顧客離脱予測では、利用頻度や契約年数などの条件で顧客を分割し、離脱の有無というクラスが揃うグループを作ることで、離脱しやすい顧客セグメントを特定します。不純度の低い分割を積み重ねることで、アプローチの優先順位付けに使えるセグメントが浮かび上がります。

医療・ヘルスケアの分野では、検査値や症状の有無を条件に患者を分割し、診断結果のクラスが揃うグループを作ることで、判断根拠が明確なルールベースの診断支援モデルを構築します。不純度の低いノードで構成された木は、どの条件が診断結果に効いているかを人が読み取りやすい形で示します。

5. 要点まとめ

  • 不純度は決定木のノード内でクラスがどれだけ混ざっているかを表す指標で、単一クラスのみのノードでは最小(0)になります。
  • ジニ不純度は「1−Σp_i^2」で計算され、決定木は分割後の子ノードの不純度が最小になる特徴量と閾値を選びます。
  • CARTはジニ不純度、ID3・C4.5はエントロピーを既定の分割基準とし、不純度は数値予測の回帰木ではなくクラスを予測する分類木で使われます。

6. 確認問題

問1不純度は、決定木のノード内に含まれるデータが複数のクラスにどれだけ混ざっているかを表す指標であり、ノード内が単一クラスのみで構成される場合は不純度が最小になる。

解答・解説をみる

○ 正しい

不純度はクラスの混ざり具合を表す指標で、単一クラスのみのノードでは不純度は最小(0)になります。決定木は、この不純度が小さくなる分割を選びながら木を構築していきます。

問2ジニ不純度は「−Σp_i log2 p_i」という式で計算される。

解答・解説をみる

× 誤り

この式はエントロピーの計算式です。正しくはジニ不純度=1−Σp_i²(p_iはノード内であるクラスiの割合)で、ジニ不純度とエントロピーは計算式が異なる別の指標です。

問3決定木は、分割後の子ノードの不純度が最も小さくなる、つまり分割前後の不純度の差(情報利得)が最も大きくなる特徴量と閾値を選んで構築される。

解答・解説をみる

○ 正しい

決定木は候補となる特徴量・閾値ごとに分割後の不純度を比較し、不純度の減少量である情報利得が最大になるものを選びます。