1. 定義と概要
分類木とは、決定木のうち、予測したい対象である目的変数(予測したい対象の値)が、カテゴリのような質的な情報、すなわち離散値(「はい/いいえ」のようにとびとびに区切れる値のこと)である場合に用いる手法です。決定木とは、木構造で条件分岐を繰り返しながら予測を行う教師あり学習(正解ラベル付きのデータをもとに学習する手法)の一種で、分類木と回帰木(目的変数が連続値のときに使う決定木)を合わせた総称を指します。
木構造では、分岐点や末端の一つ一つの点をノードと呼び、その末端にあたるノードを葉(リーフ)と呼びます。葉にたどり着いたデータのうち、最も多いクラス(カテゴリのこと)による多数決(複数のデータの中で一番多いクラスを予測結果として採用する決め方)を、その葉の予測値とします。
具体例としては、メールが「スパムか否か」を判定する、顧客が商品を「購入する/しない」を予測する、検査データから疾患の「陽性/陰性」を判定するといった場面が挙げられます。
決定木は、予測対象の種類によって大きく二つに分かれます。カテゴリのような離散値を予測するものが分類木で、気温や金額のように切れ目なく続く連続値(気温や金額のように切れ目なく続く数値のこと)を予測するものが回帰木です。
「決定木」という言葉が分類木の説明だけで使われる場面も多く、決定木イコール分類木と混同されやすい状況がありますが、正しくは分類木と回帰木を合わせた総称が決定木です。
2. 試験対策ポイント
まず整理したいのは、分類木の予測値がどのように決まるかという仕組みです。葉に到達した学習データのうち、最も多いクラスによる多数決で予測値が決まります。クラスごとの割合をそのまま確率として出力する場合もあり、多数決の結果だけでなく内訳が使われる点も、あわせて押さえておきたいポイントです。
分岐条件は、不純度(ノードの中に異なるクラスのデータがどれだけ混ざっているかを表す指標)を最小化する特徴量(予測に使う入力データの各項目)と閾値(分岐の基準となる境目の値)の組み合わせによって決まります。不純度の代表的な指標には、ジニ不純度(データの混ざり具合を数値化する代表的な指標のひとつ)とエントロピー(情報の乱雑さ・不確実性を数値化した指標)があります。
どちらの指標を使うかは、木を作るアルゴリズムによって決まっています。CART(ジニ不純度を使って木を作る代表的なアルゴリズム)とID3・C4.5(エントロピーを使って木を作る代表的なアルゴリズム)の対応は、次のとおりです。
| アルゴリズム | 使う不純度の指標 |
|---|---|
| CART | ジニ不純度 |
| ID3・C4.5 | エントロピー |
アルゴリズムの名前と指標は混同しやすい組み合わせのため、対にして押さえておきたいところです。
分類木と回帰木の対比は、3点セットで整理されます。
| 観点 | 分類木 | 回帰木 |
|---|---|---|
| 予測対象 | カテゴリ | 連続値 |
| 分割基準 | 不純度系の指標 | 分散・二乗誤差 |
| 葉の出力 | 多数決によるクラス | クラス内の平均値 |
分類木の側から見ると、予測対象・分割基準・葉の出力の三つを、回帰木と対にして押さえる関係にあります。
3. 関連概念との比較・相違点
回帰木との最大の違いは、予測対象がカテゴリ(分類木)か連続値(回帰木)かという点にあります。
分割の基準も、分類木は不純度(ジニ不純度・エントロピー)を最小化するのに対し、回帰木は分散(データのばらつきの大きさを表す指標)や二乗誤差(予測値と実際の値のずれを二乗して合計した指標)を最小化する点で異なります。葉の出力も、分類木が多数決によるクラスであるのに対し、回帰木は葉に含まれるデータの目的変数の平均値である点が対になっています。
ロジスティック回帰(入力データから確率を計算してクラスを予測する分類手法)との違いは、境界の形にあります。分類木は特徴量の閾値で領域を区切る木構造で、軸に平行な境界を作るため、分岐条件がそのまま可視化できます。
一方、ロジスティック回帰は入力の線形結合(各入力の値に重みを掛けて足し合わせたもの)から確率を出力する手法で、境界は直線や平面になります。どちらも分類に使える手法ですが、判断根拠を条件分岐として追えるかどうかという点で性質が異なります。
4. ビジネス・実務での活用シナリオ
金融の与信審査では、顧客の属性や取引履歴から融資の可否をクラス分類する場面で分類木が使われます。分岐条件が木構造として可視化されるため、なぜその審査結果になったのかを説明しやすいという特性があります。融資を断る場合にも、どの条件が判断の決め手になったかを示せるため、審査結果に対する顧客の納得感につながります。
医療の分野では、検査値から疾患の陽性・陰性を分類する用途に使われます。判断の過程を条件分岐として追えるため、医師が患者に判断根拠を説明する際にも使いやすい手法です。検査値のどの項目が診断の決め手になったかを条件分岐として遡れるため、医師どうしの見解のすり合わせにも活用できます。
マーケティングの分野では、顧客の行動履歴から解約するかしないかを分類し、解約リスクが高い顧客層を条件分岐の形で特定する用途に使われます。どの条件が解約に結びついているかが分岐として残るため、対策を検討する材料にもなります。解約に結びつきやすい条件ごとに顧客層を絞り込めるため、限られた予算を効果の見込める層へ重点的に配分する判断材料になります。
5. 要点まとめ
- 分類木は、目的変数がカテゴリ(離散値)のときに使う決定木で、葉に到達したデータの多数決でクラスを予測します。
- 分岐条件は不純度の指標(ジニ不純度・エントロピー)を最小化する特徴量と閾値で決まり、CARTはジニ不純度、ID3・C4.5はエントロピーを使います。
- 回帰木とは、予測対象(カテゴリか連続値か)・分割基準(不純度系か分散・二乗誤差か)・葉の出力(多数決か平均値か)の3点で対になります。
6. 確認問題
問1分類木は、目的変数が離散値(カテゴリ)である場合に用いられる決定木であり、葉に到達したデータの多数決によってクラスを予測する。
解答・解説をみる
○ 正しい
分類木の予測値は、葉に到達した学習データの多数決で決まります。目的変数がカテゴリのときに使う点が、回帰木との違いです。
問2分類木の分岐条件は、ジニ不純度やエントロピーといった不純度の指標を最小化する特徴量と閾値の組み合わせによって決まる。
解答・解説をみる
○ 正しい
CARTアルゴリズムはジニ不純度、ID3・C4.5はエントロピーを使って、不純度が小さくなる分岐を選びます。
問3分類木の葉は、その葉に含まれる学習データの目的変数の平均値を出力する。
解答・解説をみる
× 誤り
葉が平均値を出力するのは回帰木の特徴です。分類木の葉は、多数決によるクラスを出力します。予測対象と出力方法を入れ替えた記述は、取り違えやすい点です。

