決定木 (G検定)

決定木

1. 定義と概要

決定木とは、データが持つ特徴量(予測に使うデータの個々の項目。例えば年齢や年収など)について「もし〜ならば」という条件分岐(if-then)を木構造に重ねていき、ルートノード(木構造の一番上にある最初の分岐点。根ノードとも呼ばれます)から葉ノード(木構造の末端にあたり、最終的な予測結果が出る点)へとたどり着くことで、分類や数値の予測を行う教師あり学習(正解ラベルの付いたデータを使ってモデルに学習させる方法)のアルゴリズムです。

出力がクラス(カテゴリ)の場合を分類木(予測結果がカテゴリになる決定木)、数値の場合を回帰木(予測結果が数値になる決定木)と呼び、両者をまとめて決定木と総称します。例えば、顧客の年齢や年収、購入履歴といった条件分岐を重ねていくことで、その顧客が商品を購入するかどうかを予測できます。

従来の統計的な予測モデルは、数式やパラメータ(モデルの挙動を決める数値設定)の意味を専門家でないと解釈しにくいという課題を抱えていました。決定木は各分岐が単純なif-then条件式で表されるため、専門知識がなくても判断の道筋を目で追えます。この可読性の高さから、予測の精度そのものより説明責任が重視される場面で採用が進んできました。

2. 試験対策ポイント

理解するうえで中心になるのは、決定木の可読性の高さです。各分岐が単純なif-then条件式で表され、ホワイトボックスモデル(内部の判断過程を人間が確認できるモデル)に分類されます。内部構造がブラックボックスモデル(内部の判断過程が人間には分かりにくいモデル)になりやすいニューラルネットワーク(人間の脳の神経回路を模した学習モデル)と対比される点です。

特徴量の正規化・標準化(値の範囲や分布をそろえる前処理)が不要で前処理の負担が少ない点、外れ値(他のデータから大きく外れた値)の影響を受けにくい点も、決定木の特徴として押さえておきたいポイントです。値の大小の順序だけで分岐を決めるため、スケールの違いに左右されにくいというわけです。

一方で、決定木は過学習しやすいという弱点があります。木を深く伸ばすほど訓練データに過度に適合し、未知データへの汎化性能(未知のデータに対してどれだけ正しく予測できるかという能力)が下がってしまいます。

木の深さや葉の数に制限をかけて枝を間引く剪定(プルーニング。木の枝を間引いて複雑さを抑える処理)は代表的な対策としてあわせて整理しておきたいところです。訓練データがわずかに変わるだけで木の形が大きく変わりやすい不安定さも決定木の制約のひとつです。

各ノード(木構造の中で分岐や末端にあたる点)では、分割後のデータの混ざり具合を表す不純度が下がるように、分割前後の不純度の低下量を表す情報利得が最大になる条件を、モデルが自動的に選んで分割します。不純度を測る代表的な指標には、ジニ不純度(不純度を測る指標のひとつ)とエントロピー(情報理論に由来するもうひとつの指標)があります。

具体的な計算式や使い分けは個別の解説に譲りますが、不純度を下げる方向に分割を繰り返すという考え方は、決定木を理解するうえでの中心的な論点です。

決定木単体は不安定で過学習しやすいという弱点があるため、複数の決定木を組み合わせるアンサンブル学習が発展しました。バギング(複数のモデルを並列に作り、多数決や平均をとる手法)の代表例がランダムフォレスト(複数の決定木の多数決や平均で予測する手法)です。前のモデルの誤りを次のモデルで順に補正していくブースティングという系統もあります。

決定木はこれらの基礎となる弱学習器(単体では精度が低いが、組み合わせることで高精度になるモデル)にあたり、アンサンブル学習の土台になっている関係は総論として整理されます。

3. 関連概念との比較・相違点

決定木は、比較する相手によって浮かび上がる違いの軸が変わります。ニューラルネットワークとは解釈性の軸で、ランダムフォレストとは単体で予測するか集団で予測するかという軸で対比されます。それぞれの違いを並べると次のようになります。

比較対象 違いの軸 決定木の側 比較対象の側
ニューラルネットワーク 解釈性 各分岐がif-then条件式で表され、判断根拠を人間が追跡できるホワイトボックスモデル 内部の重みの意味を人間が直接解釈しにくいブラックボックスモデル
ランダムフォレスト 単体か集団か 1本の木で予測を行うため過学習や不安定さの影響を受けやすい 複数の決定木を組み合わせた多数決や平均で精度と安定性を高めたアンサンブル手法

解釈のしやすさの違いは、モデルの説明可能性が重視される場面でしばしば対比されます。判断根拠を示す義務がある領域では、精度だけで手法を選べないためです。

ランダムフォレストとの関係でいえば、決定木単体の予測結果が訓練データのわずかな変化で大きく揺れやすいという弱点を、複数の木の組み合わせで補っている関係にあります。1本では偶然に左右される分岐も、多数の木で平均すればならされるという考え方です。

4. ビジネス・実務での活用シナリオ

金融の与信審査では、年収や延滞履歴といった条件分岐を木構造で示すことで、融資を承認したか却下したかの根拠を審査担当者や申込者に説明できます。決定木の分岐がそのまま説明資料になるため、判断のプロセスを可視化できる点が実務での価値になっています。

医療の分野では、症状や検査値の条件分岐から疾患リスクの傾向を判定する診断支援に使われ、医師が分岐の根拠を確認しながら意思決定に活用します。分岐の内容を目で追える性質が、専門家による最終判断を後押しする材料になっています。

マーケティングの分野では、顧客の属性や購買履歴の条件分岐から解約しやすい顧客層を特定し、木構造をそのまま施策検討の説明資料として関係者に共有します。分岐の条件がそのまま説明の言葉になるため、施策の合意形成を進める場面で活用されています。

5. 要点まとめ

  • 決定木は特徴量へのif-then条件分岐を木構造で重ね、分類(分類木)と回帰(回帰木)を行う教師あり学習のアルゴリズムです。
  • 各分岐の条件は、不純度(ジニ不純度・エントロピー)が下がるように情報利得が最大になる基準で、モデルが自動的に決めます。
  • メリットは可読性の高さと前処理の少なさ、デメリットは過学習しやすいこと(剪定で対策)で、この弱点を補うためバギング・ブースティングといったアンサンブル学習が発展しました。

6. 確認問題

問1決定木は各ノードでの条件分岐が単純なif-then文で表現されるため、判断の根拠を人間が追跡しやすいホワイトボックスモデルに分類される。

解答・解説をみる

○ 正しい

各分岐が特徴量に関するif-then条件式で示されるため、内部の判断過程を確認できます。内部構造が把握しにくいニューラルネットワークとの対比で取り違えやすい点です。

問2決定木は木を深く伸ばすほど未知データへの予測精度が下がり続けるため、過学習の心配はほとんどない。

解答・解説をみる

× 誤り

正しくは逆で、木を深く伸ばすほど訓練データに過度に適合し、未知データへの汎化性能が下がります。これが過学習であり、木の深さや葉の数を制限する剪定が代表的な対策にあたります。

問3ランダムフォレストは、複数の決定木を組み合わせて多数決や平均をとることで、決定木単体より安定した予測を目指すアンサンブル学習の代表例である。

解答・解説をみる

○ 正しい

ランダムフォレストはバギングの代表例であり、決定木の不安定さや過学習しやすさを複数モデルの組み合わせで補う関係にあります。