1. 定義と概要
回帰木とは、決定木(木構造で条件分岐を繰り返しながら予測を行う手法)のうち、予測対象が連続値(気温や金額のように切れ目なく続く数値)である場合に用いる手法です。木構造の末端にあたる葉(木構造の末端のノードで、最終的な予測値が決まる場所)に到達したデータについて、その目的変数(予測したい対象の値)の平均値を、その葉の予測値とします。
たとえば、部屋の面積や築年数、最寄り駅までの距離といった説明変数(予測に使う入力データの項目)から住宅の成約価格を予測したり、気温や来店客数から商品の販売数量を予測したりする場面で使われます。数値そのものを答えとして返す点が、回帰木の輪郭をつかむ手がかりになります。
決定木は予測対象の種類によって2種類に大別され、数値(連続値)を予測するものが回帰木、カテゴリ(離散値)を予測するものが分類木(目的変数がカテゴリのときに使う決定木で、葉では多数決でクラスを予測する手法)です。
従来、数値を予測する場面では、線形回帰(データの関係を1本の直線や平面の数式で近似する予測手法)のように変数間の関係を数式で表すモデルが使われてきました。しかし現実のデータには、駅からの距離の影響が築年数によって変わるといった非線形な関係や変数どうしの相互作用(ある変数の影響の大きさが、別の変数の値によって変わること)が含まれることが多くあります。条件分岐でデータを段階的に分割していく回帰木は、こうした関係を捉えやすい手法です。
2. 試験対策ポイント
まず整理しておきたいのは、回帰木における予測値の決まり方と分岐条件の基準です。回帰木の予測値は、葉に到達した学習データの目的変数の平均値で決まります。これに対して分類木は、葉に到達したデータの多数決でクラスを予測するため、平均値を使うか多数決を使うかという出力方法の違いが分かれ目になります。
分岐条件についても、回帰木と分類木では基準が異なります。回帰木では、分割後の各グループの分散(データのばらつきの大きさを表す統計量)や二乗誤差(予測値と実際の値の差を2乗して合計した誤差の大きさ)が最小になる分割点を探します。具体的には、特徴量(予測に使うデータの項目)と閾値(分岐の基準となる値)の組み合わせを選びます。
一方の分類木は、不純度(ノード内のデータがどれだけ複数のクラスに混ざっているかを表す指標)を使って分岐を決めています。代表的な指標としてジニ不純度やエントロピー(いずれも不純度を数値化する代表的な計算方法)が使われ、回帰木とは異なる基準である点が試験対策の要になります。予測対象(連続値かカテゴリか)、分割基準(分散・二乗誤差か不純度か)、葉の出力(平均値か多数決か)という3点は、回帰木と分類木を対比する軸になります。
勾配ブースティング(複数の簡単なモデルを順番に学習させ、前のモデルの誤りを次のモデルで補正しながら精度を高める手法)では、分類・回帰いずれのタスクでも、各ステップで予測誤差(勾配)という連続値を学習します。そのため弱学習器(単体では精度が高くない簡易なモデルで、複数組み合わせて使う部品のようなもの)には、タスクが分類問題であっても回帰木が使われるという関係にあります。
3. 関連概念との比較・相違点
分類木との最大の違いは、予測対象・分割基準・葉の出力という3点にあります。この3つの観点で両者を並べると、次のような対応になります。
| 観点 | 回帰木 | 分類木 |
|---|---|---|
| 予測対象 | 連続値(数値) | カテゴリ(離散値) |
| 分割基準 | 分散(二乗誤差)の最小化 | 不純度の最小化 |
| 葉の出力 | 平均値 | 多数決 |
同じ決定木という枠組みでありながら、扱う目的変数の種類によって内部の計算方法がまるごと変わる関係にあります。分割のたびに数値のばらつきを小さくしていくのが回帰木、クラスの混ざり具合を減らしていくのが分類木で、見ている対象そのものが違うわけです。
線形回帰との最大の違いは、非線形な関係や変数どうしの相互作用を捉えられるかどうかです。回帰木は条件分岐によって非線形な関係や相互作用を捉え、予測値は葉ごとに一定の階段状(不連続)になります。
一方の線形回帰は、説明変数と目的変数の関係を線形の数式で表すため、線形の関係を前提とした連続的な予測値になります。データに含まれる関係が直線的かどうかによって、どちらの手法が適しているかが変わってきます。
4. ビジネス・実務での活用シナリオ
不動産の分野では、物件の面積や築年数、最寄り駅までの距離などから成約価格を予測する場面で回帰木が使われます。駅からの距離が価格に与える影響は築年数によって変わることがあり、こうした条件依存の非線形な関係を分岐条件として捉えられる点が、線形回帰にはない強みです。
小売・ECの分野では、過去の販売実績や季節、プロモーションの有無から商品の需要数量を予測する用途に用いられます。キャンペーンの効果が商品カテゴリによって変わるといった影響の違いを木構造で表現できるため、単純な平均値による需要予測よりも精度の高い在庫計画につながります。
製造業では、センサーで計測した温度や圧力などの数値から製品の品質スコアを予測する用途があります。回帰木を多数組み合わせた勾配ブースティングは表形式データに対する予測精度が高く、品質管理や異常予兆の把握に活用されています。
5. 要点まとめ
- 回帰木は、目的変数が連続値(数値)のときに使う決定木で、葉に到達したデータの平均値を予測値として出力します。
- 分岐条件は分散・二乗誤差を最小化する特徴量と閾値の組み合わせで決まり、不純度を使う分類木とは分割基準が異なります。
- 勾配ブースティングでは分類・回帰いずれのタスクでも弱学習器に回帰木が使われ、非線形な関係を捉える点で線形回帰と対比されます。
6. 確認問題
問1回帰木は、目的変数が連続値(数値)である場合に用いられる決定木であり、葉に到達したデータの平均値を予測値として出力する。
解答・解説をみる
○ 正しい
回帰木の予測値は、葉に到達した学習データの平均値で決まります。目的変数が連続値のときに使う点が、多数決でクラスを予測する分類木との違いです。
問2回帰木の分岐条件は、ジニ不純度やエントロピーといった不純度の指標を最小化する特徴量と閾値の組み合わせによって決まる。
解答・解説をみる
× 誤り
不純度を使うのは分類木の分割基準です。正しくは、回帰木は分散(二乗誤差)の減少を基準に分岐を選びます。分割基準を入れ替えた記述は、逆にとらえやすい点です。
問3勾配ブースティングでは、タスクが分類問題であっても弱学習器として回帰木が使われることがある。
解答・解説をみる
○ 正しい
勾配ブースティングは各ステップで予測誤差(勾配)という連続値を学習するため、タスクが分類であっても弱学習器には回帰木が使われます。

