1. 定義と概要
ランダムフォレストとは、バギング(元データから重複を許してランダムに複数の学習データセットを作り、それぞれでモデルを学習させて結果を統合する手法)に工夫を加えた一手法です。アンサンブル学習(複数の予測モデルを組み合わせて1つの高精度な予測を作る手法の総称)の一種として位置づけられます。
この工夫にあたるのが、各決定木(データを条件分岐で枝分かれさせながら予測するモデル)の分岐で使う特徴量(予測に使う入力項目)をランダムに選ぶ処理です。分類問題(データを複数のカテゴリに振り分ける問題)では複数の決定木の予測の多数決、回帰問題(連続する数値を予測する問題)では平均によって最終的な予測を出します。具体的な活用例は、与信スコアリングや疾患の診断支援、顧客の解約予測などです。
決定木は単体では学習データに過学習(学習データに適合しすぎて、未知のデータへの予測精度が落ちてしまう状態)しやすく、汎化性能(未知のデータに対してもどれだけ正確に予測できるかという能力)が下がりやすいという弱点を持ちます。この弱点を補うため、複数の学習器を組み合わせるアンサンブル学習の考え方が生まれました。
バギングは学習データの行方向、つまりサンプルの選び方にランダム性を導入する手法です。ランダムフォレストはこれに列方向、つまり特徴量のランダム性も加えることで個々の決定木同士の相関を下げ、バギング単体よりも汎化性能を高めた手法という位置づけになります。この工夫によって、複数の決定木が似たような分岐条件ばかりを選んでしまう偏りを避けられます。
2. 試験対策ポイント
ランダムフォレストは、アンサンブル学習の中でもバギング系の代表例として位置づけられます。バギング系とは、複数の学習器を並列に学習させ、予測のばらつきである分散(予測結果のばらつきの大きさ)を抑える手法群を指します。
バギングとの違いとして論点になるのは、学習データのブートストラップサンプリング(元のデータから重複を許してランダムに抽出し、複数の学習データセットを作る手法)です。これに加えて、各決定木の分岐で使う特徴量もランダムに選択するという2重のランダム性が、バギングとの違いの分かれ目です。この2重のランダム性は、どこに対して働くかで次のように分けられます。
| ランダム性の対象 | 具体的な処理 | 由来 |
|---|---|---|
| 行(サンプル) | ブートストラップサンプリングで学習データを抽出する | バギングから引き継いだ仕組み |
| 列(特徴量) | 各決定木の分岐で使う特徴量をランダムに選ぶ | ランダムフォレストで加えられた工夫 |
行と列の両方にランダム性が働くことで、個々の決定木が互いに似通わないように仕向けられます。
学習後に特徴量重要度(予測にどの入力項目がどれだけ影響したかを示す指標)を算出できる点も、モデルの中身を人が理解しやすくする実務上の利点として扱われます。決定木単体との比較では、多数の木の予測を多数決や平均で統合することで過学習を抑え、汎化性能を高める点が論点です。
勾配ブースティング(前のモデルの誤差を次のモデルが順番に補正しながら精度を高めていく手法)との対比も重要な論点です。ランダムフォレストは複数の決定木を並列に学習させて分散を抑えるのに対し、勾配ブースティングは木を逐次的に学習させ、予測のずれであるバイアス(予測が本来の値からどれだけずれているかという偏り)を抑えます。
バギング・特徴量重要度・勾配ブースティングという関連用語の束は、ランダムフォレストとあわせて整理しておきたいところです。用語同士の対応関係を整理しておくと、選択肢の違いを見分けやすくなります。
3. 関連概念との比較・相違点
バギングとの最大の違いは、ランダム性を加える対象の範囲にあります。バギングは学習データの行、つまりサンプルのランダム抽出のみを扱う一般的な枠組みです。これに対してランダムフォレストは、列にあたる特徴量のランダム選択まで加えた、決定木限定の具体的な手法という関係にあります。この対象範囲の違いが、両者を区別する軸になります。
勾配ブースティングとの違いは、学習の順序と抑える誤差の種類です。ランダムフォレストは独立した決定木を並列に学習させ、分散を抑えます。一方、勾配ブースティングは前の木の誤差を次の木が逐次補正していく方式で、バイアスを抑えます。並列か逐次かという学習方式の違いが、両者を取り違えやすい点です。
決定木単体との違いは、可読性と汎化性能のトレードオフです。決定木単体は分岐条件をそのまま追えるため解釈しやすい一方、過学習しやすいという弱点を持ちます。ランダムフォレストは複数の木を組み合わせることで汎化性能を高める代わりに、個々の木の分岐をそのまま追う可読性を失う点が特徴です。この可読性と精度の関係は、モデルを選ぶ際の判断材料にもなります。
ここまでの3つの対比を軸ごとに並べると、次のように整理できます。
| 比較対象 | 違いの軸 | 相手側の性質 |
|---|---|---|
| バギング | ランダム性を加える対象の範囲 | 行のランダム抽出のみを扱う一般的な枠組み |
| 勾配ブースティング | 学習の順序と抑える誤差の種類 | 木を逐次的に学習させてバイアスを抑える |
| 決定木単体 | 可読性と汎化性能の関係 | 分岐条件を追えて解釈しやすい一方で過学習しやすい |
いずれの対比でも、ランダムフォレストは複数の決定木を並列に学習させて分散を抑える側に立ちます。この立ち位置を押さえておくと、似た手法名が並ぶ選択肢でも見分けやすくなります。
4. ビジネス・実務での活用シナリオ
金融業界では、与信審査における貸し倒れリスクのスコアリングにランダムフォレストが使われます。特徴量重要度を確認すれば、年収や返済履歴などどの項目が審査結果に強く影響したかを示す材料が得られるため、審査結果の根拠を説明する際に活用できます。数値の裏付けをもって審査基準を説明できる点は、金融という規制の厳しい業界で重視される理由です。
医療分野では、検査値などから疾患の有無を予測する診断支援モデルにも用いられます。多数の決定木による合議で予測を出す仕組みのため、外れ値(他のデータから大きく外れた例外的な値)を含むデータに対しても頑健な予測結果が得られやすいという特性があります。1つの誤った判断に予測全体が引きずられにくいことは、人の健康に関わる領域で重視される性質です。
マーケティングの現場では、顧客の購買や解約予測、いわゆるチャーン予測がランダムフォレストの代表的な用途です。特徴量重要度を分析すれば、利用頻度や問い合わせ回数などどの要因が解約につながりやすいかを把握でき、対策の優先順位を検討する材料になります。限られた予算を優先度の高い顧客層に振り向ける判断にも役立ちます。
5. 要点まとめ
- ランダムフォレストは、バギングに特徴量のランダム選択を加え、多数の決定木を並列学習して多数決/平均で予測するアンサンブル学習の手法です。
- バギングとの違いは特徴量(列)もランダムに選ぶ点、勾配ブースティングとの違いは並列学習で分散を抑える点(逐次学習でバイアスを抑えるブースティングと対比)にあります。
- 学習後に特徴量重要度を算出できる点と、決定木単体より過学習に強い点は、実務と試験の両方で扱われる論点です。
6. 確認問題
問1ランダムフォレストは、ブートストラップサンプリングによる学習データのランダム抽出に加えて、各決定木の分岐で使う特徴量もランダムに選択する。
解答・解説をみる
○ 正しい
サンプル(行)のランダム抽出に加えて、特徴量(列)もランダムに選ぶ点が、バギングとの違いとして扱われます。この2重のランダム性によって個々の決定木同士の相関が下がり、汎化性能の向上につながります。
問2ランダムフォレストを構成する複数の決定木は、勾配ブースティングと同様に前の木の誤差を次の木が逐次的に学習する。
解答・解説をみる
× 誤り
正しくは、ランダムフォレストは各決定木を独立して並列に学習させるバギング系の手法にあたります。前の木の誤差を次の木が逐次補正していく方式は勾配ブースティングの特徴で、両者は取り違えやすい点です。
問3ランダムフォレストは学習後に特徴量重要度を算出でき、どの特徴量が予測に寄与したかを把握できる。
解答・解説をみる
○ 正しい
特徴量重要度は、モデルの内部構造を人が理解しやすくする実務上の利点として扱われます。与信審査など、予測根拠の説明が求められる場面で活用されます。

