1. 定義と概要
ブースティングとは、弱学習器(単体では性能があまり高くない簡易なモデル)を1つずつ順番に学習させる手法です。前の学習器が誤分類したデータに大きな重みをつけて次の学習器に学習させることを繰り返しながら、複数の学習器を束ねた強学習器(複数の弱学習器を組み合わせて作った精度の高いモデル)を構築します。
代表的な手法は2つあります。1つは、誤分類されたデータの重みを増やしながら弱学習器を追加していくAdaBoost(誤分類データの重みを増やしながら弱学習器を順に学習させる代表的なブースティング手法)です。もう1つは、決定木(データを条件分岐で振り分けながら予測を行うモデル)を弱学習器に用い、前の木の予測誤差を次の木が学習していく勾配ブースティング(決定木を用い、前の木の予測誤差を次の木が学習していく手法)です。
こうした手法の背景には、単一のモデルだけでは精度に限界があるという課題があります。そこから、複数のモデルを組み合わせて1つの高精度なモデルに仕立てるアンサンブル学習(複数のモデルを組み合わせて1つの高精度なモデルに仕立てる手法)という考え方が広がってきました。
代表的な系統は2つに分かれます。学習データのサブセットを使って複数のモデルを独立に並列で学習させるバギング(学習データのサブセットを使い複数のモデルを独立に並列で学習させる手法)と、弱学習器を順番に学習させ前の学習器の誤りを次の学習器で補正していくブースティングです。ブースティングはこのうち逐次型にあたります。
2. 試験対策ポイント
試験対策として重要な論点は、ブースティングが弱学習器を逐次的(直列的)に学習させる手法だという点です。各学習器が独立ではなく前の学習器の結果に依存するため、バギングのように学習を並列化しにくいという制約があります。
この逐次的な誤り補正によって、バイアス(モデルの予測が本来の値から系統的にずれる度合い)を小さくすることに強みがあります。一方で、誤分類されたデータへの重み付けを繰り返すため外れ値(他のデータから大きく離れた値)の影響を受けやすく、過学習(訓練データに適合しすぎて未知のデータへの対応力が下がる現象)にもつながりやすいという制約も知られています。
代表的なアルゴリズムとして、AdaBoost法と勾配ブースティングの2つが挙げられます。それぞれが何を手がかりに次の学習器を作るのかを並べると、次のように対応します。
| 手法 | 学習の進め方 | 特徴 |
|---|---|---|
| AdaBoost法 | 誤分類されたデータの重みを増やしながら弱学習器を追加する | 最終的に各学習器の重み付き多数決で予測する |
| 勾配ブースティング | 前の木の予測誤差(残差と呼ばれる、実際の値と予測値との差)を次の木が学習する | 決定木を弱学習器に用い、損失関数(モデルの予測誤差の大きさを数値化した関数)を最小化する方向へ逐次モデルを追加する |
両者の違いは、誤分類データの重みを直接調整するか、決定木を使って予測誤差を逐次学習するかという学習の進め方にあります。どちらも逐次的にモデルを積み上げる点は共通しており、手がかりの取り方だけが分かれる関係です。
勾配ブースティングを高速・高精度に実装したライブラリとして、XGBoost(勾配ブースティングを高速・高精度に実装した代表的なライブラリ)が挙げられます。同様の位置づけのライブラリとして、LightGBM(勾配ブースティングを高速に計算できるよう工夫された別の代表的なライブラリ)もあります。
ファインチューニング(既存の学習済みモデルを、新しいデータで追加学習して微調整する手法)やスタッキング(複数のモデルの予測結果を、さらに別のモデルに学習させて統合する手法)とは名称や文脈が紛らわしく、混同しやすい用語です。
3. 関連概念との比較・相違点
バギングとの最大の違いは、学習の進め方にあります。両者を観点ごとに並べると、系統の違いがはっきりします。
| 観点 | バギング | ブースティング |
|---|---|---|
| 学習の進め方 | 学習データのサブセットを使い、複数のモデルを独立に並列学習させる | 弱学習器を逐次学習させ、前の誤りを次の学習器で補正する |
| 低減を狙うもの | バリアンス(学習データの違いによってモデルの予測が敏感に変動する度合い) | バイアス(予測が本来の値から系統的にずれる度合い) |
| 代表的な手法 | ランダムフォレスト | AdaBoost法・勾配ブースティング |
並列型か逐次型かという系統の違いが、そのまま低減の狙いどころの違いにつながっています。
ランダムフォレスト(バギングを応用し多数の決定木を組み合わせる代表的な手法)との違いは位置づけにあります。ランダムフォレストはバギングを応用し、多数の決定木を並列に学習させる代表的な手法であり、ブースティングとは異なる系統、すなわち並列型に属します。逐次型のブースティングと並列型のランダムフォレストは、同じ決定木を弱学習器に使う場合でも学習の進め方が対照的という関係にあります。
4. ビジネス・実務での活用シナリオ
金融の与信審査や不正検知の分野では、勾配ブースティングを用いたモデルが、取引履歴や属性データから複雑な非線形パターンを捉え、与信スコアリングや不正取引の検知精度を高める用途で使われています。単純な線形モデルでは捉えにくい要因の組み合わせを表現できる点が、判断の精度を左右する金融領域で選ばれる理由です。
Webサービスや広告の分野では、広告のクリック率(CTR)予測やレコメンデーションにおいて、表形式データに強い勾配ブースティング系のモデル、たとえばXGBoost、LightGBM等が精度面で選ばれることが多くあります。大量のユーザー属性や行動履歴を組み合わせて予測する場面で、逐次的な誤り補正の仕組みが効果を発揮します。
製造業の品質予測や異常検知では、センサーデータや検査データから不良品の発生を予測するモデルにブースティングが用いられます。単一モデルより高い精度で予兆を捉えられるため、不良品の流出を未然に防ぐ取り組みに活用されています。
5. 要点まとめ
- ブースティングは弱学習器を逐次的に学習させ、前の学習器の誤りを次の学習器で補正していくアンサンブル学習の手法で、バイアスの低減に強みがあります。
- 並列に学習するバギング(バリアンスの低減)とは対照的な系統に位置づけられ、逐次処理のため学習の並列化には向きません。
- 代表的な手法はAdaBoost(誤分類データへの重み付け)と勾配ブースティング(決定木で誤差を逐次学習、XGBoost・LightGBM等で実装)です。
6. 確認問題
問1ブースティングは、弱学習器を逐次的に学習させ、前の学習器が誤分類したデータの重みを増やしながら次の学習器に学習させる手法である。
解答・解説をみる
○ 正しい
この逐次的な誤り補正の仕組みがブースティングの定義の核であり、代表例としてAdaBoost法や勾配ブースティングが挙げられます。
問2ブースティングはバギングと同様に、複数の弱学習器を互いに独立させて並列に学習させることができる手法である。
解答・解説をみる
× 誤り
正しくは、ブースティングの各学習器は前の学習器の結果に依存する逐次的な学習であり、並列化には向きません。並列に独立して学習できるのはバギングの特徴であり、両者を取り違えた記述にあたります。
問3勾配ブースティングでは、決定木を弱学習器として用い、前の決定木の予測誤差を次の決定木が学習する形でモデルを逐次追加していく。
解答・解説をみる
○ 正しい
勾配ブースティングは損失関数を小さくする方向へ、前の木の誤差を次の木が学習しながらモデルを積み上げていく手法で、XGBoost・LightGBM等が代表的な実装にあたります。

