1. 定義と概要
バギング(Bagging、Bootstrap Aggregating)とは、元の学習データから複数のデータセットを作り、それぞれで学習させた予測モデルの結果を統合する手法です。これはアンサンブル学習(複数の予測モデルを組み合わせて1つの結論を出す学習方法)の一種にあたります。
このデータの抽出方法はブートストラップサンプリング(同じデータを何度選んでもよいランダムな抽出を繰り返して、新しいデータの束を作る操作)と呼ばれ、復元抽出(一度選んだデータを元に戻してから次を選ぶ、重複を許す抽出方法)の一種にあたります。バギングでは、この方法で作った複数のデータセットごとに弱学習器(単体では精度がそれほど高くない、比較的シンプルな予測モデル)を学習させます。
そして、分類問題では多数決(複数のモデルが出した予測のうち、最も多かった答えを採用する集約方法)、回帰問題では平均によって、個々の予測を1つの結果にまとめます。たとえば10個の弱学習器のうち7個が「A」、3個が「B」と予測した場合、多数決による最終的な予測は「A」になります。
統計学者レオ・ブレイマンが1996年の論文でこの手法を提唱しました。代表的な実装はランダムフォレスト(決定木というデータをYes/Noの条件分岐で振り分けて予測するツリー状のモデルを多数組み合わせ、その予測をまとめて1つの答えを出すバギングの手法)です。
考案の背景にあるのは、単一のモデルが抱える弱さです。単一のモデルは学習データの偏りに影響を受けやすく、学習データに適合しすぎて未知のデータへの精度が落ちる過学習(学習データに適合しすぎて、新しいデータへの予測精度が落ちてしまう状態)を起こしやすいという課題があります。
バギングは、複数のモデルを異なるデータセットで学習させて予測を集約することで、個々のモデルの誤差を打ち消し合います。その結果、予測のばらつきを示す分散(バリアンス。予測結果がどれくらいばらつくかを示す指標)を抑え、安定した精度を得るという発想で考案されました。
2. 試験対策ポイント
アンサンブル学習は、G検定ではバギング・ブースティング(前のモデルの誤りを次のモデルが重点的に学習する手法)・スタッキング(複数モデルの出力を別モデルでまとめる手法)の3手法に大別されます。このうちバギングは、複数の弱学習器をそれぞれ独立したデータセットで並列に学習させる点が特徴です。
予測の統合方法は、分類問題では多数決、回帰問題では平均という対応関係にあり、この使い分けも押さえておきたいポイントです。アンサンブル学習・バギング・ブースティング・スタッキングという一連の用語は、まとめて整理しておきたい関連語の束です。
バギングは分散の低減を主な目的とする手法です。これに対しブースティングは、予測の偏りを示すバイアス(予測が真の値からどれくらいずれて偏っているかを示す指標)の低減を重視します。
弱学習器ごとに使うデータが少しずつ異なるため、個々の学習器が持つ誤差の方向がそろいにくく、全体として安定した予測につながります。この目的の違いは重要な論点で、両者の目的を入れ替えた記述が選択肢に使われることもあります。
ブートストラップサンプリングは、元のn件の学習データから復元抽出でランダムにn件を抽出する操作です。この操作を弱学習器の数だけ繰り返し、少しずつ異なる複数のデータセットを用意します。
ランダムフォレストは、決定木を弱学習器としたバギングの一種で、各分岐で使う特徴量(予測に使う入力データの各項目)もランダムに選ぶ点が特徴です。この特徴量のランダム選択は通常のバギングにはない工夫で、バギングとの関連づけとして押さえておきたい点です。
3. 関連概念との比較・相違点
ブースティングとの最大の違いは、弱学習器を学習させる順序にあります。二つの手法を観点ごとに並べると、対応がはっきりします。
| 観点 | バギング | ブースティング |
|---|---|---|
| 弱学習器の学習 | 複数を並列に独立して学習させる | 前の弱学習器の誤りに重みをつけながら逐次的に学習させる |
| 主に低減するもの | 分散(予測結果のばらつき) | バイアス(予測の真の値からのずれ) |
並列に学習を進めるか順番に学習を進めるかという構造の違いが、両者を分ける本質的なポイントです。この並列か逐次かという構造の違いは、分散とバイアスのどちらを低減するかという違いにそのまま対応します。
ランダムフォレストとの違いは、両者の抽象度にあります。どちらの層の言葉なのかを整理すると、次のようになります。
| 用語 | 位置づけ | 中身 |
|---|---|---|
| バギング | 手法の総称 | データのサブセットを使って複数のモデルを学習し統合する枠組み |
| ランダムフォレスト | 具体的な実装アルゴリズム | 弱学習器に決定木を用い、特徴量の選択にもランダム性を加えたバギング |
つまり、バギングという枠組みの中に、ランダムフォレストという具体的な手法が含まれるという関係になります。この抽象度の違いにより、文章中の「バギング」がバギング一般を指しているか、ランダムフォレストという具体例を指しているかが変わります。
4. ビジネス・実務での活用シナリオ
金融機関の与信審査では、ランダムフォレストを使った与信スコアリングモデルが使われています。複数の決定木が出す判定の多数決によって、極端な入力データに引きずられにくい安定した与信判定が可能になります。与信審査は一件の誤判定が顧客との関係や損失に直結するため、複数モデルの合議によって判断のばらつきを抑えることが重視されます。
医療分野の画像診断支援でも、複数モデルの予測を多数決で統合する仕組みが採用されています。単一モデルが下す誤判定に予測全体が引きずられるリスクを、複数モデルの合議によって抑えられます。検査データの分類のように誤診の影響が大きい領域では、単一モデルへの依存を避ける設計が重視されます。
小売業の需要予測でも、複数の予測モデルの出力を平均する手法が有効です。特定のモデルが出す極端な予測に振り回されず、安定した需要予測を実現できます。需要予測は在庫や仕入れ計画に直結するため、極端な予測に依存しない安定性が重要な条件になります。
5. 要点まとめ
- バギングはブートストラップサンプリング(復元抽出)で作った複数のデータセットで弱学習器を並列に学習させ、多数決(分類)や平均(回帰)で予測を統合するアンサンブル学習の手法です。
- 分散の低減を目的とする点で、バイアスの低減を重視し逐次的に学習するブースティングと対比されます。
- ランダムフォレストは決定木にバギングと特徴量のランダム選択を組み合わせた代表的な具体例です。
6. 確認問題
問1バギングでは、複数の弱学習器がそれぞれ独立したデータセットを使って並列に学習する。
解答・解説をみる
○ 正しい
バギングはブートストラップサンプリングで作った複数のデータセットを使い、弱学習器を並列に学習させる手法です。逐次的に学習を進めるブースティングとの違いにあたります。
問2バギングは予測のバイアス(偏り)を低減することを主な目的とし、分散の低減を重視するのはブースティングである。
解答・解説をみる
× 誤り
目的が逆です。正しくはバギングが分散の低減を、ブースティングがバイアスの低減を重視します。両者の目的を入れ替えた記述は、混同しやすい組み合わせです。
問3ランダムフォレストは、決定木を弱学習器としたバギングの一種であり、特徴量の選択にもランダム性を加えている。
解答・解説をみる
○ 正しい
ランダムフォレストは通常のバギングの手続きに加えて、各決定木の分岐で使う特徴量も無作為に選ぶ点が特徴です。バギングの代表的な実装として位置づけられます。

