AdaBoost (G検定)

AdaBoost

1. 定義と概要

AdaBoost(Adaptive Boosting)とは、Yoav Freund氏とRobert Schapire氏が1995年に発表した手法です。1997年には学術誌(Journal of Computer and System Sciences)で論文としても発表されました。ブースティング(単純な予測モデルを順番に学習させて弱点を補い合いながら精度を高める手法)の代表的な手法として位置づけられています。

仕組みの中心にあるのは、弱学習器(単独では判定精度が低い、ごく単純な予測モデル)の逐次的な学習です。弱学習器を1つずつ順番に学習させ、直前の弱学習器が誤分類したデータの重みを大きくして次の弱学習器に重点的に学習させることを繰り返します。

最終的には、各弱学習器の性能(誤分類率の低さ)に応じた重み付き多数決(精度の高いモデルの意見をより強く反映してまとめる集計方法)によって、1つの高精度なモデル(強学習器)を作ります。弱学習器には、1回の条件分岐だけで判定する単純な決定木である決定株(decision stump)がよく使われます。

こうした手法が生まれた背景には、単一の複雑なモデルで高精度を狙う従来のアプローチの弱点があります。この方向性は過学習(学習データに適合しすぎて、未知のデータへの精度が落ちてしまう現象)しやすく、汎化性能(未知のデータに対してもどれだけ正しく予測できるかという性能)にも課題が残っていました。

そこで、単独では精度が低い簡易な弱学習器を複数組み合わせて全体として高精度な予測を実現する、アンサンブル学習(複数の予測モデルを組み合わせて1つの高精度な予測を作る手法)が発展し、アダブーストはその代表的な手法の1つに位置づけられます。

アダブーストは、直前の弱学習器が誤分類したデータに次の弱学習器が重点的に取り組むように重みを更新する「適応的(Adaptive)」な仕組みを持つ点が名称の由来です。この仕組みは、他のブースティング手法とも共通する出発点になっています。

2. 試験対策ポイント

アダブーストについてまず押さえておきたい基本情報は、提唱者と発表年です。Yoav Freund氏とRobert Schapire氏が1995年に発表し、1997年に学術誌へ論文化したという経緯があります。

予測の誤差である残差(実際の値と予測値の差)を次のモデルが埋めるように学習していく勾配ブースティングは、この提唱者や発表年の面でアダブーストと混同されやすい手法です。XGBoost等の名称ともあわせて、提唱者と年号の組み合わせが取り違えやすい点です。

アルゴリズムの流れも重要な論点です。重みがどう動くかを手順として並べると、次のようになります。

手順 内容
1 全訓練データに均等な重みを与える
2 その重みのもとで弱学習器を学習させる
3 誤分類したデータの重みを大きくし、正しく分類したデータの重みを小さくする
4 更新した重みのもとで次の弱学習器を学習させる

手順2から4を繰り返す中で、弱学習器が苦手とするデータに徐々に焦点が絞られていく点がアダブーストの核心です。

最終的な予測についても取り違えやすい論点があります。弱学習器を単純な多数決で統合するのではなく、誤分類率が低い(性能の良い)弱学習器ほど大きな重み(信頼度)を掛けた重み付き多数決で統合する仕組みで、この違いが選択肢の作り分けに使われます。

また、弱学習器には決定株(decision stump)が用いられることが多い一方、アダブーストは外れ値(他のデータから大きく外れた特異な値)やノイズの影響を受けやすいという弱点も知られています。

3. 関連概念との比較・相違点

勾配ブースティングとの最大の違いは、何に着目して重みや学習対象を更新するかという点にあります。誤分類したデータの重みを更新して次の弱学習器に学習させるアダブーストに対し、勾配ブースティングは残差を次のモデルが学習して埋めていきます。どちらもブースティングの一種として並べて理解したいテーマです。

バギング(複数のモデルを独立・並列に学習させ、その結果を平均や多数決でまとめる手法)との最大の違いは、学習の順序にあります。両者を観点ごとに並べると、違いがはっきりします。

観点 アダブースト バギング
学習の順序 弱学習器を1つずつ順番に(逐次的に)学習させる 複数のモデルを独立・並列に学習させる
結果の統合 性能に応じた重み付き多数決 単純な多数決や平均
代表的な構成 弱学習器に決定株がよく使われる ランダムフォレスト(バギングの代表例で、複数の決定木を組み合わせる手法)が代表例

ランダムフォレストがよく引き合いに出されることもあり、逐次か並列かという学習順序の違いがそのまま試験の選択肢になります。

4. ビジネス・実務での活用シナリオ

画像認識・セキュリティの分野では、顔検出のViola-Jones法が代表例です。これは、Haar-like特徴量(画像の明暗パターンを数値化した特徴量)とアダブーストで作った強識別器(強学習器と同じく、複数の弱学習器を統合した高精度なモデル)を組み合わせた手法です。この強識別器をカスケード分類器(判定を多段階に分けて高速に絞り込んでいく分類の仕組み)によって多段階に接続し、スマートフォンのカメラや防犯カメラでリアルタイムに顔を検出する仕組みを実現しています。

金融の分野では、与信審査や不正取引検知のような分類問題にアダブーストの考え方が使われます。直前のモデルが見逃した誤判定データに重点を置いて学習を繰り返す仕組みが、全体の中では少数派である不正パターンの検出精度を高める用途に適しているためです。

医療の分野では、検査データから疾患の有無を判定するような、単純な判定基準を積み重ねて全体の精度を高めていく分類問題が、アダブーストのような手法が力を発揮しやすい領域として位置づけられます。

5. 要点まとめ

  • アダブーストは誤分類したデータの重みを大きくしながら弱学習器を1つずつ順番に学習させ、性能に応じた重み付き多数決で統合するブースティング手法で、Freund氏とSchapire氏が1995年に発表しました。
  • 弱学習器には決定株がよく使われ、誤分類率の低い弱学習器ほど大きな重みを持つ点が単純な多数決との違いになります。
  • 勾配ブースティングとはサンプル重み更新か残差学習かで、バギングとは逐次学習か並列学習かで区別されます。

6. 確認問題

問1アダブーストでは、直前の弱学習器が誤分類したデータの重みを大きくして、次の弱学習器がそのデータに重点的に取り組むように学習を進める。

解答・解説をみる

○ 正しい

アダブーストの適応的(Adaptive)な重み更新そのものです。誤分類したデータの重みを増やし、正しく分類したデータの重みを減らして次の弱学習器に渡します。

問2アダブーストの最終的な予測は、すべての弱学習器の意見を均等に扱う単純な多数決によって決定される。

解答・解説をみる

× 誤り

正しくは、誤分類率が低い(精度の高い)弱学習器ほど大きな重み(信頼度)を持つ重み付き多数決で統合します。単純な多数決ではない点が要点です。

問3アダブーストは誤分類したサンプルの重みを更新して次の弱学習器を学習させる手法であるのに対し、勾配ブースティングは予測値と正解の差である残差を次のモデルが学習する手法である。

解答・解説をみる

○ 正しい

両者ともブースティングの一種ですが、弱学習器を学習させる際に何に注目するか(サンプルの重み更新か残差学習か)が異なる点が比較の要点です。