ブートストラップサンプリング (G検定)

ブートストラップサンプリング

1. 定義と概要

ブートストラップサンプリングとは、元データ(サイズn)から要素を1つ取り出してはそのまま元に戻す操作をn回繰り返し、元と同じサイズnの新しいデータセット(ブートストラップサンプル)を1つ作る手法です。この「取り出しては戻す」抽出方式は復元抽出(一度選んだデータを元に戻してから次を選ぶ抽出方法で、同じデータが何度も選ばれうる)と呼ばれます。

ブートストラップサンプリングでは、この復元抽出をn回繰り返して1つのサンプルを作る操作を独立に多数回繰り返すことで、複数のブートストラップサンプルを用意します。この抽出方式では、同じデータが1つのブートストラップサンプルの中で複数回選ばれる一方、一度も選ばれないデータも生じます。取り出すたびに元へ戻すため、サンプルごとに少しずつ顔ぶれの違うデータセットが出来上がります。

統計学では従来、推定したい数値がどの範囲に収まるかを確かめたり誤差を求めたりするために、数学的な公式や大量の追加データが必要な場面がありました。計算機の性能が向上したことで、手元のデータをコンピュータ上で仮想的に何度も取り直し、統計量のばらつきを推定するブートストラップ法が広く使われるようになりました。

機械学習の文脈では、この考え方が学習データの複製・多様化に応用されています。この応用の代表がバギング(ブートストラップサンプリングで作った複数のデータセットでモデルを学習し、結果を多数決や平均でまとめる手法)です。ランダムフォレストは、バギングの考え方を決定木(条件分岐を繰り返してデータを分類・予測する木構造のモデル)に適用した手法です。さらに、各決定木の分岐ごとに使う特徴量(予測に使うデータの項目)もランダムに選ぶことで、通常のバギングより木同士の多様性を高めています。

2. 試験対策ポイント

G検定では、ブートストラップサンプリングの手続きに加えて、選ばれなかったデータであるOOB(Out-of-Bag。ブートストラップサンプルの作成時に一度も選ばれなかったデータ)の性質が重要な論点です。1つのブートストラップサンプルを作る際、元データのうち特定の1つが一度も選ばれない確率は(1-1/n)^nで表されます。データ数nを大きくしていくと、この確率は理論上約36.8%(1/e)に収束するという関係にあります。

ランダムフォレストのOOB誤差推定は、この選ばれなかったデータをそのまま検証用に使う仕組みです。別途テストデータを用意しなくても、モデルの汎化性能(学習に使っていない新しいデータに対する予測のよさ)を評価できる点は、ブートストラップサンプリングと合わせて見ておきたい性質です。

ブートストラップサンプリングは、バギングやランダムフォレストの土台となる手法である、という位置づけです。復元抽出によって同じデータが複数回選ばれる一方で選ばれないデータも生じるという性質、OOBの約36.8%という収束値、そしてOOB誤差推定の仕組みは、いずれも一体として理解しておきたい関連知識です。

3. 関連概念との比較・相違点

バギングとの最大の違いは、指すものの範囲にあります。ブートストラップサンプリングはデータを複製してリサンプリングする手続きそのものを指します。一方でバギングは、その手続きを使って複数のモデルを独立に学習し、多数決(分類の場合)や平均(回帰の場合)で結果を集約するアンサンブル学習(複数のモデルの予測を組み合わせて1つの予測を作る手法)の手法全体を指します。

まぎらわしい3つの語がそれぞれどこを指しているかを並べると、次のようになります。

用語 指しているもの
ブートストラップサンプリング 元データから復元抽出でデータセットを複製する手続きそのもの
バギング その手続きで複数のモデルを学習し、多数決や平均で結果を集約する手法全体
ランダムフォレスト バギングの考え方を決定木に適用し、分岐に使う特徴量の選び方もランダムにした手法

手続き、それを使った手法全体、さらにその応用という三段の関係になっています。どの語がどの段を指しているかを押さえておくと、選択肢の中で取り違えにくくなります。

汎化性能を評価する方法としては、交差検証(データを複数のグループに分け、一部を検証用に使い分けてモデルの性能を確かめる方法)との違いが、混同しやすい点です。両者は検証に使うデータの作り方が異なります。

評価方法 検証用データの作り方
交差検証 データをあらかじめk個のグループに分け、その一部を検証用に確保する
OOB評価 ブートストラップサンプリングの副産物である「選ばれなかったデータ」をそのまま検証に使う

この違いにより、OOB評価では別途データを切り分ける手間がかかりません。

4. ビジネス・実務での活用シナリオ

金融業界では、与信審査や不正検知のためのランダムフォレストモデルの構築にブートストラップサンプリングが使われます。複数の決定木を並行して学習させることで、単一のモデルよりも安定した予測が得られます。個々の決定木は異なるブートストラップサンプルで学習するため、特定の顧客層に偏ったデータに引きずられにくくなり、予測結果のばらつきが抑えられます。

製造業では、センサーデータから不良品を予測するモデルの汎化性能をOOB評価で確認する場面があります。別途検証用データを取り分けずに済むため、開発サイクルを短くできます。不良品の発生件数が少なく検証用に十分なデータを確保しにくい現場でも、手元のデータを学習と検証の両方に活かせる点が導入の後押しになります。

マーケティング分析の現場では、顧客離反予測モデルの精度をブートストラップサンプリングで複数回評価します。指標のばらつきを把握することで、モデルの安定性を判断する材料になります。評価のたびに異なるブートストラップサンプルを使うため、特定の顧客層に偏った結果ではないかを確認でき、施策判断に使う指標への信頼度を高められます。

5. 要点まとめ

  • ブートストラップサンプリングは元データから重複を許して同じサイズの新しいデータセットを複数作るリサンプリング手法で、同じデータが複数回選ばれる一方、選ばれないデータも生じます。
  • 選ばれなかったデータ(OOB、Out-of-Bag)は理論上約36.8%(1/e)に収束し、別途テストデータを用意せずに汎化性能を評価する用途に使われます。
  • ブートストラップサンプリングはバギング・ランダムフォレストの土台であり、データを分割して確保する交差検証とは異なる仕組みでモデル評価にも使われます。

6. 確認問題

問1ブートストラップサンプリングは、元のデータセットから重複を許して同じサイズの新しいデータセットを複数作るリサンプリング手法である。

解答・解説をみる

○ 正しい

定義のとおりです。元データ(サイズn)から復元抽出をn回繰り返して同じサイズnのデータセットを1つ作る操作を、独立に多数回繰り返します。

問2ブートストラップサンプリングでは、一度選ばれたデータが同じブートストラップサンプルの中で再び選ばれることはない。

解答・解説をみる

× 誤り

重複を許す抽出方式のため、同じデータが1つのブートストラップサンプル内で複数回選ばれることがあります。正しくは、重複選択が生じるという記述になります。

問3OOB(Out-of-Bag)は、あるブートストラップサンプルの作成時に一度も選ばれなかったデータのことで、データ数を大きくすると理論上約36.8%に収束する。

解答・解説をみる

○ 正しい

1つのデータが選ばれない確率(1-1/n)^nは、nを大きくすると約e^-1(≒0.368)に収束します。ランダムフォレストのOOB誤差推定は、このデータを検証に使う仕組みです。