復元抽出 (G検定)

復元抽出

1. 定義と概要

復元抽出とは、母集団から標本を取り出す際、取り出した要素をそのつど母集団に戻してから次の要素を取り出す標本抽出の方法です。同じ要素が複数回選ばれる可能性があります。くじを引いたらもとに戻してから次を引く、サイコロを繰り返し振るといった場面が身近な例にあたります。

標本抽出には、取り出した要素を戻す復元抽出と、戻さない非復元抽出の2つの方式があります。復元抽出は毎回の抽出条件、つまり母集団の構成や要素数が変わらないため、確率的な扱いが単純になり、理論的な解析がしやすいという特徴を持ちます。

この単純さから、統計的なリサンプリング(手元のデータから繰り返し標本を取り直して統計量のばらつきを推定する手法)や機械学習のアンサンブル学習(複数のモデルの予測を組み合わせて精度を高める学習手法)で、復元抽出は積極的に利用されています。

2. 試験対策ポイント

G検定では、復元抽出によって各試行の抽出確率が常に一定に保たれるという性質が重要な論点です。復元抽出は取り出した要素を毎回母集団に戻すため、次の抽出でも母集団の構成が変わりません。この結果、各試行が独立試行(前の結果が次の結果の確率に影響を与えない試行)となり、n回の復元抽出における特定の要素の出現回数は二項分布(成功か失敗かの結果を持つ試行を繰り返したときの成功回数が従う確率分布)に従います。

対して非復元抽出は要素を戻さないため確率が試行ごとに変化し、各試行が独立でなくなります。この場合の出現回数は超幾何分布(母集団から要素を戻さずに取り出したときの、特定の要素の出現数が従う確率分布)に従い、母集団が十分大きい場合には超幾何分布は二項分布に近づくという関係になります。

母集団の要素数がnのとき、そこからn回の復元抽出を行うと、ある1つの要素が一度も選ばれない確率は(1-1/n)のn乗で表され、nが大きくなるとおよそ36.8%に収束します。裏を返すと、元の母集団の要素のうち約63.2%が少なくとも1回は選ばれることになり、選ばれた要素の中には重複も含まれるという性質です。

復元抽出を繰り返し用いる代表例がブートストラップサンプリングで、元データセットと同じ大きさの標本を複数回、復元抽出で作り直す手法です。これを訓練データの生成に使うのがバギング(複数のモデルを異なる訓練データで学習させ、予測を平均や多数決でまとめる手法)です。

バギングによって複数の決定木(データを条件分岐で振り分けて予測を行うツリー状のモデル)を組み合わせる代表的な手法がランダムフォレスト(バギングを使って複数の決定木を組み合わせるアンサンブル学習の代表的な手法)です。仕組みの詳細はブートストラップサンプリング自体の論点として扱われますが、復元抽出の応用先として押さえておきたいポイントです。

3. 関連概念との比較・相違点

非復元抽出との最大の違いは、取り出した要素を母集団に戻すかどうかです。この一点の違いが、抽出確率の変化・各試行の独立性・出現回数が従う分布へと連鎖していきます。両者を観点ごとに並べると、次のような対応になります。

観点 復元抽出 非復元抽出
取り出した要素 母集団に戻す 母集団に戻さない
抽出確率 常に一定に保たれる 試行のたびに変化する
各試行の独立性 独立試行になる 独立でなくなる
出現回数が従う分布 二項分布 超幾何分布

文中の「戻す」「戻さない」という記述から独立試行かどうかを見分け、二項分布と超幾何分布のどちらが対応するかを判断する視点は、取り違えやすい点です。非復元抽出は一度選んだ要素を除いてから次を選ぶため、試行のたびに母集団の構成と選ばれる確率が変わり、そのぶん各試行が独立でなくなるという流れで理解しておくと整理しやすくなります。

ブートストラップサンプリングとの関係では、両者は同じ階層の概念ではありません。復元抽出は標本抽出の方式そのものを指す概念であるのに対し、ブートストラップサンプリングは復元抽出を繰り返して複数の訓練用・分析用データセットを作る手法という応用にあたります。

復元抽出という基本操作を土台にして、ブートストラップサンプリングという具体的な手法が成り立ち、そこからさらにバギングやランダムフォレストといったアンサンブル学習の手法へと発展していくという段階的な関係になっています。

4. ビジネス・実務での活用シナリオ

機械学習・データ分析の現場では、バギングやランダムフォレストにおいて、元の訓練データから復元抽出で複数のブートストラップサンプルを作り、決定木ごとに異なる訓練データを与えます。これにより個々のモデルの予測のばらつきが打ち消し合い、全体としての予測精度が安定するという効果が得られます。

統計的検定・データ分析の場面では、手元にある限られたサンプルから何度も復元抽出を行い、平均や標準誤差(推定値のばらつきの大きさを示す指標)のばらつきを推定するブートストラップ法として使われます。理論分布の仮定が難しい少量データでも、統計量の信頼区間(推定値がどの範囲に収まるかを示す区間)を見積もれるという意義があります。

シミュレーション・抽選システムの分野では、乱数生成を伴う抽選やモンテカルロシミュレーション(乱数を使って試行を繰り返し、確率的に結果を推定する手法)のように、毎回同じ確率条件で対象を選び続ける必要がある場面があります。こうした場面では、独立試行を再現できる復元抽出の性質が前提になります。

5. 要点まとめ

  • 復元抽出は取り出した標本を母集団に戻してから次を取り出す方法で、同じ要素が複数回選ばれる可能性があり、毎回の抽出確率が一定に保たれます。
  • 各試行が独立であるため抽出結果は二項分布に従います。非復元抽出は要素を戻さないため確率が変化し、結果は超幾何分布に従います。
  • 復元抽出を繰り返す手法がブートストラップサンプリングで、バギングやランダムフォレストといったアンサンブル学習の土台になっています。

6. 確認問題

問1復元抽出では、一度取り出した標本を母集団に戻してから次の標本を取り出すため、同じ要素が複数回選ばれる可能性がある。

解答・解説をみる

○ 正しい

復元抽出の定義そのものです。毎回もとの母集団に戻すため要素数と構成が変わらず、同じ要素が繰り返し選ばれることがあります。

問2復元抽出では各試行の抽出確率が一定に保たれるため、n回の抽出における特定の要素の出現回数は二項分布に従う。

解答・解説をみる

○ 正しい

母集団の構成が毎回同じに保たれることで各試行が独立試行になり、出現回数は二項分布に従います。対して非復元抽出は確率が変化し独立でないため、結果は超幾何分布に従います。

問3非復元抽出は一度選んだ要素を母集団に戻さないため、復元抽出よりも同じ要素が選ばれる可能性が高くなる。

解答・解説をみる

× 誤り

この記述は逆になっています。非復元抽出は一度選んだ要素を除くため、同じ要素が二度選ばれることはありません。同じ要素が複数回選ばれる可能性があるのは復元抽出の性質で、正しくは両者の性質が入れ替わっています。