非復元抽出 (G検定)

非復元抽出

1. 定義と概要

非復元抽出とは、母集団(調査や分析の対象となるデータ全体の集まり)から標本抽出(母集団から一部を取り出して調べること)を行う際、一度選んだ要素をその後の抽出対象から除外し、母集団に戻さずに次の抽出を進める方法です。くじ引きで引いた札を戻さずに次の札を引く方式が典型例です。

抽出のたびに要素を元へ戻す復元抽出(取り出した要素を元に戻してから次を取り出す抽出方法)とは対照的に、非復元抽出では各回の抽出確率が直前までの結果に依存し、標本どうしに従属(ある抽出の結果が別の抽出の確率に影響すること)の関係が生まれます。

統計的な調査では、母集団から標本(母集団から取り出した一部のデータ)を取り出す方法として、復元抽出と非復元抽出の2通りが古くから対比されてきました。理論上の確率計算では、各抽出が独立(ある抽出の結果が別の抽出の確率に影響しないこと)に扱える復元抽出のほうが数式が単純になるため、教科書ではまず復元抽出から説明されることが多くあります。

しかし現実の調査や実験では、同一の個体を重複して選ぶことを避けたい場面が多く、非復元抽出のほうが実務上の標準になりやすい傾向があります。機械学習の分野でも、限られたデータを無駄なく使い切りたいという要請から、データセットの分割や交差検証など随所で非復元抽出の考え方が採用されています。

2. 試験対策ポイント

まず押さえておきたいのは、非復元抽出と復元抽出の対比です。非復元抽出では抽出のたびに母集団の要素数が減るため、各回の抽出確率が変化し抽出どうしが従属の関係になります。一方、復元抽出では毎回同じ母集団から選ぶため抽出確率が一定に保たれ、各抽出は独立の関係になります。この独立性の有無が、両者を見分ける軸になります。

機械学習の実務では、非復元抽出の考え方がいくつもの場面で使われています。データセットを訓練用とテスト用に分割する際は、同じデータ点が両方のセットに重複しないよう分けるのが基本で、これは非復元抽出にあたります。

k分割交差検証(データをいくつかのグループに分け、順番にテスト用として使い分けてモデルの性能を評価する手法)も、各データが正確に1回だけテスト用に使われる点で同じ考え方に基づいています。さらに、1エポック(学習データ全体を1回すべて使い切る学習の単位)の中でミニバッチ(学習データを小さなまとまりに分割した単位)を作る際も、データを重複なく分割するため非復元抽出の一種です。

取り違えやすい論点として、ブートストラップサンプリング(母集団から復元抽出を繰り返して複数の標本集団を作る統計手法)との混同があります。ブートストラップサンプリングは復元抽出を基本とする手法であり、非復元抽出とは標本作成の基盤が異なります。

3. 関連概念との比較・相違点

復元抽出との最大の違いは、抽出後に要素を母集団へ戻すか戻さないか、そして抽出どうしの独立性にあります。この2点から母集団の要素数や抽出確率の振る舞いまでが枝分かれしていきます。観点ごとに並べると、次のような対応になります。

観点 非復元抽出 復元抽出
抽出した要素 母集団に戻さず除外する 母集団に戻す
母集団の要素数 抽出のたびに減り続ける 毎回変わらない
抽出確率 回を追うごとに変化する 一定に保たれる
抽出どうしの関係 従属関係が生まれる 独立に扱える

理論上の確率計算のしやすさから復元抽出が教科書的に扱われる一方、重複選択を避けたい実務の場面では非復元抽出が選ばれやすい、という関係にあります。同じ標本抽出でありながら、扱いやすさを取るか重複の回避を取るかで使い分けられていると捉えると整理しやすくなります。

ブートストラップサンプリングとは、標本作成の基盤そのものが異なります。ブートストラップサンプリングは、母集団から復元抽出を繰り返して複数の標本集団を作る統計手法であり、同じデータ点が1つの標本内で重複して選ばれることを前提としています。

非復元抽出が重複を避ける方法であるのに対し、ブートストラップサンプリングは復元抽出を土台にした手法である点で、標本の作り方の前提が異なります。

4. ビジネス・実務での活用シナリオ

マーケティングリサーチや世論調査では、アンケート対象者を無作為に選ぶ際、同一人物へ重複して依頼することを避けるために非復元抽出が使われます。母集団が十分に大きい調査では復元抽出との差はほとんど無視できますが、対象となる母集団が小規模な調査では非復元抽出が標準的な方法になります。

品質管理・検査の分野では、工場出荷前のロット検査で、抜き取ったサンプル(検査対象として取り出した製品)を検査後に母集団へ戻さない非復元抽出が標準的な方法です。同一の製品を重複して検査対象にしないことで、限られた検査コストのなかでも母集団全体の代表性を確保できます。

機械学習エンジニアリングでは、データセットを訓練・検証・テストに分割する作業や、k分割交差検証、各エポックでのミニバッチ生成のいずれもが非復元抽出に基づいています。同じデータが複数の役割に重複して使われることを避けることで、汎化性能(未知のデータに対してもモデルが正しく予測できる能力)を適切に評価することにつながります。

5. 要点まとめ

  • 非復元抽出は、一度選んだ要素を母集団に戻さずに次の抽出を行う標本抽出法で、抽出確率が前の結果に依存し標本どうしに従属関係が生まれる点が復元抽出との違いです。
  • 機械学習では訓練・テスト分割やk分割交差検証、ミニバッチ作成が非復元抽出にあたり、同一データの重複利用を避ける役割を持ちます。
  • ブートストラップサンプリングは復元抽出を基本とする手法であり、非復元抽出とは標本作成の基盤が異なります。

6. 確認問題

問1非復元抽出とは、一度選んだ要素をその後の抽出対象から除外し、二度と選ばれないようにする標本抽出法である。

解答・解説をみる

○ 正しい

非復元抽出の定義そのものです。くじ引きで引いた札を戻さずに次を引く方式が典型例です。

問2機械学習における訓練データとテストデータの分割は、通常同じデータ点が両方のセットに重複しないよう非復元抽出的に行われる。

解答・解説をみる

○ 正しい

訓練データとテストデータの分割は、各データ点をいずれか一方のみに割り当てるため非復元抽出にあたります。k分割交差検証やミニバッチ作成も同じ考え方に基づいています。

問3非復元抽出では各回の抽出において選ばれる確率が常に一定であり、各抽出は互いに独立である。

解答・解説をみる

× 誤り

抽出確率が一定で各抽出が独立なのは復元抽出の性質です。非復元抽出では母集団の要素数が減っていくため抽出確率が変化し、標本どうしに従属関係が生まれます。性質を入れ替えた記述は取り違えやすい点です。