1. 定義と概要
データリーケージとは、モデルが予測を行う時点では本来利用できないはずの情報が、訓練データや前処理の過程に混入してしまう現象です。試験を受ける前に答えを見てしまうことに例えられ、検証・テストでの評価指標が実際の運用性能より高く見積もられる結果を招きます。
従来、モデルの精度は訓練データと検証・テストデータをきちんと分けて評価すれば正しく測れると考えられてきました。しかし、データ分割や前処理の手順を誤ると、検証・テストの側にも訓練時の情報が漏れ込み、評価そのものが汚染されてしまいます。
この分割の手続きミスが精度の見かけ上の底上げにつながる点は、単なる精度不足やモデル設計の課題とは異なる注意点として扱われます。手順のわずかなミスが評価全体の信頼性を揺るがすため、データの取り扱い方そのものが重視される分野として位置づけられています。
2. 試験対策ポイント
リーケージは大きく2つの型に整理されます。1つは、訓練用のデータと検証・テスト用のデータが混ざり合うトレインテストコンタミネーション(学習用のデータと評価用のデータが混ざってしまうこと)です。
もう1つは、目的変数(モデルが予測しようとする答えにあたる値)に由来する情報が特徴量(モデルへの入力として使う個々のデータ項目)へ紛れ込むターゲットリーケージ(予測したい答えに由来する情報がこっそり入力データに紛れ込むこと)です。この2分類とあわせて4つの典型パターンが重要な論点になります。
1つ目のパターンは、標準化(データの数値の範囲を揃える処理)や、欠損値を埋める欠損値補完といった前処理を、データ分割より前に全データへ適用してしまうケースです。平均や標準偏差(データのばらつきの大きさを表す値)といった統計量にテストデータの情報が混ざり、分割後のテストデータが訓練プロセスの影響を受けてしまいます。
2つ目は時系列データで、モデルが予測時点ではまだ観測されていないはずの未来の情報を学習に使ってしまうケースです。時系列データの分割はランダムではなく時間順に行う必要があるという注意点とセットで扱われます。
3つ目は、目的変数から派生した特徴量を誤って学習に含めてしまうケースです。督促状の発行記録のように、予測したい結果が起きた後に生成される情報を特徴量にすると、モデルはその情報に依存してしまいます。
4つ目は、同一の被験者や顧客、機器といった同一個体から得られた複数のデータが、訓練データと検証・テストデータの両方に分かれて含まれるケースです。個体単位でまとめて分割しないと、モデルは個体固有の特徴を覚えるだけで高精度に見えてしまいます。
症状としては、訓練・検証段階の評価指標が高いにもかかわらず本番運用で精度が大きく落ち込むギャップとして現れます。このギャップは、モデルを本番環境に投入するまで気づきにくいという厄介さがあります。
過学習(訓練データに適合しすぎて、新しいデータへの対応力が落ちること)との違いは、過学習が訓練誤差と検証誤差の乖離として表面化するのに対し、リーケージは検証・テストの評価そのものが汚染されているため乖離が見えにくい点にあります。
対策は、4つの典型パターンそれぞれに対応する形で整理できます。
| 典型パターン | 対策 |
|---|---|
| 前処理を分割より前に全データへ適用する | データ分割を前処理より先に行い、訓練データのみから統計量を計算する |
| 時系列データで未来の情報を学習に使う | 分割はランダムではなく時間順に行う |
| 目的変数から派生した特徴量が混入する | 目的変数由来の特徴量を学習から除外する |
| 同一個体のデータが訓練側と評価側にまたがる | 同一個体のデータは訓練側と検証・テスト側のどちらかにまとめる |
いずれの対策も、評価に使うデータへ訓練時の情報を流し込まないという一点で共通しています。手順の順序を守ることが、そのまま評価の信頼性につながる分野といえます。
3. 関連概念との比較・相違点
過学習との最大の違いは、精度の乖離が見える形で表れるかどうかという点にあります。過学習は訓練誤差と検証誤差の差として表面化するため、学習曲線(学習の進行に伴う訓練誤差と検証誤差の推移を示すグラフ)を確認すれば気づけます。
一方でリーケージは検証・テストの評価そのものが汚染されているため、この乖離が見えないまま高い精度が出てしまいます。見た目の精度だけでは両者を区別できないため、評価の手順そのものを確認する視点が必要になります。両者の見え方の違いを軸ごとに並べると、次のように整理できます。
| 比較の軸 | 過学習 | データリーケージ |
|---|---|---|
| 表面化の仕方 | 訓練誤差と検証誤差の乖離として表れる | 評価そのものが汚染され乖離が見えない |
| 気づける手がかり | 学習曲線の確認で気づける | 本番運用に入るまで気づきにくい |
訓練データ・検証データ・テストデータの分割手順そのものとの違いにも注意が必要です。分割の方法や比率をどう選ぶかは、評価の設計に関わる話です。これに対してリーケージは、分割や前処理の手順を誤ることで評価の前提が崩れてしまう事故という位置づけにあります。
分割の比率を工夫するだけでなく、前処理より先に分割を済ませる順序を守ることが、評価を正しく機能させる条件になります。分割方法の選び方とリーケージ対策は、どちらも評価の信頼性を支える別々の観点として扱われます。
4. ビジネス・実務での活用シナリオ
金融の与信審査や不正検知では、延滞後に発行される督促状の記録を特徴量に含めてしまう事故が起こりえます。審査の時点ではまだ存在しないはずの情報にモデルが依存してしまうため、実運用の与信スコアリング(融資の可否や条件を点数化して判断する仕組み)では説明力を失い、審査担当者が納得できる根拠を示せなくなります。モデルの判断根拠を説明できない状態は、規制対応や顧客への説明責任の面でも大きなリスクになります。
医療分野では、同一患者から得た複数の検査データが訓練データと検証データの両方に分かれて含まれるケースが見られます。疾患予測モデルの精度は、実際に来院する初診患者に対する性能よりも高く見積もられてしまい、臨床現場に導入した後で期待した精度が出ないという事態を招きます。臨床現場で導入した後に精度低下が判明すると、運用の見直しに時間とコストがかかります。
小売・需要予測の分野では、時系列の売上予測において、実際にはまだ確定していない未来の在庫状況や販促情報を学習に使ってしまう例があります。予測モデルの運用時の精度は事前評価を下回り、発注計画や仕入れ判断の見直しが必要になります。在庫の欠品や過剰在庫を防ぐには、確定済みの情報だけで予測モデルを検証する姿勢が欠かせません。
5. 要点まとめ
- データリーケージは、本来モデルが学習時点で知り得ない情報が訓練データや前処理に混入し、検証・テストでの性能を実際より高く見せる現象です。
- 典型パターンは、前処理の分割前適用・時系列データの未来情報混入・目的変数由来の特徴量混入・同一個体データの訓練/評価またがりの4つに整理されます。
- 対策の基本は、データ分割を前処理より先に行い、時系列は時間順に分割し、目的変数由来の特徴量と個体単位の重複を排除することです。
6. 確認問題
問1データリーケージが発生すると、検証データやテストデータでの評価指標は、実際の本番運用時の性能よりも高く見積もられる傾向がある。
解答・解説をみる
○ 正しい
データリーケージは、本来使えないはずの情報がモデルに渡ることで評価を実力以上に見せてしまう現象です。検証・テストの数値と本番性能の乖離として現れます。
問2標準化や欠損値補完などの前処理は、データを訓練用と検証・テスト用に分割する前に全データへ適用しても、リーケージのリスクは生じない。
解答・解説をみる
× 誤り
分割前の前処理は、平均や標準偏差といった統計量にテストデータの情報も混ぜてしまう典型的なリーケージの原因になります。正しくは、分割を先に行い、訓練データのみから統計量を計算して検証・テストデータへ適用する順番です。
問3同一の被験者や機器から得られた複数のデータが、訓練データと検証・テストデータの両方に分かれて含まれる場合、データリーケージの原因になりうる。
解答・解説をみる
○ 正しい
個体固有の特徴をモデルが覚えてしまうと、未知の個体にどれだけ対応できるかという汎化性能(学習に使っていないデータへの対応力)を正しく評価できなくなります。個体単位でまとめて分割する対応が必要になります。

