1. 定義と概要
訓練データ(training data)とは、機械学習モデルが持つパラメータ(重みやバイアスなど、学習によって調整される数値)を実際に学習させるために使用するデータの集合です。教師あり学習(入力データと正解のペアを使ってモデルを学習させる方式)では、入力データと正解ラベルのペアで構成されます。
モデルはこのペアを繰り返し処理しながら、予測値と正解のずれである誤差(訓練誤差)を小さくする方向にパラメータを更新していきます。たとえば犬と猫の画像を見分ける分類モデル(データをあらかじめ決めたカテゴリに振り分けるモデル)であれば、大量の犬・猫の画像とその正解ラベルの組み合わせが訓練データにあたります。
手元にあるデータをすべて学習に投入するだけでは、モデルが未知のデータにどれだけ通用するかを確認できません。そこでデータセットを訓練データ・検証データ(学習中の調整に使うデータ)・テストデータ(最終評価に使うデータ)の3つに分割し、学習に使うデータと評価に使うデータを分ける手順が標準的な進め方として定着しました。
分割の比率にはたとえば6対2対2や8対1対1といった目安があり、手元のデータ量が少ない場合には交差検証(データの分け方を変えながら学習と評価を複数回繰り返し、性能を確かめる手法)と呼ばれる別の手法との使い分けも論点になります。
2. 試験対策ポイント
まず重要になるのは、訓練データ・検証データ・テストデータという3つのデータの役割分担です。どの段階でどのデータを使うのかを並べると、次のように整理できます。
| データの区分 | 使う場面 | 担う役割 |
|---|---|---|
| 訓練データ | 学習の過程 | モデルのパラメータ(重み・バイアス)の学習 |
| 検証データ(学習中に調整や早期終了の判断に使うデータ) | 学習の途中 | ハイパーパラメータ(学習率など、人があらかじめ設定する値)の調整やモデル選択 |
| テストデータ(学習完了後の評価にだけ使うデータ) | 学習がすべて終わったあと | 最終評価 |
訓練データの役割はパラメータの学習に限られ、ハイパーパラメータの調整にも最終評価にも踏み込みません。この分担が、3つのデータを区別する基本の軸になります。
訓練データに対する予測の誤差は訓練誤差と呼ばれ、学習が進むほど小さくなる性質があります。訓練誤差が小さいことだけを根拠にモデルの性能を判断すると、訓練データに過剰に適合し未知のデータへの対応力が落ちる過学習を見抜けません。訓練誤差の小ささは、必ずしも汎化性能(未知のデータに対してどれだけ正しく予測できるかという能力)の高さを意味するわけではありません。
訓練データの量と質は、モデルの精度と汎化性能を左右します。量が不足すると、データの背後にあるパターンを十分に学習できない未学習(アンダーフィッティング。モデルがデータのパターンを十分に学習できていない状態)に陥りやすくなります。質、つまりラベルの正確さや偏りのなさが低い場合も、モデルの判断に偏りが生じやすくなります。
この量と質を補う手段として、データ拡張(手持ちのデータに変換を加えて水増しする手法)やデータクレンジング(データの誤りや欠損、重複を取り除いて整える作業)が関連づけて整理されます。また、訓練データと実際の運用データの分布が異なる場合、訓練データ上で精度が良くても実運用では性能が出ないことがある点も、モデル運用の論点として扱われます。
3. 関連概念との比較・相違点
検証データとの最大の違いは、パラメータの学習に直接関わるかどうかという点にあります。訓練データはパラメータの学習そのものに使うデータであるのに対し、検証データは学習中のハイパーパラメータ調整や早期終了の判断に使うデータで、パラメータの学習には直接使いません。訓練データで学習を進めながら、検証データでモデルの調子を確認するという役割分担にあります。
テストデータとの最大の違いは、使うタイミングにあります。訓練データは学習の過程で繰り返し使うデータですが、テストデータは学習がすべて完了したあとの最終評価にのみ使い、学習プロセスには一切関与させません。
訓練データ・検証データ・テストデータの3つは、学習から評価までの各段階でそれぞれ異なる役目を担うデータという関係にあります。この位置づけの違いを押さえておくと、3データの名前を混同しにくくなります。
4. ビジネス・実務での活用シナリオ
製造業の外観検査では、過去に撮影した良品・不良品の画像を訓練データとして分類モデルを学習させ、検査の自動化を進める取り組みが広がっています。訓練データに含まれる不良パターンの網羅性が、そのまま検出精度を左右します。あらゆる不良の種類を訓練データに含めておかなければ、想定外の欠陥を見逃す原因になります。
金融の与信・不正検知の分野では、過去の取引履歴や返済実績を訓練データとして、不正検知や与信スコアリングのモデルを学習させます。訓練データが特定の属性に偏っていると、実運用で公平性を欠く判断につながるリスクがあります。特定の属性を持つ人だけが不利な評価を受ける結果になれば、モデルの信頼性そのものが揺らぎかねません。
音声認識や自然言語処理(人間の言葉をコンピュータに処理させる技術分野)の分野では、音声データと書き起こしテキストの組を訓練データとして学習させます。訓練データに含まれる話者や言語のバリエーションが少ないと、多様な利用者への対応力が落ちてしまいます。方言やアクセント、話す速さの違いまで訓練データに反映させることが、実際の利用者層に対応する認識精度につながります。
5. 要点まとめ
- 訓練データは、モデルのパラメータ(重み・バイアス)を学習させるために使うデータで、検証データ(ハイパーパラメータ調整用)やテストデータ(最終評価用)とは役割が異なります。
- 訓練データに対する誤差は訓練誤差と呼ばれ、これだけを確認しても未知データへの性能低下である過学習を見抜くことはできません。
- 訓練データの量と質がモデルの精度と汎化性能を左右し、データ拡張やデータクレンジングで補われます。
6. 確認問題
問1訓練データは、機械学習モデルの重みやバイアスといったパラメータを学習させるために使われる。
解答・解説をみる
○ 正しい
訓練データはパラメータの学習そのものに使うデータです。ハイパーパラメータの調整に使う検証データ、最終評価に使うテストデータとは役割が異なります。
問2訓練データに対する誤差(訓練誤差)が小さいことだけを確認すれば、そのモデルが未知のデータに対しても高い性能を発揮すると判断できる。
解答・解説をみる
× 誤り
訓練誤差が小さいだけでは、訓練データに過剰適合した過学習の可能性を排除できません。正しくは、未知データへの対応力である汎化性能は、テストデータなど別のデータで確認する必要があります。
問3訓練データの量が少ない場合、モデルはデータの背後にあるパターンを十分に学習できず、未学習に陥りやすい。
解答・解説をみる
○ 正しい
訓練データが不足すると、モデルの表現力を活かしきれずパターンの学習が不十分な未学習(アンダーフィッティング)に陥りやすくなります。データ拡張などで量を補う対応がとられます。

