未学習 (G検定)

未学習

1. 定義と概要

未学習(アンダーフィッティング)とは、モデルの表現力(複雑な関係やパターンをどれだけ細かく捉えられるかというモデルの能力)や学習量が不足し、訓練データに含まれるパターンや関係性を十分に学習できていない状態です。

英語表記は「underfitting」です。具体例として、データが曲線的な(非線形の)関係を持つにもかかわらず、直線でしか予測できない単純な線形モデル(データの関係を直線で表そうとするシンプルなモデル)を当てはめた場合、訓練データの傾向すら再現できず未学習に陥ります。

モデルは学習を重ねるほど誤差が小さくなっていくと考えられがちですが、モデルの構造自体が単純すぎたり、特徴量(予測の手がかりとして使うデータの項目。たとえば気温や年齢など)が不足していたり、学習の途中で打ち切られたりすると、誤差が下がりきらないまま高止まりします。

この状態が未学習であり、モデルを新しいデータに適用したときの性能である汎化性能(未知のデータに対してもどれだけ正確に予測できるかという能力)を左右する基本的な課題として扱われます。訓練データに対する結果だけを見ていては未学習に気づきにくく、モデルの評価では常に汎化性能まで確認する視点が求められます。

2. 試験対策ポイント

理解するうえで中心になるのは、未学習の状態では訓練誤差(モデルが学習に使ったデータそのものに対してどれくらい間違えるかを示す数値)が高止まりすることです。同時に、未知のデータに対する誤差であるテスト誤差(モデルがまだ見たことのない新しいデータに対してどれくらい間違えるかを示す数値)も大きい値のまま高止まりするという関係にあります。この関係は、モデルの学習状況を見分ける基本的な物差しとして扱われます。

原因としては3点が挙げられ、それぞれに対応する手立てがあります。原因と対策を並べると、次のように整理できます。

未学習の原因 対応する手立て
モデルの表現力が不足している モデルをより複雑な構造に変更して表現力を高める
予測の手がかりとなる特徴量が学習データに含まれていない 特徴量を追加する
学習の繰り返し回数であるエポック数(同じ学習データを繰り返し学習させた回数)が少なく、学習が十分に進んでいない 学習を十分な回数まで行う

いずれの対策も、モデルの表現力か学習量を増やす方向の対応にあたります。

ここで注意したいのが、対策の向きです。過学習対策として使われる正則化(モデルが複雑になりすぎないよう制限をかける手法)やドロップアウト(学習の際に一部のニューロンを意図的に無効にしてモデルを単純化する手法)は、いずれもモデルを単純化する方向の手法にあたります。こうした手法を未学習の状態で使うと、表現力をさらに削ることになり、かえって逆効果になります。

3. 関連概念との比較・相違点

過学習(オーバーフィッティング。モデルが訓練データに適合しすぎて未知のデータへの対応力を失う状態)との最大の違いは、モデルが単純すぎるか複雑すぎるかという方向性にあります。両者は訓練誤差の大小が逆になる、対称的な関係にあります。

誤差の出方まで含めて並べると、対称性がはっきりします。

観点 未学習 過学習
モデルの複雑さ 単純すぎる 複雑すぎる
訓練誤差 大きいまま 小さくなる
テスト誤差(未知データへの誤差) 大きいまま かえって大きくなる
調整の方向 表現力を高める 表現力を抑える

この対比は、モデルの複雑さをどちらの方向に調整すべきかを判断する手がかりになります。

モデルの表現力やバイアス(予測結果が真の値からどれだけずれて偏っているかを示す度合い)という観点からも、未学習は説明されます。未学習はモデルの表現力が不足している状態と言い換えられ、統計学でいう「バイアスが高い状態」に近いものです。表現力が不足するほどバイアスは大きくなる関係にあり、この対応づけも押さえておきたいポイントです。

バイアスの大小は、モデルの複雑さをどの程度に設定するかという設計判断と直結しています。過学習やバイアスそのものの詳しい仕組みは、それぞれ別の用語として個別に整理されています。

4. ビジネス・実務での活用シナリオ

需要予測や価格予測の分野では、季節性など複雑な変動要因を持つ売上データに単純な線形モデルを当てはめると、繁忙期・閑散期の変動をとらえられず、過去データに対する予測でさえ大きく外れることがあります。こうした場合は、モデル選定そのものの見直しが必要な状態になります。予測の精度がそのまま在庫計画や仕入れ判断に直結するため、未学習のまま運用を続けることは業務上のリスクにつながります。

製造業の異常検知では、検査に使う特徴量が少なすぎたり、単純なモデルを使ったりすると、既知の不良パターンさえ正しく判定できず、検知漏れが訓練の段階から発生します。検知漏れは、出荷後に不良品が流出する事態につながりかねない弱点です。

AIプロジェクトの初期検証では、プロトタイプ段階で意図的に単純なモデルから始めることが多くあります。しかし、評価の時点で訓練データに対する誤差自体が大きい場合は、データ量の不足ではなく、モデルの構造や特徴量設計そのものに課題があると判断できます。この見極めは、次の開発フェーズでどこに手を入れるべきかを左右する分岐点になります。

5. 要点まとめ

  • 未学習(アンダーフィッティング)は、モデルの複雑さや学習量が不足し、訓練データのパターンすら十分に学習できていない状態で、訓練誤差・テスト誤差がともに大きくなります。
  • 過学習とは訓練誤差の大小が逆になる対称的な関係にあり、未学習はモデルが単純すぎる状態、過学習はモデルが複雑すぎて汎化性能が低下する状態として整理されます。
  • 対策はモデルの表現力を高めること、特徴量を増やすこと、学習を十分に行うことで、過学習対策である正則化やドロップアウトとは逆方向の対応になります。

6. 確認問題

問1未学習の状態では、訓練データに対する誤差だけでなく、未知のデータに対する誤差も大きい値になる。

解答・解説をみる

○ 正しい

未学習はモデルが訓練データのパターンを捉えきれていない状態のため、訓練誤差・テスト誤差ともに高止まりする関係にあります。過学習では訓練誤差だけが小さくなる点が、両者の違いです。

問2未学習を解消する対策として、モデルを単純化する正則化やドロップアウトを追加することが有効である。

解答・解説をみる

× 誤り

正則化やドロップアウトはモデルを単純化して過学習を防ぐ手法であり、すでに単純すぎる未学習の状態にはさらに単純化する方向に働くため逆効果になります。正しくは、モデルの表現力を高める、特徴量を追加する、学習を十分な回数まで行うといった対応です。

問3未学習は、曲線的な(非線形の)関係を持つデータに対して、直線的な線形モデルのような単純な構造のモデルを当てはめた場合に生じやすい。

解答・解説をみる

○ 正しい

モデルの表現力がデータの複雑さに対して不足すると未学習が生じます。曲線的な関係を持つデータに直線でしか対応できないモデルを当てはめる例は、その典型として扱われます。