バリアンス (G検定)

バリアンス

1. 定義と概要

バリアンスとは、訓練データの選び方を変えたときに、モデルの予測結果がどれだけ変動するかを表す指標です。モデルが訓練データに含まれる細かな特徴やノイズまで拾って学習してしまうほど、バリアンスは大きくなります。

例えば、同じ課題に対して異なる訓練データで学習した複数のモデルを比べたとき、それぞれの予測結果が大きくばらついている状態はバリアンスが高い状態にあたります。学習に使うデータを少し入れ替えただけで予測が変わってしまうモデルは、それだけデータの偶然の偏りに引きずられているといえます。

従来、モデルの精度を高めるにはより複雑な構造を採用すればよいと考えられてきました。しかし、モデルを複雑にしすぎると、訓練データの細部やノイズまで学習してしまい、訓練データでは高精度でも未知のデータでは精度が落ちる現象が起こります。これは過学習(オーバーフィッティング。訓練データに合わせすぎて、新しいデータにはうまく対応できなくなること)と呼ばれる状態です。

この現象を整理する枠組みとして、モデルの予測誤差をバイアス・バリアンス・ノイズという3つの要素に分けて捉える考え方が使われています。この分解を知っておくと、モデルの精度が思うように上がらないときに、原因がどこにあるのかを見分ける手がかりになります。

2. 試験対策ポイント

G検定の重要な論点になるのは、バリアンスが高い状態と過学習の結びつきです。バリアンスが高いモデルは訓練データに強く適合するため、訓練データに対する予測精度は高くなります。一方で、未知のデータに対しては予測が安定せず、精度が下がりやすいという関係にあります。逆にバリアンスが低いモデルは、訓練データが変わっても予測結果が大きくぶれにくいという性質を持ちます。

モデルの予測誤差は、汎化誤差(学習に使っていない新しいデータに対する予測の誤差)と呼ばれ、バイアス・バリアンス・ノイズという3つの要素に分解して説明されます。3つは誤差の出どころがそれぞれ違うため、次のように並べて切り分けておきたいところです。

要素 誤差の中身 誤差の出どころ
バイアス モデルの表現力不足による系統的なずれ モデルが単純すぎること
バリアンス 訓練データの選び方による予測のばらつき モデルが複雑すぎること
ノイズ データ自体に含まれる誤差 データそのもの。手法の工夫では取り除けない

この3つの切り分けが押さえておきたいポイントです。バイアスとバリアンスはモデルの設計しだいで動かせるのに対し、ノイズだけはモデル側から手を出せないという違いも、あわせて意識しておくと整理しやすくなります。

バイアスとバリアンスは、一方を減らそうとするともう一方が増えるトレードオフの関係にあります。モデルを複雑にするとバリアンスは増え、バイアスは減ります。逆にモデルを単純にすると、バイアスは増えてバリアンスは減ります。

この関係を踏まえたうえで、バリアンスを抑える手法として、正則化(モデルの複雑さにペナルティを与えて調整する手法)、アンサンブル学習(バギング)、そして訓練データを増やすことの3点が柱になります。アンサンブル学習(バギング)とは、複数のモデルの予測を組み合わせて、1つのモデルより安定した結果を出す手法のことです。

3. 関連概念との比較・相違点

バイアスとの最大の違いは、モデルが複雑すぎることに起因するか、単純すぎることに起因するかという点にあります。バリアンスは、モデルが複雑すぎて訓練データの選び方に予測が振り回される状態で、過学習と結びつきます。

バイアスは、モデルが単純すぎて予測全体が系統的にずれる状態で、未学習(アンダーフィッティング)と結びつきます。未学習(アンダーフィッティング)とは、モデルが単純すぎてデータの傾向を十分に捉えられていない状態のことです。両者は独立した誤差ではなく、一方を減らすと他方が増えるトレードオフの関係にある点が、ここでの要点です。

ノイズとの違いも混同しやすい点です。バリアンスはモデルの学習の仕方に起因する誤差であり、正則化やアンサンブル学習などモデル側の工夫によって抑えることができます。これに対してノイズは、データそのものに含まれる誤差であり、モデルをどれだけ改善しても取り除くことができません。この性質から、ノイズは還元不可能な誤差とも呼ばれます。バリアンスを下げる工夫を積み重ねても、ノイズに由来する誤差だけは残り続けるという関係にあります。

統計学で使われる分散との関係も、混同を避けるうえで整理しておきたい点です。統計学における分散は、あるデータの集合が平均値からどれだけ散らばっているかを表す指標です。機械学習の文脈で使われるバリアンスは、この分散の考え方を応用し、訓練データの選び方を変えたときにモデルの予測結果がどれだけ散らばるかを捉えるものです。

対象がデータそのものか、モデルの予測結果かという違いはありますが、どちらも「ばらつきの大きさ」を測るという発想では共通しています。バイアス・バリアンス・ノイズの分解は、この分散という統計学の考え方を機械学習のモデル評価に応用した枠組みといえます。

4. ビジネス・実務での活用シナリオ

需要予測・在庫管理の分野では、直近の販売データに合わせすぎたモデルが季節変動などの安定した傾向を捉えにくくなり、急な欠品や過剰在庫の予測を外す原因になります。バリアンスを抑えた設計にすることで、目先の変動に振り回されにくい、安定した需要予測につながります。発注量や仕入れ計画の見直しサイクルを頻繁に変えずに済むという点も、現場にとっての利点です。

与信・スコアリングの分野でも、バリアンスの制御は運用の安定性に直結します。審査モデルが訓練データに含まれる特定の顧客層の癖まで学習してしまうと、新規顧客に当てはめたときのスコアが不安定になりやすくなります。正則化やアンサンブル学習でバリアンスを抑えることは、多様な顧客層に対して一貫した審査結果を返すための土台になります。審査基準の一貫性は、利用者からの信頼にも関わる要素です。

画像検品・外観検査の現場では、限られた枚数の訓練画像に合わせてモデルを複雑にしすぎると、訓練時に写っていなかった照明条件や角度の製品画像で誤検知が増えやすくなります。データ拡張(既存の画像を回転・反転させるなどして訓練データを人工的に増やす手法)や正則化によってバリアンスを抑えることは、現場の多様な撮影条件に耐える検査精度の安定に関わります。検査ラインごとに設定を作り直す手間を減らせる点も、実務上の価値につながります。

5. 要点まとめ

  • バリアンスとは、訓練データの選び方によってモデルの予測がどれだけばらつくかを表す指標で、バリアンスが高い状態は過学習と結びつきます。
  • モデルの予測誤差はバイアス・バリアンス・ノイズの3要素に分解でき、バイアスとバリアンスはトレードオフの関係にあります。
  • バリアンスを抑える手法として、正則化・アンサンブル学習(バギング)・訓練データを増やすことの3点が挙げられます。

6. 確認問題

問1バリアンスが高いモデルは、訓練データに対する予測精度が高い一方で、未知のデータに対する予測精度が低下しやすい。

解答・解説をみる

○ 正しい

バリアンスが高い状態は過学習と結びつきます。訓練データには強く適合するため訓練誤差は小さくなる一方、未知のデータでは予測が安定せず汎化誤差が大きくなりやすくなります。

問2バリアンスを抑える手法として、正則化やアンサンブル学習(バギング)、訓練データを増やすことが挙げられる。

解答・解説をみる

○ 正しい

正則化はモデルの複雑さを抑え、バギングは複数モデルの予測を平均してばらつきを減らします。訓練データを増やすことも個々のデータの影響を相対的に小さくし、バリアンスを抑える方向に働きます。

問3バリアンスはデータそのものに含まれる誤差であり、モデルを改善しても取り除くことはできない。

解答・解説をみる

× 誤り

この性質はノイズ(還元不可能な誤差)の説明であり、バリアンスとは異なります。正しくは、バリアンスはモデルの学習の仕方に起因する誤差で、正則化やアンサンブル学習などモデル側の工夫によって抑えることができます。バリアンスとノイズは混同しやすい点です。