1. 定義と概要
L2正則化とは、モデルの学習において、予測のズレの大きさを表す損失関数に、重みの大きさに応じた罰則項を加えることで、重みが大きくなりすぎないように抑える正則化の一つです。正則化とは、モデルが複雑になりすぎないように制約をかける手法の総称です。
罰則項には、各重みを2乗してすべて合計した値を用います。この合計の平方根を取った値はL2ノルム(重みの大きさ全体を1つの数値にまとめた指標で、ユークリッド距離とも呼ばれます)に一致するため、L2正則化という名前が付いています。
具体例として、通常の線形回帰(入力の値とその重みの合計から出力を予測する基本的な回帰モデル)にこの罰則項を加えた手法は、リッジ回帰と呼ばれます。線形回帰にかぎらず、重みを持つさまざまなモデルの学習に、L2正則化を組み込むことができます。
損失を最小化するだけの学習では、訓練データの細部にまで過度に適合してしまう過学習(オーバーフィッティング。訓練データに適合しすぎて未知のデータへの対応力が下がること)が起こりやすくなります。学習データの細かな癖まで再現しようとするほど、重みの値は極端に大きくなりやすいためです。
そこで、重みの大きさそのものに制約をかけ、モデルをなめらかに保つ発想の正則化が、L1正則化やL2正則化といった形で用いられてきました。L2正則化は、罰則項を重みの2乗の合計とする点が特徴であり、重みを全体的に小さく抑えることによって過学習を抑制するといえます。
2. 試験対策ポイント
まず整理しておきたいのは、罰則項の形とその挙動です。L2正則化では、各重みを2乗してすべて合計した値を損失関数に加えます。合計の平方根を取らずに2乗のまま用いるのは、値がなめらかで学習時の勾配(損失を減らすためにパラメータをどちら向きにどれだけ動かせばよいかを示す傾き)の計算が安定するという理由もあわせて挙げられます。
この罰則項によって、重み全体をなだらかに小さくする方向に学習が働きますが、値をちょうど0にする効果は弱く、多くの重みが小さな値のまま残りやすいという特徴があります。重みが完全には0にならないため、一部の変数だけを取り除くような単純化には向きません。この挙動の違いは、L1正則化(重みの絶対値の合計を罰則に使い、重みをちょうど0にしやすい正則化手法)との対比で語られる重要な論点です。
L2正則化と線形回帰の対応関係も、取り違えやすい論点です。L2正則化を通常の線形回帰に組み込んだ手法名がリッジ回帰であり、正則化の種類であるL2正則化と手法名であるリッジ回帰は、考え方と具体的な手法という関係にあります。
あわせて、罰則項にかける係数である正則化パラメータ(罰則項の効き具合を調整する係数)を大きくするほど重みへの制約が強まり、小さくするほど通常の学習に近づくという調整の考え方も扱われます。この係数の設定は、訓練データへの当てはまりの良さと、重みへの制約の強さのバランスを取る作業といえるでしょう。
L2正則化は、過学習を抑えて汎化性能(未知のデータに対してどれだけ正しく予測できるかという能力)を高めるための手法の一つという位置づけにあります。他の過学習対策と並べると、抑え方の違いは次のように整理できます。
| 過学習対策 | 過学習の抑え方 |
|---|---|
| L2正則化 | 重みの2乗の合計を罰則項に加え、重み全体を小さく抑える |
| L1正則化 | 重みの絶対値の合計を罰則項に加え、重みをちょうど0にしやすくする |
| ドロップアウト | 学習時に一部のニューロンを無効化する |
| 早期終了 | 検証誤差が悪化し始めた時点で学習を打ち切る |
これらはいずれも、モデルを訓練データだけに特化させず、未知のデータにも対応できる状態に保つという共通の狙いを持っています。並べて紹介されることが多いため、それぞれの抑え方の違いをセットで覚えておきたいところです。
3. 関連概念との比較・相違点
L1正則化との最大の違いは、罰則項の形と、重みをちょうど0にするかどうかという挙動にあります。L1正則化は、罰則項に各重みの絶対値の合計を用いる手法であり、一部の重みをちょうど0にすることでモデルを単純化しやすいという性質(スパース化)を持ちます。一方でL2正則化は、罰則項に重みの2乗の合計を用いるため、重み全体をなだらかに小さくしますが、値をちょうど0にはしにくいという違いがあります。
観点ごとに並べると、両者の違いは次のようになります。
| 比較の観点 | L1正則化 | L2正則化 |
|---|---|---|
| 罰則項の形 | 各重みの絶対値の合計 | 各重みを2乗した値の合計 |
| 重みの挙動 | 一部の重みがちょうど0になる | 全体がなだらかに小さくなる |
| モデルの単純化 | 変数が絞られスパース化しやすい | 変数を取り除く単純化には向かない |
この罰則項の形と挙動の違いが、L1正則化とL2正則化を区別する手がかりになります。どちらの罰則項を使うかによって、学習後に得られる重みの分布そのものが変わってくるといえます。
リッジ回帰との関係は、考え方と具体的な手法という位置づけの違いです。L2正則化は正則化という手法の一種を指す名前であるのに対し、リッジ回帰は、そのL2正則化を通常の線形回帰に組み込んだ具体的な手法名です。つまり、L2正則化という考え方を実際のモデルで使う代表例がリッジ回帰にあたり、両者は同じものではなく、抽象的な手法名と、それを適用した具体的なモデル名という関係にあります。
4. ビジネス・実務での活用シナリオ
製造業の需要予測では、過去の販売実績から需要を予測する回帰モデル(入力データをもとに数値を予測する仕組み)にL2正則化を組み込む活用例があります。特定の説明変数(予測に使う入力項目)に極端に大きな重みが割り当たることを防ぐことで、季節変動など多少のデータの揺れがあっても、安定した予測が保たれます。突発的な要因で一部の数値が大きく振れても、予測結果全体が過剰に反応しにくくなるという効果です。
金融の与信・スコアリング分野では、相関の強い財務指標を多数含む与信スコアリングモデルにL2正則化を適用する例があります。変数同士が強く相関し合う多重共線性(説明変数同士が強く相関し合っていて、係数の推定が不安定になる状態)の影響を抑えることで、推定される重みが不安定になる事態を防ぎます。審査結果の妥当性を説明する場面でも、極端な重みが出にくいことは実務上の利点になるでしょう。
マーケティングの売上予測では、広告費・価格・季節要因など多数の変数を使う予測モデルにL2正則化が使われます。一部の変数だけに極端に依存させず、全体の変数をバランスよく使った予測になります。特定の施策だけを過大評価するリスクが減り、複数の要因を組み合わせた分析につながります。
5. 要点まとめ
- L2正則化は損失関数に各重みを2乗してすべて合計した罰則項を加え、重みが大きくなりすぎないように抑える正則化手法です。
- L1正則化と異なり、重み全体をなだらかに小さくするが値をちょうど0にはしにくく、この考え方を線形回帰に組み込んだ手法はリッジ回帰と呼ばれます。
- 過学習を抑えて汎化性能を高める目的で、L1正則化・ドロップアウト・早期終了など他の過学習対策と並べて扱われます。
6. 確認問題
問1L2正則化は、損失関数に各重みを2乗してすべて合計した値を罰則項として加える手法である。
解答・解説をみる
○ 正しい
罰則項の形がL2正則化の特徴です。この合計の平方根を取った値はL2ノルムやユークリッド距離と呼ばれる指標に一致します。
問2L2正則化を通常の線形回帰に組み込んだ手法は、リッジ回帰と呼ばれる。
解答・解説をみる
○ 正しい
L2正則化を線形回帰に適用した具体的な手法名がリッジ回帰であり、L2正則化とリッジ回帰は、考え方と具体的な手法という関係にあります。
問3L2正則化は、L1正則化と同様に多くの重みをちょうど0にしてモデルを単純化する効果を持つ。
解答・解説をみる
× 誤り
正しくは、L2正則化は重み全体をなだらかに小さくしますが、値をちょうど0にはしにくいという性質を持ちます。重みをちょうど0にしやすいのはL1正則化の特徴であり、この記述はL1正則化とL2正則化の挙動を取り違えています。

