1. 定義と概要
正則化(Regularization)とは、機械学習モデルが訓練データに過剰に適合すること(過学習。訓練データに合わせすぎて未知のデータへの予測精度が落ちてしまうこと)を防ぐため、損失関数(モデルの予測が正解からどれだけずれているかを数値で表す指標)に「モデルの複雑さに応じた罰則」を加える手法の総称です。具体的には、パラメータ(重み。モデルが学習によって決める数値で、大きくなりすぎるとモデルが複雑になりすぎます)が大きくなりすぎないよう抑える項を損失関数に足し、その罰則込みの値を最小にするように学習を進めます。
代表例は、重みの絶対値の合計を罰則として使うL1正則化と、重みの二乗の合計を罰則として使うL2正則化の2つです。どちらも回帰分析(データの傾向から数値を予測する分析)だけでなく、ニューラルネットワークを含む幅広いモデルに適用できます。
従来の機械学習モデルは、訓練データに対する誤差だけを小さくするように学習していました。パラメータ数が多く複雑なモデルほど訓練データの細かいノイズまで覚え込みやすく、汎化性能(学習に使っていない新しいデータに対してもうまく予測できる能力)が落ちる過学習に陥りやすいという課題があります。モデルが訓練データの平均的な傾向ではなく個々のデータ点の癖まで覚えてしまうと、実運用の場面で精度が大きく落ち込むことがあります。
この課題に対して、損失関数に罰則項を加えて重みの大きさを抑える正則化という工夫が広く使われるようになりました。損失を減らすことだけを目指すとモデルが訓練データに合わせすぎてしまうため、複雑になりすぎないよう罰則を科すという発想です。
2. 試験対策ポイント
まず押さえておきたいのは、正則化の目的が過学習の抑制と汎化性能の向上にあるという点です。損失関数に罰則項を加え、パラメータが大きくなりすぎないよう抑える仕組みが正則化の柱になります。罰則を加えないまま学習を進めると、モデルは訓練データの誤差をひたすら小さくしようとして複雑になりすぎる方向に傾きます。
代表的な2手法であるL1正則化とL2正則化の違いも重要な論点です。L1正則化(ラッソ回帰)は、重みの絶対値の合計を罰則として使い、一部の重みをちょうど0にする効果を持ちます。これは予測にあまり役立たない変数を自動的に取り除く特徴選択(不要な変数を削り重要な変数だけを残す働き)と呼ばれる効果です。
一方のL2正則化(リッジ回帰)は、重みの二乗の合計を罰則として使い、重みを0にはせず全体的に小さく縮めます。L1正則化を使う線形回帰はラッソ回帰、L2正則化を使う線形回帰はリッジ回帰と呼ばれます。
両方を組み合わせた手法はElastic Net(L1正則化とL2正則化を組み合わせた手法)と呼ばれ、特徴選択の効果と重みを縮める効果をあわせ持ちます。数式そのものではなく、名称と使い分けのイメージが要点になります。
正則化以外の過学習対策との位置づけも整理しておきたい論点です。ドロップアウト(学習の際にニューロンの一部を確率的に無効化する過学習対策)や早期終了(検証データの誤差が悪化し始めた時点で学習を打ち切る過学習対策)といった手法があります。データ拡張(訓練データに加工を加えて水増しする過学習対策)やアンサンブル学習(複数のモデルの予測を組み合わせて精度を高める手法)も同様の対策です。これらと並び、正則化は損失関数に手を加えるアプローチとして整理されます。
また、正則化の強さは正則化係数と呼ばれるハイパーパラメータで調整します。値を大きくすると罰則が強く効きモデルは単純になる方向に働き、小さくすると罰則が弱く過学習が残りやすい方向に働くというトレードオフの関係にあります。
3. 関連概念との比較・相違点
過学習との最大の違いは、正則化が過学習という現象そのものではなく、過学習を防ぐための対策手法の一つという関係にある点です。過学習は訓練データに合わせすぎて未知のデータへの予測精度が落ちてしまう現象であり、正則化はそれを防ぐために損失関数へ罰則を加える手立てです。原因と対策という別のレイヤーにある概念であり、両者は混同しやすい組み合わせです。
L1正則化とL2正則化の最大の違いは、罰則の掛け方にあります。両者を観点ごとに並べると、次のように対応しています。
| 観点 | L1正則化(ラッソ回帰) | L2正則化(リッジ回帰) |
|---|---|---|
| 罰則に使う値 | 重みの絶対値の和 | 重みの二乗和 |
| 重みへの効き方 | 一部の重みをちょうど0にする | 0にはせず全体的に縮める |
| 得られる効果 | 不要な変数を削る特徴選択 | すべての変数を少しずつ残す |
ラッソ回帰とリッジ回帰という呼び名の違いとあわせて、取り違えやすい対比です。どちらを選ぶかは、変数を絞り込みたいか、すべての変数を少しずつ残したいかという目的によって変わります。
ドロップアウトやデータ拡張など他の過学習対策との違いも整理しておきたい点です。狙いはいずれも過学習の抑制で共通していますが、モデルのどこに手を加えるかが分かれます。
| 対策 | 手を加える対象 | 具体的なアプローチ |
|---|---|---|
| 正則化 | 損失関数 | 罰則項を加えて重みの大きさを抑える |
| ドロップアウト | ネットワーク構造 | ニューロンを一部無効化する |
| データ拡張 | データ | 訓練データ自体を増やす |
同じ狙いを、損失関数・ネットワーク構造・データという別々の場所への働きかけで実現している点が対比の要になります。実務ではこれらを単独ではなく組み合わせて使う場面も少なくありません。
4. ビジネス・実務での活用シナリオ
金融の与信スコアリング(顧客の返済能力を評価してスコア化する業務)では、限られた顧客データで与信モデルを作る際に正則化が使われます。正則化によって変数の影響を絞り込み単純なモデルにすることで、未知の申込者に対しても安定した審査精度を保てます。変数を絞り込む理由は、複雑すぎるモデルほど手元のデータの癖まで覚え込み、初めて申し込む顧客への判定がぶれやすくなるためです。
マーケティングの需要予測では、広告費・季節・競合価格など多数の説明変数(予測に使う入力側の変数)を使う回帰モデル(数値を予測するモデル)にL1正則化を組み込みます。影響の薄い変数の重みを自動的に0へ近づけることで、解釈しやすいモデルに整理できます。担当者が要因を説明する場面でも、絞り込まれた少数の変数だけを根拠に示せるという実務上の効果があります。
医療・創薬のバイオマーカー探索(病気の兆候を示す生体指標を見つける研究)では、サンプル数に対して特徴量(予測に使う個々の変数)が非常に多いデータを扱います。遺伝子発現データなどがその代表例です。正則化により少数の重要な特徴量に絞り込むことで過学習を抑え、少ないサンプルでも再現性のある結果を得られます。
5. 要点まとめ
- 正則化は損失関数に罰則項を加え、モデルの重みが大きくなりすぎないよう抑えることで過学習を防ぎ、汎化性能を高める手法です。
- L1正則化(ラッソ回帰)は重みを0にする特徴選択効果、L2正則化(リッジ回帰)は重みを全体的に縮める効果という違いがあり、両者を組み合わせた手法はElastic Netと呼ばれます。
- 正則化はドロップアウトや早期終了、データ拡張などと並ぶ過学習対策の一つであり、正則化の強さは正則化係数というハイパーパラメータで調整します。
6. 確認問題
問1正則化は、損失関数にモデルの複雑さに応じた罰則(ペナルティ)を加えることで過学習を抑える手法である。
解答・解説をみる
○ 正しい
正則化は損失関数へ罰則項を追加し、重みが大きくなりすぎないよう抑えることで未知データへの汎化性能を高める手法です。過学習対策の代表的な手法として整理されます。
問2L1正則化は重みを完全に0にすることはなく、全体的に小さく縮める効果を持つ。
解答・解説をみる
× 誤り
重みをちょうど0にして特徴選択の効果を持つのはL1正則化です。重みを0にはせず全体的に縮めるのはL2正則化であり、この問題文はL1とL2の説明が入れ替わっています。
問3正則化の強さを調整するハイパーパラメータの値を大きくするほど、モデルは単純になる方向に働く。
解答・解説をみる
○ 正しい
正則化係数を大きくすると罰則が強く効き、重みが小さく抑えられるためモデルは単純化する方向に働きます。大きくしすぎると学習不足に陥る点も関連する論点です。

