1. 定義と概要
L1正則化とは、モデルの学習時に損失関数(モデルの予測のズレを数値で表す関数)へ、重みの絶対値の合計(L1ノルム)を罰則項として加える正則化手法です。ここでいう重みとは、モデルが入力のどの部分をどれだけ重視するかを表す数値のパラメータのことです。罰則項を加えることで重みが大きくなりすぎることを防ぎ、過学習(学習データに合わせすぎて、未知のデータへの対応力が落ちてしまうこと)を抑えます。
それだけでなく、L1正則化には一部の重みをちょうど0にしやすいという性質があります。この性質により、予測への寄与が小さい特徴量(予測に使う入力データの各項目)の重みが完全に0になり、モデルから実質的に取り除かれます。この状態をスパース化と呼びます。
モデルの複雑さを抑える正則化の手法としては、重みの二乗の合計を罰則にするL2正則化が先に広く使われてきました。ただしL2正則化は重みを0に近づけるものの、完全な0にはしにくいという特徴があります。
一方、扱う特徴量が非常に多い高次元データでは、寄与の小さい特徴量を人手で見極めるのは容易ではありません。画像や自然言語のように入力の項目数が数千から数万に及ぶ領域では、なおさら人の目で取捨選択することは難しくなります。そこで、罰則の形をL1ノルムに変えることで重みをちょうど0にしやすくし、重要な特徴量だけを自動的に残すL1正則化が注目されるようになりました。
2. 試験対策ポイント
まず整理したいのは、L1正則化の罰則項の中身です。罰則項は重みの絶対値の合計であり、これをL1ノルムと呼びます。損失関数にこの罰則項を加えることで、大きすぎる重みにペナルティを課し、過学習を抑える仕組みです。罰則項が無い状態では、モデルは学習データの細かなノイズにまで合わせようとして重みが極端に大きくなりやすく、これが過学習の一因になります。
L1正則化の最大の特徴は、一部の重みをちょうど0にしやすい点にあります。重みが0になった特徴量はモデルの予測に使われなくなるため、不要な特徴量を自動的に切り捨てるスパース化・特徴選択の効果を持ちます。この性質は、L2正則化との比較における分かれ目です。人手で特徴量を選ぶ手間を減らせる点も、実務上の利点として合わせて理解しておきたい内容です。
L1正則化を線形回帰(入力の各項目に重みを掛けて足し合わせて予測する基本的な回帰手法)に組み込んだ手法はラッソ回帰と呼ばれます。同様にL2正則化を組み込んだ手法はリッジ回帰、両方の罰則項を組み合わせた手法はElastic Netと呼ばれ、この対応関係は取り違えやすい点です。罰則の種類と回帰手法の対応は、次のように整理できます。
| 罰則の種類 | 罰則項の中身 | 線形回帰に組み込んだ手法 |
|---|---|---|
| L1正則化 | 重みの絶対値の合計(L1ノルム) | ラッソ回帰 |
| L2正則化 | 重みの二乗の合計 | リッジ回帰 |
| 両方の組み合わせ | L1とL2の罰則項をあわせて用いる | Elastic Net |
つまりリッジ回帰(L2正則化を組み込んだ線形回帰の手法)とラッソ回帰は、罰則の形だけが入れ替わった関係にあり、名称と罰則を逆に覚えていないかを確かめておきたいところです。
正則化の強さは、正則化パラメータ(正則化の強さを調整するための係数)によって調整されます。この係数を大きくするほど罰則の影響が強まり、重みが0になりやすくなるという制御の仕組みも合わせて押さえておきたい内容です。反対に係数を0に近づけていくと、罰則の効果は弱まり、正則化を行わない通常の回帰に近い挙動へと変化していきます。
3. 関連概念との比較・相違点
L2正則化との最大の違いは、罰則の形と、その結果として重みに起こる変化にあります。L1正則化は重みの絶対値の合計を罰則にし、一部の重みをちょうど0にしてスパース化を起こします。一方、L2正則化は重みの二乗の合計を罰則にし、重みを全体的に小さく縮めますが、完全な0にはしにくいという違いがあります。
両者の違いを軸ごとに並べると、次のようになります。
| 比較の軸 | L1正則化 | L2正則化 |
|---|---|---|
| 罰則項の形 | 重みの絶対値の合計 | 重みの二乗の合計 |
| 重みに起こる変化 | 一部がちょうど0になる(スパース化) | 全体的に小さく縮むが0にはなりにくい |
| 向いている場面 | 特徴量を減らして解釈しやすいモデルを作りたいとき | 重みを滑らかに抑えて安定した予測を狙いたいとき |
どちらも過学習を抑えるという目的は共通しており、選び分けの基準になるのは狙いたいモデルの姿です。特徴量同士の相関が強いデータでは、L2正則化のほうが結果が安定しやすいという違いも知られています。
ラッソ回帰との違いは抽象度にあります。L1正則化は罰則の仕組みそのものを指す概念であり、ラッソ回帰はL1正則化を線形回帰に適用した具体的な回帰手法を指します。つまりL1正則化は手段であり、ラッソ回帰はその手段を用いて作られたモデルという関係にあります。
この抽象度の違いは、両者を同じ意味で混同しやすい点として注意が向けられます。L1正則化という仕組み自体は線形回帰以外のモデルにも組み込むことができ、適用範囲はラッソ回帰よりも広いという点も対比の軸になります。
4. ビジネス・実務での活用シナリオ
マーケティング・小売の現場では、購買予測モデルに数百種類の顧客属性・行動データを説明変数(予測に使う入力データの項目)として投入することがあります。ここでL1正則化を使うと、寄与の小さい変数の重みが0になり、重要な変数だけが残るシンプルなモデルになります。変数が絞られたモデルは、どの要因が購買に影響しているかを人が解釈しやすいという特徴を持ち、施策の立案にもつなげやすくなります。
医療・創薬の分野では、遺伝子発現データのように説明変数の数が非常に多い研究が扱われます。L1正則化を用いると重要な遺伝子(特徴量)だけを絞り込むことができ、どの要因が結果に影響しているかを解釈できるようになります。数千から数万に及ぶ変数の中から意味のある変数を見つける場面で、この性質が生きます。臨床研究のように扱えるサンプル数が限られる領域でも、変数を絞り込む効果は分析の助けになります。
金融の与信スコアリングモデルでは、多数の指標を扱う場面があります。L1正則化により重要度の低い指標の重みが自動的に0になり、モデルをシンプルに保ちながら過学習を抑えられます。指標が絞られることは、審査結果の説明責任が求められる金融業務との相性がよい特徴です。どの指標が審査結果に影響したかを示しやすくなる点は、規制対応の観点からも意味を持ちます。
5. 要点まとめ
- L1正則化は重みの絶対値の合計(L1ノルム)を罰則として損失関数に加える手法で、一部の重みをちょうど0にしやすくスパース化につながります。
- L2正則化(重みの二乗の合計を罰則にし重みを全体的に小さくするが0にはしにくい)との違いが比較の軸になります。
- L1正則化を回帰に用いた手法がラッソ回帰であり、L2正則化を用いたリッジ回帰・両方を組み合わせたElastic Netという対応関係を整理しておきたいところです。
6. 確認問題
問1L1正則化は、重みの絶対値の合計を損失関数に罰則項として加える手法である。
解答・解説をみる
○ 正しい
L1正則化の罰則項は重みの絶対値の合計(L1ノルム)であり、これを損失関数に加えることで過学習を抑えます。罰則の形が異なるL2正則化との対比で理解しておきたい基本の定義です。
問2L1正則化は、一部の重みをちょうど0にしやすい性質を持ち、スパース化につながる。
解答・解説をみる
○ 正しい
L1正則化の最大の特徴は重みをちょうど0にしやすい点にあります。不要な特徴量を自動的に切り捨てるスパース化・特徴選択の効果を持ちます。
問3L1正則化を用いた回帰手法はリッジ回帰と呼ばれる。
解答・解説をみる
× 誤り
正しくはラッソ回帰です。リッジ回帰はL2正則化を用いた回帰手法であり、L1とL2の対応関係を逆にした記述は取り違えやすい典型です。

