1. 定義と概要
ラッソ回帰(Lasso回帰)とは、線形回帰にL1正則化(回帰係数の絶対値の合計にペナルティを与える手法で、一部の係数をちょうどゼロにできる)を適用した回帰分析(説明変数を使って目的変数を予測する統計的な手法の総称)です。損失関数(予測値と実際の値との誤差を数値化した指標)に回帰係数(それぞれの説明変数が予測結果にどれくらい影響するかを表す数値)の絶対値の合計をペナルティとして加える点が、通常の線形回帰との違いです。
ここでいう目的変数とは、予測したい対象となる数値(例えば、来月の売上高など)を指します。なお、モデルに入力する説明変数は、特徴量(予測に使う入力データの各項目を指す別の呼び方)とも呼ばれます。「Lasso」は「Least Absolute Shrinkage and Selection Operator」の略で、統計学者ロバート・ティブシラニが1996年に提案した手法とされています。
このペナルティによって、一部の回帰係数はちょうどゼロに定まります。そのため、モデルの構築と同時に、予測に効く説明変数(予測の元になる入力データの項目。例えば価格や広告費など)だけを残す「特徴量選択」(予測に役立つ説明変数だけを自動的に絞り込む処理)が自動的に行われる点が最大の特徴です。
線形回帰は説明変数の数が増えるほど訓練データに過剰適合する過学習(訓練データに合わせすぎて、新しいデータへの予測精度が落ちてしまう現象)を起こしやすく、不要な説明変数が混じるとモデルの解釈も難しくなります。この課題に対して、回帰係数の大きさそのものにペナルティを課して抑える正則化(モデルが訓練データに合わせすぎないよう、係数の大きさにペナルティを課す工夫)という考え方が使われています。
そのうちL1正則化を線形回帰に用いる手法が、ラッソ回帰にあたります。回帰係数をちょうどゼロにできる性質から、説明変数の数が多い高次元データでモデルを単純化する目的でも用いられます。説明変数の数が数百から数千に及ぶような場面では、この単純化の効果がとくに大きくなります。
2. 試験対策ポイント
理解するうえで中心になるのは、ラッソ回帰の最大の特徴である、L1正則化によって一部の回帰係数をちょうどゼロにできる点です。この性質によりモデルが不要な説明変数を自動的に除外する「特徴量選択(スパース化)」が実現し、多数の候補変数の中からモデルに効く変数だけを残せます。この特徴量選択の働きは、説明変数の数が多い高次元データほど効果を発揮します。
L1正則化とL2正則化(回帰係数の二乗の合計にペナルティを課す手法)は、ペナルティのかけ方の違いと、それぞれがもたらす効果の違いがセットで整理される論点です。この違いは、次節で扱うリッジ回帰(回帰係数の二乗の合計にペナルティを課すL2正則化を使った回帰分析の手法)との比較の柱になります。
ラッソ回帰は連続値を予測する回帰分析の一手法であり、分類問題に用いる手法ではない点も取り違えやすい点です。あくまで線形回帰の応用形という位置づけの理解が前提になります。
加えて、相関の強い説明変数群がある場合、ラッソ回帰はそのうち1つしか係数を残さず他をゼロにする性質があり、選ばれる変数がデータによって変わりやすい不安定さを持つ点も論点です。この不安定さは、相関の強い変数どうしのどちらを選ぶかが、データのわずかな違いで入れ替わりうることに起因します。
3. 関連概念との比較・相違点
リッジ回帰との最大の違いは、正則化の種類がL1かL2かという点と、回帰係数をちょうどゼロにできるかどうかという点にあります。ラッソ回帰はL1正則化を用いるため、不要な説明変数の係数をちょうどゼロにでき、結果として特徴量選択が自動的に行われます。一方、リッジ回帰はL2正則化を用いるため、回帰係数を小さく縮小することはできても、ちょうどゼロにはしにくいという性質を持ちます。
近い関係にある3つの手法を並べると、次のように整理できます。
| 手法 | 用いる正則化 | 回帰係数への効果 | 向いている場面 |
|---|---|---|---|
| ラッソ回帰 | L1正則化 | 一部の係数がちょうどゼロになる | 説明変数を絞り込みたいとき |
| リッジ回帰 | L2正則化 | 係数は小さく縮小されるがゼロにはなりにくい | すべての変数を緩やかに残したいとき |
| Elastic Net | L1正則化とL2正則化の組み合わせ | 相関の強い変数群でも安定して係数を絞り込める | 相関の強い説明変数群を扱うとき |
この違いから、説明変数を絞り込みたい場面ではラッソ回帰が、多重共線性(説明変数どうしが強く相関し合っている状態)を抑えながらすべての変数を緩やかに残したい場面ではリッジ回帰が選ばれる傾向にあります。解釈のしやすさを重視する場面ではラッソ回帰が、細かな係数の違いも保持したい場面ではリッジ回帰が向くという使い分けも可能です。
Elastic Net(L1正則化とL2正則化を組み合わせた回帰分析の手法)は、ラッソ回帰とリッジ回帰の両方の性質をあわせ持つ手法という位置づけです。ラッソ回帰単体には、相関の強い説明変数群がある場合にそのうち1つしか係数を残さず、選ばれる変数がデータによって変わりやすいという不安定さがあります。この手法はL2正則化の性質もあわせ持つことでこの弱点を緩和し、相関の強い変数群でも安定した変数選択を行いやすくなります。
4. ビジネス・実務での活用シナリオ
マーケティング・需要予測の分野では、広告媒体や季節要因、価格など多数の候補変数から売上に効く要因だけを自動的に絞り込む用途でラッソ回帰が使われます。モデルを単純に保ちながら要因分析を行えるため、施策の効果を説明しやすくなります。候補変数を絞り込む工程を人手ではなくラッソ回帰に任せることで、分析にかかる時間も抑えられます。
医療・創薬分野の研究では、多数の遺伝子発現量や検査項目の中から疾患リスクに関連する少数の変数を選び出す場面で活用されています。変数を絞り込むことで、解釈しやすいモデルを構築できます。遺伝子データのように説明変数の数が観測データの件数を上回る場面でも、モデルを単純化できる点が利点です。
金融・与信スコアリングの分野でも、顧客属性や取引履歴など多数の候補変数から与信判断に効く変数だけを残す目的でラッソ回帰が用いられます。不要な変数を除いたモデルは、なぜその判断に至ったかを説明しやすく、モデルの説明性を高めます。説明変数が絞り込まれたモデルは、審査結果の根拠を利用者や監督官庁に説明する際にも扱いやすくなります。
5. 要点まとめ
- ラッソ回帰は線形回帰にL1正則化を組み合わせた手法で、回帰係数の一部をちょうどゼロにすることで特徴量選択を自動的に行います。
- L2正則化を使うリッジ回帰は係数を縮小するがゼロにはしない点が、ラッソ回帰との主な違いとして整理されます。
- L1正則化とL2正則化を組み合わせた「Elastic Net」は、相関の強い説明変数群に弱いラッソ回帰単体の性質を補う手法として位置づけられます。
6. 確認問題
問1ラッソ回帰は線形回帰にL1正則化を適用した手法で、一部の回帰係数をちょうどゼロにすることで特徴量選択を自動的に行う。
解答・解説をみる
○ 正しい
L1正則化は回帰係数の絶対値の合計をペナルティとして加える手法で、この性質により一部の係数がちょうどゼロになり、モデルが不要な説明変数を自動的に除外します。
問2リッジ回帰はL1正則化を用いる手法であり、ラッソ回帰と同様に回帰係数をちょうどゼロにできる。
解答・解説をみる
× 誤り
誤りです。正しくは、リッジ回帰はL2正則化(回帰係数の二乗の合計をペナルティとする手法)を用いており、係数を小さく縮小することはできても、ちょうどゼロにすることはできません。回帰係数をゼロにできるのはL1正則化を用いるラッソ回帰の性質です。
問3Elastic Net(L1正則化とL2正則化を組み合わせた手法)は、相関の強い説明変数群に対するラッソ回帰の不安定な変数選択を補う位置づけにある。
解答・解説をみる
○ 正しい
正しい記述です。ラッソ回帰は相関の強い説明変数群から1つしか係数を残さない性質があり選択結果が不安定になりやすいため、L2正則化の性質もあわせ持つ「Elastic Net」がこの弱点を緩和します。

