リッジ回帰 (G検定)

リッジ回帰

1. 定義と概要

リッジ回帰とは、線形回帰にL2正則化を組み合わせた回帰分析(説明変数から目的変数を予測する統計的な手法の総称)の手法です。線形回帰は、説明変数(予測に使う手がかりとなる入力側のデータ項目)と目的変数(予測したい結果側のデータ項目)の関係を直線的な式で表して予測する、回帰分析の基本的な手法です。

学習の際には、予測の誤差を小さくすることに加えて、回帰係数(各説明変数が予測結果にどれくらい影響するかを表す数値、いわば重み)の大きさそのものにも罰則を科します。この、誤差だけでなく係数の大きさにも罰則を加えて学習を調整する考え方が正則化と呼ばれ、リッジ回帰はそのうちのL2正則化、つまり回帰係数を二乗して合計した値をペナルティとして加える方式を用います。二乗して合計した値に比例するペナルティを、学習の目的関数(学習で小さくすることを目指す、予測のズレと罰則を合わせた指標)に加えることで、特定の係数だけが極端に大きくなることを抑え、モデルを安定させます。

たとえば住宅価格を面積・築年数・駅からの距離など複数の特徴量(説明変数として使う個々のデータ項目)から予測するモデルにリッジ回帰を適用すると、一部の特徴量の重みだけが突出することを防ぎ、未知のデータに対しても崩れにくいモデルになります。

通常の線形回帰は、訓練データに対する誤差を最小にするよう回帰係数を決めます。しかし特徴量の数が多い場合や特徴量同士の相関が強い場合には、係数が極端な値をとりやすくなります。その結果、訓練データに適合しすぎて未知のデータへの予測精度が落ちてしまう過学習(訓練データに適合しすぎて、未知のデータへの予測精度が落ちてしまう状態)が起きやすくなります。

この課題に対して、係数の大きさにも罰則を加えて全体的に小さく抑えるという発想が広がり、その代表的な方式の一つであるL2正則化を線形回帰に組み込んだ手法が、リッジ回帰にあたります。

2. 試験対策ポイント

G検定では、リッジ回帰を「線形回帰にL2正則化を組み合わせた手法」という位置づけで捉えているかが重要な論点になります。L2正則化そのものの仕組み、つまり目的関数に罰則項を加えるという考え方は、正則化という上位概念の一つとして理解しておく必要があります。

L2正則化の性質として、回帰係数は全体的に小さく抑えられますが、ちょうどゼロにはなりにくいという特徴があります。そのため、影響の小さい特徴量も含めて、すべての説明変数がモデルに残り続ける点は押さえておきたいポイントです。

また、説明変数同士が強く相関し合う多重共線性(説明変数同士が強く相関し合い、係数の推定が不安定になる状態)の状況でも、リッジ回帰は回帰係数を安定して推定できる対処法の一つとして扱われます。相関の強い説明変数どうしに重みを分け合う形で、安定した推定を実現する仕組みです。

回帰係数をちょうどゼロにできるラッソ回帰(回帰係数の絶対値の合計をペナルティとして加え、重要度の低い係数をちょうどゼロにできる正則化つきの回帰手法)との対比は、ここでの要点になります。両者を組み合わせた「Elastic Net」(L2正則化とL1正則化を組み合わせた、リッジ回帰とラッソ回帰の折衷にあたる手法)との関係も、あわせて整理しておきたいところです。

3. 関連概念との比較・相違点

関連概念との比較で最大の違いになるのは、正則化の種類です。リッジ回帰が用いるのはL2正則化で、回帰係数の二乗の合計にペナルティを課します。これに対しラッソ回帰が用いるのはL1正則化で、回帰係数の絶対値の合計にペナルティを課します。

罰則のかけ方の違いは、そのままモデルに残る説明変数の顔ぶれの違いとして表れます。3つの手法の対応関係を整理すると、次のようになります。

手法 正則化の種類 ペナルティの中身 回帰係数への効き方
リッジ回帰 L2正則化 回帰係数の二乗の合計 全体的に小さくなるが、ちょうどゼロにはなりにくい
ラッソ回帰 L1正則化 回帰係数の絶対値の合計 重要度の低い係数がちょうどゼロになり、特徴量を絞り込める
「Elastic Net」 L2正則化とL1正則化の併用 二乗の合計と絶対値の合計を同時に加える 多重共線性への安定性と特徴量選択の効果を両立させる

リッジ回帰はすべての説明変数を残す方向に働き、ラッソ回帰は不要な説明変数を落とす方向に働きます。似た枠組みでありながら、モデルにどの説明変数を残すかという結果が大きく異なる点が、両者を取り違えやすい理由です。

リッジ回帰とラッソ回帰の間に位置づけられるのが「Elastic Net」です。L2正則化とL1正則化を同時に組み合わせた手法で、リッジ回帰の強みである多重共線性への安定性と、ラッソ回帰の強みである特徴量選択の効果を両立させる折衷案という位置づけにあります。

3つの手法は罰則のかけ方が異なるだけで、目的自体は過学習を抑えてモデルを安定させることで共通しており、係数の大きさをどう扱うかという一点で使い分けが決まる関係にあります。

4. ビジネス・実務での活用シナリオ

マーケティング・需要予測の分野では、広告費・気温・曜日など互いに連動しやすい複数の販促要因を説明変数とする需要予測モデルに、リッジ回帰が使われます。気温の上昇と広告費の増加が同じ週に重なるといったように要因同士が連動して動く場面でも、特定の要因だけに予測が過度に引っ張られることを防ぎ、発注量や仕入れ量の見積もりに使える安定した予測結果を得られる点が実務上の利点です。

不動産価格の査定でも、築年数・延床面積・駅からの距離のように相関しやすい物件属性を多数投入した価格査定モデルに、リッジ回帰が用いられます。駅から近い物件ほど延床面積も広くなりやすいといったように物件属性同士が絡み合っていても、一部の属性の重みだけが不自然に膨らむことを避けられるため、査定額の内訳を顧客に説明する場面でも根拠を保てる効果があります。

金融・信用スコアリングの領域では、年収・勤続年数・借入残高のように相関しやすい複数の属性を扱う与信モデルに、リッジ回帰が適用されます。勤続年数が長いほど年収も高くなりやすいといった相関があっても、審査のたびにスコアが特定の項目だけに大きく左右される事態を避けられ、特定の項目に極端に依存しない安定したスコアリングを実現できる点が評価されています。

5. 要点まとめ

  • リッジ回帰は、線形回帰にL2正則化(回帰係数の二乗の合計にペナルティを課す方式)を組み合わせた回帰分析の手法です。
  • 回帰係数は全体的に小さく抑えられますが、ちょうどゼロにはなりにくく、すべての説明変数がモデルに残り続けます。
  • 説明変数同士が強く相関する多重共線性への対処法の一つとして扱われ、係数をゼロにできるラッソ回帰(L1正則化)、両者を組み合わせた「Elastic Net」との違いをセットで押さえておきたい点です。

6. 確認問題

問1リッジ回帰とは、線形回帰の学習に、回帰係数の二乗の合計をペナルティとして加えるL2正則化を組み合わせた手法である。

解答・解説をみる

○ 正しい

定義のとおりです。正則化という上位概念のうち、罰則項を係数の二乗の合計とする方式がL2正則化であり、これを線形回帰に用いた手法がリッジ回帰にあたります。

問2リッジ回帰はL2正則化の性質により、重要度の低い説明変数の回帰係数がちょうどゼロになり、モデルから自動的に取り除かれる。

解答・解説をみる

× 誤り

誤りです。回帰係数をちょうどゼロにして特徴量を自動的に絞り込めるのは、L1正則化を用いたラッソ回帰の性質です。正しくは、リッジ回帰(L2正則化)は係数を全体的に小さくするものの、ちょうどゼロにはなりにくく、すべての説明変数がモデルに残り続けるという性質を持ちます。両者を取り違えやすいポイントです。

問3リッジ回帰は、説明変数同士の相関が強い多重共線性の状況でも、回帰係数を比較的安定して推定できる対処法の一つとして扱われる。

解答・解説をみる

○ 正しい

多重共線性が生じると、通常の線形回帰では係数の推定が不安定になりやすくなります。リッジ回帰は、相関の強い説明変数どうしに重みを分け合う形で、安定した推定を可能にします。