線形回帰分析 (G検定)

線形回帰分析

1. 定義と概要

線形回帰分析とは、説明変数と目的変数の関係を一次式で表し、未知データの目的変数を予測する回帰分析の手法です。説明変数がひとつの場合を単回帰分析、2つ以上の場合を重回帰分析と呼びます。

回帰式には、切片(説明変数がゼロのときの目的変数の値にあたる定数)と回帰係数(各説明変数が目的変数にどれだけ影響するかを表す数値)が含まれます。目的変数の値は、切片に説明変数と回帰係数の積を足し合わせ、実際の値とのずれである誤差を加えた形で表されます。単回帰分析では説明変数がひとつのため回帰係数もひとつですが、重回帰分析では説明変数の数だけ回帰係数が式に加わります。

たとえば、部屋の広さから家賃を予測するモデルは単回帰分析にあたり、広さに加えて築年数や最寄り駅からの距離も説明変数に加えるモデルは重回帰分析にあたります。説明変数を増やすほど多くの要因を考慮できる一方で、回帰式全体の解釈はそのぶん複雑になります。

従来、2つの数値データの関係は、相関係数(2つのデータがどれだけ同じ方向に動くかを示す指標)で強さと向きを把握する程度にとどまっていました。しかし、未知のデータに対する具体的な数値予測が必要な場面が増えたことで、説明変数から目的変数を数式で予測する回帰分析(数値データ同士の関係を数式で表し、その関係から予測を行う分析手法)が発展してきました。

線形回帰分析はその中でも、説明変数と目的変数の関係を直線という単純な形で仮定するモデルであり、G検定のシラバスでは機械学習の具体的な手法のひとつとして扱われています。

2. 試験対策ポイント

まず整理したいのは、単回帰分析(説明変数がひとつ)と重回帰分析(説明変数が2つ以上)という呼び方の対応関係です。回帰式に含まれる切片は説明変数がゼロのときの目的変数の値にあたる定数、回帰係数は各説明変数が目的変数にどれだけ影響するかを表す数値です。

単回帰分析では回帰係数がひとつ、重回帰分析では説明変数の数に応じて回帰係数が複数になるという対応が、基本的な論点になります。説明変数の数と回帰係数の数が一致するという構造は、重回帰分析の全体像をつかむうえでの出発点です。この対応を、先ほどの家賃の例と合わせて並べておきます。

区分 説明変数の数 回帰係数の数 家賃予測の例
単回帰分析 ひとつ ひとつ 部屋の広さから家賃を予測する
重回帰分析 2つ以上 説明変数の数だけ 広さ・築年数・最寄り駅からの距離から家賃を予測する

呼び方が違っても、いずれも説明変数と目的変数の関係を一次式で表す線形回帰分析である点は共通しています。

回帰係数と切片をどう求めるかという論点では、最小二乗法という用語が中心になります。最小二乗法とは、残差(実際の値と予測値との差)を2乗して合計した残差平方和(残差を2乗して合計した値)が最小になるように、回帰係数と切片を決める方法です。この考え方は単回帰分析にも重回帰分析にも共通して用いられ、回帰式を実際のデータに当てはめる基本的な手続きにあたります。

重回帰分析に特有の注意点として、多重共線性(説明変数どうしの相関が強すぎることで回帰係数の推定が不安定になる現象)があります。予測の信頼性が低下する原因になるため、重回帰分析を行う際に確認すべき、単回帰分析にはない注意点です。

あわせて、名称に「回帰」を含むロジスティック回帰(確率をもとにデータを分類する手法)との違いも取り違えやすい点です。線形回帰は連続値(家賃や気温のように切れ目なく続く数値データ)を予測する回帰の手法であるのに対し、ロジスティック回帰はデータをクラスに分ける分類の手法にあたります。説明変数と目的変数の関係を曲線で捉える非線形回帰との対比も、あわせて扱われます。

3. 関連概念との比較・相違点

ロジスティック回帰との最大の違いは、名称に「回帰」を含みながら目的が異なる点にあります。線形回帰は連続値を予測する回帰の手法であるのに対し、ロジスティック回帰はシグモイド関数(結果を0から1の確率に変換する関数)を用いて確率を求め、その確率をもとに2値や多値のクラスへ分ける分類の手法です。同じ「回帰」という名前がついていても、扱う問題の種類そのものが異なります。

非線形回帰との違いは、説明変数と目的変数の関係を直線で仮定するか曲線で仮定するかという点にあります。線形回帰は関係を一次式、つまり直線や平面で表すモデルであるため、データの傾向が直線的でない複雑な関係には適合しにくいという制約があります。

こうした場合の候補になるのが、曲線的な関係を表現できる非線形回帰です。単純な形を仮定する分だけ、線形回帰は結果の解釈がしやすいという特徴も持ち合わせています。名前が似ている3つの手法を、目的と仮定する関係の形という2つの軸で並べると、区別がつけやすくなります。

手法 目的 仮定する関係の形
線形回帰 連続値の予測(回帰) 直線や平面で表す一次式
ロジスティック回帰 クラスへの分類 シグモイド関数で確率に変換する
非線形回帰 目的変数の予測(回帰) 曲線

このように、ロジスティック回帰は目的そのものが、非線形回帰は仮定する関係の形が、線形回帰と異なります。

単回帰分析と重回帰分析は、線形回帰という同じ枠組みの中で、説明変数の数によって呼び方が分かれる関係にあります。説明変数がひとつなら単回帰分析、2つ以上なら重回帰分析です。重回帰分析では説明変数を増やせるぶん、単回帰分析にはない多重共線性という追加の注意点が生じます。この構造の違いは、線形回帰という同じ手法の中での区分にあたります。

4. ビジネス・実務での活用シナリオ

不動産業界では、部屋の広さ・築年数・最寄り駅からの距離を説明変数、家賃を目的変数とする重回帰モデル(重回帰分析によって作られる予測の式)が査定システムに組み込まれています。回帰係数を確認すれば、広さや駅からの距離といった各要素が家賃にどれだけ影響しているかを数値で示せるため、担当者の経験や勘に頼らず価格設定の根拠を説明できるようになります。性質の異なる複数の要因を同時に扱えるのは、重回帰分析ならではの特徴です。

マーケティングの分野では、広告費や来店客数などを説明変数、売上を目的変数とする回帰モデルが使われます。施策ごとの回帰係数の大きさを比較すれば、どの施策が売上への影響が大きいかを客観的な数値で把握できるため、限られた予算をどこに配分するかという判断の材料になります。感覚的な評価にとどまらず、施策間の効果を同じものさしで比べられる点が回帰分析を用いる意義です。

製造業・品質管理の現場では、設備の稼働条件である温度や圧力などを説明変数、製品の品質数値を目的変数とする回帰モデルが用いられます。どの条件が品質のばらつきに強く影響しているかを回帰係数から特定できるため、工程改善の対象を絞り込む手がかりになります。複数の条件が絡み合う現場であっても、要因を数値で切り分けられる点が改善活動の土台になります。

5. 要点まとめ

  • 線形回帰分析は説明変数と目的変数の関係を直線の式で表し、未知データの目的変数を予測する手法で、説明変数が1つなら単回帰分析、2つ以上なら重回帰分析と呼びます。
  • 回帰係数と切片は残差平方和を最小にする最小二乗法によって求められ、重回帰分析では説明変数どうしの相関が強すぎることで生じる多重共線性に注意する必要があります。
  • 線形回帰は連続値を予測する回帰の手法であり、分類を行うロジスティック回帰、曲線的な関係を扱う非線形回帰とは目的や仮定するモデルの形が異なります。

6. 確認問題

問1線形回帰分析とは、説明変数と目的変数の関係を直線(一次式)で表し、目的変数の値を予測する手法である。

解答・解説をみる

○ 正しい

線形回帰分析の定義そのものです。説明変数が1つなら単回帰分析、2つ以上なら重回帰分析と呼び、いずれも一次式で関係を表す点は共通しています。

問2重回帰分析では、説明変数どうしの相関が強すぎることによって回帰係数の推定が不安定になる多重共線性という問題が生じることがある。

解答・解説をみる

○ 正しい

多重共線性は重回帰分析に特有の注意点です。説明変数どうしの相関が強い組み合わせがないかを確認する必要があります。

問3ロジスティック回帰は、線形回帰と同様に連続値を予測する回帰の手法である。

解答・解説をみる

× 誤り

ロジスティック回帰は名称に「回帰」を含みますが、実際には確率をもとに2値・多値のクラスへ分ける分類の手法です。正しくは、連続値を予測するのが線形回帰、クラスに分類するのがロジスティック回帰という関係にあります。