説明変数 (G検定)

説明変数

1. 定義と概要

説明変数(独立変数)とは、回帰分析において、予測したい対象に影響を与える要因となる変数です。通常はxで表し、複数ある場合はx1、x2のように添字で区別します。例えば、勉強時間からテストの点数を予測する回帰式「テストの点数=a×勉強時間+b」では、勉強時間が説明変数にあたります。

回帰分析とは、この説明変数を用いて、予測したい対象である目的変数(説明変数を使って予測しようとする対象の値。例えば将来の売上)を数式で表す分析手法です。説明変数の値が分かれば、この回帰式に当てはめることで目的変数の値を見積もれます。

回帰分析は、説明変数と目的変数の関係を回帰式で表し、未知のデータに対する目的変数の値を予測する統計手法として古くから使われてきました。

説明変数が1つだけの場合を単回帰分析(説明変数を1つだけ使って目的変数を予測する回帰分析)、説明変数が2つ以上ある場合を重回帰分析(説明変数を2つ以上使って目的変数を予測する回帰分析)と呼び分けます。現実のビジネス課題は、売上や解約のように複数の要因が絡み合うことが多く、実務では重回帰分析が用いられる場面のほうが多くなっています。

説明変数を増やせば予測精度が上がるとは限らず、どの変数を採用するかという変数選択や、説明変数同士の相関への注意が必要になる、という流れがG検定のシラバスでも整理されています。

2. 試験対策ポイント

まず押さえておきたいのが、説明変数と目的変数の呼称のペアです。入力側か出力側かという役割の違いが、この対比の軸になります。呼び方が複数あるため、どちらの言い換えを指しているかは混同しやすい組み合わせです。

入力側と出力側で呼び方を並べると、次のように対応します。

役割 主な呼び方 記号 位置づけ
入力側 説明変数・独立変数・予測変数 x 予測に使う変数
出力側 目的変数・従属変数・応答変数 y 予測される変数

同じ行に並ぶ呼び方はどれも同じ変数を指しているため、行をまたいで組み合わせた言い換えが出てきたら誤りだと判断できます。

単回帰分析と重回帰分析の違いも試験対策のポイントです。説明変数が1つの場合を単回帰分析、2つ以上の場合を重回帰分析と呼びます。

出店予定の店舗の売上高を、地域の人口・店舗面積・販売品目数という複数の説明変数から予測する事例は、重回帰分析の典型例として扱われます。複数の要因を同時に説明変数へ組み込める点が、重回帰分析が実務で選ばれやすい理由です。

重回帰分析では、説明変数同士の相関が強いペアを同時に採用すると、回帰係数(説明変数が目的変数にどれだけ影響するかを示す数値)の推定が不安定になり、予測精度が悪化します。この現象は多重共線性と呼ばれ、変数選択で注意すべき点として整理されています。説明変数同士の相関をあらかじめ確認しておくことが、多重共線性への対処の基本になります。

機械学習の文脈では、説明変数とほぼ同じ対象を指す呼び方として特徴量が使われます。同じ入力側のデータでも、統計学・回帰分析の文脈では説明変数、機械学習の文脈では特徴量と呼ばれるという、分野による呼び分けは取り違えやすい点です。

3. 関連概念との比較・相違点

目的変数との最大の違いは、原因側か結果側かという点にあります。説明変数は予測に使う入力側の変数で、独立変数とも呼ばれます。目的変数は予測される出力側の変数で、従属変数とも呼ばれます。

勉強時間からテストの点数を予測する例では、勉強時間が説明変数、テストの点数が目的変数にあたり、原因と結果の関係で対になっています。回帰式「テストの点数=a×勉強時間+b」の中でも、説明変数は式の右辺に置かれる変数、目的変数は式の左辺に置かれる変数という位置づけの違いとして整理できます。

特徴量との違いは、指しているデータの中身ではなく、使われる分野にあります。説明変数と特徴量は、ほぼ同じ対象を指すことが多い呼び方です。

二つの呼び方を軸ごとに並べると、違いがどこにあるかがはっきりします。

観点 説明変数 特徴量
使われる分野 統計学・回帰分析 機械学習
指すデータ 予測に使う入力側のデータ 予測に使う入力側のデータ
典型的な場面 回帰式の説明 機械学習モデルへの入力

指しているデータの中身は同じで、変わるのは分野と場面だけです。同じ「勉強時間」というデータでも、回帰式の説明では説明変数、機械学習モデルへの入力として扱う場面では特徴量と呼ばれます。文脈に注目して呼び分けを判別することが、ここでの要点です。

4. ビジネス・実務での活用シナリオ

小売業の出店計画では、地域の人口・店舗面積・販売品目数を説明変数、売上高を目的変数とした重回帰分析が使われます。複数の要因を同時に説明変数へ組み込めるため、単一の指標だけで判断するより出店予定地の売上を数式で見積もりやすくなり、出店判断の精度が高まります。

不動産業では、築年数・駅からの距離・専有面積を説明変数、家賃を目的変数とした回帰分析が用いられます。物件ごとの条件を説明変数として数式に当てはめることで相場を客観的に算出できるため、経験や勘に頼っていた査定業務の効率化につながります。

マーケティングの解約予測では、利用頻度・契約期間・問い合わせ回数を説明変数として、顧客の解約有無を予測します。説明変数同士の相関が強いと多重共線性が生じ、どの要因が解約に効いているのかが分かりにくくなるため、説明変数の組み合わせを見直す変数選択が課題になります。

小売・不動産・マーケティングのいずれの事例でも、目的に合わせて説明変数をどう選ぶかが予測精度を左右する共通点になっています。

5. 要点まとめ

  • 説明変数(独立変数)とは、回帰分析において目的変数を予測するための手がかりとなる入力側の変数であり、目的変数は予測される出力側の変数です。
  • 説明変数が1つの単回帰分析と、2つ以上の重回帰分析が区別され、重回帰分析では説明変数同士の相関が強いことで生じる多重共線性に注意する必要があります。
  • 統計学の文脈では説明変数、機械学習の文脈ではほぼ同じ対象を特徴量と呼ぶという、分野による呼び分けがあります。

6. 確認問題

問1説明変数とは、回帰分析において目的変数を予測するための手がかりとなる変数であり、独立変数とも呼ばれる。

解答・解説をみる

○ 正しい

説明変数の定義そのものです。目的変数を出力側、説明変数を入力側とする役割の違いが、この用語対の軸になっています。予測に使う情報かどうかという位置づけが、この問いを判断する基準です。

問2単回帰分析は説明変数が複数、重回帰分析は説明変数が1つのみを用いる分析手法である。

解答・解説をみる

× 誤り

正しくは逆で、単回帰分析は説明変数が1つ、重回帰分析は説明変数が2つ以上を用いる手法です。説明変数の数による呼び分けは、取り違えやすい点として知られています。

問3重回帰分析において、説明変数同士の相関が強いことで回帰係数の推定が不安定になる現象を多重共線性という。

解答・解説をみる

○ 正しい

多重共線性の定義そのものです。説明変数間の強い相関により予測精度が悪化するため、変数選択などの対処が必要になります。回帰係数の推定が不安定になるという点が、多重共線性を見分ける手がかりです。