1. 定義と概要
多重共線性とは、重回帰分析(複数の説明変数を使って目的変数の値を予測・説明する分析手法)における2つ以上の説明変数(予測のもとになる入力側のデータ項目)どうしの関係に着目したものです。両者の間に強い線形関係(2つの変数の関係をグラフにしたとき、直線に近い形で表せる関係)があると、この状態が生じます。統計学の実務ではマルチコ(多重共線性の略称・俗称)と呼ばれることも少なくありません。
この状態が生じると、各説明変数が目的変数(予測したい結果側のデータ項目)に与える影響を切り分けて推定することが難しくなり、回帰係数(各説明変数が目的変数にどれだけ影響するかを表す数値)の推定値が不安定になります。符号が理論と逆転したり、標準誤差(推定値のばらつき・不確かさの大きさを表す数値)が過大になったりする現象が典型例です。
例えば重回帰の分析に「気温」と「アイスクリームの店頭在庫」のように互いに連動する2つの説明変数を同時に投入すると、どちらの変数が目的変数に効いているのかを統計的に区別しづらくなります。
重回帰分析は、複数の説明変数を使って目的変数を予測・説明する手法であり、各説明変数が互いに独立して目的変数に影響するという前提のもとで回帰係数を推定します。しかし説明変数どうしが強く相関していると、この前提が崩れ、どの変数がどれだけ効いているのかを統計的に分離できなくなります。この現象が多重共線性であり、重回帰分析を行ううえで確認すべき典型的な落とし穴として扱われます。
2. 試験対策ポイント
まず押さえておきたいのは、多重共線性が生じたときに回帰係数の推定値が不安定になり、標準誤差が大きくなるという点です。回帰係数の符号が理論や直感と逆転することもあり、個々の説明変数の影響を正しく解釈できなくなります。本来はプラスに働くはずの変数が、モデル上ではマイナスの係数として現れるようなケースが該当します。
検出には、分散(データのばらつきの大きさを表す統計量)が説明変数間でどれだけ拡大するかを数値化した分散拡大係数(VIF: Variance Inflation Factor。ある説明変数が他の説明変数からどれだけ説明できてしまうかを数値化した指標)が用いられます。一般にVIFが10を超えると多重共線性の疑いがあるとされ、より厳格な基準として5を目安にする場合もあります。単純な2変数間では、相関係数(2つの変数の関係の強さを表す指標)が0.95前後を超えるかどうかも判断材料になります。
対処法は、大きく3つに整理できます。それぞれが手を入れる場所は次のとおりです。
| 対処法 | 何をするか |
|---|---|
| 変数削除 | 相関の高い説明変数の一方を取り除く |
| 主成分分析 | 複数の変数をまとめて少数の新しい変数に置き換える |
| リッジ回帰(正則化) | 回帰係数が大きくなりすぎないよう抑える |
主成分分析は、相関の強い複数の変数をまとめて、新しい少数の変数に置き換える手法を指します。リッジ回帰(正則化)とは、回帰係数が大きくなりすぎないよう抑えることでモデルを安定させる手法のことです。この3つが、代表的な対処法として押さえておきたいポイントになります。
またカテゴリ変数はOne-Hotエンコーディング(カテゴリ変数を0と1の列に変換する処理)で扱われることがあります。その際、全カテゴリ分の列をそのまま説明変数として使うと、列同士が完全な線形従属関係(一方の列の値が他の列から100%計算できてしまう関係)になり、多重共線性が生じます。
これはダミー変数トラップと呼ばれ、多重共線性という現象を引き起こす具体的な原因の一つという関係にあります。実務では基準となる1カテゴリの列を除いてN-1列にすることで、この発生を避けます。
3. 関連概念との比較・相違点
単回帰分析(説明変数が1つだけの回帰分析)との最大の違いは、説明変数の数にあります。多重共線性は説明変数が2つ以上ある重回帰分析特有の問題で、説明変数が1つしかない単回帰分析では原理的に生じません。単回帰分析には、そもそも説明変数どうしの相関という前提自体が存在しないためです。
ダミー変数トラップとの関係は、原因と結果に近い位置づけです。ダミー変数トラップはOne-Hotエンコーディングで全カテゴリの列をそのまま使うことで生じる現象で、多重共線性という大きな問題を引き起こす具体的な発生原因の一つに当たります。
両者の位置づけを並べると、次のように対応します。
| 観点 | 多重共線性 | ダミー変数トラップ |
|---|---|---|
| 位置づけ | 現象そのもの | 発生原因の一つ |
| 生じる場面 | 説明変数が2つ以上ある重回帰分析 | One-Hotエンコーディングで全カテゴリの列を使ったとき |
| 主な手当て | 変数削除・主成分分析・リッジ回帰(正則化) | 基準となる1カテゴリの列を除いてN-1列にする |
多重共線性という現象そのものと、その発生原因の一つであるダミー変数トラップという構造は取り違えやすい点ですが、両者は包含関係にあると捉えられます。エンコーディングの設計段階で基準となる1カテゴリの列を除いておけば、この種の多重共線性は生じません。
4. ビジネス・実務での活用シナリオ
マーケティングの分野では、広告費・SNS投稿数・キャンペーン実施日数のように互いに連動しやすい複数の販促指標を、同時に重回帰分析の説明変数として用いる場面があります。これらをそのまま使うと、各施策の真の効果を切り分けられなくなります。VIFで相関の強さを確認したうえで指標を統合・削減してから分析することで、施策ごとの効果を正しく評価できます。単一の指標だけに絞り込むよりも、相関構造を把握したうえで変数を整理する進め方が実務では一般的です。
不動産価格の査定では、築年数と延床面積のように相関しやすい物件属性を説明変数に使う場面が多くあります。多重共線性を放置すると各要因の回帰係数の解釈を誤り、査定額の根拠を顧客に説明できなくなります。要因ごとの寄与を正確に切り分けることが、査定の透明性を保つ前提になります。同じ理由で、類似した築年関連の指標を複数同時に使う際は、事前にVIFで相関の強さを確認する必要があります。
人事・採用分析では、学歴・保有資格数・研修受講時間のように相関する評価指標を同時にモデルへ入れると、どの要因が業績評価に効いているかの判断を誤ります。VIFで確認し、一部の指標を除外・統合したうえで評価モデルを設計することで、評価の根拠を明確に示せます。評価制度の納得感を高めるうえでも、要因ごとの影響を切り分けられるモデル設計が土台になります。
5. 要点まとめ
- 多重共線性(俗称マルチコ)は重回帰分析で2つ以上の説明変数どうしが強い相関を持つ状態で、回帰係数の推定が不安定になります。
- 検出には分散拡大係数(VIF、目安10超で疑いあり)を用い、対処法として変数削除・主成分分析による変数の合成・リッジ回帰(正則化)の3つが挙げられます。
- One-Hotエンコーディングで全カテゴリの列をそのまま使うと生じるダミー変数トラップは多重共線性の代表的な発生原因の一つで、説明変数が1つの単回帰分析では原理的に起こらない重回帰特有の問題です。
6. 確認問題
問1多重共線性とは、重回帰分析において2つ以上の説明変数の間に強い相関関係があり、回帰係数の推定が不安定になる現象を指す。
解答・解説をみる
○ 正しい
定義のとおりです。統計学の実務では「マルチコ」と略して呼ばれることが多くあります。
問2多重共線性の検出には分散拡大係数(VIF)が用いられ、一般にVIFの値が大きいほど多重共線性の疑いが強いとされる。
解答・解説をみる
○ 正しい
VIFは説明変数どうしの相関の強さを数値化した指標で、一般にVIFが10を超えると疑いが強いとされます(5を基準とする場合もあります)。
問3多重共線性は、説明変数と目的変数の間の相関が強すぎることによって生じる問題である。
解答・解説をみる
× 誤り
多重共線性は説明変数どうし(互いの間)の相関が強いことで生じる問題です。正しくは、説明変数と目的変数の相関が強いこと自体はむしろ精度の高いモデルの条件であり、両者は取り違えやすい点です。

