1. 定義と概要
擬似相関とは、2つの事象の間に統計的な相関がみられるものの、両者の間に直接の因果関係(一方の事象が原因となり、もう一方の事象という結果を実際に引き起こす関係)が存在しない状態のことです。多くの場合、両方の事象に影響を与えている共通の第三の変数、いわゆる交絡因子(2つの変数の両方に影響を与えている、背後に隠れた第三の変数)が背景にあり、この交絡因子を介して見かけ上の相関が生じます。
代表例として挙げられるのが、アイスクリームの売上と水難事故の発生件数の関係です。両者は同時期に増減する統計的な相関がみられますが、直接の関係はなく、気温の上昇という交絡因子が両方を押し上げています。同様に、アイスクリームの売上とビールの売上の間にみられる相関も、気温という共通の交絡因子によって生じる擬似相関です。
従来、2つのデータの間に相関がみられると、一方が原因でもう一方が結果であるかのように解釈される場面がありました。データ分析やAI開発で扱う変数の数が増えるほど、直接の関係がない変数同士が共通要因を通じて統計的に結びつく場面が増え、見かけの相関を因果関係と誤認するリスクが高まります。
とくに、扱う変数が数十から数百に及ぶビッグデータ分析や機械学習の現場では、偶然の一致による見かけの相関が紛れ込みやすくなります。そこで、相関関係と因果関係を区別し、交絡因子の有無を確認する視点が、データ分析や機械学習モデル構築の基本姿勢として重視されるようになりました。
2. 試験対策ポイント
G検定では、「相関関係は因果関係を意味しない」という原則とセットで、擬似相関の成り立ち、つまり背後に潜む交絡因子を介して見かけ上の相関が生じる現象であることが重要な論点になります。相関がみられる2つの事象について、直接の因果関係があるのか、それとも背後に別の要因があるのかを見極める視点も、この原則とあわせて欠かせません。
交絡因子の具体例も押さえておきたいポイントです。典型として扱われるのは、次の組み合わせです。
| 見かけ上の相関がみられる2つの事象 | 背後にある交絡因子 |
|---|---|
| アイスクリームの売上と水難事故の発生件数 | 気温の上昇 |
| アイスクリームの売上とビールの売上 | 気温 |
| お店の数と犯罪件数 | 人口の多さ |
人口が多い地域ほどお店の数も犯罪件数も増える傾向がありますが、お店の数そのものが犯罪を引き起こしているわけではありません。いずれの組み合わせも、片方がもう片方を引き起こしているのではなく、共通の要因が両方を同時に押し上げている点で共通しています。
擬似相関を見抜く手段として、交絡因子の影響を統計的に取り除いたうえで2変数間の関係を測る偏相関係数(交絡因子の影響を取り除いたうえで2つの変数間の関係の強さを測る指標)が使われるという関係も、あわせて整理しておきたいところです。
通常の相関係数(2つの変数の関係の強さを-1から1の数値で表す指標)では正の相関がみられても、交絡因子の影響を除いた偏相関係数を計算すると、相関は弱まる、または見られなくなります。通常の相関係数だけを根拠にすると、交絡因子の影響を含んだ見かけの関係を、本来の関係と取り違えてしまいます。
機械学習モデルの構築では、擬似相関に基づいて特徴量(モデルが予測に使う入力データの特徴を数値化したもの)を選んでしまう課題も取り違えやすい点です。訓練データでは高い精度が出ても、未知のデータに対する汎化性能(学習に使っていないデータにも正しく対応できる能力)が低下する結果を招きます。扱う特徴量の数が多いモデルほど、偶然の一致による擬似相関を拾いやすくなる傾向もあります。
3. 関連概念との比較・相違点
因果関係との最大の違いは、原因と結果の関係が実際に存在するかどうかにあります。擬似相関は見かけ上の相関に過ぎず、2つの事象の間に直接の原因・結果の関係が存在しない現象です。相関があっても因果関係があるとは限らないという原則の具体例として、擬似相関が位置づけられます。見かけ上の相関だけでは、原因と結果のどちらが先に生じているかを判断できない点も、両者を区別するうえでの注意点になります。
逆の因果関係(逆因果。因果関係自体は存在するが、原因と結果の向きを取り違えて解釈してしまうこと)との最大の違いは、因果関係そのものの有無にあります。擬似相関は2つの事象の間に因果関係そのものが存在しない現象であるのに対し、逆の因果関係は因果関係自体は存在するものの、原因と結果の向きを取り違えて解釈してしまう現象です。
たとえば、テレビの視聴時間が子どもの肥満を引き起こすと解釈される場合がありますが、実際には肥満のために運動を避け、テレビを見る時間が長くなっている可能性があります。相関から安易に因果関係を結論づける危うさを示す点は擬似相関と共通しますが、原因が存在しないのか、原因と結果が逆なのかという違いがあります。
両者の違いは、因果関係そのものの有無と、誤りが生じる場所という2つの軸で並べると整理しやすくなります。
| 現象 | 因果関係の有無 | 誤りの中身 |
|---|---|---|
| 擬似相関 | 2つの事象の間に因果関係が存在しない | 交絡因子による見かけの相関を因果関係と解釈してしまう |
| 逆の因果関係 | 因果関係自体は存在する | 原因と結果の向きを取り違えて解釈してしまう |
相関がみられたときは、まず共通要因の有無を疑い、次に原因と結果の向きを確かめるという順で見ていくと、どちらの誤りにも気づきやすくなります。
4. ビジネス・実務での活用シナリオ
マーケティングの現場では、広告費とWebサイトの売上に相関がみられても、季節キャンペーンや連休といった交絡因子の影響を考慮せずに広告費の効果と判断すると、実際には効果の薄い施策に投資を続けてしまいます。売上を押し上げていたのが広告費ではなく季節要因だった場合、広告予算の配分を誤る結果につながります。季節キャンペーンの影響を切り分けずに広告費を評価すると、翌年以降の予算配分の基準までゆがんでしまう可能性があります。
機械学習モデル開発の現場では、特徴量とラベル(モデルが予測する対象の正解データ)の間にある見かけ上の相関、つまり擬似相関を根拠に特徴量を選定すると、訓練データでは高い精度が出ても、未知のデータに対する汎化性能が低下します。学習に使ったデータだけに偶然みられた関係を、モデルが学習してしまうためです。
医療・疫学の分野では、生活習慣と疾病発生率の相関を調べる研究で、年齢や生活地域といった交絡因子の影響を統計的に取り除いた分析を行わないと、誤った因果関係を導き出すリスクがあります。年齢が生活習慣にも疾病発生率にも影響する場合、年齢の影響を除かずに関係をみると、生活習慣そのものの効果を見誤ります。生活地域による医療機関へのアクセスのしやすさなど、複数の交絡因子が同時に絡む場合は、分析はさらに複雑になります。
5. 要点まとめ
- 擬似相関とは、共通の第三の変数(交絡因子)の影響によって、実際には直接の関係がない2つの事象が統計的に相関しているように見える現象です。
- 「相関関係は因果関係を意味しない」という原則の代表例であり、通常の相関係数だけでは交絡因子の影響を含んだ見かけの関係と真の関係を区別できません。
- 交絡因子の影響を統計的に取り除いた偏相関係数を用いることで擬似相関を見抜くことができ、原因と結果の向きを取り違える逆の因果関係とは区別されます。
6. 確認問題
問1擬似相関とは、2つの事象の間に統計的な相関がみられるものの、両者の間に直接の因果関係が存在しない状態を指す。
解答・解説をみる
○ 正しい
擬似相関の定義そのものです。多くの場合、両方の事象に影響を与えている共通の第三の変数である交絡因子が背景にあり、この交絡因子を介して見かけ上の相関が生じます。
問2アイスクリームの売上と水難事故の発生件数の間にみられる相関は、気温という交絡因子の影響による擬似相関の代表例である。
解答・解説をみる
○ 正しい
気温はアイスクリームの売上と水難事故の発生件数の両方に影響する交絡因子であり、両者の間に直接の関係はありません。
問3相関関係と因果関係を取り違える現象はすべて擬似相関に分類され、原因と結果の向きを誤って解釈する逆の因果関係も擬似相関に含まれる。
解答・解説をみる
× 誤り
逆の因果関係は因果関係自体は存在するものの、その向きを誤って解釈する現象であるのに対し、擬似相関は因果関係そのものが存在しない現象です。正しくは、原因が存在しないのか、原因と結果が逆なのかという点で両者は区別されます。

