1. 定義と概要
決定係数(R²、寄与率とも呼ばれる指標)とは、回帰モデルが目的変数(予測したい結果側のデータ)の変動をどれだけ説明できているかを示す指標です。計算式ではR²=1-(残差平方和/全平方和)と表されます。残差平方和とは、実測値と予測値の差(残差)を2乗して合計した値のことです。全平方和は実測値と平均値の差を2乗して合計した値で、目的変数のばらつき、つまり分散(データが平均値からどれくらい散らばっているかを表す指標)の大きさに対応しています。
数値が1に近いほど、モデルの当てはまりが良いという関係にあります。たとえば、気温とアイスクリームの売上額の関係を回帰直線で予測するモデルで決定係数が0.8であれば、売上の変動のうち80%が気温という説明変数(予測に使う入力側のデータ)で説明できることになります。逆に決定係数が0に近い場合は、目的変数の変動をその説明変数ではほとんど説明できていないことを意味します。
従来、回帰モデルの当てはまりは、散布図(2つの変数の値を縦軸と横軸にとり、データを点で表した図)やグラフを目視で確認する方法や、誤差の大きさをそのまま見る方法が中心でした。回帰モデルの当てはまりを表す指標が目的変数の単位によって変わってしまうと、異なるモデル同士を比較しにくくなります。そこで、予測モデルの精度を単位に依存しない共通の尺度で比較する必要から、0から1の範囲に正規化された決定係数のような指標が整えられていきました。分類モデル(データがどのクラスに属するかを予測するモデル)では、正解率(予測全体のうち正しく当てられた割合)が代表的な指標です。ほかにも適合率(陽性と予測したもののうち実際に陽性だった割合)や再現率(実際に陽性のもののうち正しく拾えた割合)といった指標で性能を評価します。決定係数は、回帰モデルの評価指標としてこれらと対比しながら理解しておきたい位置づけにあります。
2. 試験対策ポイント
試験対策として重要な論点は、決定係数が0から1の値をとり、1に近いほど回帰モデルの当てはまりが良いことを示す点です。計算式R²=1-(残差平方和/全平方和)とあわせて、残差平方和と全平方和がそれぞれ何を表すかが要点です。残差平方和が0であれば、すべての実測値が予測値と一致していることを意味し、決定係数は1になります。
もう一つの論点が、決定係数と相関係数の関係です。単回帰分析(説明変数が1つだけの回帰分析)に限り、決定係数は相関係数の2乗(R²=r²)に一致します。一方、重回帰分析(説明変数が2つ以上ある回帰分析)では、この単純な関係は成り立ちません。単回帰か重回帰かという条件によって成り立つかどうかが変わる点は、取り違えやすい論点です。
さらに、説明変数を増やすと決定係数は下がることがなく上昇しやすいという性質があります。この性質はモデルの当てはまりの良さを見かけ上つり上げてしまい、決定係数だけでモデルを比較すると、説明変数を増やしただけの見かけ上高いモデルを選んでしまう恐れがあります。
そのため、他の評価指標とあわせて見ておきたいところです。回帰モデルの評価指標には次のようなものがあります。
| 指標 | 何を表すか |
|---|---|
| 決定係数(R²) | 目的変数のばらつきを説明できる割合(0から1) |
| 自由度調整済み決定係数 | 説明変数の数とサンプルサイズを加味して補正した説明力 |
| RMSE(二乗平均平方根誤差) | 予測値と実際の値のずれの大きさ |
| MAE(平均絶対誤差) | ずれの平均的な大きさ |
決定係数が説明力の割合を表すのに対し、RMSEやMAEは誤差そのものの大きさを表す点が違いです。サンプルサイズとは、分析に使うデータの件数を指します。
3. 関連概念との比較・相違点
相関係数との最大の違いは、何を測る指標かという点にあります。相関係数は2つの変数の直線的な関係の強さと向きを-1から1で表す指標であるのに対し、決定係数は回帰モデルの説明力を0から1で表す指標です。単回帰分析ではR²=r²の関係が成り立ちますが、重回帰分析ではこの等式は成り立たず、決定係数と相関係数は別の指標として扱われます。それぞれの指標が何を表しているかを区別することが要点です。
RMSE・MAEとの違いは尺度にあります。決定係数は0から1に正規化された説明力の割合であるのに対し、RMSEとMAEは予測値と実際の値のずれ(誤差)そのものの大きさを表す指標で、単位を持ちます。単位を持つRMSE・MAEは、目的変数の単位が変わると数値も変わるため、決定係数のようにモデル間で単純に比較しにくいという特徴があります。
4. ビジネス・実務での活用シナリオ
マーケティングの分野では、広告費と売上の関係を回帰モデルで予測し、決定係数で当てはまりの良さを確認したうえで、予算配分の根拠資料として活用します。決定係数が低いモデルをそのまま使うと、根拠に乏しい予算配分につながるため、指標による裏づけが意味を持ちます。とくに複数の施策を比較検討する場面では、決定係数の高さが施策の説得力を裏づける材料になります。
製造業では、設備の稼働条件と製品の品質数値の関係を回帰モデルで予測し、決定係数の高さでモデルの信頼性を判断してから、稼働条件の最適化に用います。決定係数が低いモデルは、稼働条件と品質の関係を十分に説明できていないため、そのまま最適化に使うと誤った条件を導きかねません。決定係数が高いモデルであれば、稼働条件を変更した際の品質への影響を一定の根拠を持って予測できます。
不動産・金融の分野では、築年数や立地条件などの説明変数から物件価格を予測する回帰モデルの精度評価に決定係数を用い、査定システムの妥当性を検証します。決定係数が高いモデルほど、価格の変動を説明変数で説明できているといえるため、査定の客観性を支える材料になります。決定係数の低いモデルをそのまま査定に使うと、実勢価格とのずれが大きくなるおそれがあります。
5. 要点まとめ
- 決定係数(R²)は、回帰モデルが目的変数の変動をどれだけ説明できているかを0から1の数値で示す指標で、1に近いほど当てはまりが良いことを表します。
- 単回帰分析では決定係数は相関係数の2乗に一致しますが、重回帰分析ではこの関係は単純には成り立ちません。
- 説明変数を増やすと決定係数は上昇しやすい性質があり、この点を補正する自由度調整済み決定係数、および誤差の大きさを表すRMSE・MAEとあわせて回帰モデルの評価指標として整理しておきたい点です。
6. 確認問題
問1決定係数は0から1の値をとり、1に近いほど回帰モデルの当てはまりが良いことを示す。
解答・解説をみる
○ 正しい
決定係数の定義そのものです。目的変数の変動のうち回帰モデルで説明できた割合を表す指標です。
問2単回帰分析においては、決定係数は相関係数の2乗に一致する。
解答・解説をみる
○ 正しい
R²=r²の関係は、説明変数が1つの単回帰分析の場合に成り立ちます。重回帰分析ではこの単純な関係は成り立たない点とあわせて理解しておきたいところです。
問3回帰モデルに説明変数を追加すると決定係数は低下するため、モデルの当てはまりが悪化しているかどうかの判断に使える。
解答・解説をみる
× 誤り
実際には、説明変数を追加すると決定係数は下がることがなく上昇しやすい性質があります。正しくは、この性質を補正するために自由度調整済み決定係数が使われるという関係です。

