1. 定義と概要
主成分とは、主成分分析において複数の元の変数(観測変数)を線形結合してつくられる新しい合成変数のことです。データの分散(データのばらつきの大きさを表す数値)が最大になる方向にとった軸を第1主成分とします。
第1主成分と直交(統計では2つの変数の間に相関がない、つまり無相関であることを意味します)する方向のうち、次に分散が大きい軸を第2主成分とする、という順序で定義されます。たとえば、身長・体重・座高という3つの元の変数から、体格の大きさを表す1つの合成変数をつくるような例が挙げられます。
変数の数が多いデータをそのまま扱うと、変数間の相関が入り組み、全体の傾向を解釈しにくくなります。そこで、情報である分散をできるだけ保持したまま、少数の合成変数に置き換える手法が使われており、その置き換え先として得られる合成変数が主成分にあたります。
この合成変数をつくる手順そのもの、つまり主成分分析のアルゴリズムや次元削減(データが持つ変数の数を減らして扱いやすくする処理)としての位置づけについては、主成分分析(PCA)や次元削減を扱う記事に譲ります。ここでは、主成分という合成変数の性質に絞って解説します。
2. 試験対策ポイント
まず整理しておきたいのは、第1主成分と第2主成分の順序関係です。第1主成分は元データの分散を最も多く説明する合成変数であり、第2主成分は第1主成分と直交した上で、次に分散を説明する合成変数として定められます。この順序を逆に捉え、第2主成分が第1主成分と相関を持つように定められるという記述は、順序関係を取り違えた誤解にあたります。
寄与率(ある主成分が元データ全体の情報をどれくらい説明しているかを示す割合)と累積寄与率(上位いくつかの主成分の寄与率を足し合わせた割合)の関係も、あわせて整理しておきたいところです。累積寄与率が高いほど、少ない数の主成分で元データの情報を集約できていることを示します。
第1主成分、第2主成分、第3主成分と番号が進むにつれて寄与率は小さくなり、番号の若い主成分ほど元データの分散を多く説明するという対応関係にあります。
各主成分は元の観測変数の線形結合として表されます。その組み合わせ方の指標である主成分負荷量(主成分と元の変数との相関の強さを表す数値で、その変数が主成分にどれだけ影響しているかを示す指標)を見ることで、その主成分が何を表しているかを解釈できます。
また、主成分の分散の大きさは固有値(主成分の分散の大きさに対応する数値)に対応しており、固有値が大きい主成分ほど寄与率も高くなるという関係にあります。主成分負荷量・固有値・寄与率という関連用語の束が、この論点の柱になります。それぞれが主成分の何を示す数値なのかを対応づけると、次のようになります。
| 用語 | 主成分について何を示すか |
|---|---|
| 主成分負荷量 | 元の変数との相関の強さ。その主成分が何を表すかの解釈に使う |
| 固有値 | その主成分の分散の大きさ |
| 寄与率 | 元データ全体の情報をどれくらい説明しているかの割合 |
| 累積寄与率 | 上位いくつかの主成分を合計してどこまで説明できているか |
いずれも主成分の説明力や意味を別の角度から表した数値であり、一つずつ切り離して覚えるよりも、互いの関係でとらえたほうが理解を保ちやすくなります。
3. 関連概念との比較・相違点
元の変数(観測変数)との最大の違いは、単独の測定値か、複数変数を合成した指標かという点にあります。元の変数はアンケート項目や計測値など個々の測定項目であるのに対し、主成分はそれらを線形結合してつくる新しい合成変数であり、元の変数が持っていた個別の意味をそのまま保持しません。
たとえばアンケートの価格満足度・接客評価・品質評価という個々の項目はそれぞれ独立した測定値ですが、これらを合成してつくられる主成分は、元の変数のどれか一つには還元できない新しい指標になります。
因子分析(観測データの背後にあると仮定する共通の原因、つまり潜在変数を推定する分析手法)の因子との最大の違いは、合成変数が生まれる向き、つまり結果か原因かという点にあります。主成分は観測変数から導かれる結果としての合成変数であるのに対し、因子分析の因子は観測変数の背後にあると仮定する原因であり、両者は因果の向きが逆の関係にあります。
主成分分析と因子分析はどちらも複数の変数を少数の指標にまとめる点で似ていますが、主成分が観測変数の組み合わせそのものであるのに対し、因子分析の因子は観測変数を生み出す背景要因として位置づけられる点で区別されます。ここまでの2つの対比を並べると、次のように整理できます。
| 比較対象 | それが指すもの | 主成分との関係 |
|---|---|---|
| 元の変数(観測変数) | アンケート項目や計測値など個々の測定項目 | 主成分はこれらを線形結合してつくる新しい指標 |
| 因子分析の因子 | 観測変数の背後にあると仮定する共通の原因 | 主成分は観測変数から導かれる結果で、因果の向きが逆 |
表のとおり、主成分は測定そのものでも背景要因でもなく、観測された変数から計算でつくり出される指標という位置にあります。
4. ビジネス・実務での活用シナリオ
マーケティング・顧客調査の分野では、アンケートの多数の評価項目、たとえば価格満足度・接客評価・品質評価などを、第1主成分「総合満足度」、第2主成分「価格重視度」のような少数の合成指標にまとめる例があります。個々の評価項目をばらばらに見るよりも、少数の合成指標に要約した方が、顧客セグメントの傾向がつかみやすくなります。
製造業・品質管理の分野では、製品検査で得られる寸法・重量・硬度といった複数の計測値を少数の主成分に要約し、通常品との差が大きい主成分スコアから異常品を判定する取り組みがあります。個別の計測値を一つずつ確認するのではなく、要約された主成分のスコアを見ることで、異常の有無を効率よく把握できます。
金融の分野では、複数銘柄の値動きのデータを、市場全体の動きを表す主成分とセクター特有の動きを表す主成分に要約し、ポートフォリオのリスク分析に活用する例があります。値動きの背後にある共通要因を主成分として取り出すことで、個別銘柄の動きだけでは見えにくいリスクの構造を把握できます。
5. 要点まとめ
- 主成分とは、元の複数の変数を線形結合してつくる合成変数のことで、第1主成分は分散が最大、第2主成分は第1主成分と直交した上で次に分散が大きい、という順序で定義されます。
- 寄与率は各主成分が元データ全体の分散を説明する割合を示し、累積寄与率は上位いくつかの主成分の寄与率を合計した値で、少ない主成分で元の情報をどれだけ集約できているかを表します。
- 元の変数は個々の観測項目であるのに対し、主成分は変数を合成した新しい指標であり、因子分析の因子とは合成変数の生成の向き(結果か原因か)が逆という点で区別されます。
6. 確認問題
問1第1主成分は、元データの分散を最も多く説明するように定められた合成変数である。
解答・解説をみる
○ 正しい
第1主成分は分散が最大になる方向にとった軸として定義され、元データの情報量を最も多く保持する合成変数にあたります。寄与率が最も高い主成分でもあります。
問2第2主成分は、第1主成分と同じ方向の情報をより詳しく説明するため、第1主成分と高い相関を持つように定められる。
解答・解説をみる
× 誤り
正しくは、第2主成分は第1主成分と直交(無相関)する方向のうち次に分散が大きい軸として定められます。第1主成分と相関を持たせるという記述は、順序関係を逆向きに捉えた誤解にあたります。
問3主成分は複数の元の観測変数を線形結合してつくられる合成変数であり、元の変数そのものとは異なる新しい指標である。
解答・解説をみる
○ 正しい
主成分は観測変数に重みをかけて足し合わせた線形結合として表現され、元の変数を単に選び直したものではなく、新たにつくられる指標です。

