1. 定義と概要
標準化(Standardization)とは、各データから平均を引いて標準偏差(データのばらつきの大きさを表す指標)で割ることで、データを平均0・分散(標準偏差を2乗した値)1に変換する前処理手法です。計算式はz=(x-μ)/σ(μは平均、σは標準偏差)で表され、この変換後の値をzスコアと呼びます。
特徴量(モデルへの入力に使う個々のデータ項目)ごとに単位や値の範囲(スケール)が異なる場合に、そのスケールをそろえる目的で使います。たとえば年収(万円単位)と年齢(歳単位)のように桁の異なる特徴量を標準化すると、両者とも平均0付近を中心にした同じ物差しで扱えるようになります。
従来、複数の特徴量をそのままモデルに入力する手法が取られてきました。しかし特徴量ごとにスケールが大きく異なると、距離計算や、勾配降下法(誤差を減らす方向へモデルの重みを少しずつ更新していく最適化の手法)に基づくアルゴリズムで、値の大きい特徴量が結果を支配してしまう課題がありました。
この課題に対応するため、スケーリング(特徴量の値の範囲や単位をそろえる処理の総称)という前処理が整備されました。代表的な手法として、正規化(min-max。最小値0・最大値1の範囲に収める前処理)と、標準化(z-score)が使われるようになりました。
2. 試験対策ポイント
G検定では、標準化と正規化の計算式・出力範囲の違いが重要な論点です。標準化はz=(x-μ)/σで平均0・分散1に変換するのに対し、正規化(min-max)は(x-min)/(max-min)という式で最小値0・最大値1の範囲に収めます。同じスケーリングの一種でありながら基準にする値が異なる点が、両者を区別するポイントになります。
アルゴリズムとの対応にも触れておきます。k近傍法(近くにあるデータの多数決で分類する手法)やSVM(データを最もよく分ける境界線・超平面を求める分類手法)はその代表例です。k-means法(データをいくつかのグループ・クラスタに自動で分ける手法)などのクラスタリング(データをいくつかのグループに分ける処理の総称)も同様です。
主成分分析(PCA。多数の特徴量の情報をできるだけ保ちながら少数の合成変数に要約する手法)も、距離や分散の計算に基づくため特徴量のスケールが結果を左右します。勾配降下法で最適化するニューラルネットワーク(人間の神経回路を模した機械学習モデル)やロジスティック回帰(境界を確率として求める分類手法)も同様です。
一方、決定木(条件分岐を繰り返してデータを分類・予測するモデル)のような木構造モデルもあります。ランダムフォレスト(決定木を複数組み合わせて多数決や平均で予測するモデル)や勾配ブースティング(決定木を順番に組み合わせ、誤差を少しずつ減らしていく手法)も同様です。これらは分割基準がスケールの影響を受けにくく、前処理としての必要性が相対的に低いという対比になります。
外れ値(他のデータから大きく離れた極端な値)への頑健性は取り違えやすい点です。標準化は平均・標準偏差という代表値・散布度をもとに変換するため外れ値の影響を受けにくい一方、正規化(min-max)は最小値・最大値という極端な値そのものを基準にするため外れ値の影響を強く受けます。
分布に特定の仮定を置かない正規化に対し、標準化はデータが正規分布(平均を中心に左右対称な釣り鐘型を描く分布)に近いときに効果を発揮するとされます。加えて、説明変数(結果を予測するために使う入力側の変数)を標準化してから求める標準化回帰係数(単位の異なる説明変数間で影響度の大きさを比較する際に使う回帰係数)も押さえておきたいポイントです。
標準化・正規化はいずれもデータのスケールをそろえる前処理です。一方、正則化(モデルの重みにペナルティを課して過学習を抑える手法)は、過学習(学習データに適合しすぎて未知のデータへの精度が落ちる状態)を抑える学習時の手法であり、目的が異なります。名称が似ているため、標準化・正規化・正則化の3語は混同しやすい組み合わせです。
3. 関連概念との比較・相違点
正規化(min-max)との最大の違いは、計算式と出力範囲、そして外れ値への頑健性です。正規化は(x-min)/(max-min)で最小値0・最大値1に収める一方、標準化は(x-μ)/σで平均0・分散1にします。正規化は最小値・最大値という極端な値を基準にするため外れ値の影響を強く受けますが、標準化は平均・標準偏差を使うため外れ値の影響を受けにくいという関係にあります。分布の仮定を置かず範囲を明確にしたい場合は正規化が、データが正規分布に近い場合は標準化が向いています。
白色化(無相関化に加えて各成分を標準化する、より高度な前処理)との最大の違いは処理範囲です。標準化は各特徴量を個別に平均0・分散1へそろえる処理であるのに対し、白色化は主成分分析などを用いて無相関化(特徴量どうしの相関をゼロにする処理)を行ったうえで、各成分を標準化します。標準化が1つの特徴量の中で完結するのに対し、白色化は複数の特徴量の関係にまで踏み込む点で範囲が広くなります。
正則化との最大の違いは目的です。標準化や正規化はデータのスケールをそろえる前処理であるのに対し、正則化はモデルの重みにペナルティを課して過学習を抑える学習時の手法です。前者はデータ側、後者はモデル側の手法という違いがあり、名称の響きが似ていても扱う対象はまったく異なります。
混同しやすい4語は、何をするかと、データ側かモデル側かという2つの軸で並べると整理しやすくなります。
| 用語 | 何をする処理か | 位置づけ |
|---|---|---|
| 標準化 | z=(x-μ)/σで平均0・分散1にそろえる | データ側の前処理 |
| 正規化(min-max) | (x-min)/(max-min)で最小値0・最大値1に収める | データ側の前処理 |
| 白色化 | 無相関化を行ったうえで各成分を標準化する | データ側の前処理の発展形 |
| 正則化 | モデルの重みにペナルティを課す | 過学習を抑える学習時の手法 |
名称が似ている3語のうち、標準化と正規化はデータをそろえる仲間、正則化だけが別の役割という区切りで覚えると、取り違えを防げます。
4. ビジネス・実務での活用シナリオ
マーケティング・顧客分析の分野では、年齢・年収・購買回数など単位の異なる顧客データを標準化してからk-means法にかける場面があります。値の大きい年収がクラスタ形成を支配することを防げるため、購買行動パターンに基づく均等な顧客セグメンテーション(顧客をグループに分ける分析)ができます。
製造業やディープラーニングの分野では、センサー計測値や画素値など複数の特徴量を標準化してからニューラルネットワークに入力する場面があります。勾配降下法による学習の収束が安定し、学習速度の向上につながります。
金融・リスク分析の分野では、株価・出来高・財務指標などスケールの異なる複数の特徴量を標準化してから主成分分析(PCA)や異常検知モデルに投入する場面があります。スケールの違いに引きずられない特徴抽出ができ、リスクの見極めに役立ちます。
5. 要点まとめ
- 標準化は各データから平均を引き標準偏差で割ることで平均0・分散1に変換する前処理で、計算式はz=(x-μ)/σです。
- 正規化(min-max、0〜1に変換)との違いは計算式・出力範囲に加え、標準化のほうが外れ値の影響を受けにくいという頑健性の違いにあります。
- 距離・勾配ベースのアルゴリズムでは標準化・正規化が重要になる一方、木構造モデルはスケールの影響を受けにくく、白色化は標準化に無相関化を加えた発展形です。
6. 確認問題
問1標準化とは、各データから平均を引き標準偏差で割ることで、データを平均0・分散(標準偏差)1に変換する処理である。
解答・解説をみる
○ 正しい
標準化の定義そのものです。計算式z=(x-μ)/σで表され、変換後の値はzスコアと呼ばれます。
問2正規化(min-max)は最小値・最大値という代表値を用いるため外れ値の影響を受けにくいのに対し、標準化は平均・標準偏差を用いるため外れ値の影響を受けやすい。
解答・解説をみる
× 誤り
正しくは逆で、標準化のほうが外れ値の影響を受けにくくなります。正規化は最小値・最大値という極端な値そのものを基準にするため外れ値の影響を強く受けます。両者の頑健性の関係を逆に述べた記述は、取り違えやすい典型です。
問3決定木やランダムフォレストのような木構造モデルは、特徴量のスケールの影響を受けにくいため、標準化などの前処理を行わなくても分割基準に大きな支障は出ない。
解答・解説をみる
○ 正しい
木構造モデルは各特徴量を個別のしきい値で分割するためスケールの影響を受けにくく、距離やノルムに基づくアルゴリズム(k近傍法・SVM・k-means法など)との対比で扱われます。

