正規化 (G検定)

正規化

1. 定義と概要

正規化(Normalization)とは、特徴量(モデルに入力するデータの各項目のこと)ごとに単位やスケールが異なるデータを、決まった範囲に変換してそろえる前処理の一種です。狭い意味ではmin-max正規化を指し、計算式は「(x − 最小値)/(最大値 − 最小値)」で表され、変換後の値は最小値が0、最大値が1に収まります。

たとえばテストの得点(0〜100点)を0〜1の範囲に変換したり、画像のピクセル値(0〜255の数値で色の濃淡を表す値)を0〜1に変換してニューラルネットワーク(人間の神経回路を模した機械学習モデル)へ入力したりする場面で使われます。

特徴量ごとに単位や値の大きさ(スケール)がばらばらだと、いくつかの課題が生じます。距離をもとに判断するk近傍法(近くにあるデータ点を基準に分類や予測を行うアルゴリズム)やk-means法(データを距離の近さでグループ分けする手法)のようなアルゴリズムでは、値の大きい特徴量に結果が引っ張られてしまいます。

また、勾配降下法(損失が小さくなる方向へパラメータ(モデル内部が持つ数値)を少しずつ更新していく学習アルゴリズム)を使うニューラルネットワークでは、学習の収束が遅くなるという課題も生じます。こうした背景から、特徴量の尺度をそろえる処理群であるスケーリングが前処理として使われるようになり、その代表的な手法の一つが最小値0・最大値1に収める正規化です。

2. 試験対策ポイント

まず整理しておきたいのは、正規化と標準化の使い分けです。正規化(min-max正規化)は特徴量の範囲を0から1に固定するため、値の範囲があらかじめ分かっているデータ(画像のピクセル値など)や、距離をもとに判断するアルゴリズムとの相性がよいとされます。

一方で外れ値(他の大多数のデータから大きく外れた極端な値)の影響を強く受けやすく、極端に大きい値や小さい値があると、他のデータが狭い範囲に押し込められてしまう制約があります。

これに対して標準化(Standardization、Z-score)は平均0・分散(データが平均からどれだけ散らばっているかを表す数値)1に変換する処理で、正規化のような範囲の固定はしません。外れ値の影響は正規化より小さいとされ、正規分布(平均を中心に左右対称に広がる代表的な確率分布)を仮定する回帰系のアルゴリズムの前処理としても使われます。正規化と標準化は、どちらもスケーリング(特徴量の尺度を揃える処理)に含まれる関係にあります。

白色化(Whitening)は、特徴量同士の相関をなくす無相関化(特徴量同士の連動して動く関係性をなくす処理)と、各特徴量を平均0・分散1にそろえる標準化を組み合わせた処理として説明されます。主成分分析(PCA、相関のある複数の特徴量をまとめて新しい少数の軸に変換する次元削減の手法)を経由して行われる点が、正規化・標準化との違いになります。

また、バッチ正規化(Batch Normalization)は入力データそのものではなく、ニューラルネットワークの各層を通過する途中のデータをミニバッチ単位で正規化する手法で、学習の安定化や高速化を目的とします。4つの処理を変換の中身と適用対象で並べると、次のように対応します。

処理 変換の中身 適用対象
正規化(min-max正規化) 最小値0・最大値1の範囲に変換 入力する特徴量(個別に変換)
標準化 平均0・分散1に変換 入力する特徴量(個別に変換)
白色化 無相関化と標準化を組み合わせる 入力する特徴量(相関をなくす工程まで含む)
バッチ正規化 ミニバッチ単位で正規化 各層を通過する途中のデータ

入力特徴量への前処理である正規化・標準化とは適用対象が異なる点として、あわせて整理されます。

加えて、正規化(Normalization)と正則化(Regularization)は名称が似ていますが、別の概念です。正規化は特徴量のスケールを揃える前処理です。

これに対して正則化は、損失関数にL1正則化・L2正則化(モデルの重みが大きくなりすぎないようにペナルティを加える手法)などのペナルティ項を加え、過学習(訓練データに適合しすぎて未知のデータへの精度が落ちる現象)を抑える学習時の手法です。この違いは、名称が似ているために取り違えやすいポイントです。

3. 関連概念との比較・相違点

標準化との最大の違いは、変換後の分布と外れ値への耐性です。正規化は最小値を0、最大値を1に固定するのに対し、標準化は平均を0、分散を1にそろえます。範囲を固定しない分、標準化は極端な値に全体が引っ張られにくく、外れ値が多いデータでは正規化よりも標準化のほうが選ばれやすい傾向があります。

白色化との違いは、処理の範囲にあります。正規化と標準化は各特徴量を個別に変換するのに対し、白色化は特徴量間の相関をなくす無相関化の工程まで含みます。個々の特徴量のスケールをそろえるだけの正規化に比べ、白色化は特徴量同士の関係性そのものを整理する、より踏み込んだ前処理といえます。

正則化との違いは、名称の類似に反して目的がまったく異なる点です。正規化は特徴量のスケールを調整する前処理であるのに対し、正則化は過学習を抑えるために損失関数へペナルティ項を加える学習時の手法です。前処理の段階で行うか、学習の過程で行うかという工程の違いが、両者を区別する軸になります。

4. ビジネス・実務での活用シナリオ

画像認識の分野では、0から255の画素値を0から1に正規化してからCNN(畳み込みニューラルネットワーク、画像認識でよく使われるモデルの一種)へ入力する処理が広く使われています。値の範囲をそろえることで、学習の収束が安定するという効果があります。

マーケティング・顧客分析の領域では、購買金額や来店回数など単位の異なる顧客特徴量を正規化してから、距離をもとにしたクラスタリング(似た特徴を持つデータをグループに分ける手法)でセグメント分けする活用が見られます。金額と回数のように桁の異なる数値をそろえることで、特定の特徴量だけが結果を左右する事態を避けられます。

IoT・センサー監視の現場では、温度・湿度・振動など単位の異なるセンサー値を正規化し、同一のスケールで異常検知モデルへ投入する活用があります。単位のばらばらな複数のセンサー値を横並びで扱えるようにすることが、複合的な異常を見落とさずに検知する精度を左右します。

5. 要点まとめ

  • 正規化(min-max正規化)は特徴量を最小値0・最大値1に変換する前処理で、外れ値に弱い一方、値の範囲が既知なデータとの相性のよさが挙げられます。
  • 標準化(平均0・分散1)、白色化(無相関化+標準化)、バッチ正規化(層ごとのミニバッチ単位の正規化)はいずれもスケーリングの一種または関連手法として、適用対象や計算内容の違いをあわせて整理しておきたいところです。
  • 正規化と正則化は名称が似ていますが、前処理か過学習抑制の学習手法かという目的の違いがあり、混同しやすい組み合わせです。

6. 確認問題

問1正規化(min-max正規化)は、特徴量の値を最小値0、最大値1の範囲に変換する処理である。

解答・解説をみる

○ 正しい

計算式は(x − 最小値)/(最大値 − 最小値)で、変換後の値は0から1の範囲に収まります。これがmin-max正規化の定義です。

問2正規化と正則化は同じ概念であり、どちらも過学習を抑制するための手法である。

解答・解説をみる

× 誤り

正規化は特徴量のスケールを揃える前処理で、正則化は損失関数にペナルティ項を加えて過学習を抑える学習時の手法です。正しくは、前処理と学習時の手法という別の工程に位置づけられます。名称が似ているための典型的な混同です。

問3外れ値が多いデータでは、min-max正規化よりも標準化のほうが影響を受けにくいとされる。

解答・解説をみる

○ 正しい

min-max正規化は最大値・最小値を基準にするため外れ値に引っ張られやすく、平均・分散を使う標準化のほうが外れ値の影響を受けにくいとされます。