1. 定義と概要
スケーリングとは、特徴量(モデルに入力する個々のデータ項目。年齢や広さ、金額などが該当します)ごとに異なる数値の範囲や単位をそろえる前処理の総称です。特徴量スケーリングやデータスケーリングという呼び方もされます。
代表的な手法として、値を0から1の範囲に変換する正規化(min-maxスケーリング)と、平均を0、分散(データのばらつきの大きさを表す統計量)を1にそろえる標準化(zスコア化)の2つがあります。いずれもスケーリングという総称に含まれる具体的な手法です。
現実のデータでは、特徴量ごとに単位や桁が大きく異なることが珍しくありません。例えば不動産価格の予測に使う部屋の広さ(平米)と築年数(年)、あるいは顧客データの購入金額(円)と来店回数(回)では、数値の桁がまったく違います。
桁の大きい特徴量が距離の計算や学習に不当に強い影響を与えたり、勾配降下法(予測の誤差を少しずつ減らすようにパラメータ(モデル内部が持つ数値)を更新していく学習アルゴリズム)の収束が不安定になったりする課題があります。そこで特徴量間のスケールをそろえる前処理として、スケーリングが行われます。
2. 試験対策ポイント
G検定では、スケーリングの影響を受けやすいアルゴリズムと受けにくいアルゴリズムの区別が重要な論点です。代表的なアルゴリズムを影響の受けやすさで区分すると、次のように整理できます。
| 区分 | 代表的なアルゴリズム |
|---|---|
| 影響を受けやすい(距離の計算に基づく) | k近傍法(KNN。近くにあるデータ点の多数決で分類・予測する手法)、k-means(データを似た者同士のグループに分ける代表的な手法) |
| 影響を受けやすい(勾配降下法で最適化する) | 線形回帰、ロジスティック回帰、ニューラルネットワーク、SVM(データを分ける境界線の余白をできるだけ大きくとる分類手法) |
| 影響が小さい(大小関係だけを見る) | 決定木(条件分岐を繰り返してデータを分類・予測する木構造のモデル)、ランダムフォレスト |
距離の計算や勾配降下法による最適化を土台にする手法では、桁の大きい特徴量に結果が引っ張られます。一方、決定木やそれを複数組み合わせたランダムフォレストのような木構造のモデルは、特徴量の大小関係だけで分岐を作るため、スケーリングの有無による影響が小さくなります。
代表手法である正規化と標準化の使い分けも試験対策ポイントのひとつです。両者は変換の基準と、外れ値(他の大多数のデータから大きく外れた値)への強さで対比されます。
| 手法 | 変換の基準 | 変換後の値 | 外れ値の影響 |
|---|---|---|---|
| 正規化(min-maxスケーリング) | 最大値と最小値 | 0から1の範囲 | 受けやすい |
| 標準化(zスコア化) | 平均と標準偏差(データのばらつきの大きさを表す指標) | 平均0・分散1 | 受けにくい |
最大値と最小値を基準にする正規化は、極端な値がひとつ混じるだけで変換後の分布が偏ります。外れ値が多いデータでは、中央値と四分位範囲を使って外れ値の影響を抑えるロバストスケーリングという発展的な手法も存在します。
正規化(normalization)と正則化(regularization)の違いは、混同しやすい組み合わせです。漢字が似ているため取り違えやすいのですが、正則化はモデルの複雑さにペナルティを課し、過学習(訓練データに適合しすぎて未知のデータへの精度が落ちる状態)を防ぐ手法(L1正則化・L2正則化)を指します。特徴量のスケールをそろえるスケーリングとは、目的も対象も異なる概念です。
3. 関連概念との比較・相違点
正規化・標準化との最大の違いは、包含関係にある点です。スケーリングは特徴量の尺度をそろえる前処理全体を指す総称で、正規化(min-max)と標準化(z-score)は、その中に含まれる代表的な具体的手法にあたります。それぞれの変換の計算手順は、姉妹記事の正規化・標準化の解説に譲ります。
正則化との最大の違いは、対象がデータか学習かという点です。名称が似ていますが、正則化はモデルの複雑さにペナルティを課して過学習を防ぐ学習側の工夫であり、特徴量のスケールをそろえるスケーリングとはまったく別の概念にあたります。データを加工する前処理と、学習の仕方を調整する工夫というこの違いは、取り違えやすい点です。
白色化との最大の違いは、発展度合いです。白色化(分散をそろえるだけでなく特徴量間の相関そのものを取り除く、より発展的な前処理)は、スケーリングよりもさらに踏み込んだ手法にあたります。次元削減の代表手法である主成分分析(相関のある複数の特徴量をまとめて情報を圧縮する手法)と組み合わせて使われることが多く、詳しい仕組みは姉妹記事の白色化の解説に譲ります。
4. ビジネス・実務での活用シナリオ
不動産価格予測の現場では、部屋の広さ(平米)と築年数(年)のように桁の異なる特徴量をスケーリングしてから線形回帰にかけます。スケーリングをはさむことで桁の大きい特徴量に予測結果が偏る事態を避けられ、広さと築年数の双方をバランスよく反映したモデルになります。
マーケティングや顧客分析の現場では、購入金額と来店回数のような単位の異なる特徴量をスケーリングしてから、k-means法で顧客をグループ分けします。距離の計算が特定の特徴量に偏らなくなるため、実態に近い自然な顧客グループを見つけられます。
画像認識やディープラーニングの分野では、0から255の範囲で表される画素値を0から1にスケーリングしてからニューラルネットワークへ入力します。入力値の範囲をそろえることで、勾配降下法による学習の収束が安定するでしょう。
5. 要点まとめ
- スケーリングは特徴量ごとの数値の範囲をそろえる前処理の総称で、代表的手法に正規化(min-max、0〜1に変換)と標準化(z-score、平均0・分散1に変換)があります。
- 距離計算や勾配降下法を用いるアルゴリズム(KNN・k-means・線形回帰・ニューラルネットワーク・SVMなど)はスケーリングの影響を受けやすい一方、決定木系のモデルは受けにくくなっています。
- 正規化(normalization)と正則化(regularization)は名称が似ていますが別概念であり、紛らわしい概念として選択肢に登場します。
6. 確認問題
問1距離を用いてクラスタリングや分類を行うk-means法やk近傍法では、特徴量ごとのスケールの違いが結果に影響しやすいため、事前のスケーリングが有効である。
解答・解説をみる
○ 正しい
距離ベースの手法はスケールの大きい特徴量に結果が引っ張られやすく、スケーリングによって各特徴量を公平に扱えます。勾配降下法を用いる線形回帰やニューラルネットワークにも同じことがいえます。
問2正規化(min-maxスケーリング)は外れ値の影響を受けにくく、標準化よりも外れ値が多いデータに適している。
解答・解説をみる
× 誤り
正規化は最大値・最小値を基準に変換するため外れ値の影響を受けやすくなっています。正しくは、外れ値が多いデータでは標準化や、中央値と四分位範囲を使うロバストスケーリングの方が適しています。基準と影響を逆にした記述です。
問3決定木やランダムフォレストのような木構造のモデルは、特徴量の大小関係で分岐を作るため、スケーリングの有無による予測性能への影響が小さい。
解答・解説をみる
○ 正しい
木構造のモデルは分割基準に特徴量の絶対値ではなく大小関係を使うため、スケールに影響されにくくなっています。距離計算や勾配降下法を用いるモデルと対になる関係です。

