標準正規分布 (G検定)

標準正規分布

1. 定義と概要

標準正規分布とは、平均0、標準偏差(データのばらつきの大きさを表す指標)1、分散(標準偏差を2乗した値)1になるよう標準化した正規分布のことです。

任意の正規分布に従うデータは、各値xから平均μを引き、標準偏差σで割る標準化(データを平均0、標準偏差1になるよう変換する処理)によって、標準正規分布に変換できます。この変換の式はz=(x-μ)/σと表され、変換後の値zはZ値(標準得点。標準化した後の値で、元の値が平均から標準偏差いくつ分離れているかを表す数値)と呼ばれます。単位や尺度の異なるテストの点数や身長のデータも、標準化すれば同じ物差しであるZ値で比較できます。

正規分布は平均と標準偏差の組み合わせごとに無数に存在し、そのままでは区間ごとの確率を求めるために分布ごとに複雑な積分計算が必要になるという課題があります。どんな正規分布に従うデータも標準化すれば、平均0、標準偏差1という単一の基準形に統一できます。

あらかじめ計算済みの標準正規分布表(標準正規分布の区間ごとの確率をまとめた早見表)を参照するだけで任意の区間の確率を求められるため、標準正規分布は正規分布の確率計算を効率化する共通の物差しとして使われています。個別の分布ごとに計算し直す手間がなくなる点が、標準正規分布という基準形を用意する意義です。

標準化によって単位や基準がそろうため、性質の異なるデータどうしも同じ尺度で比較できます。テストの得点と身長のデータは単位も分布の広がり方も異なりますが、Z値に変換すれば、値そのものではなく平均からどれだけ離れているかという相対的な位置づけとして扱えます。

2. 試験対策ポイント

理解するうえで中心になるのは、標準正規分布の定義と標準化の式です。平均0、分散1の正規分布という定義と、z=(x-μ)/σという標準化の式は、セットで押さえておきたい基本です。式の意味としては、値から平均を引くことで分布の中心を0に合わせ、標準偏差で割ることでばらつきの大きさを1にそろえる、という2段階の操作にあたります。

あわせて重要なのが、68-95-99.7ルールと呼ばれる経験則です。平均から標準偏差1つ分(±1標準偏差)の範囲には約68.27%、±2標準偏差には約95.45%、±3標準偏差には約99.73%のデータが含まれます。教材では、丸めた数値である68%、95%、99.7%として扱われることが多く、区間が広がるほど含まれる割合が100%に近づいていく関係も併せて確認できます。

標準化したZ値を使って任意の区間の確率を求める際に参照するのが標準正規分布表です。正規分布のままでは表を直接使えず、標準化が前提条件になります。

母集団(調査や分析の対象となるデータ全体の集まりで、手元にある標本データはその一部にあたる)の分散が既知の場合に平均を検定する手法であるZ検定でも、標準化したZ値が標準正規分布に従う性質が利用されます。分散が未知で標本(母集団から実際に取り出して調べる一部のデータ)のサイズが小さい場合は、t分布を使う点との対比も取り違えやすい点です。

さらに、元の分布の形によらず標本平均(標本から計算した平均値)の分布は、標本サイズの増加とともに正規分布に近づいていきます。これを中心極限定理といい、標準正規分布と結びつけて教材で扱われる論点です。標準化・68-95-99.7ルール・標準正規分布表・Z検定・中心極限定理という一連の用語は、互いに関連づけて理解しておきたい用語の束といえます。

3. 関連概念との比較・相違点

正規分布との最大の違いは、パラメータ(分布の形を決める数値)が固定か任意かという点にあります。標準正規分布は正規分布のうち平均0、標準偏差1に固定した特殊な形です。これに対して正規分布は、平均と標準偏差の値が任意であり、無数に存在します。標準正規分布は、無数にある正規分布の中の一つの基準形という位置づけになります。

t分布との最大の違いは、母集団の分散が既知か未知か、そして標本サイズの大小にあります。観点ごとに並べると、使い分けの基準がはっきりします。

観点 標準正規分布 t分布
母集団の分散 既知 未知
想定する標本サイズ 大きい 小さい
分布の裾 標準的 厚い
用いる検定 Z検定 t分布を使った検定

標本サイズが大きくなるにつれて、t分布の形は標準正規分布に近づいていく関係にあります。この違いは、母集団の分散が既知か未知かによって、どちらの検定を用いるかを分ける基準になっています。

4. ビジネス・実務での活用シナリオ

教育・人材分野では、模試の得点をZ値に標準化し、そこから偏差値(Z値を10倍して50を足して求める、試験の成績を表す指標)を算出します。試験回によって平均点や難易度が異なっていても、標準化によって同じ物差しで学力を比較できるため、複数回の模試の結果を横並びに扱う場面で使われています。

製造業・品質管理の分野では、製品寸法や検査データを標準化し、平均から3標準偏差以上外れた値を異常値として管理限界の設定に用います。標準正規分布に基づいて管理限界の範囲をあらかじめ数値で定められるため、目視や経験だけに頼らない基準を持つことができ、不良品の早期検出につながります。

金融・リスク管理の分野では、株式リターンなど価格変動データを標準化し、標準正規分布に基づいて一定の確率で起こりうる損失額の目安を見積もります。感覚的な予測ではなく分布に基づいた数値として損失額の目安を示せる点が、リスク管理の指標としてこの手法が使われている理由です。

5. 要点まとめ

  • 標準正規分布は平均0、標準偏差1に標準化した正規分布で、標準化の式z=(x-μ)/σとセットで理解します。
  • 平均±1標準偏差に約68%、±2標準偏差に約95%、±3標準偏差に約99.7%のデータが含まれる68-95-99.7ルールが重要な論点です。
  • 標準正規分布表やZ検定は標準化を前提に成り立ち、分散未知・小標本で使うt分布との使い分けが分かれ目になります。

6. 確認問題

問1標準正規分布は、正規分布のうち平均を0、標準偏差を1になるよう標準化したものである。

解答・解説をみる

○ 正しい

定義そのものです。任意の正規分布に従うデータは、z=(x-μ)/σという変換によって標準正規分布に変換できます。分散は標準偏差の2乗にあたるため、平均0、分散1の正規分布と言い換えても同じ意味になります。

問2標準正規分布において、平均から標準偏差1つ分(±1標準偏差)の範囲に含まれるデータの割合は約68%である。

解答・解説をみる

○ 正しい

68-95-99.7ルールのうち1標準偏差分の値(約68.27%)にあたります。2標準偏差では約95%、3標準偏差では約99.7%となり、範囲が広がるほど含まれる割合が高くなります。

問3平均や標準偏差が異なる複数のデータを標準化すると、単位や尺度が異なるため互いに比較することはできなくなる。

解答・解説をみる

× 誤り

正しくは逆で、標準化の目的は異なる平均・標準偏差を持つデータを同じ物差しである標準正規分布、Z値に揃えて比較可能にすることにあります。逆方向の記述は、取り違えやすい典型です。