正規分布 (G検定)

正規分布

1. 定義と概要

正規分布(ガウス分布)とは、平均値を中心に左右対称な釣り鐘型を描く連続型確率変数(身長や時間のように連続的な値をとる変数)の確率分布のことです。データのばらつきの大きさは標準偏差(データのばらつきの大きさを表す指標)という数値で表され、これを2乗した値が分散にあたります。

正規分布の形は、平均とこの分散(標準偏差)という2つのパラメータ(分布の形を決める数値)だけで決まり、平均値・中央値・最頻値の3つが一致するという性質を持ちます。分布の形は確率密度関数(連続的な確率変数の分布の形を表す関数)によって数式で表され、平均から離れるほど山の高さがなだらかに低くなっていきます。具体例として、身長やテストの点数、測定誤差などのデータが近似的にこの分布に従うことが知られています。

従来、データのばらつきを把握する手段は個々の数値を個別に確認する方法が中心でした。しかし身長やテストの点数など、多くの自然現象や社会現象のデータが、平均の周りに山なりに集まり左右対称に広がるという共通した形をとることが経験的に分かってきました。

ここで、推測の対象となるデータ全体の集団を母集団、母集団から取り出した一部のデータを標本と呼び、標本から計算した平均の値を標本平均と呼びます。さらに中心極限定理(どんな分布の母集団でも、標本の数を増やすと標本平均の分布が正規分布に近づくという定理)により、母集団の分布形状によらず標本サイズが大きくなるほど標本平均の分布が正規分布に近づくことが理論的に裏づけられています。

この裏づけによって、正規分布は統計的推定(標本から母集団の性質を推測すること)や統計的仮説検定(標本のデータをもとに、母集団についての仮説が正しいかどうかを判定する手法)などの基礎になっています。これらの手法は推測統計(標本のデータから母集団の性質を推測する統計学の分野)と呼ばれる分野に位置づけられます。G検定でも、正規分布は統計分野の入り口として扱われる用語です。

2. 試験対策ポイント

まず押さえておきたいのは、68-95-99.7則(経験則。正規分布で平均±1、2、3標準偏差の範囲に含まれるデータの割合を示す)です。範囲と割合の対応は次のとおりです。

範囲 含まれるデータの割合
平均±1標準偏差 約68%
平均±2標準偏差 約95%
平均±3標準偏差 約99.7%

この数値の対応は取り違えやすい典型です。中心極限定理により、母集団の分布によらず標本サイズが大きくなるほど標本平均の分布が正規分布に近づく点も、統計的推定・統計的仮説検定の理論的根拠にあたります。

標準化(z変換。平均0・標準偏差1になるようデータを変換する操作)も重要なポイントです。z=(x-μ)/σという変換により、任意の正規分布を平均0・分散1の標準正規分布(平均0・分散1に標準化した正規分布)に変換できます。単位や平均が異なるデータでも標準化すれば同じものさしで比較できるようになり、標準正規分布表を使った確率計算とあわせて整理しておきたいところです。

加えて、確率分布どうしの違いも混同しやすい点です。正規分布は連続型で釣り鐘型の分布であるのに対し、二項分布(成功か失敗かの試行を繰り返したときの成功回数の分布)やポアソン分布(一定期間・範囲内で稀な事象が起こる回数を表す確率分布)は離散型の分布です。

それぞれどんな現象を扱うのかという対応関係を押さえておきたいところです。単に名前を覚えるだけでなく連続型か離散型かという軸で整理しておくと選択肢を判別しやすくなります。

機械学習の実装分野との関連も整理しておきたい論点です。ニューラルネットワークの重み初期化(Xavier初期化・He初期化など。ニューラルネットワークの重みを正規分布などに従う乱数で初期化する手法)には、正規分布に従う乱数がよく用いられます。統計理論としての正規分布と、実装場面での応用は、実務面でも意識しておきたい関係にあります。

3. 関連概念との比較・相違点

標準正規分布との最大の違いは、一般形か特殊形かという点にあります。正規分布は平均・分散が任意の値をとる一般的な分布であるのに対し、標準正規分布はそれを標準化して平均0・分散1にそろえた特殊形です。標準化によって、異なる平均や分散を持つデータどうしを同じ基準で比較できるという関係にあります。正規分布と標準正規分布のどちらの話をしているかを見極める視点が要点で、z変換の式とあわせて整理しておく必要があります。

ポアソン分布との最大の違いは、連続型か離散型かという点にあります。正規分布は身長や時間のように連続的な値を扱う釣り鐘型の分布であるのに対し、ポアソン分布は一定期間・範囲内で稀な事象が起こる回数という離散値を表す分布です。両者は扱うデータの性質が根本的に異なるため、混同しやすい組み合わせです。連続的な量を扱うか、数えられる回数を扱うかという視点で区別すると判別しやすくなります。

4. ビジネス・実務での活用シナリオ

製造業では、工程管理の管理図に3σルール(平均±3標準偏差の範囲を基準にする考え方)を用います。測定値が平均±3標準偏差の範囲を超えた場合を異常、つまり不良品の兆候として検知し、品質を安定させる仕組みです。測定値の多くが正規分布に近い形で分布するという前提があるからこそ、統計的な基準で異常を早期に見つけられます。この考え方は、経験や勘に頼らず数値の基準で品質を管理できるという意義を持っています。

教育の分野では、テストの得点を偏差値(テストの得点を平均50・標準偏差10に変換した相対評価の指標)に変換する際、得点分布を正規分布とみなして計算します。素点だけでは難易度の異なる試験どうしの成績を比較できませんが、偏差値に変換することで集団内での相対的な位置を示せるようになります。得点分布が正規分布に近いという前提があるからこそ、標準偏差を基準にした相対評価が成り立ちます。

機械学習の実装では、ニューラルネットワークの重み初期化にXavier初期化・He初期化など、正規分布に従う乱数を用います。重みの初期値が偏っていると学習がうまく進まないことがあるため、正規分布に基づいた初期化によって学習の初期段階を安定させています。統計理論としての正規分布の性質が、モデルの学習という実装の現場にも直結している例です。

5. 要点まとめ

  • 正規分布は平均を中心に左右対称な釣り鐘型の連続型確率分布で、平均値・中央値・最頻値が一致します。
  • 68-95-99.7則により平均±1、2、3標準偏差の範囲に含まれるデータの割合(約68%、95%、99.7%)が定まり、標準化(z変換)で標準正規分布に変換できます。
  • 中心極限定理により、母集団の分布によらず標本サイズが大きいほど標本平均の分布は正規分布に近づき、統計的推定・統計的仮説検定の基盤となります。

6. 確認問題

問1正規分布は、平均値・中央値・最頻値が一致し、平均を中心に左右対称な釣り鐘型をした分布である。

解答・解説をみる

○ 正しい

左右対称性と、平均値・中央値・最頻値が一致するという性質は、正規分布の定義そのものにあたります。正規分布を理解するうえでの中心的な論点です。

問2正規分布において、平均値から±1標準偏差の範囲にはおよそ95%のデータが含まれる。

解答・解説をみる

× 誤り

68-95-99.7則により、±1標準偏差の範囲に含まれるのはおよそ68%です。正しくは、95%のデータが含まれるのは±2標準偏差の範囲であり、この数値の対応関係は取り違えやすい典型です。

問3中心極限定理により、母集団の分布の形状にかかわらず、標本サイズを十分大きくすると標本平均の分布は正規分布に近づく。

解答・解説をみる

○ 正しい

これは中心極限定理の定義そのものです。統計的推定や統計的仮説検定が、幅広い母集団分布に対して適用できる理論的な根拠となっています。