記述統計 (G検定)

記述統計

1. 定義と概要

記述統計とは、収集済みのデータそのものが持つ特徴を、平均値・分散などの数値やヒストグラム(データの分布を棒グラフで表した図)・箱ひげ図(データの分布を箱と線で表した図)などのグラフで整理・要約する統計学の一分野です。

たとえばクラス40人のテストの点数をまとめて「平均72点、70点台が最多」と表す作業がこれにあたります。手元にあるデータの記述にとどまり、そこにないデータや母集団(調査や分析の対象となるデータ全体の集まり)全体の値を推測することはしません。あくまで、今そこにあるデータをどう読み解くかという範囲にとどまる分野です。

従来、データの集計は人手で表にまとめる作業が中心でした。1件ずつ数え上げて紙の帳票に記録し、傾向を読み取るには担当者の経験に頼る部分が大きい時代が長く続いていました。統計学の発展にともない、平均値・分散などの数値化とグラフ化による体系的な要約手法が整備され、誰が見ても同じ傾向を読み取れる形にデータをまとめられるようになりました。

AI・機械学習が扱うデータ量が拡大する中では、モデルを作る前にデータの傾向や外れ値(他のデータから大きく離れた極端な値)を把握するEDA(探索的データ分析。本格的な分析の前にデータの傾向や特徴をひととおり把握しておく作業)の土台として、記述統計の重要性が増しています。データの量が増えるほど、まず全体像を数値とグラフでつかむ工程の意義は大きくなります。

2. 試験対策ポイント

まず押さえておきたいのは、代表値(データ全体を代表する数値)と散布度(データがどれくらいばらついているかを示す指標)の使い分けです。それぞれの指標は次のように整理できます。

分類 指標 意味
代表値 平均値 すべてのデータを合計して個数で割った値
代表値 中央値 大きさ順に並べたときちょうど真ん中に来る値
代表値 最頻値 データの中で最も多く出現する値
散布度 分散 平均からどれだけ離れているかを数値化した指標
散布度 標準偏差 分散を元のデータと同じ単位に直した指標
散布度 四分位範囲 データを4等分したとき中央50%が収まる範囲

代表値は、データの分布の形によって使い分けが分かれ目になります。極端に大きい値や小さい値が混じる分布では、平均値が実態からずれやすく、中央値のほうが分布の中心を示す指標として適する場面があります。

グラフ表現もあわせて押さえておきたいところです。データの分布を棒グラフで示すヒストグラム、箱と線で示す箱ひげ図、2変数の関係を点で示す散布図などが代表的です。

記述統計と推測統計の違いは重要な対比です。記述統計は手元のデータをまとめる分野である一方、推測統計は一部の標本(母集団から一部を取り出したデータ)から母集団全体を推し量る分野という関係にあります。推測統計はさらに、標本のデータをもとに母集団の値を見積もる統計的推定と、得られた差や関係が偶然によるものかどうかを確認する統計的仮説検定の2つに分かれます。

両者の目的と対象範囲の違いは、取り違えやすい点です。手元のデータをまとめているだけなのか、それとも見ていないデータについて何かを判断しようとしているのかという視点で見分けると、両者の区別がつきやすくなります。

2変数の関係性を扱う相関係数(2つの変数がどれくらい関係しているかを-1から1の数値で表す指標)は、記述統計の一手法です。その計算の元になる共分散(2つの変数がそれぞれ平均からどれだけ離れているかを掛け合わせて平均した指標)も、同様に記述統計の一手法という位置づけにあります。機械学習の前処理であるEDAと記述統計の結び付きも整理しておきたいところで、代表値・散布度・グラフ表現・相関係数という一連の指標がセットで扱われます。

3. 関連概念との比較・相違点

推測統計との最大の違いは、対象範囲と目的にあります。記述統計は手元のデータをまとめることが目的である一方、推測統計は標本から母集団を推し量ることが目的で、統計的推定と統計的仮説検定という2つの手法に分かれます。

記述統計が「今あるデータを説明する」段階であるのに対し、推測統計は「まだ見ていないデータについて判断する」段階という関係になります。たとえば、あるクラスの40人分のテスト結果をまとめるのは記述統計、その40人の結果から学年全体の平均点を見積もるのは推測統計という違いになります。

相関係数との関係も混同しやすい点です。相関係数は記述統計とは別の概念ではなく、記述統計に含まれる一手法という位置づけにあります。2つの変数の関係の強さを-1から1の数値で表す指標であり、代表値や散布度と並んで、手元のデータの特徴を数値で要約する記述統計の一部として扱われます。相関係数だけを独立した分野と捉えると、記述統計全体の位置づけを見誤りやすくなります。

4. ビジネス・実務での活用シナリオ

マーケティングの現場では、顧客アンケートの回答を平均値や分布で集計し、施策検討の土台となる現状把握資料を作成する場面で記述統計が使われます。回答をただ並べるのではなく代表値と散布度でまとめることで、担当者間で共通の理解を持って次の施策を検討できる状態が作られます。数値やグラフという共通の言語に落とし込む点に、記述統計を使う意義があります。

製造業では、製品検査データの分散やばらつきを可視化し、品質管理における異常検知の基準値を設定する場面で記述統計が役立ちます。ばらつきの大きさを数値で把握しておくことで、通常の変動と異常な変動の境界線を明確にでき、検査工程の判断基準になります。感覚的な良否判断から、数値に基づいた判断へ切り替える土台になる点が実務上の効果です。

データ分析・AI開発の現場では、機械学習モデルを構築する前に記述統計でデータの傾向や外れ値を把握し、前処理の方針を立てるEDAが行われます。データの分布や欠損、極端な値をあらかじめ確認しておく工程は、モデルの精度や学習の安定性を左右する重要な位置づけにあります。記述統計による事前の把握を欠くと、後工程でモデルの挙動が不安定になる原因を特定しづらくなります。

5. 要点まとめ

  • 記述統計は、手元にあるデータの特徴を平均値・分散などの数値やグラフで整理・要約する統計学の一分野です。
  • 推測統計(標本から母集団を推し量る統計的推定・統計的仮説検定)とは目的・対象範囲が異なり、この対比が試験の重要な論点です。
  • 代表値(平均値・中央値・最頻値)と散布度(分散・標準偏差・四分位範囲)、相関係数などの指標をセットで押さえておきたいところです。

6. 確認問題

問1記述統計は、手元にあるデータの特徴を平均値や分散などの数値やグラフで整理・要約する手法である。

解答・解説をみる

○ 正しい

記述統計の定義そのものです。目の前のデータをまとめる点が、推測統計との違いにあたります。

問2記述統計を用いれば、手元の標本データから母集団全体の平均値を推定できる。

解答・解説をみる

× 誤り

標本から母集団全体の値を推し量るのは推測統計(統計的推定)の役割です。記述統計は手元のデータの記述にとどまり、母集団の推測は行いません。両者の役割を取り違える取り違えやすい点です。

問3分散や標準偏差は、記述統計におけるデータの散らばり(散布度)を示す代表的な指標である。

解答・解説をみる

○ 正しい

分散・標準偏差はデータのばらつきを数値化する散布度の指標です。平均値・中央値などの代表値とあわせて、記述統計の基本的な手法にあたります。