統計的仮説検定 (G検定)

統計的仮説検定

1. 定義と概要

統計的仮説検定とは、母集団に関する仮説が統計学的に成り立つかどうかを、標本のデータをもとに判断する手法です。

統計的仮説検定は「仮説検定」「有意性検定」とも呼ばれ、英語では「hypothesis testing」と表記されます。まず否定したい仮説である帰無仮説(いったん正しいと仮定して、否定されることを想定して立てる仮説)を立てます。それが棄却(仮説を誤りであるとして退けること)できるかどうかによって、本来主張したい対立仮説(帰無仮説とは反対の、本当に主張したい仮説)を支持するかどうかを判断します。

たとえば新薬の効果を検証する場面では、帰無仮説「新薬に効果はない」と対立仮説「新薬に効果がある」を設定し、治験によって得られたデータをもとに帰無仮説を退けられるかどうかを判定します。棄却できれば対立仮説である「新薬に効果がある」が支持され、棄却できなければ効果があるとは言えないという判断にとどまります。統計的仮説検定は母集団の性質を断定するのではなく、標本から得られた限られた情報にもとづいて確率的な判断を下す手法です。

母集団全体を漏れなく調査するのは、時間やコストの面で難しい場合がほとんどです。そこで、標本のデータから母集団全体の性質を推し量る推測統計が発展してきました。推測統計は、母集団の未知パラメータ(平均や比率など、母集団がもつ値)を言い当てる統計的推定と、仮説の妥当性を判定する統計的仮説検定を合わせた総称です。

統計的仮説検定は、この推測統計を支える代表的な手法のひとつです。いったん否定したい帰無仮説を正しいと仮定し、それを反証することで間接的に対立仮説を支持します。これは背理法(ある仮定を否定すると矛盾が生じることを示し、もとの仮定が正しいと結論づける論証方法)に近い考え方です。

2. 試験対策ポイント

まず整理しておきたいのは、統計的仮説検定の手順です。次の4段階で進みます。

手順 内容
1. 仮説設定 否定したい帰無仮説を立て、対になる対立仮説を用意する
2. 有意水準の決定 棄却の基準となる確率を定める(通常5%または1%)
3. 検定統計量とp値の算出 標本データから判定のもとになる数値を計算する
4. 判定 p値と有意水準を比較して、棄却するかどうかを決める

有意水準(α)とは、帰無仮説を棄却するかどうかを決める基準となる確率です。検定統計量は標本データから計算する、判定のもとになる数値を指します。p値は、帰無仮説が正しいと仮定した場合に、観測された結果と同じかそれ以上に極端な結果が起こる確率です。否定したい仮説を先に帰無仮説として立てるという順序は、取り違えやすい点です。

判定の核になるのは、有意水準とp値の大小比較です。この判断は、検定統計量の値をもとに算出したp値と、あらかじめ定めておいた有意水準という、2つの基準を比較する形で下されます。

p値が有意水準より小さければ、観測された結果は帰無仮説のもとでは起こりにくい珍しい結果だったとみなし、帰無仮説を棄却して対立仮説を支持します。一方、p値が有意水準以上のときは帰無仮説を棄却できないという判定にとどまり、対立仮説が正しいと積極的に証明されたことにはなりません。この表現の違いは、混同しやすい組み合わせです。

有意水準は、本当は正しい帰無仮説を誤って棄却してしまう第一種の過誤の許容確率を表す数値でもあります。有意水準を5%に設定するということは、本当は正しい帰無仮説を誤って棄却してしまう確率を5%まで許容するという意味になります。この第一種の過誤と、本当は誤りの帰無仮説を棄却できずに見逃してしまう第二種の過誤という、2種類の判定ミスの分類は、あわせて整理しておきたいところです。

3. 関連概念との比較・相違点

統計的推定との最大の違いは、目的にあります。統計的推定は、母集団の未知パラメータそのものを標本から言い当てる手法です。値そのものを求めるという点で、仮説の妥当性を判定する統計的仮説検定とは目的が異なります。

統計的仮説検定は、あらかじめ立てた特定の仮説が正しいと言えるかどうかを判定する手法であり、パラメータの値を直接求めるものではありません。両者はともに推測統計を支える二本柱にあたり、標本から母集団について何かを知ろうとする点は共通しています。目的が値を求めることか仮説を判定することかという点が、両者の分かれ目です。

第一種の過誤・第二種の過誤は、検定結果に伴う誤りの種類として区別されます。有意水準は、第一種の過誤の確率をあらかじめ制御する数値です。有意水準をどの値に設定するかによって、本当は正しい帰無仮説を誤って棄却してしまう確率の上限が変わります。これに対して第二種の過誤は、本当は誤りの帰無仮説を棄却できずに見逃してしまう誤りであり、有意水準とは異なる概念として扱われます。この2種類の過誤は、検定の判定結果を解釈するときに混同しやすい概念であり、セットで整理しておきたいところです。

4. ビジネス・実務での活用シナリオ

マーケティングやWebサービスの現場では、ABテスト(2つのパターンを比較して、どちらが優れているかを検証する手法)を用いる場面があります。ボタンの色を変更した際に、CVR(成約率)の改善が偶然のばらつきによるものか、統計的に意味のある差なのかを仮説検定で判断します。感覚や勘だけで施策の効果を判断すると、たまたま生じたばらつきを効果と誤認するおそれがあります。仮説検定による判断は、担当者の経験や勘に頼った判断に比べて、第三者に対する説明力が高いという特徴もあります。仮説検定を経ることで、施策の採否が数値の裏付けを持った意思決定になります。

製薬・医療の分野では、新薬の治験データについて、帰無仮説「効果に差はない」を有意水準5%で検定します。この検定結果は、新薬の承認判断を支える科学的根拠として使われています。個々の担当者の主観的な印象ではなく、あらかじめ定めた有意水準に基づく客観的な基準で効果の有無を判断できる点が、この手法が医療の意思決定に組み込まれている理由です。判断の根拠となる基準を事前に定めておくことで、審査する側にとっても結果の妥当性を確認しやすくなります。

製造業の品質管理では、新旧の製造工程で不良率に差があるかどうかを検定します。工程を変更した直後は不良率の数値が改善して見えても、それが標本のばらつきによる一時的な変化なのか、工程そのものの改善による変化なのかは、検定を行わなければ判別できません。検定を通すことで、工程変更が単なる感覚的な改善ではなく、数値の裏付けを持った改善かどうかを判定できます。検定の結果を示すことで、現場の担当者だけでなく経営層に対しても、工程変更の妥当性を数値で説明できるようになります。

5. 要点まとめ

  • 統計的仮説検定は、否定したい帰無仮説を立てて棄却できるかどうかで、本来主張したい対立仮説を検討する手法です。手順は仮説設定から有意水準の決定、p値の算出、判定という流れをとります。
  • p値が有意水準(通常5%)より小さければ帰無仮説を棄却します。有意水準は第一種の過誤の許容確率を表す数値でもあります。
  • 母集団のパラメータ自体を推測する統計的推定とは目的が異なり、判定ミスを分類する第一種の過誤・第二種の過誤と併せて押さえておきたいポイントです。

6. 確認問題

問1統計的仮説検定では、否定したい仮説を帰無仮説として設定し、それを棄却することで、本来主張したい対立仮説を支持する。

解答・解説をみる

○ 正しい

検定は帰無仮説をいったん正しいと仮定し、標本データからそれを反証できるかどうかによって対立仮説を間接的に支持する構造をとります。帰無仮説を直接肯定するのではなく、否定を試みることで結論を導く点が、この手法の特徴です。

問2p値が有意水準より大きい場合、帰無仮説が正しいことが積極的に証明されたことになる。

解答・解説をみる

× 誤り

正しくは、p値が有意水準以上のときは帰無仮説を棄却できないというだけで、帰無仮説が正しいと証明されたわけではありません。判定結果は「証明」ではなく「棄却できない」という消極的な結論にとどまる点が、取り違えやすい典型です。

問3有意水準は、本当は正しい帰無仮説を誤って棄却してしまう第一種の過誤の許容確率を表す数値である。

解答・解説をみる

○ 正しい

有意水準(α)は検定を実施する前に設定する、第一種の過誤の確率の上限値であり、通常5%や1%が用いられます。本当は誤りの帰無仮説を見逃す第二種の過誤とは区別される数値であり、検定を始める前に定めておく点も押さえておきたいポイントです。