1. 定義と概要
ポアソン回帰とは、目的変数(予測したい結果側のデータ)が回数や件数などのカウントデータ(0以上の整数で表されるデータ)であるときに用いる回帰分析の手法です。回帰分析とは、説明変数(予測に使う入力側のデータ)をもとに目的変数の値を予測する統計的な手法を指します。
ポアソン回帰は、確率分布にポアソン分布(ある期間や範囲内で発生する回数のばらつきを表す確率分布)を用います。リンク関数(目的変数の期待値と説明変数の合計を結びつける変換の式)には対数リンク関数(予測値を必ず正の値にする働きを持つ変換式)を使います。これらの組み合わせから、ポアソン回帰は一般化線形モデル(GLM。目的変数の確率分布とリンク関数を柔軟に組み合わせて回帰分析を拡張した枠組み)の一種に位置づけられます。
具体例としては、1日あたりの来店客数の予測、交通事故の発生件数の予測、コールセンターの入電数(問い合わせ件数)の予測などが挙げられます。
回帰分析として従来広く使われてきたのが線形回帰(重回帰分析。目的変数を連続した数値として、説明変数との関係を直線的な式で予測する回帰分析)です。線形回帰は、目的変数が連続値で正規分布(平均を中心に左右対称の釣り鐘型に広がる、統計で最も基本的な確率分布)に従うことを前提とします。しかしカウントデータは0以上の整数しか取らないため、線形回帰をそのまま当てはめると理論上は負の予測値が出てしまう不都合が生じます。この課題に対応するため、目的変数の確率分布とリンク関数を柔軟に選べるGLMの枠組みの中で、ポアソン分布と対数リンク関数を組み合わせたポアソン回帰が使われるようになりました。
2. 試験対策ポイント
G検定では、一般化線形モデル(GLM)の位置づけが重要な論点です。代表的な3つの回帰は、確率分布とリンク関数の組み合わせで次のように整理できます。
| 回帰の種類 | 目的変数 | 確率分布 | リンク関数 |
|---|---|---|---|
| 線形回帰 | 連続値 | 正規分布 | 恒等リンク関数 |
| ロジスティック回帰 | 0か1の2値 | ベルヌーイ分布 | ロジットリンク関数 |
| ポアソン回帰 | カウントデータ | ポアソン分布 | 対数リンク関数 |
恒等リンク関数とはそのまま結びつけるリンク関数、ロジットリンク関数とは確率を0から1の範囲に収めるためのリンク関数を指します。ベルヌーイ分布は、0か1のどちらかの結果しか取らない事象の確率分布です。確率分布とリンク関数の組み合わせで説明できるGLMという共通の枠組みに、これら3つがともに含まれる点は、取り違えやすい点です。
対数リンク関数の役割も、まず押さえておきたいポイントです。説明変数の合計にあたる線形予測子を対数リンク関数で変換し、指数関数で逆変換することで、予測値(期待値。確率分布の平均的な値)は必ず正の値になります。カウントデータは0以上の整数しか取らないため、この性質がポアソン回帰に求められます。目的変数が連続値であれば線形回帰、0か1の2値であればロジスティック回帰、回数や件数のカウントデータであればポアソン回帰という対応関係も、あわせて見ておきます。
過分散への対応も、あわせて整理しておきたいテーマです。ポアソン分布は、期待値と分散(データのばらつきの大きさを表す指標)が等しいという前提を持ちます。実際のデータではこの前提が崩れ、分散が平均を上回る過分散(実際のデータの分散が、ポアソン分布の前提より大きくなっている状態)が生じることがあります。過分散が疑われる場合には、負の二項分布(過分散が疑われるカウントデータに対応するために使われる確率分布)を用いた負の二項回帰で対応することがあります。
3. 関連概念との比較・相違点
線形回帰(重回帰分析)との最大の違いは、目的変数の前提です。線形回帰は目的変数を連続値として扱うため、たとえば1日あたりの来店客数をそのまま線形回帰で予測すると、説明変数の組み合わせによっては「マイナス3人」のような意味をなさない負の値が計算上出てしまうことがあります。ポアソン回帰は対数リンク関数によって線形予測子を指数関数で変換するしくみを持ち、予測値が必ず正の値になるため、0以上の整数しか取らないカウントデータにそのまま対応できます。
ロジスティック回帰との最大の違いは、目的変数の性質と、それに伴う確率分布・リンク関数の組み合わせです。ロジスティック回帰は「起きるか起きないか」という2値(0か1)の分類に使う手法で、ベルヌーイ分布とロジットリンク関数を用います。一方でポアソン回帰は「何回起きたか」という回数や件数のカウントデータに使う手法で、ポアソン分布と対数リンク関数を用います。目的変数が2値かカウントかという性質の違いから、どちらの手法を選ぶかを取り違えやすい点も、両者を区別するポイントです。両者はともに一般化線形モデル(GLM)の一種という共通点を持ちます。
4. ビジネス・実務での活用シナリオ
小売・飲食の分野では、曜日や天候、キャンペーン施策などを説明変数として1日あたりの来店客数を予測する場面でポアソン回帰が使われます。来店客数は0人以上の整数でしか表れないカウントデータであるため、負の予測値が出ない対数リンク関数の性質が、仕入れ量や人員配置の計画を立てるうえでの土台になります。
保険・交通の分野では、運転者の年齢や走行距離などから事故件数を予測する場面で活用されます。事故件数もカウントデータであり、予測された発生件数は保険料の算定やリスク評価の材料として用いられます。
コールセンター・カスタマーサポートの分野では、時間帯や季節要因から入電数(問い合わせ件数)を予測する場面で使われます。入電数の予測はオペレーターの配置人数を最適化する判断材料になり、過不足のない人員体制につながります。
5. 要点まとめ
- ポアソン回帰は目的変数がカウントデータ(回数・件数)のときに使う回帰分析の手法で、ポアソン分布と対数リンク関数を用いた一般化線形モデル(GLM)の一種です。
- 対数リンク関数によって予測値が必ず正の値になり、カウントデータの性質に対応します。線形回帰(連続値)・ロジスティック回帰(2値分類)とは目的変数の種類で使い分けます。
- ポアソン分布は平均と分散が等しいことを前提としますが、実際のデータでは分散が平均を上回る過分散が生じることがあり、その場合は負の二項回帰などで対応します。
6. 確認問題
問1ポアソン回帰は、来店客数や事故件数のように0以上の整数で表されるカウントデータを目的変数とする際に用いられる。
解答・解説をみる
○ 正しい
ポアソン回帰はポアソン分布を仮定した一般化線形モデル(GLM)で、回数・件数などのカウントデータのモデル化に用いられる手法です。
問2ポアソン回帰では対数リンク関数を用いることで、目的変数の予測値が負の値になることを防いでいる。
解答・解説をみる
○ 正しい
線形予測子を対数リンク関数で変換し指数関数で逆変換することで、予測値は常に正の値になります。0以上の整数しか取らないカウントデータの性質に対応するしくみです。
問3ポアソン回帰は2値分類に用いる手法であり、目的変数はロジスティック回帰と同じく0か1の値をとる。
解答・解説をみる
× 誤り
2値分類に用いられるのはロジスティック回帰です。ポアソン回帰の目的変数は回数・件数などのカウントデータ(0以上の整数)であり、正しくは両者で目的変数の種類が異なります。ともに一般化線形モデル(GLM)の一種という共通点はあります。

