1. 定義と概要
ロジスティック回帰とは、説明変数の線形結合(複数の入力データを重み付けして足し合わせたもの)をもとに、ある事象が発生する確率を求める統計的な手法です。名前には「回帰」と入っていますが、出力される確率をもとにカテゴリを振り分けるため、実際には分類問題に用いられます。
分類先が2つの二値分類(結果を2つのカテゴリのどちらかに振り分ける問題)にも、3つ以上の多クラス分類(結果を3つ以上のカテゴリに振り分ける問題)にも対応できる点が特徴です。検査データから腫瘍が良性か悪性かを判定する、受信したメールがスパムか否かを判定するといった場面で使われています。0か1かをそのまま出すのではなく確率として結果を示せるため、判定の境界を状況に応じて調整できる柔軟さも備えています。
従来の線形回帰(説明変数から連続した数値を予測する手法)は、売上高や気温のような連続値を予測するのに使われます。しかし出力値が0から1の範囲に収まらないため、確率やカテゴリの予測には不向きという課題がありました。
ロジスティック回帰は、説明変数の線形結合をシグモイド関数(入力された値を0から1の間になめらかなS字カーブで変換する関数)に通すことで出力を0から1の確率に変換し、線形回帰の考え方を分類問題に応用する形で成立しています。線形回帰の考え方(線形結合)を、分類へと応用した手法だといえるでしょう。
2. 試験対策ポイント
G検定では、「回帰」という名称でありながら実際には分類手法である点が重要な論点です。ロジスティック回帰は二値分類と多クラス分類の両方に対応しており、分類先の数に応じて出力を確率に変換する関数を使い分けます。名称だけで手法の性質を判断すると誤りやすく、出力の中身まで確認する必要があるのです。
二値分類では、線形結合の出力をシグモイド関数(ロジスティック関数とも呼ばれます)に通し、事象が発生する確率として解釈します。シグモイド関数は、入力の値がどれだけ大きくても小さくても、出力が0から1の間になめらかに収まるという性質を持ちます。
一方、3クラス以上の多クラス分類では、各クラスに属する確率をそれぞれ計算し、その合計がちょうど1になるよう変換するソフトマックス関数(複数の選択肢それぞれの確率を計算し、合計がちょうど1になるよう変換する関数)を使います。分類先が2値か3値以上かによって使う関数が異なる点は、G検定で取り違えやすい論点です。どちらの関数がどちらの分類に対応するのかを、出力の形と合わせて整理しておきます。
| 分類先 | 使う関数 | 出力の形 |
|---|---|---|
| 二値分類(分類先が2つ) | シグモイド関数 | 事象が発生する確率を1つ求める |
| 多クラス分類(分類先が3つ以上) | ソフトマックス関数 | 各クラスの確率を求め、合計がちょうど1になる |
いずれの場合も、線形結合の出力をそのまま使うのではなく、関数を通して確率の形に変換するという流れは共通しています。
モデルの内部では、オッズ(ある事象が起こる確率と起こらない確率の比)の自然対数をとった値を用います。対数オッズ(ロジット)とは、線形回帰の考え方をそのまま当てはめられる形にした値のことで、この対数オッズを説明変数の線形結合で表現します。この対数オッズをシグモイド関数に通すことで、確率へと変換する構造です。
また、説明変数が1単位増加したときにオッズが何倍になるかを表す指標であるオッズ比は、モデルの係数を解釈する際に使われ、シグモイド関数・ソフトマックス関数・対数オッズとあわせて見ておきたい語句です。
パラメータ(モデルが学習によって決める内部の数値)の推定方法にも特徴があります。ロジスティック回帰では、手元のデータが得られる確率を最大にするようにモデルの数値を決める方法(最尤推定)を用いる一方、線形回帰では誤差の二乗和を最小化する最小二乗法を用います。この推定方法の違いは、両者を区別する重要な観点です。
3. 関連概念との比較・相違点
線形回帰との最大の違いは、出力の型とパラメータの推定方法にあります。線形回帰は説明変数と目的変数(予測したい結果そのものを表す変数)の関係を直線の式で表し、連続した数値を予測する手法です。これに対しロジスティック回帰は、線形結合の出力をシグモイド関数に通して0から1の確率に変換し、その確率をもとにカテゴリへ振り分けます。
パラメータの推定でも、線形回帰は誤差の二乗和を最小化する最小二乗法を用いるのに対し、ロジスティック回帰は最尤推定を用いる点が異なります。ここまでの違いを観点ごとに並べると、次のようになります。
| 観点 | 線形回帰 | ロジスティック回帰 |
|---|---|---|
| 予測の対象 | 連続した数値 | カテゴリへの振り分け |
| 出力の型 | 連続値 | 0から1の確率 |
| パラメータの推定方法 | 最小二乗法(誤差の二乗和を最小化) | 最尤推定(データが得られる確率を最大化) |
同じ「回帰」という名前を持ちながら、出力の性質も推定の考え方も別物である点が両者を区別する軸だといえるでしょう。
分類先のクラス数による使い分けも整理しておきたい論点です。分類先が2つの二値分類では、シグモイド関数によって1つの確率値を計算します。一方、分類先が3つ以上になる多クラス分類は、ソフトマックス回帰と呼ばれることもあり、ソフトマックス関数によって各クラスに属する確率をそれぞれ計算し、合計が1になるよう変換します。
使う関数が分類先の数によって異なる点が、両者の相違点です。この違いは、扱う分類問題が二値か多値かによって、モデルの出力構造を選び分ける判断にも直結します。
4. ビジネス・実務での活用シナリオ
医療の現場では、検査データから腫瘍が良性か悪性かを予測する診断支援にロジスティック回帰が使われます。出力が確率で得られるため、判定の閾値(陽性と判断する境界値)を調整することで、見逃し(偽陰性)を減らす運用ができます。人の健康に直結する判定であるほど、単なる二択ではなく確率という形で結果の確からしさを示せる点に意義があります。
マーケティングの分野では、顧客の属性や行動データから商品を購入する確率を予測し、確率の高い顧客に絞ってキャンペーンを実施する用途に使われます。全顧客に一律で販促を行うのではなく、購入確率という指標にもとづいて対象を絞り込むことで、限られた予算や人手を効果につながりやすい層に配分できます。確率という連続的な指標を使うからこそ、対象者を段階的に絞り込む運用が可能になるのです。
金融の分野では、与信審査において顧客の属性データから返済が滞る確率を推定し、与信判断の材料とする使い方があります。返済の可否を0か1かの二択で判断するのではなく、確率という連続的な指標で示すことで、審査基準に応じた柔軟な判断につながります。数値として確率を扱えることが、審査における説明のしやすさにも結びつきます。
5. 要点まとめ
- ロジスティック回帰は「回帰」という名前ですが、実際には分類手法で、二値分類にはシグモイド関数、多クラス分類にはソフトマックス関数を使います。
- モデルは説明変数の線形結合で対数オッズ(ロジット)を表現し、シグモイド関数で確率に変換します。パラメータ推定には最尤推定を用いる点が線形回帰の最小二乗法と異なります。
- オッズ比は説明変数が1単位増加したときにオッズが何倍になるかを表す指標で、モデルの結果を解釈する際に用いられます。
6. 確認問題
問1ロジスティック回帰は名前に回帰とあるが、実際には分類問題に用いられる手法であり、二値分類と多クラス分類の両方に適用できる。
解答・解説をみる
○ 正しい
名称と実際の用途のギャップは、ロジスティック回帰を理解するうえで欠かせない視点です。二値分類ではシグモイド関数、多クラス分類ではソフトマックス関数を使って出力を確率に変換します。
問2ロジスティック回帰のパラメータ推定には、線形回帰と同様に誤差の二乗和を最小化する最小二乗法が用いられる。
解答・解説をみる
× 誤り
正しくは、手元のデータが得られる確率を最大化する最尤推定が用いられます。誤差の二乗和を最小化する最小二乗法は線形回帰で使われる手法であり、両者は取り違えやすい点です。
問3オッズ比とは、ある説明変数の値が1単位増加したときに、事象が発生するオッズが何倍になるかを表す指標である。
解答・解説をみる
○ 正しい
オッズは事象が発生する確率と発生しない確率の比を表し、オッズ比はロジスティック回帰モデルの係数を解釈する際に用いられます。

