回帰問題 (G検定)

回帰問題

1. 定義と概要

回帰問題とは、教師あり学習のうち、説明変数(予測に使う入力側のデータ)から目的変数(予測したい結果側のデータ)を予測するタスクのうち、目的変数が連続値(家賃や気温のように切れ目なく続く数値データ)になるものの総称です。

たとえば部屋の広さから家賃を予測する、気温からアイスクリームの売上額を予測する、企業の財務指標から株価を予測するといった課題は、いずれも回帰問題にあたります。出力が「金額」や「気温」のような連続的な数値である点が共通しています。

対になる分類問題(あらかじめ定義したカテゴリのどれに属するかを予測するタスク)は、出力が離散値(クラス名のように飛び飛びの値)になる点で異なります。教師あり学習では、正解ラベルつきのデータから入力と出力の関係を学習し、未知のデータに対する出力を予測します。その出力の性質によってタスクを大きく2つに分ける整理が生まれ、出力が連続値なら回帰問題、出力が離散のクラスなら分類問題と呼び分けます。

この出力の性質による整理は、G検定に限らず機械学習全体でタスクの種類を捉える基本的な視点になっています。G検定のシラバスでも、教師あり学習の代表的なタスクとして回帰問題と分類問題が並んで扱われ、それぞれに対応する代表的な手法や評価指標が柱になっています。

2. 試験対策ポイント

G検定では、回帰問題と分類問題を分ける基準が出力の性質である点が基本的な論点になります。回帰問題は連続値そのものを予測し、分類問題はあらかじめ定義したクラスのどれに属するかを予測します。回帰問題と分類問題を取り違えないためには、モデルが何を出力するかに着目する見分け方が有効です。

回帰問題を解く代表的な手法として、線形回帰(説明変数と目的変数の関係を一次式で表す手法)が挙げられます。線形回帰は説明変数の数によって、単回帰分析(説明変数が1つだけの線形回帰)と重回帰分析(説明変数が複数ある線形回帰)に分かれます。

ほかにも、回帰木(木構造でデータを分岐させながら連続値を予測する手法)や、ポアソン回帰(来店回数のような数え上げデータを予測する回帰の手法)などが代表的な手法として挙げられます。それぞれの計算の仕組みは個別の手法として別のテーマで扱われるため、本記事では回帰問題を解くための代表的な手法の一つという位置づけの理解に絞って整理します。

なお、名称に回帰を含むロジスティック回帰は、実際には確率をもとに2値・多値のクラスへ分ける分類問題を解く手法であり、回帰問題を解く手法ではありません。名前だけで判断せず、モデルが何を出力するかで見分ける必要があります。

回帰問題の評価には、分類問題で使う指標とは異なる体系が用いられます。分類問題では正解率(全体のうち正しく判定できた割合)・適合率(正と予測したもののうち実際に正だった割合)・再現率(実際に正であるもののうち正しく拾えた割合)が用いられます。これに対し回帰問題では、予測値と実際の値がどれだけずれたかを測る指標が使われます。

回帰問題でよく使われる評価指標と、その意味は次のように対応しています。

指標 略称 どのようにずれを測るか
平均二乗誤差 MSE 予測値と実際の値のずれ(残差)を2乗して平均した指標
二乗平均平方根誤差 RMSE 平均二乗誤差の平方根をとり、元の数値と同じ単位に戻した指標
平均絶対誤差 MAE ずれの絶対値を平均した指標
決定係数 R² モデルが目的変数の変動をどれだけ説明できるかを0から1の値で示す指標

いずれも予測と実測のずれをどう集計するかという発想で作られており、単位をそろえたいのか、大きな外れを重く見たいのかによって使い分けられます。回帰問題と分類問題とでは、評価指標の体系そのものが異なる点が試験対策として重要な論点です。

3. 関連概念との比較・相違点

分類問題との最大の違いは、教師あり学習の中で出力が連続値になるか離散のクラスになるかという分岐にあります。両者の対比を観点ごとに並べると、次のように整理できます。

観点 回帰問題 分類問題
出力の性質 連続値 離散のクラス
出力の例 家賃・気温・株価のような数値 あらかじめ定義したカテゴリ名
代表的な評価指標 平均二乗誤差・二乗平均平方根誤差・平均絶対誤差・決定係数 正解率・適合率・再現率・F値

F値とは、適合率と再現率をバランスよく1つにまとめた指標です。出力の性質が違えば、予測のずれをどう測るかという考え方そのものが変わります。分類問題そのものの詳しい仕組みは別記事に譲りますが、回帰問題では、この出力の違いが評価指標の違いにそのままつながっています。

ロジスティック回帰との違いは、名称と実際の役割が一致しない点にあります。線形回帰などと同じ「回帰」という名前がついていますが、ロジスティック回帰が予測するのは連続値ではなく、あるクラスに属する確率です。

最終的にその確率をしきい値(判定の境目となる基準値)で区切ってクラスを判定するため、実質的には分類問題を解く手法に位置づけられます。名前の印象だけで手法の性質を判断すると誤りやすい、取り違えやすい論点です。

4. ビジネス・実務での活用シナリオ

不動産業界では、部屋の広さ・築年数・立地といった入力データから家賃という連続値を予測する回帰問題として査定モデルを構築する事例があります。担当者の経験や勘だけに頼らず、数値の根拠を示しながら価格を設定できる点が実務上の意義です。似た条件の物件データが蓄積されるほど予測の精度は高まり、査定の一貫性という形で信頼につながります。

小売・流通の分野では、気温・曜日・過去の来店実績といった入力データから来客数や売上金額という連続値を予測する回帰問題として、発注量の最適化に活用されています。仕入れ量を実績と気候の変化に合わせて調整できれば、欠品と廃棄という相反する損失を同時に抑えられます。天候という変数を数値として扱えることが、勘に頼った発注との大きな違いです。

製造業の設備保全では、センサーの稼働データから部品の劣化度合いや残り寿命といった連続値を予測する回帰問題が用いられています。故障が実際に発生する前に部品を交換できるようになるため、突発的なライン停止を避けながら保全コストを抑えられます。この仕組みは予知保全と呼ばれ、部品を壊れる前に取り替えるという発想の転換を数値予測が支えています。

5. 要点まとめ

  • 回帰問題は入力データから連続値そのものを予測する教師あり学習のタスクで、離散のクラスを予測する分類問題と対比されます。
  • 線形回帰・回帰木・ポアソン回帰などが代表的な手法として挙げられ、名前に回帰とつくロジスティック回帰は実際には分類問題を解く手法である点は取り違えやすい論点です。
  • 評価にはMSE・RMSE・MAE・決定係数といった回帰問題ならではの指標が用いられ、分類問題で使う正解率・適合率とは体系が異なります。

6. 確認問題

問1回帰問題とは、入力データから連続的な数値そのものを予測する教師あり学習のタスクである。

解答・解説をみる

○ 正しい

回帰問題の定義そのものです。出力が連続値である点が、離散のクラスを予測する分類問題との違いになります。

問2ロジスティック回帰は名前に「回帰」とつくとおり、連続値を予測する回帰問題を解く手法である。

解答・解説をみる

× 誤り

ロジスティック回帰は名称に反して、確率をもとに2値・多値のクラスへ分ける分類問題を解く手法です。正しくは、名前だけで判断せず何を出力するかで見分ける必要があります。

問3回帰問題の評価には平均二乗誤差(MSE)や決定係数などの指標が用いられ、分類問題で使われる正解率や適合率とは異なる指標の体系になっている。

解答・解説をみる

○ 正しい

回帰問題は連続値の予測誤差を測る平均二乗誤差・二乗平均平方根誤差・平均絶対誤差・決定係数を用い、分類問題は正解ラベルとの一致度を測る正解率・適合率・再現率・F値を用います。出力の性質が違うため、評価指標の体系も分かれます。