1. 定義と概要
連続値とは、身長・体重・売上高・気温のように、ある区間内のあらゆる実数値を連続的に取りうるデータのことです。理論上どこまでも細かい値(例えば165.234…cmのような値)を取れる点が特徴になります。人数や回数、サイコロの出目のようにとびとびの値しか取らない離散値(とびとびの値しか取らない、人数や回数のように数え上げられるデータ)と対比されます。
統計学では、まずデータを性別や順位のように種類や順序を表す質的データ(性別や順位のように種類や順序を表すデータ)と、数値として測れる量的データ(数値として測れるデータで、連続値と離散値に分かれる)に大別します。量的データはさらに、四則演算ができる比例尺度と間隔尺度に基づき連続値と離散値に分かれる、という階層構造で整理されてきました。この階層を並べると、次のような区分になります。
| 区分 | どういうデータか | 代表例 |
|---|---|---|
| 質的データ | 種類や順序そのものを表す | 性別・順位 |
| 量的データ(連続値) | 区間内のあらゆる実数値を連続的に取る | 身長・体重・売上高・気温 |
| 量的データ(離散値) | 数え上げられる、とびとびの値しか取らない | 人数・回数・サイコロの出目 |
量的データを支える尺度の側から見ると、比例尺度は身長や売上高のように絶対的なゼロ点があり比率にも意味がある尺度で、間隔尺度は気温のように目盛りの間隔が一定だが絶対的なゼロ点はない尺度です。連続値はこの二つの尺度の上に成り立つ値であり、単なる数字の並びではなく、大小や差の大きさに意味がある量として扱われます。
機械学習が実務で使われるようになると、この区別は教師あり学習(正解の値が分かっているデータを使ってモデルを学習させる手法)の設計に直結するようになりました。出力(目的変数)が連続値であれば数値そのものを予測する回帰問題、離散値(カテゴリ)であれば分類先を予測する分類問題として、手法や評価指標を使い分ける必要が生じました。
2. 試験対策ポイント
まず押さえておきたいのは、教師あり学習が出力(目的変数)の型によって大きく二つに分岐する対応関係です。出力が連続値であれば回帰問題、離散値(カテゴリ)であれば分類問題と呼ばれ、扱う手法や評価指標も異なります。確率分布にも連続型と離散型の区別があり、値の型の違いはそのまま分布の分類にも及びます。値の型を軸に、対応する要素を並べると次のようになります。
| 出力(目的変数)の型 | 問題設定 | 代表的な評価指標 | 対応する確率分布 |
|---|---|---|---|
| 連続値 | 回帰問題 | 平均二乗誤差(MSE) | 連続型(正規分布) |
| 離散値(カテゴリ) | 分類問題 | 正解率・F値 | 離散型(ポアソン分布) |
回帰問題では、予測値と実測値の差を2乗して平均したMSE(平均二乗誤差。予測値と実際の値の差を2乗して平均した、回帰問題でよく使う評価指標)のように、数値の誤差そのものに基づく評価指標が使われます。予測が何度も少しずつ外れるのか、大きく外すことがあるのかを、誤差の大きさとして捉える考え方です。
一方で分類問題では、正解率(予測が実際の値と一致した割合を示す評価指標)のように、カテゴリの当たり外れに基づく評価指標が使われます。適合率(予測した中で実際に正しかった割合)と再現率(実際に正しいものの中で正しく予測できた割合)のバランスを示すF値(この二つの指標を組み合わせた評価指標)も、分類問題でよく使われます。連続値と離散値の対応関係は、回帰問題と分類問題を見分ける入口にあたります。
確率分布の側でも、正規分布(平均を中心に釣り鐘型に広がる、連続値を扱う代表的な確率分布)は連続型の代表例で、ポアソン分布(一定期間に起こる回数のような離散値を扱う代表的な確率分布)は離散型の代表例として整理されます。どちらの分布がどちらの値の型に対応するかは、統計の基礎知識として確認しておきたい対応関係です。
強化学習(試行錯誤を通じて行動を学習する手法)では、行動そのものが連続値になる設定を連続値制御問題(強化学習でロボットの関節角度のような連続値の行動を出力する問題設定)と呼びます。ロボットの関節角度や自動運転のハンドル操舵角のように、なめらかな量を出力する場面で扱われます。行動の選択肢が離散的な設定に適した価値ベースの手法(各行動の価値を推定してもっとも価値の高い行動を選ぶ強化学習のアルゴリズムの系統)に対し、連続値制御問題では方策勾配法(連続値の行動空間に適した強化学習のアルゴリズムの系統。PPOなどが含まれる)の系統が適しているという対応関係があります。
3. 関連概念との比較・相違点
離散値との最大の違いは、取りうる値の性質にあります。連続値は身長や売上高のように区間内の任意の実数値を取るのに対し、離散値は人数や回数のように数え上げられる、とびとびの値しか取りません。連続値は165.2cmのように小数点以下をどこまでも細かくできますが、離散値は3人や5回のように途中の値が存在しません。
教師あり学習では、この違いがそのまま回帰問題(連続値を予測する問題)と分類問題(離散値やカテゴリを予測する問題)の分岐点になります。強化学習の連続値制御問題のように、行動そのものが連続値になる設定も、この分岐の延長線上にある応用例です。
分類の階層で見ると、連続値と離散値はどちらも量的データ(数値として測れるデータで、連続値と離散値に分かれる)に属する下位区分です。これに対して質的データ(性別や順位のように種類や順序を表すデータ)は、性別や順位のように種類や順序そのものを表すデータであり、分類の軸が量的データとはまったく異なります。量的データを連続値と離散値のどちらに区分するかは、G検定で連続値と離散値の違いを整理するうえでの基礎的な出発点です。
4. ビジネス・実務での活用シナリオ
小売業の需要予測では、気温や過去の販売実績から来週の来店客数や売上高(連続値)を回帰モデル(回帰問題を解くために用いる予測モデル)で予測し、仕入れ量や人員配置の最適化に活用します。売上高は日々細かく変動する連続値であるため、離散的なカテゴリ分けでは捉えきれない需要の微妙な増減を、回帰モデルによる数値予測が表現します。
製造業の設備保全では、温度・振動・圧力といった連続値のセンサーデータの変化から、設備の故障確率や残存耐用時間を予測します。連続値のセンサーデータは異常の兆候を数値の推移として捉えられるため、あらかじめ定めた閾値(判断の基準となる値)を超えた瞬間だけを見る単純な管理よりも早い段階で予兆を検知でき、計画的なメンテナンスにつながります。
ロボティクスや自動運転の分野では、関節の角度や操舵角のような連続値の行動を出力する連続値制御問題として、深層強化学習の一種である方策勾配法を用います。行動の選択肢を有限個に区切る離散的な制御では、なめらかな動作を再現できません。方策勾配法による連続値の行動出力が、精緻な動作制御を実現する前提条件になっています。
5. 要点まとめ
- 連続値は区間内の任意の実数値を取るデータ(身長・売上高など)、離散値はとびとびの数え上げられる値を取るデータ(人数・カテゴリなど)です。
- 教師あり学習は出力が連続値なら回帰問題、離散値なら分類問題に分かれ、評価指標もMSEと正解率・F値のように異なります。
- 確率分布も連続型(正規分布)と離散型(ポアソン分布など)に分かれ、強化学習では行動が連続値になる設定を連続値制御問題と呼び方策勾配法が対応します。
6. 確認問題
問1教師あり学習において、出力(目的変数)が連続値である問題設定は回帰問題と呼ばれる。
解答・解説をみる
○ 正しい
出力が連続値なら回帰問題、離散値(カテゴリ)なら分類問題という対応関係は、教師あり学習の基本的な分岐点です。評価指標もMSEと正解率・F値のように異なります。
問2離散値とは、区間内の任意の実数値を連続的に取りうるデータのことで、身長や売上高が代表例である。
解答・解説をみる
× 誤り
これは連続値の説明です。離散値は人数や回数のように、とびとびの値しか取らない数え上げられるデータを指します。連続値と離散値の説明を入れ替えた誤りとして扱われます。
問3正規分布は連続型の確率分布に分類され、ポアソン分布は離散型の確率分布に分類される。
解答・解説をみる
○ 正しい
正規分布は連続値を扱う連続型の分布、ポアソン分布は起こる回数のような離散値を扱う離散型の分布に整理されます。連続値と離散値の区別は確率分布の分類にも及びます。

