1. 定義と概要
連続値制御問題とは、強化学習においてエージェント(強化学習で行動を選び学習していく主体のこと)が出力する行動(アクション)が、速度・角度・トルク(物体を回転させる力の大きさのこと)のような連続的な数値で表される問題設定のことです。行動の候補が理論上は無限に存在する連続行動空間(エージェントが選べる行動の集合のこと)を扱う点が特徴です。
たとえば、ロボットアームの関節角度を細かく調整する場面や、自動運転車のハンドルの操舵角・アクセルの踏力を制御する場面が代表例として挙げられます。いずれも、動きの大きさを何段階かに区切ってしまうと目的の動作にならない場面です。
従来のQ学習やDQNのような価値ベース手法(各行動の価値を計算し最も良いものを選ぶ強化学習の手法のこと)は、離散行動空間を前提とした仕組みを取ります。行動の候補が「上」「下」「左」「右」のように有限個に区切られている場合、各行動の価値を計算して最大のものを選べば済むためです。
しかし、ロボット制御や自動運転のように行動が無数の連続値を取りうる場面では、全候補の価値を列挙することができず、価値ベース手法だけでは対応が難しくなります。そこで、方策ベース手法(行動そのものを直接出力する強化学習の手法のこと)である「Actor-Critic」系が、連続値制御問題への対応として発展してきました。
2. 試験対策ポイント
G検定の論点の一つは、離散値制御との対比です。連続値制御問題は行動が無限の値を取りうる点で離散値制御と異なり、この違いが取り違えやすい点です。また、価値ベース手法(DQNなど)は各行動の価値を比較して最良の行動を選ぶ仕組みを持つため、連続行動空間のように候補を列挙できない設定には不向きという対比も、あわせて整理しておきたいところです。
連続値制御問題では、方策(ポリシー、状況に応じてどの行動を取るかを決めるルールのこと)を担う仕組みと、行動の価値を評価する仕組みを組み合わせたものが用いられます。この枠組みが「Actor-Critic」です。
「Actor-Critic」の発展形として、代表的なアルゴリズムが3つ挙げられます。それぞれの特徴を並べると次のとおりです。
| アルゴリズム | 特徴 |
|---|---|
| DDPG | 決定論的な方策で連続値の行動を直接出力する |
| SAC(Soft Actor-Critic) | 確率的な方策とエントロピー正則化により探索の安定性を高める |
| PPO | 方策の更新幅を制限して学習を安定させる。離散行動にも連続行動にも使える汎用的な手法 |
DDPGは、行動を1つの数値に定めて出力する点が特徴です。SAC(Soft Actor-Critic)は、確率的な方策によって探索の安定性を高める手法、PPOは、方策の更新幅を抑えて学習を安定させる手法という違いがあります。G検定のシラバスにはPPOが明記されており、これに加えてDDPGやSACも連続値制御の代表的なアルゴリズムとして対策教材などでよく紹介されます。
3. 関連概念との比較・相違点
離散値制御との最大の違いは、行動空間が有限個の選択肢に区切られているか、無限に連続する数値であるかという点にあります。離散値制御では上下左右のようにあらかじめ決められた選択肢の中から行動を選びますが、連続値制御問題では角度や速度といった数値そのものを行動として出力します。この違いに応じて、離散値制御には価値ベース手法が、連続値制御問題には方策ベース手法が向いているという役割分担が生まれます。
価値ベース手法(DQNなど)との最大の違いは、行動の価値を比較して選ぶか、行動そのものを直接出力するかという役割の違いです。価値ベース手法は各行動の価値をあらかじめ計算し、最も価値の高い行動を選択する仕組みを取ります。一方、連続値制御問題で用いられる「Actor-Critic」系の方策ベース手法は、状況を受け取ると行動の数値そのものを出力するため、無限に存在する行動候補を列挙する必要がありません。この仕組みの違いが、連続値制御問題を扱ううえでの土台になっています。
両者の関係を、行動空間・行動の決め方・向いている手法という3つの軸で並べると次のように整理できます。
| 観点 | 離散値制御 | 連続値制御問題 |
|---|---|---|
| 行動空間 | 上下左右のように有限個の選択肢 | 角度や速度のように無限に連続する数値 |
| 行動の決め方 | 各行動の価値を比較して選ぶ | 行動の数値そのものを直接出力する |
| 向いている手法 | 価値ベース手法(DQNなど) | 「Actor-Critic」系の方策ベース手法 |
行動の候補を数え上げられるかどうかが、そのまま手法の向き不向きに結びついている関係です。この軸を押さえておくと、どちらの問題設定の話なのかを判断しやすくなります。
4. ビジネス・実務での活用シナリオ
ロボティクスの分野では、産業用ロボットアームの関節角度やトルクを連続的に調整することで、精密な組み立てや搬送作業を実現しています。関節の動きを段階的な選択肢ではなく滑らかな数値として制御できるため、部品を傷つけずに扱う繊細な作業や、ミリ単位の位置合わせが求められる工程に対応できます。
自動運転の分野では、ハンドルの操舵角やアクセル・ブレーキの踏力を連続的に制御することで、なめらかな加減速や車線維持を行います。操作を段階的な選択肢に区切ってしまうと、急なハンドル操作や急ブレーキにつながりかねないため、連続値制御問題としての精密な出力が乗り心地や安全性を左右します。
掃除ロボットや配膳ロボットのようなサービスロボットの分野でも、連続値制御問題の考え方が生かされています。速度と進行角度を細かく調整しながら走行することで、家具や通行人といった障害物を避けつつ目的の場所まで移動できます。
5. 要点まとめ
- 連続値制御問題は、行動が速度・角度・トルクのような連続的な数値で表される問題設定で、離散値制御(有限の選択肢から選ぶ設定)と対比されます。
- 連続値制御問題には「Actor-Critic」系の方策ベース手法(DDPG・SAC・PPO)が用いられ、行動価値を列挙する価値ベース手法(DQNなど)は不向きという関係にあります。
- ロボットアームの関節制御や自動運転の操舵・加減速など、滑らかな動作が求められる実務領域で連続値制御の枠組みが使われています。
6. 確認問題
問1連続値制御問題とは、エージェントの行動が速度や角度のような連続的な数値で表される問題設定のことである。
解答・解説をみる
○ 正しい
連続値制御問題は行動空間が連続する数値である点が定義の核心で、離散値制御(有限の選択肢から選ぶ設定)と対比されます。
問2連続値制御問題に対しては、各行動の価値を計算して最大のものを選ぶ価値ベース手法(DQNなど)が最も適している。
解答・解説をみる
× 誤り
価値ベース手法は行動候補が有限個の離散行動空間を前提としており、無限の値を取りうる連続行動空間には不向きです。正しくは、方策を直接出力する「Actor-Critic」系の方策ベース手法(DDPG・SAC・PPOなど)が用いられます。
問3連続値制御問題に対応する代表的なアルゴリズムとして、「Actor-Critic」の発展形であるDDPGやSACが挙げられる。
解答・解説をみる
○ 正しい
DDPGは決定論的な方策で連続値の行動を直接出力し、SACは確率的な方策とエントロピー正則化により探索の安定性を高めたアルゴリズムです。いずれも連続値制御問題に対応する代表的な手法です。

