1. 定義と概要
マルコフ決定過程モデル(MDP)とは、エージェント(状態を観測して行動を選ぶ、学習・意思決定の主体)がある状態で行動を選択すると、その行動に応じて確率的に次の状態へ遷移し報酬を受け取る一連のプロセスを表す数理モデルです。この一連の流れを、状態(S)・行動(A)・遷移確率(P)・報酬(R)・割引率(γ)という5つの要素でMDP=(S,A,P,R,γ)と表します。
5つの要素が何を指すのかを並べると、次のようになります。
| 要素 | 記号 | 何を表すか |
|---|---|---|
| 状態 | S | エージェントが置かれている状況やその時点の情報 |
| 行動 | A | エージェントがある状態で選べる選択肢 |
| 遷移確率 | P | ある行動を取ったときに次の状態へ移る確率 |
| 報酬 | R | 行動の結果としてエージェントが受け取る評価の数値 |
| 割引率 | γ | 将来もらえる報酬を今の価値に換算するときの重み |
このうち遷移確率とは、ある行動を選んだ結果として次の状態へ移る確からしさを表す数値のことです。遷移確率と報酬は、行動が引き起こす変化と、その行動をどう評価するかを結び付ける要素にあたります。具体例として、迷路探索エージェントの現在位置を状態、移動方向を行動、目的地到達時に得られる値を報酬とみなす設定が挙げられます。
強化学習の問題は「試行錯誤しながら学習する」という直感的な説明にとどまりがちですが、何を最適化するかを厳密に扱うには数学的な枠組みが必要になります。マルコフ決定過程は、状態遷移がマルコフ性を満たすことを前提に、強化学習の問題を「状態・行動・報酬の系列でどう価値を最大化するか」という形に定式化する枠組みです。
マルコフ性とは、次に何が起こるかは今の状態と行動だけで決まり、それより前の経緯は関係ないという性質を指します。マルコフ性そのものの詳細な解説は姉妹記事に譲り、ここでは前提条件としての最小限の説明にとどめます。
2. 試験対策ポイント
G検定における重要な論点は、マルコフ決定過程モデルが状態・行動・遷移確率・報酬・割引率の5要素で構成され、MDP=(S,A,P,R,γ)という表記とともに整理しておきたい点です。
加えて、マルコフ性がMDPの前提条件になっている点も重要なテーマになります。次の状態が現在の状態と行動のみに依存し、過去の履歴には依存しない性質が満たされていることが、MDPとして問題を定式化する条件になっています。
割引率(γ)は0から1の範囲の値をとり、将来の報酬をどの程度重視するかを表す値です。1に近いほど将来の報酬を重視し、0に近いほど直近の報酬を重視する関係にあります。この割引率は、方策(policy、ある状態でどの行動を選ぶかを決めるルール)や価値関数(ある状態や行動がどれくらい良いかを数値で表したもの)といった関連概念とセットで、強化学習の問題設定を構成する要素として扱われます。
マルコフ決定過程は強化学習の問題そのものを定式化する枠組みであり、その解法にあたる価値反復法や方策反復法とは区別される概念です。MDPが「何を解くか」を定める設計図であるのに対し、価値反復法や方策反復法は「どう解くか」の手続きにあたります。この区別は、名称の似た用語を取り違えやすい点です。
3. 関連概念との比較・相違点
マルコフ過程(マルコフ連鎖)との最大の違いは、行動と報酬の有無にあります。マルコフ過程は状態が確率的に遷移していく様子のみを扱う枠組みであり、そこに行動を選ぶ要素は含まれません。これに対してマルコフ決定過程は、エージェントが行動を選択し、その結果として報酬を受け取るところまでを扱う点で、単なる状態遷移のモデルとは一線を画します。
部分観測マルコフ決定過程(POMDP)とは、エージェントが状態を直接見ることができず、一部の情報からしか状況を推測できない場合を扱う枠組みです。マルコフ決定過程との違いは、状態の観測可能性にあります。
マルコフ決定過程は、エージェントが状態を完全に観測できることを前提とした枠組みです。一方でPOMDPは、センサーの情報が不完全である場合など、状態を直接観測できず一部の情報から推測しなければならない状況を扱います。
3つの枠組みが何を扱い、何を前提にしているのかを並べると、区別がはっきりします。
| 枠組み | 行動の選択 | 報酬 | 状態の観測 |
|---|---|---|---|
| マルコフ過程 | 含まない | 含まない | 状態遷移のみを扱う |
| マルコフ決定過程 | 含む | 含む | 完全に観測できる前提 |
| 部分観測マルコフ決定過程 | 含む | 含む | 直接観測できず推測が必要 |
これらは、現実の意思決定問題をどこまで単純なモデルに落とし込んでよいかという観点で使い分けられる関係にあります。
4. ビジネス・実務での活用シナリオ
物流・在庫管理の分野では、倉庫の在庫量を状態、発注量を行動として捉え、欠品や過剰在庫によるコストを抑える発注戦略をマルコフ決定過程として定式化する取り組みが見られます。需要は日々変動するため、経験や勘だけに頼った発注では欠品と過剰在庫のどちらかに偏りがちです。行動を選んだ結果として生じるコストを報酬として数値化することで、状況に応じた発注方策を導けるようになります。
ロボティクス・製造業の分野では、ロボットアームの関節角度を状態、次の動作を行動として捉え、目的物体の把持成功までの動作系列を報酬に基づいて最適化する応用が進んでいます。人手であらゆる動作パターンを設計するには限界があり、報酬を手がかりに試行錯誤しながら動作系列を学習させる仕組みが実務上の解決策になります。
ゲームAI・自動運転の分野では、盤面や周囲環境を状態、着手やハンドル操作を行動として捉え、勝敗や安全な走行を報酬として最大化する意思決定の枠組みとして応用されています。とくに自動運転では、刻々と変化する周囲の状況に応じて次の一手を選び続ける必要があり、状態と行動の関係を明確に定式化できるマルコフ決定過程が土台になっています。
5. 要点まとめ
- マルコフ決定過程モデルは、状態・行動・遷移確率・報酬・割引率の5要素(S,A,P,R,γ)で強化学習の問題を定式化した数理モデルです。
- 次の状態が現在の状態と行動のみで決まるマルコフ性が前提となっており、方策や価値関数といった関連概念とセットで強化学習の問題設定を構成します。
- 行動と報酬の有無でマルコフ過程と区別され、状態の完全観測を前提とする点で部分観測マルコフ決定過程(POMDP)と区別されます。
6. 確認問題
問1マルコフ決定過程モデルは、状態・行動・遷移確率・報酬・割引率の5つの要素で構成される。
解答・解説をみる
○ 正しい
マルコフ決定過程モデルはMDP=(S,A,P,R,γ)と表され、状態(S)・行動(A)・遷移確率(P)・報酬(R)・割引率(γ)の5要素からなります。この5要素と表記はセットで押さえておきたいところです。
問2マルコフ性とは、次の状態が現在の状態だけでなく過去のすべての履歴に依存して決まる性質を指す。
解答・解説をみる
× 誤り
正しくはその逆で、次の状態は現在の状態と選択した行動のみに依存し、過去の履歴には依存しないという性質を指します。過去への依存を含める記述は誤りとなります。
問3割引率(γ)は0から1の範囲の値をとり、将来受け取る報酬をどの程度重視するかを表す。
解答・解説をみる
○ 正しい
割引率は将来の報酬を現在の価値に換算する重みで、0から1の範囲をとります。1に近いほど将来の報酬を重視し、0に近いほど直近の報酬を重視します。

