1. 定義と概要
環境モデルとは、強化学習においてエージェント(環境の中で行動を選択する学習の主体)が置かれた環境について、ある状態と行動から次にどの状態に遷移し、どれだけの報酬が得られるかを予測する仕組みです。
強化学習の問題を定式化する数学的な枠組みであるマルコフ決定過程(MDP。状態・行動・状態遷移確率・報酬関数で表されます)では、環境モデルは状態遷移確率(ある状態から次の状態に移る確率)と報酬関数(行動の結果としてどれだけの報酬が得られるかを決める関数)として定式化されます。
直感的なイメージとしては、迷路問題における「迷路の地図」が近いでしょう。どの道が行き止まりでどこが出口につながるかを示す情報が、環境モデルの役割に相当します。地図があれば実際に歩く前にゴールまでの道筋を考えられるように、環境モデルがあればエージェントは実際に行動する前に結果を予測できます。
従来のQ学習(行動の価値を実際の経験から直接学習する代表的な手法)のようなモデルフリー強化学習は、環境と実際に何度もやり取りしながら、ある状態や行動がどれだけ良いかを表す価値関数や、どの状態でどの行動を選ぶかを決める方策を直接学習します。この方式は試行回数を多く必要とし、実機ロボットのように現実世界での試行にコストや破損リスクが伴う場面では非効率になりやすい面があります。
試行のたびに部品が摩耗したり時間がかかったりする状況では、学習の完了までに膨大な手間がかかってしまいます。そこで、環境モデルを構築し、実環境での経験と環境モデルから生成した仮想的な経験を組み合わせて学習を効率化するモデルベース強化学習が研究されています。
2. 試験対策ポイント
G検定における環境モデルの重要な論点は、状態遷移(次にどの状態に移るか)と報酬(どれだけの報酬が得られるか)を予測する仕組みという定義そのものと、それがマルコフ決定過程の状態遷移確率・報酬関数に対応するという結びつきです。
環境モデルを明示的に構築して活用するかどうかが、モデルベース強化学習とモデルフリー強化学習を分ける基準になります。この分類の軸は、強化学習の手法を整理するうえで基本となる考え方です。
モデルベース強化学習は、環境モデルを使って計画、いわゆるプランニング(行動する前に結果を予測して手順を組み立てること)や仮想的なシミュレーションを行う手法です。一方のモデルフリー強化学習は、Q学習や方策勾配法(方策のパラメータを勾配に沿って直接更新する手法)のように経験から直接価値関数や方策を学習する手法です。実用化されている深層強化学習(ニューラルネットワークを用いて価値関数や方策を学習する強化学習)の多くは、こちらに分類されます。
2つの立場の違いを観点ごとに並べると、次のように整理できます。
| 観点 | モデルベース強化学習 | モデルフリー強化学習 |
|---|---|---|
| 環境モデルの扱い | 明示的に構築して活用する | 構築せずに学習を進める |
| 学習の進め方 | プランニングや仮想的なシミュレーションで手順を組み立てる | 経験から直接、価値関数や方策を学習する |
| 必要な試行回数 | 少ない試行でも学習が進みやすい | 多くの試行を必要としやすい |
環境モデルの扱いの行が、そのまま2つを分ける基準にあたります。モデルベースの代表的な枠組みにはDyna(実環境での経験と環境モデルから生成した仮想経験を組み合わせて学習を効率化する手法)があります。将棋や囲碁のように遷移関数(ルール)が最初から既知の場合は、その環境モデルを使ってモンテカルロ木探索(探索木をランダムなシミュレーションで評価しながら次の一手を選ぶ探索手法)で数手先を読みます。
モデルベース強化学習の利点は、サンプル効率(少ない試行回数でどれだけ学習が進むかを表す度合い)の良さにあります。制約としては、環境モデルの推定に誤差が生じると、その誤差が方策の質にそのまま影響してしまう関係にあります。
現実の環境を完全に正確な数式で表すことは難しいため、この誤差をどう抑えるかが研究上の課題になっています。この利点と制約は、セットで押さえておきたいポイントです。
3. 関連概念との比較・相違点
環境モデルと世界モデル(World Model)は、しばしば混同される関係にあります。環境モデルは強化学習の理論的な構成要素で、状態遷移と報酬を予測する仕組みを指す一般的な用語です。一方、世界モデルはエージェントが観測データから深層学習によってその環境モデルを内部に学習し、将来を予測・シミュレーションして方策の学習に活用する具体的な枠組みを指す用語で、2018年のHaらの論文で提唱されました。
両者の詳しい仕組みは別の記事で扱いますが、G検定では、環境モデルという概念を具体的に実現する枠組みの一つが世界モデルという関係にあります。つまり、環境モデルが指す範囲の方が広く、世界モデルはその実現方法の一つという位置づけです。
動的計画法(価値反復法など)との違いは、環境モデルが既知か未知かという前提にあります。動的計画法は、環境モデル、つまり状態遷移確率・報酬関数が完全に既知であることを前提に最適な行動を厳密に計算する手法です。これに対してモデルベース強化学習は、環境モデルが未知・不完全な場合でも、それを推定しながら活用する点が異なります。
あらかじめルールが分かっている問題なら動的計画法で解け、ルールが分からない、あるいは複雑すぎて式に表せない問題ではモデルベース強化学習が候補になるという位置づけです。
4. ビジネス・実務での活用シナリオ
ロボティクスの分野では、実機ロボットが自身の動きの結果、つまり状態遷移を環境モデルとして学習する取り組みが進んでいます。破損リスクの高い動作は実機ではなく仮想的なシミュレーション上でまず試すことで、学習の効率と安全性を両立できます。実機だけで試行を重ねる方法では部品の摩耗や事故のリスクが避けられないため、仮想的な経験を併用できる環境モデルの存在が重要になります。
物流・配送最適化の分野では、渋滞や配送時間の変化を環境モデルとして表現する活用が考えられます。実際に車両を動かす前に配送ルートの候補を仮想的に計画してから最適なルートを選べるため、現場での試行錯誤にかかるコストを抑えられます。配送ルートを実際の車両で試しながら決めるのは時間もコストもかかるため、環境モデル上で候補を絞り込んでから実行に移す進め方が現実的です。
ボードゲームAIの分野では、将棋や囲碁のようにルール、つまり状態遷移が最初から既知である特性を生かし、その環境モデルを使ってモンテカルロ木探索で数手先を読み、最適な一手を選択します。ルールが完全に分かっている環境であるため、環境モデルをそのまま探索に使える点が特徴です。ルールを推定する手間がかからない分、探索そのものに計算資源を集中できるという利点があります。
5. 要点まとめ
- 環境モデルとは、強化学習において現在の状態と行動から次の状態と報酬を予測する仕組みで、マルコフ決定過程の状態遷移確率・報酬関数に対応します。
- 環境モデルを構築・活用するかどうかがモデルベース強化学習とモデルフリー強化学習を分ける基準で、モデルベースはプランニングにより実環境での試行回数を減らせます。
- 環境モデルは強化学習の一般的な構成要素で、世界モデルはそれを深層学習で学習し方策の学習に活用する具体的な枠組みという関係にあります。
6. 確認問題
問1環境モデルとは、強化学習において現在の状態と行動から次の状態や報酬を予測する仕組みを指す。
解答・解説をみる
○ 正しい
環境モデルはマルコフ決定過程における状態遷移確率と報酬関数に対応する仕組みで、次にどの状態に移りどれだけの報酬が得られるかを予測します。
問2モデルフリー強化学習は、環境モデルを明示的に構築してから方策を学習する手法である。
解答・解説をみる
× 誤り
環境モデルを構築・活用するのはモデルベース強化学習の特徴です。モデルフリーは環境モデルを使わず、Q学習のように経験から直接方策や価値関数を学習します。分類の基準を取り違えやすい点です。
問3モデルベース強化学習は、環境モデルを用いた計画によって実環境での試行錯誤の回数を減らせる利点がある。
解答・解説をみる
○ 正しい
環境モデルを使って仮想的なシミュレーションや計画を行うことで、実環境での試行回数を抑えながら学習を進められます。この点がモデルベース強化学習の利点です。

