モデルフリー (G検定)

モデルフリー

1. 定義と概要

モデルフリーとは、強化学習において環境モデル(状態遷移確率と報酬関数を予測する関数)を推定せず、環境との相互作用から得られる経験(状態・行動・報酬の観測)のみをもとに方策や価値関数を学習する手法です。

代表例として、Q学習(状態と行動の組み合わせの価値を更新しながら最適な行動を学ぶ手法)と、SARSA(実際にとった行動をもとに価値を更新していく、Q学習に似た手法)が挙げられます。ほかにモンテカルロ法(1エピソード分の結果、つまり収益をまとめて平均して価値を見積もる手法)も代表例です。

方策を決める数値を報酬が大きくなる方向へ直接更新していく方策勾配法(REINFORCEなど)もモデルフリーの代表的な手法です。行動を選ぶ役(Actor)と行動を評価する役(Critic)を組み合わせたActor-Critic(A3C、PPOなど)も同様です。

これらはいずれも、環境がどのような仕組みで状態や報酬を生成しているかを事前に知らないまま、実際の経験だけを頼りに学習を進める点で共通しています。深層強化学習の代表例であるDQN(Deep Q-Network)は、Q学習をニューラルネットワークで近似したモデルフリー型のアルゴリズムです。

実世界の複雑な環境では、状態遷移確率(ある行動を取ったときに次の状態へ移る確からしさ)を正確にモデル化すること自体が難しい場合が多くあります。環境の仕組みを式として書き下せなければ、そもそも環境モデルを推定するという入口に立てません。

実用化されている深層強化学習の多くはモデルフリーで、環境モデルの構築が難しい現実の問題に広く使われています。一方でサンプル効率の観点からモデルベースの手法も注目されています。

2. 試験対策ポイント

モデルフリーの定義そのものが、まず押さえておきたいポイントです。環境モデルを推定せず、環境との相互作用から得た経験のみで方策や価値関数を学習する点が、モデルベースとの違いとして取り違えやすい点です。この定義を内部の分類や制約と結び付けて理解しているかどうかが、選択肢を見分ける鍵になります。モデルベースかモデルフリーかは、代表的なアルゴリズム名から逆算して判断できるかどうかも判断材料になります。

モデルフリーの内部は、何を学習の対象に置くかによって、大きく次のように分かれます。

分類 学習の対象 代表的な手法
価値ベース 状態と行動の組み合わせの価値、つまりQ値 Q学習、SARSA
方策ベース とるべき行動の確率分布、つまり方策そのもの 方策勾配法、REINFORCE
Actor-Critic 行動を選ぶ役と行動を評価する役の両方 A3C、PPO

価値ベースの代表例であるQ学習とは、状態と行動の組み合わせの価値、つまりQ値を更新しながら最適な行動を学ぶ手法です。SARSAとは、実際にとった行動をもとにQ値を更新していく、Q学習によく似た手法を指します。一方の方策ベースとは、とるべき行動の確率分布、つまり方策そのものを直接学習する考え方です。

モデルベースに比べてサンプル効率(少ない試行回数、つまり経験でどれだけ学習が進むかを表す度合い)が劣るという制約も重要なテーマです。環境モデルによる先読みができない分、モデルフリーは多くの試行錯誤を必要とします。

実際の環境で何度も行動を試し、その結果得られる報酬から少しずつ方策を修正していく点が、モデルベースとの大きな違いです。深層強化学習の代表例であるDQNは、Q学習をベースにしたモデルフリー型のアルゴリズムであるという結び付けも、あわせて押さえておきたいところです。

3. 関連概念との比較・相違点

モデルベースとの最大の違いは、環境モデルを推定して使うかどうかという点にあります。モデルベースは推定した環境モデルを使い、将来の状態を先読みしてから方策を決めます。一方でモデルフリーは、環境モデルを持たず、経験から直接方策や価値関数を学習します。

両者を区別する分かれ目は、環境モデルを介するかどうかという一点にあります。この軸に沿って考えれば、初見のアルゴリズムであっても、環境モデルを介するかどうかでどちらに分類されるかを判断できます。

分類の軸が異なる概念として、オフライン強化学習(学習中に環境と相互作用せず、事前に収集済みの固定データセットのみで学習する手法)との違いもあります。混同を避けるには、次のように軸そのものを分けて眺めるのが近道です。

分類の軸 区別する基準 分かれる区分
環境モデルの有無 環境モデルを推定して使うかどうか モデルフリー/モデルベース
データの集め方 学習中に環境と相互作用して集めるか、収集済みの固定データセットのみを使うか オンライン/オフライン強化学習

したがって、モデルフリーのアルゴリズムを固定データセットで学習させる組み合わせも成立し、二つの分類は互いに独立した関係にあります。つまりモデルフリーか否かという軸と、オフラインか否かという軸は、別々に組み合わせて考える必要があります。

4. ビジネス・実務での活用シナリオ

ゲームAIの分野では、「Atari」のようなビデオゲームでスコアを最大化する方策を、DQNなどモデルフリー型の深層強化学習が獲得します。ゲームのルールを事前にモデル化する必要がないため、ルールや画面構成が異なる多様なゲームにも、同じ学習の枠組みをそのまま適用しやすいという利点があります。スコアという単純な報酬信号だけで学習が進む点も、モデルフリー型の手法が採用されやすい理由です。

ロボティクスの領域では、実機ロボットの制御学習にモデルフリー手法を用いると、サンプル効率の低さから大量の試行が必要になります。実機での試行を繰り返すと機体の摩耗や事故のリスクも伴うため、そのまま大量の試行錯誤を行うことは現実的ではありません。そのため実務では、シミュレーション環境で先に学習を進め、得られた方策を実機へ転移させる工夫がとられています。

Web推薦や広告配信の現場では、ユーザーのクリックや購入といった反応を報酬として直接学習に用います。ユーザー行動をあらかじめモデル化しなくても、蓄積された反応データから方策を改善できる点が、モデルフリーの実務上の強みになっています。

ユーザーの好みは時間とともに変化するため、固定的なモデルを作り込むより、日々の反応から学習し続ける仕組みのほうが実務に適しています。反応データが日々蓄積される環境では、モデルフリーの学習方式との相性がよいといえます。

5. 要点まとめ

  • モデルフリーは環境モデル(状態遷移・報酬の予測関数)を推定せず、環境との試行錯誤から直接方策や価値関数を学習する強化学習の手法です。
  • 内部は価値ベース(Q学習、SARSA)と方策ベース(方策勾配法、REINFORCE)、両者を組み合わせたActor-Critic(A3C、PPOなど)に分かれます。
  • モデルベースに比べてサンプル効率が劣るという制約がある一方、DQNなど深層強化学習の多くはモデルフリー型として実用化されています。

6. 確認問題

問1モデルフリー強化学習は、環境の状態遷移確率や報酬関数といった環境モデルを推定せずに、環境との相互作用から得られる経験のみで方策や価値関数を学習する手法である。

解答・解説をみる

○ 正しい

モデルフリーの定義そのものです。環境モデルを持たずに経験から直接学習する点が、モデルベースとの違いになります。

問2モデルフリー強化学習は環境モデルを用いた先読みができるため、モデルベースに比べてサンプル効率が高い。

解答・解説をみる

× 誤り

正しくは逆です。モデルフリーは環境モデルを持たないため多くの試行錯誤を必要とし、サンプル効率はモデルベースより劣ります。先読みができサンプル効率が高いのはモデルベース側で、これを取り違えた記述になっています。

問3モデルフリー強化学習には、行動の価値を推定して行動を選ぶ価値ベース(Q学習など)と、方策そのものを直接学習する方策ベース(方策勾配法など)という分類がある。

解答・解説をみる

○ 正しい

モデルフリー内部の代表的な分類です。行動を選ぶ役と評価する役を組み合わせた手法(Actor-Critic)も存在します。