方策勾配法 (G検定)

方策勾配法

1. 定義と概要

方策勾配法とは、方策をパラメータ(モデルの挙動を決める調整可能な数値)で表される関数としてモデル化する手法です。期待できる累積報酬(エピソード、つまり一連の行動のまとまりを通じて得られる報酬の合計)を目的関数(最大化・最小化を目指す対象として設定する関数)とします。その勾配(関数の値を大きくする方向を示す微分の値)の方向にパラメータを更新することで、方策を直接最適化していく強化学習の手法群です。

囲碁AIの着手選択のように確率的な行動を扱う場面や、ロボットの関節角度のように連続的な値を出力する場面などが、代表的な適用例として挙げられます。方策そのものの定義や基礎的な性質はすでに姉妹記事で扱っているため、本記事ではパラメータ化した方策を勾配で直接最適化するという総論の骨子にとどめます。

従来の強化学習では、状態と行動の組み合わせごとの価値(行動価値関数)を推定し、価値が高い行動を選ぶという価値ベースのアプローチが中心でした。代表例が、Q学習(行動の価値をQ値として推定し、最適な行動を選ぶ代表的な強化学習の手法)やDQN(Q学習を深層ニューラルネットワークで近似し、複雑な状況でも価値を推定できるようにした手法)です。

しかし、行動の選択肢が非常に多い場合や、ロボットの関節角度のような連続的な行動空間(角度や速度のように切れ目なく値が変化する行動の集合)では、事情が変わります。価値関数からもっとも価値の高い行動を割り出す処理そのものが難しくなり、計算コストも高くなるという課題があります。方策勾配法は、方策を直接パラメータ化し勾配法で最適化することで、この制約を回避する手法群として位置づけられます。

代表的なアルゴリズムには、エピソード全体の報酬をもとに更新するREINFORCE(もっとも基本的な方策勾配法)や、行動を決める役(Actor)と行動の価値を評価する役(Critic)を組み合わせた手法(Actor-Critic)があります。さらに、A3C(「Actor-Critic」を複数の環境で同時に並行して学習させ効率を高めた拡張手法)もあります。

いずれも方策を直接更新するという骨子は共通しており、違いは更新に使う情報や学習の進め方にあります。個別の詳細は姉妹記事に譲り、本記事では手法群全体の位置づけにとどめます。

2. 試験対策ポイント

強化学習のアルゴリズムは、行動価値関数を経由して間接的に行動を選ぶ価値ベース手法と、方策そのものを直接パラメータ化して最適化する方策ベース手法という二つの系統に整理されます。この分類軸そのものが、G検定における重要な論点です。

方策勾配法には、連続的な行動空間や確率的な方策を扱いやすいという利点がある一方、学習のたびに得られる報酬の分散(学習結果が試行のたびにどれだけばらつくかの大きさ)が大きく、学習が不安定になりやすいという制約があります。価値ベース手法との一長一短の対比にあたります。

代表的なアルゴリズムには発展の系譜があります。エピソード全体の累積報酬を用いてパラメータを更新するREINFORCEは、有名な囲碁AIの方策ネットワークの学習に用いられたことで知られています。そこから価値ベースの要素を取り込んだ「Actor-Critic」へ、さらにA3Cへという発展の流れがあり、それぞれの詳細は個別の記事のテーマにあたります。

3. 関連概念との比較・相違点

価値ベース手法(Q学習やDQNなど)との最大の違いは、行動価値関数を経由して間接的に行動を選ぶか、方策そのものを直接パラメータ化して最適化するかという点にあります。この違いは、行動の選び方と得意とする行動空間の二つの観点で対比できます。

観点 価値ベース手法 方策勾配法
行動の選び方 各行動の価値をまず見積もり、もっとも価値の高い行動を選ぶ 価値の推定を経由せず、方策のパラメータを勾配の方向へ直接更新する
扱いやすい行動空間 離散的な行動を扱う場面で計算処理が扱いやすい 連続的な行動空間や確率的な方策を扱いやすい

どちらが優れているという関係ではなく、扱う課題の性質によって向き不向きが分かれる関係にあたります。

「Actor-Critic」との関係は、比較というより包含関係にあります。方策勾配法は方策ベースの手法群全体を指す総称であり、「Actor-Critic」はそのうち、価値関数による評価を組み合わせた具体的な発展形の一つという位置づけです。

つまり「Actor-Critic」は方策勾配法という大きな分類の内側にある一手法であり、両者を並列の対立概念として捉えると誤りになります。アルゴリズムの詳細な処理は姉妹記事に譲ります。

4. ビジネス・実務での活用シナリオ

ロボティクスの分野では、関節角度やモーター出力のように切れ目なく値が変化する行動空間の制御において、方策を直接最適化することで滑らかな動作を学習させる取り組みが見られます。価値ベース手法では、こうした連続的な制御量からもっとも価値の高い行動を割り出す処理が難しくなりやすく、方策勾配法のアプローチが適した領域とされています。

ゲームAIの分野では、囲碁AIの着手選択を担う方策ネットワークの学習に方策勾配法(REINFORCE)の考え方が用いられ、局面ごとの着手確率を直接調整する仕組みに活用されました。方策そのものを更新の対象とすることで、膨大な選択肢を持つ局面でも確率的な着手選択を学習できます。

自動運転・自律移動の分野でも、ハンドルの操作角度のような連続的な制御量を直接出力する場面で、方策勾配法に基づく学習手法が研究・活用されています。離散的な選択肢に区切らず滑らかな制御量をそのまま扱える点は、実際の車両制御と相性がよい特徴です。

5. 要点まとめ

  • 方策勾配法は、方策をパラメータ化した関数として直接最適化する強化学習の手法群であり、価値関数を経由するQ学習・DQNなどの価値ベース手法と対をなす分類軸です。
  • 連続的な行動空間や確率的な方策を扱える点が利点ですが、学習の分散が大きく不安定になりやすい制約があります。
  • REINFORCEから「Actor-Critic」、A3Cへと発展する系譜があり、それぞれの詳細は個別のテーマとして扱われます。

6. 確認問題

問1方策勾配法は、行動価値関数を経由せず、方策そのものをパラメータ化した関数として直接最適化する手法である。

解答・解説をみる

○ 正しい

方策勾配法は価値関数を介さず、方策のパラメータを勾配の方向に直接更新する点が、Q学習など価値ベース手法との違いになります。

問2方策勾配法は、Q学習のような価値ベース手法と比較して、連続的な行動空間を扱うことが難しいという制約がある。

解答・解説をみる

× 誤り

実際は逆で、連続的な行動空間や確率的な方策を扱いやすい点が方策勾配法の利点です。価値ベース手法のほうが、連続的な行動空間ではもっとも価値の高い行動を割り出す処理が難しくなる傾向にあります。逆向きの記述は、利点と制約を取り違えた典型的な誤りです。

問3「Actor-Critic」は、行動を決める役(Actor)と行動の価値を評価する役(Critic)を組み合わせた手法であり、方策ベースと価値ベースの複合形として位置づけられる。

解答・解説をみる

○ 正しい

行動を決める役(Actor)と評価する役(Critic)の役割分担、および方策勾配法の系譜における位置づけ(価値ベースの要素を取り込んだ発展形)にあたります。