方策 (G検定)

方策

1. 定義と概要

方策(policy、記号π)とは、強化学習においてエージェント(状態を観測して行動を選ぶ学習主体)が、行動を選ぶ際の判断基準となる関数や規則のことです。方策には二つの種類があり、ある状態に対して行動を一つに定める決定的方策(a=π(s))と、状態ごとに各行動を選ぶ確率を与える確率的方策(π(a|s))に分かれます。

この二つの違いは、迷路の探索を例にすると見通しがよくなります。

種類 行動の決まり方 迷路の探索での例
決定的方策 ある状態に対して行動を一つに定める この位置では必ず右に進む
確率的方策 状態ごとに各行動を選ぶ確率を与える この位置では右に70%、左に30%の確率で進む

同じ位置にいても、決定的方策では毎回同じ行動が選ばれるのに対して、確率的方策では選ばれる行動が回ごとに変わりえます。この差が、後で触れる探索の余地を残すかどうかにつながります。

強化学習が登場する前の自動制御では、状況ごとにとるべき行動をあらかじめ人間がルールとして書き下す手法が中心でした。しかし強化学習では、エージェントが試行錯誤(実際に行動して結果を確かめながら学ぶこと)を繰り返します。そして、得られる報酬(行動の結果として環境から与えられる評価の数値)の合計である収益(将来にわたって得られる報酬を合計した値)を最大化するように、方策そのものを自ら学習する枠組みへと変わりました。

方策を学習するアプローチは大きく二つに分かれます。状態や行動の価値を推定してそこから方策を導く価値ベースの手法と、方策そのものをパラメータ(モデルの挙動を左右する内部の数値)で表して直接最適化する方策ベースの手法があります。

2. 試験対策ポイント

論点となるのは、方策の定義そのものと、状態から行動への対応づけを表す二つの表記です。ある状態に対して行動を一つに定める決定的方策(a=π(s))と、状態ごとに各行動を選ぶ確率を与える確率的方策(π(a|s))の違いは、方策を理解するうえでの中心的な論点です。

あわせて、方策の良し悪しはその方策に従って行動した場合に得られる期待収益によって評価されるという関係も重要です。この期待収益を状態ごとに表したものが状態価値関数V^π(s)、状態と行動の組ごとに表したものが行動価値関数Q^π(s,a)であり、方策と価値関数(ある状態や行動がどれだけ良いかを数値で表す関数)はこうした評価の観点で結びついています。

方策を学習する道筋は大きく二つに分かれます。どちらも最終的に良い方策を得ることを目指しますが、そこへ至る経路が異なります。

アプローチ 学習の進め方 代表例
価値ベース 価値関数を推定し、そこから方策を導く Q学習
方策ベース 方策そのものをパラメータとして表し直接最適化する 方策勾配法

方策勾配法とは、方策のパラメータを少しずつ調整して直接最適化する学習手法です。この二つの系統は、試験でよく対比されます。方策勾配法やREINFORCEは、方策ベースのアプローチを実現する発展的な各論として位置づけられます。なお、Actor-Critic(価値関数を推定するCritic役と方策を最適化するActor役を組み合わせた手法)のように、価値ベースと方策ベースを組み合わせたハイブリッド手法もあります。

また、新しい行動を試す探索と、今分かっている最良の行動を選ぶ活用のバランスも、あわせて整理しておきたいところです。確率的方策やε-greedy方策のようにランダム性を持つ方策は、この探索の役割を担います。

そして、あらゆる状態において期待収益を最大にする方策は最適方策(π*、あらゆる状態で期待収益を最大にする理想の行動の選び方)と呼ばれ、強化学習が最終的に求める到達点として位置づけられます。

3. 関連概念との比較・相違点

価値関数との最大の違いは、評価する対象にあります。方策は状態に対してどの行動を選ぶかを表す関数であるのに対し、価値関数はある状態や状態と行動の組がどれだけ良いかを数値で表す関数です。

方策は行動の選び方を定める関数、価値関数はその行動や状態の良さを測る物差しという役割分担にあり、この二つは取り違えやすい点です。主語が「どう行動を選ぶか」なのか「状態や行動の価値」なのかを見分けることで、方策と価値関数のどちらを指しているかを判別できます。

方策勾配法との関係は、概念と手法という階層で整理できます。方策は強化学習における学習対象の概念そのものを指すのに対し、方策勾配法は方策のパラメータを勾配上昇法(評価指標が大きくなる方向にパラメータを少しずつ動かして最適化する手法)によって直接最適化する具体的な学習アルゴリズムの一つです。

つまり方策勾配法は、方策ベースのアプローチにおいて方策を最適方策に近づけるための計算手順にあたり、方策という概念そのものとは抽象度の異なる階層に位置します。価値ベースのQ学習が価値関数を経由して間接的に方策を得るのに対し、方策勾配法は方策のパラメータを直接動かして最適化する点に違いがあります。

4. ビジネス・実務での活用シナリオ

ロボットアームの関節角度のように、行動の選択肢が連続的な値になる課題では、確率的方策を用いて動作を滑らかに調整しながら学習が進められます。離散的な行動しか扱えない手法では対応しづらい細かな制御に、この仕組みが効果を発揮します。確率的方策によって動作にわずかなばらつきを持たせることで、周囲の状況変化に応じた微調整が可能になります。

推薦や広告配信の分野では、ユーザーの閲覧状況という状態に応じて表示するコンテンツという行動を決める方策を、強化学習によって最適化します。クリック率や滞在時間といった報酬の最大化を図ることで、ユーザーごとに異なる最適な表示内容を導き出す仕組みが実現されます。ユーザーごとに反応の傾向が異なるため、方策を継続的に更新し続けることが、提示内容の精度を保つ土台になっています。

工場設備の稼働状況や在庫水準といった状態に応じて、発注量や稼働パターンという行動を決める方策を学習させる取り組みも進んでいます。コストと欠品リスクのバランスを取りながら運用全体を最適化できる点が、この分野で方策を活用する意義です。季節変動や需要の急な変化にも追従できる点で、あらかじめルールを固定する従来の運用とは異なる柔軟性を持ちます。

5. 要点まとめ

  • 方策(π)とは、状態から行動への対応づけを定める関数であり、行動を一意に定める決定的方策と、行動選択の確率を状態ごとに与える確率的方策に分かれます。
  • 方策の良し悪しは、その方策に従って得られる期待収益(価値関数)によって評価され、価値関数を経由して方策を導く価値ベースと、方策自体を直接最適化する方策ベースの2系統があります。
  • 最適方策(π*)は、あらゆる状態で期待収益を最大にする方策として定義され、これを具体的に求める手法として方策勾配法などが用いられます。

6. 確認問題

問1決定的方策は、ある一つの状態に対して常に同じ一つの行動を指定する方策である。

解答・解説をみる

○ 正しい

決定的方策はa=π(s)の形で、状態sに対して行動aを一意に定めます。これに対し確率的方策は行動選択の確率を与える点で異なります。

問2確率的方策では、各行動を選ぶ確率があらかじめ一つに固定されており、状態が変わっても行動選択の確率は変化しない。

解答・解説をみる

× 誤り

誤りは「状態が変わっても確率は変化しない」という部分です。確率的方策π(a|s)は状態sごとに行動選択の確率を与える関数であり、正しくは状態に応じて確率分布が変わります。

問3方策の良し悪しは、その方策に従って行動した場合に得られる期待収益によって評価される。

解答・解説をみる

○ 正しい

期待収益を状態や状態行動の組ごとに表したものが価値関数であり、方策と価値関数は評価の観点で対応関係にあります。