Actor-Critic (G検定)

Actor-Critic

1. 定義と概要

Actor-Critic(法)とは、方策(どの状態でどの行動を取るかを決めるルール)を扱う二つの考え方である方策ベース手法(方策そのものを直接更新する手法)と価値ベース手法を統合した強化学習のフレームワークです。方策ベース手法は方策勾配法と呼ばれる系統の学習法にあたり、詳しい仕組みは別記事に譲りますが、Actor-Critic法ではこの考え方をCritic側の評価と組み合わせている点が特徴です。

具体的には、Actor側のネットワークが状態から行動の確率分布を出力します。Critic側のネットワークは、状態価値(ある状態にいることがどれだけ有利かを表す値)や行動価値(ある状態で特定の行動を取ることがどれだけ有利かを表す値。Q値とも呼ばれる)を学習してTD誤差(予測した価値と実際に得られた結果とのズレを表す指標)を計算します。その信号でActor側の方策を更新します。

強化学習の手法は、行動の価値を推定して間接的に方策を決める価値ベース手法と、方策そのものを直接最適化する方策ベース手法に大別されてきました。価値ベース手法の代表例にはDQN(ニューラルネットワークで行動の価値を推定する価値ベース手法の代表例)が、方策ベース手法の代表例にはREINFORCEがあります。

方策ベース手法単体はエピソード終了まで待って収益(リターン。エピソード終了までに得られる報酬の合計)をまとめて使うため、学習が不安定になり勾配の分散(学習の更新方向がどれだけばらつくかを示す指標)が大きくなるという課題を抱えていました。Actor-Critic法は、Critic側が逐次的に価値を評価してActor側へ更新の信号を供給する構造により、この分散の大きさを抑えて学習を安定させる手法として登場しました。

2. 試験対策ポイント

Actor側とCritic側の役割分担が、ここでの要点です。両者は行動を決める側と評価する側に分かれており、担当と出力を並べると対応関係がはっきりします。

観点 Actor側 Critic側
担当 方策に基づく行動の選択・実行 観測した状態と報酬をもとにした行動の価値の評価
出力するもの 状態に対する行動の確率分布 状態価値・行動価値の推定とTD誤差
方策の更新 供給された信号で自らの方策を更新する 更新に使う信号を供給する

Critic側が供給するTD誤差は、そのままActor側の方策更新に使われます。行動を選ぶ働きと良し悪しを見積もる働きを別々の役割として切り分けている点が、この手法の骨格にあたります。

Critic側がTD誤差を用いて逐次的に評価を更新する点は、REINFORCEがエピソード終了後の収益でまとめて方策を更新する点と対照的です。この対比は、Actor-Critic法とREINFORCEを区別する重要な論点にあたります。

Actor-Critic法は、Q値(ある状態で特定の行動を取ったときに期待できる価値)の比較から間接的に方策を決める価値ベース手法と、方策そのものを直接最適化する方策ベース手法を組み合わせた手法として位置づけられます。方策ベースの強みであるハンドル操作のような連続行動空間(ハンドルの角度のように無数の値を取りうる行動の範囲)の扱いやすさを保ちながら、学習の安定性を高める関係にあります。

発展形としては、複数の環境で非同期かつ並列に学習を進めるA3C(Asynchronous Advantage Actor-Critic。複数の環境で並列かつ非同期に学習を進めるActor-Critic法の発展手法)が知られており、Actor-Critic法を並列化・効率化した手法として言及されます。

3. 関連概念との比較・相違点

REINFORCEとの最大の違いは、Critic側の有無による勾配の分散の大きさにあります。REINFORCEはCritic側を持たず、エピソード終了後にまとめて得られる収益をそのまま学習に使うため、勾配のばらつきが大きくなりがちです。

これに対しActor-Critic法は、学習されたCritic側の評価をベースライン(勾配の分散を抑えるために差し引く基準値)として使うことで、この分散を抑えて学習を安定させる関係にあります。

価値ベース手法との最大の違いは、方策の決め方にあります。DQNのような価値ベース手法は、状態ごとに各行動のQ値を比較し、最も高い行動を選ぶという間接的な決め方です。

一方でActor-Critic法は、Actor側が状態から行動の確率分布を直接出力するため、ハンドル操作のような連続行動空間でも扱いやすいという特徴を保っています。Critic側はあくまで評価に徹し、行動の決定そのものには関与しません。

三つの手法を、方策の持ち方と学習に使う信号という二つの軸で並べると次のようになります。

手法 方策の持ち方 学習に使う信号
REINFORCE 方策を直接持つ(Critic側なし) エピソード終了後の収益(分散が大きい)
価値ベース手法(DQNなど) Q値の比較による間接的な決定 各行動の価値の推定値
Actor-Critic法 Actor側が行動の確率分布を直接出力 Critic側のTD誤差(分散を抑える)

この並びを見ると、Actor-Critic法が方策を直接持つ強みと、価値評価によって学習を安定させる強みを同時に取り込んでいることが読み取れます。

4. ビジネス・実務での活用シナリオ

ロボティクスの分野では、ロボットアームの関節角度制御のような連続的な行動選択にSoft Actor-Critic(SAC。探索の多様性を高める工夫を加えた連続値制御向けの発展手法)が使われています。Critic側による評価を通じて、滑らかで安定した制御を学習できる点が、離散的な選択を前提とする手法との違いです。

自動運転の分野では、ハンドル角やアクセル量のような連続的な制御量を出力する場面でActor-Critic法系の手法が使われています。Critic側による評価が方策の急激な変化を抑えるため、乗り心地や安全性を損なわない滑らかな制御につながります。

金融・トレーディングの分野でも、為替(FX)取引における売買のタイミング判断にAdvantage Actor-Critic(A2C。複数環境の経験を同期的にまとめて学習するActor-Critic法の発展手法)を応用する事例があります。この応用は連続的な制御量の調整だけでなく、売買・様子見といった離散的な判断にも及びます。Critic側が利益評価を担うことで、Actor側の売買方策を安定して更新できる点が実務上の利点です。

5. 要点まとめ

  • Actor-Critic法は、行動を選ぶActor側と行動を評価するCritic側を組み合わせ、方策ベース手法と価値ベース手法を統合した強化学習の手法にあたります。
  • REINFORCEとの違いはCritic側の有無による分散の大きさで、Critic側がTD誤差を逐次供給することで学習を安定させる関係にあります。
  • 価値ベース手法との違いは方策の決め方にあり、Actor-Critic法は方策を直接持つ点で連続行動空間を扱いやすく、発展形にA3CやSACがあります。

6. 確認問題

問1Actor-Critic法は、行動を選択するActor側と、その行動を評価するCritic側を組み合わせた手法であり、方策ベース手法と価値ベース手法を統合したものにあたる。

解答・解説をみる

○ 正しい

Actor-Critic法の基本構造にあたります。Actor側が方策を担い、Critic側が価値評価を担います。

問2REINFORCEはCritic側を用いて逐次的に価値を評価するため、Actor-Critic法よりも勾配の分散が小さい。

解答・解説をみる

× 誤り

正しくは、REINFORCEはCritic側を持たずエピソード終了後の収益をそのまま使うため勾配の分散が大きいという関係です。Actor-Critic法はCritic側の評価をベースラインとして使うことで分散を抑えます。逆向きの記述にあたります。

問3Actor-Critic法は価値ベース手法のようにQ値の比較から間接的に行動を決めるのではなく、Actor側が方策を直接持つため連続的な行動空間を扱いやすい。

解答・解説をみる

○ 正しい

方策を直接持つ方策ベース手法の強みを引き継いでいる点です。DQNのような価値ベース手法との対比にあたります。