1. 定義と概要
REINFORCEとは、方策関数のパラメータ(方策の振る舞いを決める調整値の集まり)であるθを、1エピソード(スタートからタスク終了までの一連の行動のまとまり)が終わったあとに得られる収益(Gt。あるエピソードの中で、その時点以降に得られる報酬を合計した値)を使って更新する、モンテカルロ法(実際に試行を最後まで行った結果を使って値を推定する方法)に基づく方策勾配法の基本的な実装です。
方策そのものはπθという関数(方策関数)で表され、1992年にRonald Williams氏が発表した論文で提案されました。更新式はθ←θ+α・Gt・∇logπθ(at|st)という形をとります。記号を一つずつ分解すると、次のような役割を担っています。
| 記号 | 意味と役割 |
|---|---|
| θ | 方策関数のパラメータ。更新の対象になる値です |
| α | 学習の一歩の大きさを決める学習率。一度の更新でθを動かす幅を決めます |
| Gt | 1エピソードが終わってから確定する収益。勾配に掛け合わせる重みになります |
| ∇logπθ | 状態stで行動atを選ぶ確率の対数を微分した勾配です |
つまり、対数の勾配に収益Gtを掛け合わせてθを書き換える式であり、収益が大きい行動ほど選択確率を強める方向にパラメータが動きます。応用例として、囲碁AIのAlphaGoに搭載されたRLポリシーネットワークは、自己対局(AI同士を対戦させて学習用のデータを作る方法)を重ねた最終的な勝敗を収益として、対数方策の勾配を更新する仕組みを採用しています。
従来の強化学習は、価値ベース手法(行動の価値を先に推定してから行動を選ぶアプローチ)が中心でした。ある状態で特定の行動をとったときに将来得られる報酬の期待値であるQ値を推定するQ学習や、Q値をニューラルネットワークで推定するDQNがその代表です。
価値ベース手法は離散的な行動選択には強い一方、連続的な行動空間の表現や、同じ状態でも状況に応じて異なる行動を選ぶ確率的な方策の学習には不向きという課題を抱えています。この課題に対して、行動価値を経由せず方策関数そのものを直接最適化する方策勾配法が登場し、REINFORCEはその最も基礎的な実装として位置づけられています。
2. 試験対策ポイント
試験で重要な論点になるのは、REINFORCEがモンテカルロ法に基づく更新方式である点です。1ステップごとに推定値を更新する時間差分学習(TD法)とは異なり、エピソードが最後まで終わってから収益Gtをまとめて計算し、そのうえで方策パラメータを更新します。
収益Gtをそのまま使うと、分散(結果のばらつきの大きさ)が大きくなりやすく、学習が不安定になりやすいという弱点があります。これに対し、状態価値関数などをベースライン(収益から差し引く基準値で、学習のばらつきを抑えるための工夫)として収益から差し引くと、勾配推定にバイアスを増やすことなく分散だけを小さくできます。ここでの要点は分散とベースラインの関係です。
更新式の構造も重要な論点で、対数尤度勾配(log-derivative trick)とは、確率の対数を微分することで勾配の計算を簡単にする数学的な工夫です。選んだ行動の対数尤度に対するこの勾配に、その後得られた収益Gtを掛け合わせてパラメータを更新する構造をもち、収益が大きい行動ほど選択確率を強める方向に、小さい・負の行動ほど弱める方向にパラメータが動く関係にあります。
なお、REINFORCEはベースラインを価値関数(Critic。方策の良し悪しを評価する仕組み)で置き換えて分散低減をさらに進めたActor-Critic(方策を更新する仕組みと、その良し悪しを評価する仕組みを組み合わせた手法)など、発展的な手法の土台になっています。発展形自体の仕組みは別記事に譲りますが、REINFORCEがその出発点にあたる関係は、押さえておきたいポイントです。
3. 関連概念との比較・相違点
DQNとの最大の違いは、行動価値関数(Q値)を推定してから間接的に方策を決める価値ベースか、方策関数のパラメータを収益で直接更新する方策ベースか、という設計思想にあります。
DQNはQ値が最大となる行動を選ぶことで方策を間接的に表現するのに対し、REINFORCEは方策関数πθのパラメータそのものを収益Gtで直接更新するため、確率的な方策や連続的な行動空間の表現に向いています。加えて、DQNはモンテカルロ法ではなく時間差分学習(TD法)に基づき1ステップごとに更新するため、REINFORCEに比べて学習が安定しやすいという違いもあります。
両者の違いを観点ごとに並べると、次のように対応します。
| 観点 | DQN | REINFORCE |
|---|---|---|
| 設計思想 | 価値ベース。Q値を推定し、最大の行動を選ぶことで方策を間接的に表す | 方策ベース。方策関数πθのパラメータを収益で直接更新する |
| 更新の進め方 | 時間差分学習に基づき1ステップごとに更新する | モンテカルロ法に基づきエピソード終了後にまとめて更新する |
| 向いている場面 | 離散的な行動選択 | 確率的な方策や連続的な行動空間の表現 |
| 学習の安定性 | 相対的に安定しやすい | 収益のばらつきが大きく不安定になりやすい |
設計思想の違いが更新の進め方や得意な場面にまで及んでいる、という見取り図で捉えると整理しやすくなります。
Actor-Critic法との関係では、収益Gtのみをベースラインの基準にするREINFORCEに対し、Actor-Critic法は価値関数(Critic)を導入してベースラインの精度を高め、分散をさらに抑える発展形にあたります。ベースラインの選び方が学習の安定性を左右するという共通点はありますが、Actor-Critic自体の仕組みや学習の進め方は別記事に譲ります。
4. ビジネス・実務での活用シナリオ
ゲームAIの分野では、AlphaGoのRLポリシーネットワークが自己対局を重ねた最終的な勝敗に比例させて対数方策の勾配を更新する仕組みを採用しており、対局を重ねるごとに有利な手の選択確率を高めてきました。収益という一つの指標を頼りに方策を磨き上げていくREINFORCEの考え方が、囲碁という膨大な選択肢を持つゲームでも通用することを示す事例です。
ロボット制御の分野では、関節の角度やトルクのような連続的な行動を確率分布として表現し、試行錯誤を通じて動作方針を調整する場面に方策勾配の考え方が応用されます。一方で収益のばらつきが大きく、学習を安定させるにはベースラインの工夫や多くの試行回数が必要になります。
実機を使った試行には時間やコストがかかるため、分散の大きさに応じて試行回数が膨らむと、開発期間や検証コストの負担も増します。単純に収益だけを頼りにすると学習が発散しやすく、分散対策の重要性が実務の場でも表れる領域です。
5. 要点まとめ
- REINFORCEは方策勾配法を実装した具体的なアルゴリズムで、1エピソード終了後の収益Gtを使って方策パラメータを更新するモンテカルロ法に基づく手法です。
- 収益をそのまま使うと分散が大きくなりやすい弱点があり、状態価値などのベースラインを差し引いてバイアスを増やさずに分散を抑える工夫が柱になります。
- 更新式は対数尤度勾配×収益という構造をもち、AlphaGoのRLポリシーネットワークの学習にもこの考え方が使われています。
6. 確認問題
問1REINFORCEは、1エピソードが終了した後に得られた収益をもとに方策のパラメータを更新する、モンテカルロ法に基づくアルゴリズムである。
解答・解説をみる
○ 正しい
時間差分学習(TD法)のように1ステップごとに更新するのではなく、エピソード完了後にまとめて収益を計算して更新する点がREINFORCEの特徴にあたります。
問2REINFORCEでは、収益からベースラインを差し引くと勾配推定にバイアスが加わるため、実務での使用は避けるべきとされている。
解答・解説をみる
× 誤り
正しくは、ベースラインを適切に選べばバイアスを増やさずに分散だけを小さくできます。ベースラインを使わない場合のほうが分散が大きく学習が不安定になりやすく、逆向きの記述にあたります。
問3REINFORCEの更新式は、選択した行動の対数尤度に対する勾配に、その後得られた収益を掛け合わせる構造をもつ。
解答・解説をみる
○ 正しい
対数尤度勾配(log-derivative trick)に収益Gtを掛けることで、収益が大きい行動ほど選ばれやすくなる方向にパラメータが更新される構造にあたります。

