SARSA (G検定)

SARSA

1. 定義と概要

SARSAとは、エージェント(環境の中で行動を選択する主体)が状態sで行動aを取った際の行動価値関数(Q値、ある状態で特定の行動を取ったときに将来もらえる報酬の見込みを表す数値)Q(s,a)を更新するアルゴリズムです。更新には、実際にエージェントが次に選んだ行動a’のQ値Q(s’,a’)をそのまま使います。

更新式はQ(s,a) ← Q(s,a) + α[r + γQ(s’,a’) − Q(s,a)]で表されます。αは学習率(新しい情報を今の見積もりにどれだけ反映するかを決める割合)、γは割引率(将来もらえる報酬を現在の価値に割り引いて計算するための係数)にあたります。

名称は更新に使う5つの要素、状態(State)・行動(Action)・報酬(Reward)・次の状態(State)・次の行動(Action)の頭文字に由来し、この由来自体が押さえておきたい重要なテーマです。5つの要素と、更新式のなかで対応する記号を並べると次のように整理できます。

頭文字 要素 更新式で対応する記号
S 状態(State) s
A 行動(Action) a
R 報酬(Reward) r
S 次の状態(State) s’
A 次の行動(Action) a’

この5要素は、エージェントが1ステップのあいだに観測し実行する順番そのままに並んでいます。具体例としては、崖に近い最短経路と遠回りの安全な経路のどちらを学習するかを比較する崖歩き問題(Cliff Walking、強化学習のアルゴリズムの違いを比較するためによく使われる、崖に沿ったマス目状の仮想環境)が知られています。

SARSAは、1ステップごとに価値の見積もりを更新していくTD学習(時間的差分学習、1エピソードの終了を待たずに価値の推定を逐次更新していく学習の枠組み)の代表的な制御手法の一つです。行動を選ぶ際と価値を更新する際の両方に同じε-greedy方策(普段は最も良いとされる行動を選びつつ、一定の確率でランダムな行動を試す行動の選び方)を用いる点に特徴があります。

実際に選んだ行動の結果をそのまま次の更新に反映するため、探索中のランダムな行動によるリスクも価値関数に織り込まれます。うまくいかなかった試行錯誤の分だけ、その行動の見積もりが下がっていくイメージです。

2. 試験対策ポイント

G検定における重要な論点は、更新式のQ(s’,a’)が何を指すかです。SARSAでは、次の状態s’でエージェントが実際に選んだ行動a’のQ値をそのまま更新に使います。これに対しQ学習は、次の状態で最大のQ値を持つ行動を仮定するmax演算子を使って更新するため、両者の違いは更新に使うQ値の由来にあります。

行動を選ぶ方策と価値を更新する際に想定する方策が同一であることから、SARSAは方策オン型(on-policy、行動選択と価値更新の基準が同じ学習方式)のTD制御に分類されます。状態・行動・報酬・次の状態・次の行動という名称の5要素は、エージェントが1ステップごとに観測・実行する一連の流れの順番とも対応しており、名称と更新式の対応関係として整理できます。

崖歩き問題は、SARSAとQ学習の違いを具体的に示す例として重要なテーマです。探索中にランダムな行動で崖に近づいてしまうリスクも価値関数に織り込んで更新するSARSAは、崖から離れた安全な経路を学習する傾向があります。一方、次の状態で理論上最適な行動を仮定して更新するQ学習は、崖に近い最短経路を学習する傾向があります。

この違いが生じる理由は、探索中に取った行動の扱いにあります。ε-greedy方策に従って崖に近づく行動をたまたま選んだ場合、SARSAはその行動の結果をそのまま反映して評価を下げます。

一方Q学習は、実際の行動によらず次の状態で最善とされる行動を仮定するため、崖に近い行動の価値が高いまま学習が進みやすくなります。同じ環境で学習される経路が異なる点は、方策オン型と方策オフ型(off-policy、行動を選ぶときの基準と価値を更新するときに仮定する基準が別々になっている学習方式)という分類の違いが実際の挙動にどう表れるかを示す例として扱われます。

SARSAという名称が状態・行動・報酬・次の状態・次の行動という更新に使う5要素の頭文字に由来する点、更新式のQ値の出所、方策オン型という分類、崖歩き問題における経路の違いは、それぞれ独立した知識ではありません。更新に使うQ値がどこから来るかという一本の軸でつながる関係にあります。

3. 関連概念との比較・相違点

Q学習との最大の違いは、更新に使うQ値の由来にあります。SARSAは実際に選んだ次の行動のQ値を使って更新する方策オン型であるのに対し、Q学習は次の状態で最大のQ値を持つ行動を仮定して更新する方策オフ型です。行動を選ぶ方策と価値の更新に使う方策が一致しているか、それとも別々になっているかという違いが、両者を分ける中心的な軸になります。

この軸に沿って両者を並べると、次のように対応します。

観点 SARSA Q学習
更新に使うQ値 実際に選んだ次の行動a’のQ値 次の状態で最大のQ値を持つ行動を仮定
方策の分類 方策オン型 方策オフ型
崖歩き問題で学習する経路 崖から離れた安全な経路 崖に近い最短経路
学習される価値の性質 探索の影響を受けた現実の挙動に近い価値 理論上最良とされる行動を仮定した価値

経路の違いは、探索中の行動をどう扱うかから生まれます。探索中の行動の結果も含めて学習するSARSAは、崖に近づくリスクを避けた安全な経路を学習します。一方、理論上の最適行動を仮定するQ学習は、崖に近い最短経路を学習します。同じ更新式の骨格を持ちながら、Q値の出所という一点の違いが、学習される方策の性質を大きく左右する関係にあります。

この違いは、学習の途中経過にも表れます。SARSAは学習の過程で実際に使っている方策そのものの価値を評価するため、探索によるランダムな行動の影響を受けた、現実の挙動に近い価値が学習されます。

一方でQ学習は、学習中にどの方策で行動しているかによらず、理論上最良とされる行動を仮定した価値に向けて更新が進みます。更新に使うQ値の出所という一つの違いが、学習途中の価値の性質にまで及ぶ点は、両者を比較するうえでの中心的な観点です。

4. ビジネス・実務での活用シナリオ

ロボット制御の分野では、実機を用いた試行錯誤に転倒や衝突のリスクが伴います。探索行動の結果も織り込んで学習するSARSAの性質は、学習過程の安全性を重視する場面の考え方として参照されます。

理論上の最適行動を前提に価値を見積もる手法では、実機がまだ経験していない危険な状況の価値を高く見積もったまま学習が進む恐れがあり、この点でSARSAの考え方が引き合いに出されます。

ゲームAIやシミュレーションの分野でも、崖歩き問題のように危険な状態に近づくと大きな負の報酬を受ける環境で、安全側に寄った方策を学習する例として扱われます。危険な状態への近づき方そのものを評価に反映できる点は、探索の過程で起こり得る失敗も含めて方策を形づくりたい場面の考え方として参照されます。

在庫や運用の意思決定のように試行錯誤のコストが高い場面では、実際に取った行動の結果を素直に反映して学習を進める考え方が、SARSAのような手法の基礎として言及されます。理論上の最適な発注や運用ルールを仮定するのではなく、実際に選んだ行動の結果を評価に組み込む発想は、試行錯誤自体にコストが伴う意思決定の場面と相性がよい考え方として扱われます。

5. 要点まとめ

  • SARSAは、実際に選んだ次の行動のQ値を使って行動価値関数を更新する、TD学習に基づく方策オン型のアルゴリズムです。
  • 名称は状態・行動・報酬・次の状態・次の行動という更新に使う5要素の頭文字に由来し、次の状態で最大のQ値を仮定する方策オフ型のQ学習と対比されます。
  • 崖歩き問題では、探索のリスクを織り込んで更新するSARSAが安全な経路を、理論上の最適行動を仮定するQ学習が最短経路を学習するという違いが知られています。

6. 確認問題

問1SARSAという名称は、更新に用いる状態・行動・報酬・次の状態・次の行動という5つの要素の頭文字に由来する。

解答・解説をみる

○ 正しい

状態(State)・行動(Action)・報酬(Reward)・次の状態(State)・次の行動(Action)の頭文字がSARSAの名称の由来です。この5要素が更新式に登場する順番とも対応しています。

問2SARSAは、次の状態で最大のQ値を持つ行動を仮定して更新するため、方策オフ型(off-policy)のアルゴリズムに分類される。

解答・解説をみる

× 誤り

正しくは、次の状態で最大のQ値を仮定して更新するのはQ学習の特徴です。SARSAは実際に選んだ次の行動のQ値を使って更新するため方策オン型(on-policy)に分類され、この記述は両者を取り違えています。

問3崖歩き問題(Cliff Walking)において、SARSAは探索中の行動のリスクも織り込んで更新するため、Q学習よりも崖から離れた安全な経路を学習する傾向がある。

解答・解説をみる

○ 正しい

SARSAは実際に選んだ行動(ランダムな探索行動を含む)の結果を価値関数の更新に反映するため、崖に近い経路のリスクを避けた安全側の方策を学習する傾向が知られています。