1. 定義と概要
エピソードとは、強化学習においてエージェント(環境の中で行動を選び学習する主体となるプログラム)が、環境(エージェントが行動する対象となる世界やシミュレーション)とやり取りを重ねる一連の流れの単位を指す用語です。初期状態から、目標達成や失敗といった終端状態に至るまでの区切りが、1エピソードにあたります。
1回のエピソードは複数のステップ(1回ごとの状態・行動・報酬(行動の良し悪しを数値で示すフィードバック)のやり取り)から構成されており、状態(ある時点での環境の様子を表す情報)が変化するたびに1ステップが積み重なっていく構造を持っています。
具体例としては、迷路探索でスタート地点からゴールまたは行き止まりに達するまでの一連の行動が1エピソードにあたり、倒立振子の制御でバランスを崩して倒れるまでも1エピソードとして扱われます。
教師あり学習(正解の付いたデータを使って学習する機械学習の手法)ではあらかじめ用意したデータセットを処理すれば学習が完結します。一方、強化学習はエージェントが環境の中で試行錯誤しながら方策(どの状態でどんな行動を選ぶかを決めるルール)を改善する仕組みを持っています。この繰り返しの単位を区切って評価する必要があることから、エピソードという単位が導入されました。
多数のエピソードを繰り返しながら、各エピソードで得られた結果をもとに方策を更新していく流れが、強化学習の学習サイクルの基本形にあたります。
2. 試験対策ポイント
G検定では、エピソードタスクと連続タスクの区別が重要な論点です。両者の違いを整理すると、次のようになります。
| 区分 | 終わりの扱い | 代表例 |
|---|---|---|
| エピソードタスク | 終端状態(エピソードが終わる状態。ゴール到達や失敗などが該当します)に達するとリセットされ、試行が完結する | 迷路探索、ゲーム |
| 連続タスク | 明確な終わりが定義されず、相互作用が継続する | 在庫管理、長期の運用最適化 |
終端状態という区切りがあるかどうかが、両者を見分ける手がかりになります。
1エピソード内の一連の行動を通じて得た報酬の合計値は、累積報酬または収益と呼ばれ、方策の良し悪しを評価する指標として扱われます。多数のエピソードを繰り返しながら方策を更新していく反復構造は、強化学習の学習サイクルの基本形にあたります。
さらに、方策の更新タイミングには手法ごとの違いがある点も試験対策として押さえておきたい論点です。REINFORCE(方策勾配法の一種で、エピソード完了後にまとめて方策を更新する手法)は、エピソードが完了した後に累積報酬をまとめて方策の更新に使います。これに対しTD学習(ステップごとに逐次、方策や価値の見積もりを更新する手法)は、1ステップごとに逐次更新するという対比があります。
この対比の詳細な仕組みは関連手法を扱う記事に譲りますが、更新タイミングの違いとして概要をつかんでおく価値があります。
3. 関連概念との比較・相違点
ステップとの最大の違いは粒度にあります。2つの単位を並べると、次のような関係になります。
| 単位 | 中身 | 粒度 |
|---|---|---|
| ステップ | 1回分の状態・行動・報酬のやり取り | 最小単位 |
| エピソード | ステップが積み重なった集合体 | 試行1回分のまとまり |
1エピソードが数十ステップで完結する場合もあれば、数千ステップに及ぶ場合もあり、ステップ数そのものはタスクの性質によって大きく変わります。試験でこの2つの用語が並んで出てきたときは、単位の大小関係として整理すると混同を防ぎやすくなります。
連続タスクとの最大の違いは終端状態の有無にあります。エピソードタスクは終端状態に達すると環境がリセットされ、そこで一連の相互作用が区切られる構造を持っています。これに対し連続タスクには明確な終わりがなく、相互作用が継続する課題として設計されます。
迷路探索やゲームのように勝敗や到達・失敗がはっきりしている課題はエピソードタスクとして扱いやすい一方、在庫管理や設備の運用最適化のように継続的な意思決定が求められる課題は連続タスクとして扱われる傾向にあります。エピソードという単位そのものが「区切りの有無」を前提にした概念であることを押さえておくと、両者の関係が見えやすくなります。
4. ビジネス・実務での活用シナリオ
ゲームAI開発の分野では、対戦ゲームのプレイ1回分をエピソードとして扱い、多数回対戦させながら方策を改善する手法が採用されています。勝敗という明確な終端が存在するためエピソードタスクとして設計しやすく、対戦を繰り返すたびに得られた累積報酬をもとに方策を洗練させていく流れが、ゲームAIの強さを引き上げる基盤になっています。
ロボット制御の分野では、ロボットアームが物体をつかむ動作の1試行をエピソードとして区切り、失敗時は初期姿勢にリセットして再試行を繰り返しながら動作を洗練させる設計が採られます。実機での試行には時間や摩耗といった制約が伴うため、1回の試行を明確な単位で区切って評価する枠組みが、限られた試行回数の中で効率よく方策を改善する土台になっています。
在庫管理や運用最適化の分野では、明確な終端が存在しない業務を連続タスクとして扱い、エピソード単位ではなく継続的な報酬の累積で評価する設計が採用されます。発注や在庫の増減が絶えず続く業務ではどこかで区切ってリセットする発想がなじまないため、区切りのある評価とは異なる枠組みが求められます。
この継続的な評価の枠組みは、目先の判断だけでなく長期的な収益や在庫コストの最適化にもつながる設計思想として実務に生かされています。
5. 要点まとめ
- エピソードとは、強化学習における初期状態から終端状態までの一連の相互作用のまとまりで、複数のステップから構成される試行1回分の単位です。
- 環境が終端状態でリセットされ試行が完結するエピソードタスクと、終わりが定義されず相互作用が継続する連続タスクの違いは取り違えやすい点です。
- 強化学習ではエピソードを繰り返しながら方策を改善していきます。更新タイミングの違い(エピソード完了後にまとめてか、ステップごとに逐次かなど)は関連手法ごとに扱われます。
6. 確認問題
問1強化学習における1エピソードは、エージェントが初期状態から終端状態に至るまでの一連の相互作用のまとまりであり、複数のステップから構成される。
解答・解説をみる
○ 正しい
エピソードはステップの集合として定義される試行1回分の単位です。迷路探索やゲームのように、スタートから終端状態に至るまでの一連の行動が1エピソードにあたります。
問2連続タスクは、環境が終端状態に達すると初期状態にリセットされ、一連の試行がエピソードという単位で区切られる課題を指す。
解答・解説をみる
× 誤り
この説明はエピソードタスクの特徴です。正しくは、連続タスクは明確な終わりが定義されず相互作用が継続する課題を指し、在庫管理や長期の運用最適化などが該当します。
問3強化学習では、多数のエピソードを繰り返しながら方策を更新していくことで学習が進む。
解答・解説をみる
○ 正しい
エピソードを繰り返す反復構造が強化学習の学習サイクルの基本形にあたります。更新のタイミングがエピソード完了後にまとめてか、ステップごとに逐次かは手法ごとに異なります。

