1. 定義と概要
優先度付き経験再生とは、リプレイバッファ(エージェントの経験を一時的にためておく記憶領域)に蓄積された遷移(状態・行動・報酬・次状態の組)を一様ランダムに取り出す代わりに、TD誤差の大きさに応じた優先度をつけてサンプリングする手法です。2015年にSchaul(シャウル)らが提案しました。たとえば予測が大きく外れた遷移は、学習の伸びしろが大きい経験とみなされ、優先的に学習へ回されます。
従来の経験再生では、蓄積した経験から一様ランダムに遷移を取り出すため、学習に役立つ経験も無益な経験も同じ確率で選ばれ、非効率という課題がありました。そこでTD誤差という「予測外れの大きさ」を指標に優先度をつける優先度付き経験再生が考え出されました。
ただし優先度に偏ったサンプリングは、それ自体が学習にバイアスを生みます。そのため、重要度サンプリング(Importance Sampling。偏った選び方で生じるズレを数値的に補正する統計の手法)による補正とあわせて運用されます。
2. 試験対策ポイント
G検定における重要な論点は、優先度付き経験再生が経験再生の一様ランダムサンプリングを、TD誤差に基づく優先度付きサンプリングに置き換える手法である点です。これにより、学習の効率、すなわちサンプル効率(少ない経験データでどれだけ効率よく学習が進むかを示す度合い)を高めます。優先度の指標はTD誤差で、値が大きい遷移ほど学習の伸びしろが大きい経験として優先度が高くなります。
サンプリング方法にも工夫があります。TD誤差の大きい順に貪欲に選ぶと同じ経験に偏り、多様性を失ってしまいます。そこで、優先度に応じた確率で選ぶ確率的なサンプリングが用いられます。また、優先度に偏ったサンプリングは学習にバイアスを生むため、重要度サンプリングの重みを使って学習の更新量を補正する仕組みとセットで運用されます。
Rainbowとの関係も、合わせて見ておきたい論点です。Rainbowは、DQNに6つの改良手法を統合したアルゴリズムで、優先度付き経験再生もその構成要素の1つに数えられます。個々の改良手法の名称と役割の対応は、関連用語の束としてまとめて整理しておきたいところです。
| 構成手法 | 役割 |
|---|---|
| Double DQN | Q値の過大評価を抑える |
| Dueling Network(デュエリングネットワーク) | 状態の価値と行動の価値を分けて推定する |
| 優先度付き経験再生 | TD誤差の大きい経験を優先的に取り出す |
| Multi-step learning | 複数ステップ先の報酬までまとめて学習に使う |
| Distributional RL | 報酬の期待値だけでなく分布まで学習する |
| Noisy Networks(ノイジーネットワークス) | ネットワークにノイズを加えて探索を促す |
この6手法のうち、優先度付き経験再生が担うのは、ためておいた経験をどう取り出すかという部分です。ほかの手法とは受け持つ役割が異なるため、名前と役割をひも付けて覚えておくと混同を避けられます。
3. 関連概念との比較・相違点
経験再生との最大の違いは、サンプリング方法にあります。経験再生は蓄積した遷移を一様ランダムに取り出すのに対し、優先度付き経験再生はTD誤差に応じた優先度をつけて取り出します。同じバッファを使いながら、取り出し方だけを変える改良という位置づけです。
取り出し方の違いは、選ばれやすい経験と、抱える課題の違いにもつながります。
| 観点 | 経験再生 | 優先度付き経験再生 |
|---|---|---|
| 取り出し方 | 蓄積した遷移を一様ランダムに選ぶ | TD誤差に応じた優先度をつけて選ぶ |
| 選ばれやすい経験 | どの経験も同じ確率で選ばれる | 予測が大きく外れた、伸びしろの大きい経験 |
| 抱える課題 | 役立つ経験も無益な経験も同じ扱いになり非効率 | 偏った選び方が学習にバイアスを生む |
後者の課題は重要度サンプリングによる補正で手当てされます。単純に優れた手法というより、補正の工夫とセットで成り立つ改良だといえます。
DQNとの関係では、改良の対象という違いがあります。DQNは優先度付き経験再生が適用される基本アルゴリズムであり、優先度付き経験再生はDQNが持つ経験再生の仕組みを改良する拡張手法にあたります。両者は上位・下位の関係にあります。
Rainbowとの違いは、スコープの広さです。Rainbowは、優先度付き経験再生を含む6つの改良手法を1つのエージェントに統合したアルゴリズムであり、優先度付き経験再生はその構成要素の1つという位置づけになります。優先度付き経験再生が経験再生というひとつの仕組みの改良にとどまるのに対し、Rainbowはエージェント全体の性能を底上げする複数の改良の集合体です。
4. ビジネス・実務での活用シナリオ
ゲームAI開発の分野では、Atari(アタリ)のゲームなどを使った強化学習のベンチマーク(性能を比較するための基準となる試験環境)に優先度付き経験再生を導入する事例があります。一様ランダムサンプリングに比べて学習の立ち上がりが速く、最終的な性能も向上する傾向が報告されています。少ない試行回数で効果を出せる点が評価されています。
ロボティクスの分野では、実機を使うロボットアーム制御の強化学習は試行回数に限りがあります。失敗や予測外れが大きかった経験を優先的に学習へ使えば、限られた試行回数でも学習効率を高められます。実機を動かすコストの高さを考えると、この効率化は実務上の意味が大きくなります。
自動運転のシミュレーションでは、衝突やヒヤリハットのように発生頻度は低いものの重要な事象を優先的に学習へ反映する使い方があります。まれにしか起きない場面ほど見逃せない失敗につながりやすく、優先的な学習によってレアケースへの対応力を高める応用が考えられています。
5. 要点まとめ
- 優先度付き経験再生は、経験再生の一様ランダムサンプリングをTD誤差に基づく優先度付きサンプリングに置き換え、学習効率を高める手法です。
- 優先度に偏ったサンプリングによるバイアスは、重要度サンプリングの重みで補正して運用します。
- DQNの拡張手法であり、Rainbowを構成する複数の改良手法の1つとして扱われます。
6. 確認問題
問1優先度付き経験再生は、TD誤差が大きい経験ほど優先的にサンプリングされる仕組みである。
解答・解説をみる
○ 正しい
TD誤差はエージェントの予測と実際に得られた結果とのズレの大きさを表す指標です。値が大きいほど学習の伸びしろが大きい経験とみなされ、優先度が高くなります。
問2優先度付き経験再生では、優先度に応じてサンプリングした経験をそのまま重み付けせずに学習に用いても、一様ランダムサンプリングと同等の学習結果が得られる。
解答・解説をみる
× 誤り
優先度に偏ったサンプリングは、それ自体が学習にバイアスを生みます。正しくは、重要度サンプリングの重みで更新量を補正してから学習に用いる必要があります。
問3Rainbowは、優先度付き経験再生を含む複数の改良手法を1つのエージェントに統合したアルゴリズムである。
解答・解説をみる
○ 正しい
Rainbowは、Double DQN、Dueling Network、優先度付き経験再生を含む複数の手法を統合したアルゴリズムです。ほかにMulti-step learning、Distributional RL、Noisy Networks(ノイジーネットワークス)も加えた6手法で構成されます。

