デュエリングネットワーク (G検定)

デュエリングネットワーク

1. 定義と概要

デュエリングネットワークとは、2015年にDeepMind社のZiyu Wang氏らが発表した、DQNのネットワーク構造を改良した深層強化学習の手法です。行動価値関数Q(s,a)を、状態価値関数V(s)とアドバンテージ関数A(s,a)の2系統に分けて学習します。

V(s)は状態そのものがどれくらい良いかを表す値であり、A(s,a)はその状態における行動ごとの相対的な優位性を表す値です。最終的には「Q(s,a)=V(s)+A(s,a)の値からA(s,a)の平均を引いた値」という式で、2つを合成するネットワーク構造になっています。

従来のDQNは、状態と行動の組み合わせごとに行動価値Qを1系統のネットワークで直接出力していました。そのため、行動を変えても結果がほとんど変わらない状態では、すべての行動を試して比較しないとQ値の差を学習しにくいという課題がありました。

この課題に対し、状態そのものの良し悪しを表すV(s)と、行動ごとの相対的な優劣を表すA(s,a)を分けて学習する構造を導入したのが、デュエリングネットワークです。行動に依存しないV(s)を独立して学習できる点が、この構造の中心的な特徴です。

2. 試験対策ポイント

理解するうえで中心になるのは、Q値の合成式です。デュエリングネットワークでは、V(s)とA(s,a)を単純に足し合わせるのではなく、「Q(s,a)=V(s)+A(s,a)の値からA(s,a)の平均を引いた値」という形で合成します。単純な足し算にしない理由は、識別可能性の問題(VとAの組み合わせ方が複数あり、学習結果が一意に定まらないこと)を解消し、学習を安定させるためです。

また、行動を変えても結果がほとんど変わらない状態でも、行動に依存しないV(s)を独立して学習できるという利点があります。サンプル効率(少ない試行回数でどれだけ学習が進むかを表す指標)が向上する点も、あわせて整理しておきたいところです。

DQNの拡張手法どうしは、役割の違いを取り違えやすい点です。ダブルDQN(Double DQN。行動を選ぶネットワークと評価するネットワークを分けて、価値を高く見積もりすぎる問題を抑える手法)は過大評価の補正を狙う手法です。これに対し、デュエリングネットワークはネットワークの出力構造自体を分岐させる手法という違いがあります。

加えて、2017年に発表されたRainbow(DQNの複数の改良手法を組み合わせた深層強化学習の手法)は、DQNやダブルDQN、デュエリングネットワークなど7つの要素を組み合わせた手法です。デュエリングネットワークは、その構成要素の1つという位置づけにあたります。

3. 関連概念との比較・相違点

DQNとの最大の違いは、ネットワーク構造にあります。DQNは行動価値Qを1系統で直接出力するのに対し、デュエリングネットワークはV(s)とA(s,a)の2系統に分けてから合成します。この分岐により、行動によらない状態の価値を独立して学習できる点が、DQNには無い強みです。

ダブルDQNとの最大の違いは、改良の狙いにあります。ダブルDQNはQ値の過大評価の補正を狙うのに対し、デュエリングネットワークは出力構造自体を分岐させて学習効率を高めます。両者は互いを排除する関係ではなく、併用することもできます。

3つの手法の関係を、改良の狙いと出力構造の観点で整理します。

手法 改良の狙い ネットワークの出力構造
DQN ニューラルネットワークでQ値を推定する 行動価値Qを1系統で直接出力する
ダブルDQN Q値の過大評価を補正する 行動を選ぶネットワークと評価するネットワークを分ける
デュエリングネットワーク 状態の価値を独立して学習し効率を高める 状態価値V(s)とアドバンテージA(s,a)の2系統に分けて合成する

狙いが重ならないからこそ、これらは択一の関係になりません。『Rainbow』で両方が同時に採用されているのも、この違いがあるためです。

4. ビジネス・実務での活用シナリオ

ゲームAI開発の分野では、Atari 2600のように行動の選択肢が多いゲーム環境で、デュエリングネットワークの構造が生きます。行動を変えても結果への影響が小さい局面が多く出現するゲームでは、状態そのものの価値を独立して学習できる構造が、学習の安定化に寄与します。

ロボティクス・自動制御の分野では、多数の関節や動作パターンを持つ制御タスクにおいて、状態の価値を効率よく学習できる構造が活かされます。限られた試行回数でも、制御方策の学習が進む効果があります。

深層強化学習アルゴリズムの研究開発では、『Rainbow』のように複数の改良手法を組み合わせる場面があります。その際、デュエリングネットワークはダブルDQNなど他の改良手法と併用され、性能向上に寄与する構成要素の一つとして採用されています。

単独の手法だけで学習を進める場合よりも、複数の改良を組み合わせることで学習の安定性や最終的な性能の向上につながる、という位置づけです。

5. 要点まとめ

  • デュエリングネットワークは、行動価値Q(s,a)を状態価値V(s)とアドバンテージA(s,a)に分けて学習します。合成の際は、「Q(s,a)=V(s)+A(s,a)の値からA(s,a)の平均を引いた値」という式を使います。
  • 行動を変えても結果がほとんど変わらない状態でも、行動に依存しないV(s)を独立して学習できるため、学習の効率が向上します。
  • 過大評価を補正するダブルDQNとは改良の狙いが異なり、2017年発表の『Rainbow』を構成する7つの要素の一つに位置づけられます。

6. 確認問題

問1デュエリングネットワークは、行動価値関数Qを状態価値関数Vとアドバンテージ関数Aの2系統に分けて学習し、後で合成するネットワーク構造である。

解答・解説をみる

○ 正しい

デュエリングネットワークの中心的な特徴です。V(s)とA(s,a)を別系統で学習したうえで、「Q(s,a)=V(s)+A(s,a)の値からA(s,a)の平均を引いた値」として合成します。

問2デュエリングネットワークでは、状態価値VとアドバンテージAを単純に足し合わせるだけでQ値を合成する。

解答・解説をみる

× 誤り

正しくは、単純な足し算ではなくアドバンテージの平均値を差し引いてから合成します。VとAの組み合わせが一意に定まらない識別可能性の問題を解消し、学習を安定させるための工夫です。

問3デュエリングネットワークは、行動によって結果がほとんど変わらない状態において、行動に依存しない状態価値を独立して学習できるため学習の効率が向上する。

解答・解説をみる

○ 正しい

すべての行動が同程度の結果になる局面でも、V(s)を単独で学習できるためサンプル効率が向上します。これがDQNに対する利点の一つです。