カテゴリカルDQN (G検定)

カテゴリカルDQN

1. 定義と概要

カテゴリカルDQNとは、DQNを拡張した分布強化学習の手法です。行動価値関数(Q値。ある状態である行動をとったときに将来得られる報酬の見込みを表す数値)を、単一の期待値(起こりうる結果を確率で重みづけして平均した値)としてではなく、確率分布として学習する点が特徴です。この確率分布はカテゴリ分布(とりうる値をいくつかの区間に区切り、それぞれの確率を割り当てた表現方法)と呼ばれます。

出典は、2017年にDeepMind社のBellemare氏らがICMLで発表した論文『A Distributional Perspective on Reinforcement Learning』です。Atari環境において価値分布を51個の離散区間(atom。価値分布を区切る、確率を割り当てる単位となる区間の一つ一つ)で近似したことから、C51とも呼ばれます。

従来のQ学習・DQNでは、行動価値関数を期待値としてのみ学習するのが一般的でした。しかし期待値だけでは報酬のばらつき方の情報が失われ、似た平均値でもリスクの高い行動と低い行動を区別できないという課題がありました。

カテゴリカルDQNは、Q値を確率分布として学習することでより豊かな価値表現を獲得し、Atariゲームの一連のベンチマークで従来のDQNを上回る性能を示しました。この発表を契機に分布強化学習の研究は活発化し、後継としてQR-DQN(区間ではなく分位点という位置を直接学習して分布を表現する、カテゴリカルDQNの後継手法)やIQN(分布強化学習のさらなる改良手法)といった手法が登場しています。

2. 試験対策ポイント

G検定における重要な論点は、カテゴリカルDQNが分布強化学習に分類され、行動価値関数を「期待値」ではなく「確率分布」として推定する点にあります。別名のC51は、Atari環境で価値分布を51個の離散区間(atom)に区切って近似したことに由来する数値であり、2017年にDeepMind社が提案した点も重要なテーマです。

カテゴリカルDQNは、「Rainbow」を構成する6つの改良要素のうち「分布強化学習」の要素にあたります。残る5要素のうち、Double DQN(行動の選択と評価を分けて行い、価値の見積もりすぎを抑える改良手法)とDueling Network(状態そのものの価値と行動ごとの優位性を分けて学習するネットワークの構造)が挙げられます。

ほかに、優先度付き経験再生(学習効果の大きい過去の経験を優先的に学習に使う仕組み)とマルチステップ学習(1歩先だけでなく複数歩先までの報酬をまとめて学習に使う方法)も含まれます。最後の一つがNoisy Networks(ネットワークの重みにノイズを加えて、行動の探索を促す手法)です。

Rainbow論文のablation study(要素ごとの寄与を比較する検証実験)では、優先度付き経験再生とマルチステップ学習の2つが最も重要な要素とされており、カテゴリカルDQNの寄与はこの2つに次ぐ位置づけです。

後継手法としてQR-DQNが挙げられ、分布の表現方法の違いが分かれ目になります。固定の離散区間で分布を近似するカテゴリカルDQNに対し、QR-DQNは分位点による表現を用いる点が対比のポイントです。

3. 関連概念との比較・相違点

通常のDQNとの最大の違いは、Q値を単一の期待値として学習するか、確率分布として学習するかという点にあります。通常のDQNは状態と行動の組み合わせに対して1つの数値を出力するのに対し、カテゴリカルDQNは同じ組み合わせに対して確率分布全体を出力します。似た平均値を持つ行動同士でも、分布の広がり方を比較すればリスクの高低を区別できる点が実質的な違いにつながります。

「Rainbow」との関係は、単体の手法か、複数改良を組み合わせた統合アルゴリズムかという違いにあります。カテゴリカルDQNは「Rainbow」を構成する要素の一つであり、単体でも成立する手法ですが、「Rainbow」という統合アルゴリズムに組み込まれた形でも機能します。カテゴリカルDQN単体の性能と、「Rainbow」に組み込んだ場合の性能の違いは、混同しやすい組み合わせです。

QR-DQNとの違いは、分布の表現方法にあります。カテゴリカルDQNは固定の離散区間(atom)によるカテゴリ分布で確率分布を近似するのに対し、QR-DQNは分位点による表現を用います。区間の位置をあらかじめ固定して確率だけを学習するか、分位点の位置そのものを学習するかという違いが、両者を分ける軸にあたります。

3つの手法の関係を、Q値の表し方と位置づけという軸で並べると次のように整理できます。

手法 Q値の表し方 位置づけ
通常のDQN 単一の期待値 報酬のばらつき方は扱わない
カテゴリカルDQN 固定の離散区間(atom)によるカテゴリ分布 分布強化学習の手法で、「Rainbow」の構成要素の一つ
QR-DQN 分位点による表現 カテゴリカルDQNの後継手法

期待値から確率分布へ、さらに分布の表し方の工夫へと、価値の表現が段階的に豊かになってきた流れとして捉えると、3つの位置関係を整理しやすくなります。

4. ビジネス・実務での活用シナリオ

ゲームAI・研究開発の分野では、Atari 2600のベンチマークでの性能評価を通じ、複雑な環境における意思決定エージェントの学習手法としてカテゴリカルDQNの検証が進められています。単純な平均値だけでなく分布全体を評価できるため、行動ごとの結果のばらつきまで比較した性能検証が可能になります。

金融・トレーディングの分野では、報酬の分布全体を学習できる性質を利用し、リスクを考慮したポートフォリオ運用や先物取引の戦略立案への応用が研究されています。平均的なリターンだけでなく損失側の広がりまで捉えられることは、リスク管理が欠かせない金融領域と相性がよい特性です。

ロボット制御の分野では、行動の結果に対する不確実性・ばらつきを把握できる性質から、安全性が求められる制御タスクでの意思決定への活用が検討されています。結果のばらつきが大きい行動をあらかじめ見分けられれば、事故につながりかねない選択を避けた制御設計につながります。

5. 要点まとめ

  • カテゴリカルDQNはDQNを拡張した分布強化学習の手法で、Q値を期待値ではなく確率分布として学習します。別名C51は51個の離散区間(atom)に由来します。
  • 2017年にDeepMind社が提案し、「Rainbow」ではDouble DQN・Dueling Network・優先度付き経験再生などと並ぶ「分布強化学習」の構成要素にあたります。
  • 後継手法のQR-DQNは分位点で分布を表現する点が、カテゴリカルDQNとの違いにあたります。

6. 確認問題

問1カテゴリカルDQNは、行動価値関数を単一の期待値ではなく、報酬の確率分布として学習する分布強化学習の手法である。

解答・解説をみる

○ 正しい

カテゴリカルDQNの中心的な特徴であり、通常のDQNとの最大の違いにあたります。Q値を単一の数値ではなく分布として表現する点が、後続の分布強化学習の研究にもつながっています。

問2カテゴリカルDQNの別名「C51」は、価値分布を51個の離散区間(atom)に区切って近似したことに由来する。

解答・解説をみる

○ 正しい

2017年にDeepMind社が提案した際、Atari環境での実験を通じて51個の区間が採用されました。区間の数がそのまま別名の由来になっている点が特徴的です。

問3カテゴリカルDQNは、「Rainbow」とは無関係に独立して使われる手法であり、「Rainbow」の構成要素には含まれない。

解答・解説をみる

× 誤り

正しくはカテゴリカルDQNは「Rainbow」を構成する6つの改良要素の一つ(分布強化学習の要素)にあたります。独立した無関係の手法とする記述は取り違えやすい点です。