深層強化学習 (G検定)

深層強化学習

1. 定義と概要

深層強化学習とは、強化学習の枠組みに、状態や行動価値の表現をディープラーニングで近似する手法を組み合わせたものです。強化学習は、エージェント(環境の中で行動を選び学習する主体で、プログラムやロボットなどが当てはまります)が、環境とのやり取りを通じて報酬(行動の良し悪しを評価する数値のフィードバック)を最大化する行動を学習する仕組みを指します。

代表例であるDQNは、Q学習(状態と行動の組み合わせの価値を計算しながら最適な行動を学ぶ強化学習の手法)で用いるQ値(ある状態で特定の行動を取ったときに将来得られる価値の見積もり)の推定に、ニューラルネットワークを使う点に特徴があります。

従来の強化学習は、状態と行動の数が少なく、Qテーブル(状態と行動の組み合わせごとにQ値を記録した表)で管理できる規模の問題を対象としていました。しかし、画像やセンサーデータのように状態空間が膨大な現実の問題では、この方式では対応できないという課題がありました。

ディープラーニングが持つ特徴抽出や関数近似(状態と行動の価値の関係を、表ではなく数式やニューラルネットワークのモデルで近似的に表す考え方)の能力を組み合わせることで、複雑な環境でも行動価値や方策を学習できるようになりました。ここでの方策とは、ある状態でどの行動を選ぶかを決めるルールを指します。

2013年頃にDeepMind社がAtari 2600のゲーム画面を入力としてDQNを提案したことが、深層強化学習の代表的な出発点とされています。この登場は、ディープラーニングの表現力を強化学習に取り入れる大きな転換点です。

2. 試験対策ポイント

理解するうえで中心になるのが、DQNがQ学習における行動価値(Q値)の推定にディープラーニングを用いた手法であり、深層強化学習の代表例として扱われるという位置づけです。

DQNの学習を安定させる工夫として、経験再生(過去の経験をランダムに取り出して学習に使い、データの偏りを防ぐ仕組み)が用いられます。もう一つの工夫であるターゲットネットワーク(学習の目標を計算するための、一定期間固定したコピーのネットワーク)は、経験再生と対にして覚えておきたい仕組みです。DQNの仕組みは、後続の改良手法を理解するうえでの土台にもなっています。

DQNが備える経験再生・ターゲットネットワークの上に、合計6つの改良が提案されています。それぞれが何を変えるものかは、次のように整理できます。

改良 何を変えるか
Double DQN 行動価値を過大に見積もりやすい弱点を補正する
優先度付き経験再生 学習効果の高い経験を優先して取り出す、経験再生の改良版
デュエリングネットワーク 状態そのものの価値と行動ごとの価値を分けて推定する
カテゴリカルDQN 分布強化学習。価値を1つの数値でなく分布として推定する
ノイジーネットワーク ネットワークにノイズを加えて探索を促す
マルチステップ学習 複数ステップ先までの報酬をまとめて学習に使う

これらを統合した発展形がRainbow(DQNを含めて7手法の集大成と説明されることもある、複数の改良を組み合わせたDQN系の発展形)です。各改良の内部の仕組みよりも、Rainbowが複数の改良を統合したDQN系の発展形という位置づけで、名称と位置づけを押さえておきたいポイントです。

応用事例では、モンテカルロ木探索(ランダムなシミュレーションを繰り返して有望な手を探す探索手法)を深層強化学習と組み合わせた囲碁AIを皮切りに、ゲームを題材とした成果が続きました。名称と特徴の対応は、次のように整理できます。

名称 対象・特徴
AlphaGo(モンテカルロ木探索と深層強化学習を組み合わせた囲碁AI) 2016年にプロ棋士に勝利した
AlphaGo Zero(「AlphaGo」の発展版) 人間の棋譜を使わず自己対戦だけで学習した
AlphaZero(「AlphaGo」系のさらなる発展版) 囲碁だけでなくチェス・将棋にも共通の枠組みで対応した
AlphaStar(深層強化学習AI) 対象ゲームはStarCraft II
OpenAI Five(深層強化学習AI) 対象ゲームはDota 2

名称が似ているうえ対象ゲームも入り混じるため、この対応関係は取り違えやすい点です。名称だけを丸暗記せず、対象と特徴をセットにして覚えておきたいところです。

また、内発的報酬(外部からの報酬が乏しい環境で、好奇心のような内部基準で与える報酬の工夫)や、マルチエージェント強化学習(複数のエージェントが同時に学習し影響し合う設定の強化学習)は、深層強化学習の発展的な話題として名称が知られています。

3. 関連概念との比較・相違点

従来型の強化学習(ディープラーニングを使わないもの)との最大の違いは、状態・行動空間の規模と価値関数の表現方法にあります。従来型はQテーブルなど表形式で管理できる小規模な問題を対象とするのに対し、深層強化学習はニューラルネットワークによる関数近似によって、画像のような高次元・大規模な状態空間も扱えます。

この違いは、どこまで複雑な環境を対象にできるかという、深層強化学習の強みの根拠になっています。試験でも、価値関数をどう表現するかという観点が両者を比較する軸になります。

教師あり学習(入力データと正解ラベルのペアから学習する手法)との違いは、学習信号の種類にあります。教師あり学習は正解ラベルとの誤差を手がかりに学習するのに対し、深層強化学習は環境から得られる報酬を手がかりに、試行錯誤を重ねながら学習します。

あらかじめ正解データを用意できない状況でも学習を進められる点が、深層強化学習ならではの特徴です。この学習信号の違いは、両者を見分ける手がかりになります。

4. ビジネス・実務での活用シナリオ

ゲームAI・エンターテインメントの分野では、囲碁の「AlphaGo」・「AlphaGo Zero」、囲碁・将棋・チェスを共通の枠組みで扱う「AlphaZero」が代表事例です。StarCraft IIの「AlphaStar」、Dota 2の「OpenAI Five」も同じ分野の代表的な実績です。

いずれも人間のトッププレイヤーに匹敵、あるいは凌駕する成果を挙げています。これらは、深層強化学習がどこまでの複雑さに対応できるかを示す到達点となる事例です。ルールの異なる複数のゲームで成果を挙げてきたことが、応用範囲の広さを裏づけています。

ロボティクス・製造の分野では、ロボットアームの把持動作や歩行制御といった、試行錯誤を通じた行動の最適化に深層強化学習が使われています。あらゆる動作をあらかじめプログラムしなくても、環境に応じた制御を学習できる点が実務上の利点です。作業環境や対象物が変わるたびに人手でルールを書き直す必要がなくなります。

自動運転・交通制御の分野でも、周囲の状況という状態に応じた運転操作を、安全性や効率性を反映した報酬に基づいて学習する枠組みとして研究が進められています。実際の運用には、安全性の検証など残された課題もあります。それでも、状況に応じた判断を学習で獲得できる可能性は、研究が進められている理由の一つです。

5. 要点まとめ

  • 深層強化学習は、強化学習にディープラーニングを組み合わせ、画像など高次元の状態からも行動を学習できるようにした手法の総称で、DQNが代表例です。
  • DQNの学習安定化には経験再生とターゲットネットワークが使われ、そこにDouble DQNなど6つの改良を加えて統合した「Rainbow」が発展形として位置づけられます。
  • 「AlphaGo」・「AlphaGo Zero」・「AlphaZero」・「AlphaStar」・「OpenAI Five」はゲームを題材にした応用事例で、内発的報酬やマルチエージェント強化学習は発展的な話題として関連づけられます。

6. 確認問題

問1DQNは、強化学習のQ学習における状態と行動の価値(Q値)の推定に、ディープラーニングを用いる手法である。

解答・解説をみる

○ 正しい

DQNはQ学習にディープラーニングによる関数近似を組み合わせた、深層強化学習の代表例です。行動価値の推定をニューラルネットワークで行う点が特徴です。

問2DQNの学習では、直近に得られた経験のみを時系列順に使うことで、最新の環境変化に素早く適応させている。

解答・解説をみる

× 誤り

正しくは経験再生で、過去の経験をランダムに取り出して学習に使うことでデータの偏りを防ぎ、学習を安定させています。直近の経験だけを時系列順に使う方法ではない点が、誤りの根拠です。

問3「AlphaGo Zero」は、過去のプロ棋士の棋譜データを学習に用いず、自己対戦のみによって強くなった。

解答・解説をみる

○ 正しい

「AlphaGo Zero」は人間の棋譜を使わず自己対戦だけで学習した点が、人間の棋譜を利用した初代「AlphaGo」との違いです。