内発的報酬 (G検定)

内発的報酬

1. 定義と概要

内発的報酬とは、タスクの目的達成に応じて環境から与えられる本来の報酬である外発的報酬(タスクの目的を達成したときに環境から直接もらえる本来の報酬)とは別に、エージェントが自ら生成する報酬のことです。エージェントは、状態の新規性(まだ訪れたことのない状態であること)や自分の予測誤差の大きさなどを基準にして、この報酬を生み出します。探索ボーナス(内発的報酬の別の呼び方。探索を後押しするために追加でもらえる報酬)とも呼ばれます。

具体例としては、まだ訪れたことのない状態に到達したときに追加の報酬を与える方式や、自分の予測モデルが外れた度合いに応じて報酬を与える方式が挙げられます。どちらも、エージェントにとって目新しい状況ほど価値が高くなるように報酬を組み立てている点で共通しています。

従来の強化学習は、外発的報酬だけをもとにエージェントを学習させる方法が中心でした。しかし、スパース報酬の課題では、ランダムに行動を試すだけの探索ではいつまでもゴールへ辿り着けず、学習が進まないという問題が生じます。そこで、エージェント自身に探索の方向づけを与える内発的報酬の仕組みが導入されるようになりました。

2. 試験対策ポイント

試験対策としてまず押さえたい対比は、外発的報酬と内発的報酬の違いです。外発的報酬はあくまで環境から与えられる本来の報酬であるのに対し、内発的報酬はエージェント自身が生成する報酬という違いがあります。

スパース報酬環境の代表例として、アタリのゲーム『Montezuma’s Revenge(報酬が疎いことで知られるアタリのベンチマークゲーム)』が挙がります。通常のDQN(ディープラーニングを用いた代表的な強化学習アルゴリズム)では、スコアがほぼ0にとどまります。

一方、内発的報酬を用いた手法であるRandom Network Distillation(未知の状態を検出して内発的報酬を計算する代表的な手法。以下RND)を使うと、人間の平均スコアを上回った成果が知られています。同じ環境でも、探索を後押しする仕組みの有無で結果が大きく変わる例として覚えておきたいところです。

内発的報酬を生成する基準には、新規性を評価する系統と、好奇心(curiosity。自分の予測が外れる度合いが大きいこと)を評価する系統の2つがあります。

探索を促す別系統の手法として、ネットワークの重みにノイズを加えるノイジーネットワーク(ネットワークの重みにノイズを加えて探索を行う手法)もありますが、報酬を追加する内発的報酬とは実現方法が異なる点で区別されるでしょう。

3. 関連概念との比較・相違点

外発的報酬との最大の違いは、報酬の発生源にあります。外発的報酬は環境がタスクの達成度に応じて与える報酬であるのに対し、内発的報酬はエージェント自身が新規性や予測誤差をもとに生み出す報酬です。

ε-greedy(一定確率でランダムな行動を選んで探索する基本的な手法)による探索との違いは、探索の方向性にあります。この手法は一定の確率でランダムに行動を選ぶ一様な探索であるのに対し、内発的報酬による探索は新規性や予測誤差に基づいて方向づけられた探索です。

ノイジーネットワークとの最大の違いは、探索を実現する方法にあります。内発的報酬は報酬関数へ追加の報酬を加える方式であるのに対し、ノイジーネットワークはネットワークの重み自体にノイズを加えて行動のばらつきを生む方式です。両者は探索を促すという目的こそ共通していますが、仕組みは異なります。

ここまでの違いを、探索の後押しがどこから生まれるかという軸で整理すると次のようになります。

用語 探索を後押しする仕組み
内発的報酬 エージェント自身が新規性や予測誤差をもとに報酬を生成する
外発的報酬 環境がタスクの達成度に応じて報酬を与える
ε-greedy 一定の確率でランダムに行動を選ぶ
ノイジーネットワーク ネットワークの重みにノイズを加えて行動をばらつかせる

いずれも学習を前へ進めるための工夫という点では地続きですが、探索の出どころが報酬の側にあるのか行動の選び方の側にあるのかで整理しておくと、取り違えにくくなります。

4. ビジネス・実務での活用シナリオ

ロボティクスの分野では、未知の環境を探索するロボットに内発的報酬を与える取り組みが進んでいます。目的地の手がかりが乏しい状況では、外発的報酬だけに頼るとロボットが行動範囲を広げられず、探索が停滞してしまいます。内発的報酬を組み込むことで、ロボットが自律的に行動範囲を広げながら未知の空間を把握できるようになります。

ゲームAI開発では、スパース報酬のゲーム攻略AIの学習に内発的報酬が組み込まれています。人手でステージごとに報酬を細かく設計する方法には限界があり、開発コストもかさみます。内発的報酬を用いれば、人手によるステージ設計に頼らずとも、AI自身が難所を突破する行動を見つけ出せます。

自動運転のシミュレーション開発では、事故につながる稀な状況であるコーナーケースを内発的報酬でシミュレーション上で優先的に探索させる手法が使われています。実際の走行では滅多に発生しない状況ほど学習データが集まりにくく、内発的報酬による優先的な探索は学習データの網羅性を高める上で意義があります。

5. 要点まとめ

  • 内発的報酬は環境から与えられる外発的報酬とは別に、エージェント自身が新規性や予測誤差をもとに生成する報酬で、探索ボーナスとも呼ばれます。
  • スパース報酬環境の代表例はアタリの『Montezuma’s Revenge』で、RNDなど内発的報酬を用いた手法が人間の平均スコアを上回りました。
  • 探索を促す別系統の手法としてノイジーネットワークがあり、報酬設計による内発的報酬とは仕組みが異なります。

6. 確認問題

問1内発的報酬は、環境から与えられる本来の目的達成の報酬とは別に、エージェント自身が状態の新規性などを基準に生成する報酬である。

解答・解説をみる

○ 正しい

内発的報酬の定義そのものを確認する問題です。外発的報酬とは報酬の発生源が異なる点がポイントです。

問2アタリのゲーム『Montezuma’s Revenge』は報酬が高頻度に得られる環境であり、内発的報酬を使わなくても通常の強化学習で高いスコアを得られる。

解答・解説をみる

× 誤り

正しくは逆で、報酬がほとんど得られないスパース報酬環境の代表例です。通常のDQNではスコアが0にとどまり、内発的報酬を用いた手法であるRNDなどにより人間の平均スコアを上回った成果が報告されています。

問3内発的報酬による探索とノイジーネットワークによる探索は、どちらも探索を促す技術だが、報酬を追加するかネットワークの重みにノイズを加えるかという実現方法が異なる。

解答・解説をみる

○ 正しい

両者は探索を促進する目的こそ共通していますが、仕組みが異なる別系統の手法である点を確認する問題です。