報酬成形 (G検定)

報酬成形

1. 定義と概要

報酬成形(reward shaping)とは、強化学習においてエージェント(環境の中で行動を選ぶAI側のプログラム)の学習を効率化するために、最終的な目標達成時の報酬に加え、目標に近づく途中の行動にも中間的な報酬を与える設計上の工夫です。

代表的な例が迷路探索の学習で、ゴール到達時に大きな報酬を与えるだけでなく、壁への衝突にはマイナスの報酬を、ゴールに近づく行動にはわずかなプラスの報酬を組み込む設計がよく使われます。

ゴールに近づくたびにわずかな加点が入るため、エージェントは遠回りの行動よりもゴール方向への行動を選びやすくなります。こうした細かな報酬の積み重ねが、エージェントの探索方向を望ましいゴールへと自然に導きます。

従来の強化学習では、エージェントがゴール到達や失敗といった最終結果でしか報酬を受け取れない環境に置かれることが多く、これはスパース報酬(ゴール到達や失敗など、最終結果でしかもらえない少ない報酬のこと)と呼ばれています。スパース報酬の環境では学習の手がかりが乏しく、ゴールにたどり着くまでの膨大な試行錯誤に時間を要するという課題があります。

とくに探索する空間が広い環境では、偶然ゴールに到達する確率自体が低く、学習がなかなか進まないという状況も起こります。この課題に対し、途中経過の行動にも小さな報酬を与えて学習を加速させる工夫として、報酬成形が発展してきました。

2. 試験対策ポイント

G検定のシラバスでは、報酬成形は『深層強化学習』の項目に挙げられています。同じ項目に並ぶキーワードは、次のとおりです。

キーワード 内容
オフライン強化学習 実際に環境を動かさず、あらかじめ集めたデータだけで学習する強化学習の手法
残差強化学習 既存の制御方法に強化学習で学んだ補正分を上乗せする手法
sim2real シミュレーション上で学習した方策を現実世界に適用する技術
ドメインランダマイゼーション シミュレータの各種設定値をランダムに変えて複数の環境で学習し、現実とのズレに強くする工夫
マルチエージェント 複数のエージェントが同時に学習・行動する強化学習の設定
RLHF 人が評価した点数を報酬として使い、対話AIなどの応答を調整する手法

これらの用語はいずれも、強化学習という基本的な枠組みを補ったり応用範囲を広げたりする技術です。なかでもオフライン強化学習は、あらかじめ集めたデータだけを使う点で、残差強化学習は、既存の制御方法を土台にする点で、学習のやり方そのものに手を入れる工夫にあたります。名称の意味だけでなく、このキーワード群としてのつながりも押さえておきたいポイントです。

報酬成形が必要とされる背景には、最終結果でしか報酬が得られないスパース報酬の問題があります。途中経過に中間報酬を与えることで学習効率が高まるという関係にあります。

一方で、報酬の設計を誤ると、エージェントが意図しない行動で高い報酬を稼いでしまう報酬ハッキング(本来の目的とは違うやり方で報酬だけを稼ごうとする行動)を招くことがあります。成形報酬が最終目標の報酬より大きくなりすぎない設計が求められる点は、取り違えやすいポイントです。

たとえば壁に近づくたびに得点が入る設計にすると、エージェントはゴールを目指さず壁際で得点を稼ぎ続けるようになりかねません。成形報酬の大きさは、あくまで最終目標の報酬を上回らない範囲にとどめることが前提になります。

対話AIの応答を調整するRLHFは、望ましい応答に段階的な評価を与えるという点で、報酬成形の考え方と合わせて見ておきます。

3. 関連概念との比較・相違点

まぎらわしい三つの用語は、課題側か手段側か、そして報酬関数を経由するかどうかで整理できます。

用語 位置づけ 報酬関数を経由するか
報酬成形 スパース報酬という課題を解決するための設計上の工夫 経由する
模倣学習 エキスパートの行動データから方策を直接学習する手法 経由しない
スパース報酬 最終結果でしか報酬が得られないという課題設定そのもの 課題側の概念

模倣学習(お手本となる人やエキスパートの行動データを真似して学習する手法)との最大の違いは、報酬関数を経由するかどうかにあります。報酬成形は報酬の与え方を工夫して方策(エージェントがどう行動するかを決めるルール)の学習を助ける手法であるのに対し、模倣学習はエキスパートの行動データをそのまま模倣して方策を獲得します。

報酬をどう設計するかという観点と、お手本をどう真似るかという観点の違いは、混同しやすい組み合わせです。たとえば、優れた運転手の走行データをそのまま学習に使う場合は模倣学習にあたり、車線逸脱や急ブレーキに応じて点数を調整する場合は報酬成形にあたります。

スパース報酬との関係は、手段と課題という対比で整理できます。両者は対立する概念ではなく、課題とその解決策という関係にあります。この2つの用語は入れ替えて使われがちで、どちらが課題でどちらが解決策かという向きの違いは取り違えやすい点です。

4. ビジネス・実務での活用シナリオ

ロボット制御の分野では、二足歩行ロボットの歩行学習において、転倒時のペナルティに加えて歩行距離や姿勢の安定性にも報酬を与える設計が使われています。途中経過を評価する仕組みがあることで、試行錯誤の回数を減らし学習を効率化できます。転倒だけを罰する設計では、ロボットが歩き方を覚えるまでに膨大な回数のシミュレーションが必要になります。

自動運転の分野では、衝突時のペナルティに加え、車線維持やなめらかなハンドル操作といった安全運転につながる行動に小さな報酬を与える設計が採用されています。衝突というペナルティだけでは、危険な状況に至るまでの過程を学習に反映しにくくなります。安全に関わる行動を段階的に評価することで、望ましい方策を効率よく学習させることができます。

対話AIの分野では、ChatGPT等の対話AIの調整にRLHFが用いられています。人間の評価をもとに望ましい応答へ段階的な評価を与えるRLHFは、報酬成形と近い考え方で応答品質を高める仕組みです。

5. 要点まとめ

  • 報酬成形は、最終目標達成時の報酬だけでなく途中経過の行動にも報酬を与え、学習効率を高める強化学習の手法です。
  • G検定シラバスでは『深層強化学習』の項目で、オフライン強化学習・残差強化学習などと並ぶキーワードとして挙げられています。
  • 報酬の設計を誤ると報酬ハッキングを招くため、成形報酬はあくまで最終目標を補助する範囲にとどめる設計が求められます。

6. 確認問題

問1報酬成形は、強化学習において最終的な目標達成時の報酬だけでなく、目標に近づく途中の行動にも報酬を与えることで学習効率を高める手法である。

解答・解説をみる

○ 正しい

報酬成形の基本的な定義であり、スパース報酬の課題を補う工夫として位置づけられます。迷路探索でゴールへの近づきに小さな報酬を与える設計が代表例です。

問2報酬成形は、G検定シラバスの『深層強化学習』の中項目において、オフライン強化学習や残差強化学習などと同じキーワード群に挙げられている。

解答・解説をみる

○ 正しい

報酬成形はシラバス上、これらの用語と同じ『深層強化学習』のキーワード群に含まれています。sim2real・RLHFなど周辺用語とセットで扱われます。

問3報酬成形とは、専門家(エキスパート)の行動データをそのまま模倣して方策を学習する手法であり、模倣学習と同じ意味を持つ。

解答・解説をみる

× 誤り

報酬成形はあくまで報酬の与え方を工夫する手法であり、報酬関数を経由しない模倣学習とは異なるアプローチです。正しくは、報酬成形と模倣学習は方策を学習する経路が異なる別の手法です。