報酬 (G検定)

報酬

1. 定義と概要

報酬(reward)とは、強化学習においてエージェントが、ある状態(エージェントが置かれている状況を表す情報)で行動を選んだ結果として、環境から与えられる数値のフィードバック信号のことです。「この行動をとるべきだ」という具体的な指示ではなく、行動の良し悪しを数値だけで評価する点が特徴です。

たとえば、ロボットの歩行学習では歩けた距離が報酬になり、迷路探索ではゴール到達時にプラスの値、壁への衝突時にマイナスの値が与えられます。将棋や囲碁のような対局ゲームでは、勝敗の結果が報酬として設計されます。

強化学習の目的は、1回の行動に対する即時報酬を追うことではなく、累積報酬(収益)を最大化することにあります。累積報酬(収益)とは、将来にわたって得られる報酬を、割引率(将来の報酬をどれだけ割り引いて今の価値として評価するかを決める0から1の数値)で割り引きながら合計した値のことです。

行動の直後に得られる即時報酬だけを重視すると、目先の利益を優先する近視眼的な行動に陥りやすくなります。そのため、その後の展開まで見据えて行動を選ぶ設計が、強化学習の核になっています。

2. 試験対策ポイント

まず整理したいのが、即時報酬と累積報酬の違いです。即時報酬はある1回の行動の直後に得られる単発の値であるのに対し、累積報酬は将来にわたって得られる報酬を割引率で割り引きながら合計した値です。強化学習が最大化を目指すのは、この収益の期待値(起こりうる結果を確率で重み付けした平均的な見込み値)であり、即時報酬そのものではありません。

もうひとつの重要な論点が、遅延報酬という考え方です。行動の結果がすぐに反映されず、複数ステップ後にまとめて報酬が与えられる状況を指し、将棋や囲碁のように勝敗が対局終了時にしか分からない場合が代表例です。この場合、どの行動が最終的な結果にどれだけ貢献したかを特定しにくく、貢献度の割り当て問題(credit assignment problem)と呼ばれる課題が生まれます。

報酬設計の難しさも試験対策の要点のひとつです。報酬がまれにしか得られない環境はスパース報酬(ゴール到達など特定の結果でしか得られない、頻度の低い報酬)と呼ばれる状態で、学習の手がかりが少なく試行錯誤に時間がかかります。逆に設計を誤ると、報酬ハッキング(本来の目的とは違うやり方で報酬だけを稼ごうとする行動)を招きます。

報酬成形(reward shaping)とは、途中経過の行動にも中間的な報酬を与えて学習を助ける工夫のことです。この課題への発展的な工夫として、エージェント自身が報酬を生成する内発的報酬という手法もあります。いずれも、手がかりの乏しさや抜け道をどう埋めるかという発想から生まれた工夫です。

報酬は、状態・行動・報酬・状態遷移確率・割引率という枠組みで強化学習の問題を表すマルコフ決定過程(MDP)と呼ばれる数学モデルの構成要素のひとつに位置づけられます。

3. 関連概念との比較・相違点

教師あり学習の正解ラベルとの最大の違いは、情報の与えられ方にあります。教師あり学習では、各入力に対して「正解はこれ」という具体的なラベルが逐一与えられます。

一方、強化学習の報酬は行動の良し悪しを示すスカラー値の評価にすぎず、「何をすべきだったか」という正解そのものは示されません。この違いこそが、強化学習で試行錯誤(探索)が欠かせない理由になっています。

即時報酬と累積報酬(収益)の違いは、評価する時間の範囲にあります。両者を観点ごとに並べると、次のように対応しています。

観点 即時報酬 累積報酬(収益)
評価する時間の範囲 ある1回の行動の直後 将来にわたって得られる報酬の全体
値の求め方 行動の直後に得られる単発の値 将来の報酬を割引率で割り引きながら合計した値
強化学習が最大化する対象 最大化の対象ではない 期待値の最大化を目指す対象

この2つを混同すると、目先の即時報酬だけを追う設計に陥りやすくなります。累積報酬の最大化を即時報酬の最大化に置き換えてしまう記述は、選択肢での取り違えとして注意が必要です。

4. ビジネス・実務での活用シナリオ

ロボット制御の分野では、歩行ロボットの学習に報酬設計が使われます。転倒に対するマイナスの即時報酬と前進距離に対するプラスの即時報酬を組み合わせつつ、最終的に安定して長く歩き続けられるという累積報酬の最大化を目標に設計することで、目先の一歩だけでなく歩行全体の質を評価できます。

ゲームAI技術・対局AI技術の分野では、将棋や囲碁のAIモデルが対局中にほとんど即時報酬を持たず、勝敗という遅延報酬だけで方策(行動の選び方の方針)を学習します。膨大な回数の自己対局を通じて、どの一手が最終的な勝利にどれだけ貢献したかを推定しながら学習を進めていきます。少ない手がかりから最終的な勝敗に効く一手を洗い出せる点が、対局AIならではの強みです。

レコメンド・広告配信の分野では、クリックという即時報酬だけを追うと、目先の反応が良いだけの提示に偏ります。その後の継続利用や購買という遅れて得られる報酬まで踏まえた報酬設計にすると、短期的なクリック稼ぎに偏らない推薦が学習できます。

5. 要点まとめ

  • 報酬はエージェントの行動に対して環境が与える数値のフィードバックであり、教師あり学習の正解ラベルとは異なり「何をすべきか」を直接示しません。
  • 強化学習が最大化を目指すのは1回の行動で得る即時報酬ではなく、将来にわたる報酬を割引率で合計した累積報酬(収益)です。
  • 報酬が疎な環境や遅延報酬は学習を難しくし、報酬ハッキングを避ける報酬設計が課題になります。報酬成形や内発的報酬はこの課題への発展的な工夫です。

6. 確認問題

問1強化学習における報酬は、教師あり学習の正解ラベルと同様に、エージェントがとるべき具体的な行動そのものを示す情報である。

解答・解説をみる

× 誤り

正しくは、報酬は行動の良し悪しを示すスカラー値の評価にすぎず、「何をすべきだったか」を直接示す正解ラベルとは異なります。この違いが、強化学習に試行錯誤(探索)が必要な理由になります。

問2強化学習の目的は、ある1回の行動で得られる即時報酬ではなく、将来にわたって得られる報酬を割引率で合計した収益(累積報酬)の期待値を最大化することである。

解答・解説をみる

○ 正しい

強化学習が最大化を目指すのは即時報酬そのものではなく、将来にわたる報酬を割引率で割り引きながら合計した収益(累積報酬)の期待値(起こりうる結果を確率で重み付けした平均的な見込み値)です。この区別は試験対策の重要な論点です。

問3将棋や囲碁のように対局終了まで報酬が得られない状況は遅延報酬と呼ばれ、どの行動が最終的な結果にどれだけ貢献したかを特定しにくいという課題を生む。

解答・解説をみる

○ 正しい

対局終了時にしか勝敗という報酬が得られない状況は遅延報酬の代表例で、貢献度の割り当て問題(credit assignment problem)を生みます。