探索(強化学習) (G検定)

探索(強化学習)

1. 定義と概要

探索(強化学習)とは、エージェント(行動を選択する主体)が現在知っている情報だけに頼らず、まだ試していない行動を選択して新しい情報を獲得しようとする行動選択の考え方です。英語表記は「exploration」です。

強化学習は、行動によって得られる報酬(行動の結果として得られる評価の数値)をもとに、より良い行動の選び方を試行錯誤で学んでいく機械学習の枠組みです。探索はこの枠組みにおける基本的な行動選択の一つに位置づけられます。対になる活用(exploitation)は、現在持っている知識の中から報酬が最大になると推定される行動を選ぶ考え方です。

第1次人工知能ブームで扱われる古典的な探索は、状態空間を探索木(状態をノード、状態の移り方を枝として木の形に表し、しらみつぶしにたどる探索処理)で解を見つける処理を指し、強化学習の探索とは別の概念にあたります。同じ「探索」という言葉でも、指す処理がまったく異なります。

具体例として、多腕バンディット問題(報酬の確率分布が未知の複数の選択肢を繰り返し選び、得られる利得を最大化する行動を探る問題設定)を挙げられます。この問題設定では、スロットマシンの腕にたとえたアーム(多腕バンディット問題における選択肢の呼び名)のうち、まだ引いていないアームを試すことが探索、これまでの結果から最も報酬が高いと分かっているアームを引くことが活用にあたります。

行動の評価が定まっていない学習の初期段階から、目先の報酬が高い行動ばかりを選ぶ活用一辺倒の方策、いわゆるgreedy方策(常に現時点で報酬が最大と推定される行動だけを選び、探索を行わない方策)をとる場合があります。この方策をとると、たまたま早い段階で見つかった行動に固執し、実際にはもっと報酬の高い行動を見逃す局所最適解(本当はもっと良い選択肢があるのに、早い段階で見つかった良さそうな選択肢に固執してしまう状態)に陥ります。

この課題に対応するため、一定の確率でランダムな行動を試して新しい情報を集める探索の仕組みが、強化学習の方策に組み込まれるようになりました。探索と活用は常にトレードオフの関係にあり、両者をどう配分するかが強化学習の方策設計における中心的な論点です。

2. 試験対策ポイント

探索と活用はトレードオフの関係にあり、探索は新しい情報の獲得、活用は現時点で最も報酬が高いと推定される行動の選択を指します。この対比そのものが探索と活用の基本構造にあたります。

具体的な方策として扱われるのがε-greedy方策(確率εでランダムに探索し、残りは活用する強化学習の基本的な方策)です。あらかじめ定めた確率εでランダムな行動を選んで探索し、残りの1-εの確率で現時点の推定報酬が最大の行動を選んで活用します。

εを固定せず学習の進行とともに徐々に小さくしていく手法はε減衰(学習が進むにつれてランダムに探索する確率εを徐々に小さくしていく工夫)と呼ばれます。学習初期は探索を重視し、学習が進むほど活用を重視するという配分の変化とセットで整理されます。

ε-greedy方策の完全にランダムな探索とは異なる方策として、UCB方策(Upper Confidence Bound。推定報酬に加えて、試した回数が少ない行動ほど大きくなるボーナスを考慮して行動を選ぶ方策)があります。各行動のこれまでの推定報酬に不確実性のボーナス項を加えて評価するため、不確実性を踏まえた合理的な探索を行う点が区別されます。

これらの方策を検討する基本モデルとして扱われるのが多腕バンディット問題です。報酬の確率分布が未知の複数の選択肢、すなわちアームを繰り返し選ぶ場面を想定しており、探索と活用のトレードオフを検討する土台になります。

スパース報酬(ゴールに到達するまでほとんど報酬が得られない状態)の環境では、ランダムな探索だけでは十分な情報が集まらない課題があります。この課題に対しては、内発的報酬(エージェント自身が新規性や予測誤差をもとに追加の報酬を生成する仕組み)という別のアプローチも存在します。

探索を促す三つの手立てを、どこを工夫するかで並べると次のようになります。

手立て 工夫する場所 探索の進め方
ε-greedy方策 方策 確率εで完全にランダムに探索する
UCB方策 方策 試行回数が少ない行動ほど大きいボーナスを加えて選ぶ
内発的報酬 報酬 新規性や予測誤差から追加の報酬を生成する

この工夫する場所の違いが、実現手段を整理するときの分かれ目になります。

3. 関連概念との比較・相違点

活用(exploitation)との最大の違いは、新しい情報を集める行動選択か、現在の知識の中で報酬最大の行動を選ぶ行動選択かという点にあります。探索は未知の可能性を試す方向に働き、活用は既知の中で確実に報酬を得る方向に働くため、両者は常にトレードオフの関係にあり、対になる概念として一対で語られます。

探索に偏りすぎれば得られたはずの報酬を取りこぼし、活用に偏りすぎれば局所最適解から抜け出せなくなるという、逆方向の弱点を互いに抱えている関係です。

もう一つ区別が必要なのが、第1次人工知能ブームで扱われた古典的な探索です。同じ「探索」という語を使いながら、指している処理は次のように異なります。

観点 強化学習の探索 古典的な探索
何をするか 未知の行動を試して新しい情報を集める行動選択 状態空間を探索木でしらみつぶしにたどり解を見つける処理
代表的な手法 ε-greedy方策やUCB方策 幅優先探索や深さ優先探索
使われる場面 報酬をもとに行動の選び方を学ぶ場面 最短経路やパズルの解を求める場面

強化学習の探索は、木構造をたどって解を確定させる処理ではありません。同じ語を使いながら指す処理が異なるため、G検定では取り違えやすい点として扱われます。

4. ビジネス・実務での活用シナリオ

レコメンデーションや広告配信の分野では、多腕バンディット問題の考え方を応用した仕組みが使われています。新しい商品や広告、すなわちまだ十分なデータがないアームを一定割合で表示して反応データを集めつつ、実績の良い候補を優先的に配信することで、最適化とデータ収集を両立させます。新しい候補を最初から除外すると成長の芽を摘みかねないため、探索を組み込んだ設計が採られています。

ロボティクスや自動運転の学習では、シミュレーション環境の中でエージェントに未知の行動パターンを試させる取り組みが行われています。実際の道路や工場で試すにはリスクが大きい状況を仮想空間で再現し、想定外の事態への対処方法を事前に集めておくことで、実機投入後のリスクを減らす狙いがあります。

臨床試験や医療の分野でも、複数の治療法を比較検証する場面でバンディットアルゴリズムの応用が検討されています。探索によって新しい治療法のデータを集めつつ、活用によって有望な治療法へ被験者の配分を徐々に寄せていく設計です。効果が乏しい治療法に被験者を割り当て続ける事態を避けながら、新しい選択肢の情報も集められる点に応用の意義があります。

5. 要点まとめ

  • 探索(exploration)とは、強化学習でエージェントがまだ試していない行動を選び新しい情報を集める行動選択で、現在の知識の中で報酬最大の行動を選ぶ活用(exploitation)とトレードオフの関係にあります。
  • ε-greedy方策は確率εでランダムに探索し残りで活用する基本的な方策で、εを徐々に小さくするε減衰が実践で使われます。UCB方策は試行回数の少なさに応じたボーナス項を加えて不確実性を考慮した探索を行います。
  • 多腕バンディット問題は探索と活用のトレードオフを検討する基本モデルであり、第1次人工知能ブームの探索木をたどる探索、すなわち古典的探索とは異なる概念です。

6. 確認問題

問1強化学習における探索(exploration)とは、エージェントが現在知っている情報の中から報酬が最大になると推定される行動を選ぶことである。

解答・解説をみる

× 誤り

説明が逆になっています。現在の知識の中で報酬最大の行動を選ぶのは活用(exploitation)であり、探索はまだ試していない行動を選んで新しい情報を集めることを指します。両者の定義を入れ替えた記述は取り違えやすい点です。

問2ε-greedy方策では、確率εでランダムな行動を選択して探索し、残りの1-εの確率で現時点の推定報酬が最大の行動を選択して活用する。

解答・解説をみる

○ 正しい

ε-greedy方策の定義そのものにあたります。学習の進行に応じてεを徐々に小さくするε減衰もあわせて押さえておきたいポイントです。

問3UCB方策は、各行動の推定報酬に加えて、試行回数が少ない行動ほど大きくなる不確実性のボーナス項を考慮して行動を選択する。

解答・解説をみる

○ 正しい

UCB方策の定義そのものにあたります。ε-greedy方策の完全にランダムな探索とは異なり、不確実性を踏まえた合理的な探索を行う点が区別されます。