1. 定義と概要
ε-greedy方策とは、強化学習における行動選択のアルゴリズムで、ε-greedy法とも呼ばれます。多腕バンディット問題(複数のレバーのどれを選べば報酬を最大化できるかを考える、強化学習の基本的な問題設定)で典型的に扱われます。
あらかじめ設定した確率ε(イプシロンと読むギリシャ文字で、0から1の間の小さな値を表し、例えば0.1のように設定します)でランダムな行動を選択します。残りの確率1-εでは、これまでの経験上もっとも価値が高いと推定される行動を選択します。この二段構えの仕組みが、ε-greedy方策の核となります。
複数のレバーを持つスロットマシンを模した問題設定では、10%の確率でランダムなレバーを引き、90%の確率でこれまでの平均報酬が最も高かったレバーを引くという適用例が挙げられます。
行動選択のもっとも単純な方法として、貪欲方策(greedy方策)が考えられます。貪欲方策(greedy方策)とは、常に現時点で最も良いとされる行動だけを選び続けるシンプルな方法です。しかし貪欲方策のみでは、まだ試していない行動の中に真により高い報酬をもたらす選択肢が埋もれていても、それを検出する機会が失われるという弱点があります。ε-greedy方策は、この貪欲方策の弱点を、一定確率でのランダムな行動選択によって補う手法として位置づけられます。
2. 試験対策ポイント
まず整理したいのは、確率εでランダムな行動を選ぶ探索(まだ試していない選択肢を試すこと)と、確率1-εでその時点の最良行動を選ぶ活用(これまでの経験上もっとも良いとわかっている選択肢を選ぶこと)を、二者択一の二段階の手続きとして扱う点です。ここでいう最良行動とは、Q値(行動価値関数。ある行動を選んだときに将来得られる報酬の見込みを数値化したもの)がもっとも高い行動を指します。
続いて重要な論点となるのが、εの値の大小が学習に与える影響です。両極での傾向は、次のように整理できます。
| εの値 | 行動選択の偏り | 起こりやすいこと |
|---|---|---|
| 大きい | ランダムな探索の割合が増える | 学習済みの良い行動を活かしきれない |
| 小さい | 探索が不足する | 局所的に良いだけの行動へ早期に収束する |
そのため、学習の進行にあわせてεを徐々に小さくしていく運用はε減衰(ε-decay。学習が進むにつれてランダム探索の確率εを少しずつ小さくしていく運用)と呼ばれ、ε-greedy方策とセットで扱われます。
貪欲方策単体の弱点も、あわせて整理しておきたい論点です。現時点で最良と評価された行動のみを選び続けるため、未試行の行動に潜む真の最適解を見逃す可能性があります。ε-greedy方策はこの弱点を確率的な探索で補う手法として説明されます。
加えて、Q学習(Q値を更新しながら最適な行動を学ぶ強化学習アルゴリズムの一つ)やSARSA(Q学習と似た、実際に選んだ行動をもとに価値を更新する強化学習アルゴリズム)も、Q値をもとに行動を評価します。ε-greedy方策は、これらのアルゴリズムの行動選択の部分に組み込まれる仕組みという関係にあります。
3. 関連概念との比較・相違点
貪欲方策(greedy方策)との最大の違いは、探索の有無にあります。貪欲方策は常に現時点の最良行動のみを選び続けるのに対し、ε-greedy方策は確率εでランダム行動を挟むことで、貪欲方策が抱える未試行行動を検討しないという弱点を補います。
UCB方策(試した回数が少ない行動を優先的に試すことで、効率よく探索を進める方法)との違いは、探索の仕方にあります。ε-greedy方策は確率εで全行動を等確率にランダム選択するのに対し、UCB方策は各行動の試行回数の少なさに応じた不確実性ボーナスを平均報酬に加算し、その上限値(信頼区間の上限)が最大の行動を選びます。ここでいう信頼区間とは、真の値が含まれると推定される範囲を表す統計的な区間です。
3つの方策の探索の扱いを並べると、次のようになります。
| 方策 | 行動の選び方 | 探索の扱い |
|---|---|---|
| 貪欲方策 | 常に現時点の最良行動を選ぶ | 探索しない |
| ε-greedy方策 | 確率εで全行動から等確率にランダム選択 | 確率εのぶんだけ探索する |
| UCB方策 | 不確実性ボーナスを加えた上限値が最大の行動を選ぶ | 試行回数が少ない行動を優先して探索する |
試行回数が少ない行動を優先する分、UCB方策のほうが探索の無駄が少ない設計になっています。この違いは、ε-greedy方策とUCB方策を対で整理するうえでの分かれ目です。
4. ビジネス・実務での活用シナリオ
Web広告やレコメンド(おすすめ商品表示)の分野では、複数の広告クリエイティブやおすすめ商品の候補からε-greedy方策で配信先を選ぶ手法が使われています。一定確率で新しい候補も表示し続けることで、クリック率が高い候補への配信偏重を避けながら継続的な改善が図られます。
ゲームAIやロボット制御の現場でも、既知の高評価な行動だけに固執せず、ε-greedy方策により一定割合で未知の行動パターンを試行する運用が採られています。これにより、局所的な最適解への固定化を避けられます。
Web接客やA/Bテストの領域では、サイト上のボタン配色やキャッチコピーの出し分けにおいて、固定比率のA/Bテストの代わりにε-greedy方策を使う事例があります。テスト実施中でも高成績の案に配信を寄せながら、探索を続けられる点が特徴です。
5. 要点まとめ
- ε-greedy方策は確率εでランダムな行動を選ぶ探索と、確率1-εで最良の行動を選ぶ活用を組み合わせた行動選択アルゴリズムです。
- εが大きいほど探索過多、小さいほど探索不足になり、学習の進行にあわせてεを小さくしていく減衰の運用とセットで扱われます。
- 貪欲方策(greedy)は未試行行動を見逃す弱点を持ち、UCB方策は試行回数に基づく不確実性ボーナスで探索を効率化する点がε-greedy方策との違いです。
6. 確認問題
問1ε-greedy方策では、確率εでランダムな行動を選び、残りの確率1-εでその時点で最も価値が高いと推定される行動を選択する。
解答・解説をみる
○ 正しい
探索を確率ε、活用を確率1-εに割り当てる二段階の仕組みが、ε-greedy方策の定義そのものにあたります。
問2εの値を大きく設定するほど、既知の高評価行動を活用する割合が増え、学習が早期に収束しやすくなる。
解答・解説をみる
× 誤り
誤りです。正しくは、εが大きいほどランダムな探索の割合が増えるため、学習済みの良い行動を活かしきれず、収束はむしろ遅れやすくなります。εを大きくすると活用ではなく探索が増える点は、取り違えやすいところです。
問3貪欲方策(greedy方策)のみで行動選択を行うと、現時点で最良と評価された行動だけを選び続けるため、未試行の行動に潜む真により良い選択肢を検出できない場合がある。
解答・解説をみる
○ 正しい
貪欲方策単体が抱える弱点として中心的な論点で、ε-greedy方策はこの弱点を確率的なランダム探索で補います。

