1. 定義と概要
Q学習とは、強化学習(試行錯誤を通じて報酬を最大化する行動のルールを学習する機械学習の一分野)における代表的なアルゴリズムの一つです。エージェント(環境の中で行動を選択する主体)が状態sで行動aを取ったときの行動価値関数(Q値、ある状態で特定の行動を取ったときに将来もらえる報酬の見込みを表す数値)をQ(s,a)と表します。
Q学習では、実際に選んだ次の行動によらず、次の状態で最大のQ値を持つ行動を仮定してこのQ(s,a)を更新していきます。この更新の枠組みはTD学習(時間的差分学習、1エピソードの終了を待たずに1ステップごとに価値の見積もりを更新していく学習の枠組み)にあたります。
更新式はQ(s,a) ← Q(s,a) + α[r + γ max_a’ Q(s’,a’) − Q(s,a)]と表されます。αは学習率(新しい情報を今の見積もりにどれだけ反映するかを決める割合)、γは割引率(将来もらえる報酬を現在の価値に割り引いて計算するための係数)にあたります。
1989年にクリストファー・ワトキンズの博士論文で確立された手法です。グリッドワールド(強化学習の仕組みを確認するためによく使われる、マス目状の仮想的な移動環境)でゴールまでの最短ルートを試行錯誤しながら学習させる場面などが具体例として挙げられます。
モンテカルロ法(1エピソードが終わるまで待ってから価値をまとめて更新する手法)に対し、TD学習は1ステップごとに逐次で価値を更新できる手法として登場しました。TD学習全体の枠組みは概要にとどめますが、その代表例の一つがQ学習です。
行動の選択自体はε-greedy方策(普段は最も良いとされる行動を選びつつ、一定の確率でランダムな行動を試す行動の選び方)に基づいて探索を進めながら、価値の更新は次の状態で最も価値の高い行動を仮定するmax演算子を使う点に特徴があります。
2. 試験対策ポイント
まず整理しておきたいのは、更新式に含まれるmax_a’ Q(s’,a’)が何を意味するかという点です。この項は、エージェントが次に実際にどの行動を選ぶかとは無関係に、次の状態で理論上最も価値が高いとされる行動を仮定して計算されます。
行動を選ぶときに使う基準と、価値を更新するときに仮定する基準が別々になっているため、Q学習は方策オフ型(off-policy、行動を選ぶときの基準と価値を更新するときに仮定する基準が別々になっている学習方式)に分類されます。この分類は、後述するSARSAとの対比における要点です。
行動選択そのものは、前述のε-greedy方策に基づいて探索と活用のバランスを取りながら進められますが、これは更新式のmax演算子とは独立した仕組みです。実際に選んだ行動がランダムな探索によるものであっても、更新の際にはその行動とは関係なく、次の状態で最良とされる行動が仮定されます。
行動選択の仕組みと価値更新の仕組みは、それぞれ別の役割を担っているという整理が、Q学習を理解するうえでの土台になります。
更新式を構成する学習率αと割引率γも、あわせて整理しておきたい基本要素です。二つの係数は、次のように役割が分かれています。
| 記号 | 決めていること | 値を動かしたときの傾向 |
|---|---|---|
| 学習率α | 新しい情報を今の見積もりにどれだけ反映するか | 大きくすると直近の経験を強く反映する更新になる |
| 割引率γ | 将来の報酬を現在の価値へどれだけ割り引くか | 1に近づけるほど遠い将来の報酬まで考慮した価値づけになる |
いずれも更新式の構成要素であり、学習の進み方や価値づけの重心を左右する数値として整理されます。
3. 関連概念との比較・相違点
SARSA(実際に選んだ次の行動のQ値を使って更新する、Q学習と対比される方策オン型のアルゴリズム)との最大の違いは、更新に使うQ値の由来にあります。Q学習は方策オフ型、SARSAは方策オン型(on-policy、実際に選んだ行動と同じ基準を使って価値を更新する学習方式)にあたり、両者の違いは次のように並べられます。
| 観点 | Q学習 | SARSA |
|---|---|---|
| 更新に使うQ値 | 次の状態で最大のQ値を持つ行動を仮定する | 実際に選んだ次の行動のQ値をそのまま使う |
| 方策の分類 | 方策オフ型 | 方策オン型 |
| 更新の性質 | 理論上の最適行動を仮定した強気な更新になりやすい | 実際の行動方針に沿った更新になりやすい |
たとえば、ε-greedy方策によってあえてランダムな行動を選んだ場面を考えると、Q学習はその選択とは無関係に次の状態で最良とされる行動を仮定して更新しますが、SARSAは実際に選んだランダムな行動のQ値をそのまま使って更新します。
同じ経験をしても、更新に持ち込む値が違えば育つ価値の見積もりも変わります。更新に使うQ値の由来がどちらにあるかという軸は、G検定でQ学習とSARSAを区別する中心的な論点として扱われます。
4. ビジネス・実務での活用シナリオ
ロボット制御の分野では、格子状の移動経路の中でゴールまでの最適な移動ルールを試行錯誤によって学習させる基礎的な枠組みとして、Q学習の考え方が参照されます。ロボットが経路を繰り返し試すたびにQ値が更新され、遠回りを避ける移動ルールが徐々に形づくられていきます。限られた状態と行動の組み合わせであれば、Q値をテーブル形式で管理できる点も、この分野で参照されやすい理由の一つです。
ゲームAIの領域でも、状態と行動の組み合わせが比較的小さいゲームにおいて、探索を重ねながら最適な手を学習させる基礎アルゴリズムとしてQ学習が扱われます。ただし状態空間が膨大になる場合には、Q値をテーブルではなくニューラルネットワーク(脳の神経細胞のつながりを模した計算の仕組み)で近似するDQNという手法へ発展します(詳細は別記事で扱います)。
在庫や運用の意思決定の場面でも、限られた状態と行動の組み合わせの中で試行錯誤を通じて発注量などのルールを学習させる考え方の基礎として、Q学習が言及されます。過去の在庫水準や需要の状態に応じてどれだけ発注するかを繰り返し試すことで、価値の高い発注ルールが徐々に見えてくるという発想です。
5. 要点まとめ
- Q学習は、次の状態で最大のQ値を持つ行動を仮定して行動価値関数を更新する、TD学習に基づくアルゴリズムです。
- 行動選択と更新に仮定する方策が別々であるため方策オフ型に分類され、実際の次の行動のQ値を使う方策オン型のSARSAと対比されます。
- 行動選択はε-greedy方策で探索と活用のバランスを取り、更新式は学習率αと割引率γで構成されます。
6. 確認問題
問1Q学習は、次の状態で最大のQ値を持つ行動を仮定して更新式を計算するため、方策オフ型(off-policy)のアルゴリズムに分類される。
解答・解説をみる
○ 正しい
実際に選ぶ行動とは無関係に理論上最良の行動を仮定して更新する点が、Q学習が方策オフ型に分類される理由です。
問2Q学習は実際に選択した次の行動のQ値を使って更新するため、SARSAと同じ方策オン型(on-policy)のアルゴリズムに分類される。
解答・解説をみる
× 誤り
実際の次の行動のQ値を使って更新するのはSARSAの特徴です。Q学習は次の状態で最大のQ値を仮定して更新する方策オフ型であり、この記述は両者を取り違えています。
問3ε-greedy方策は、一定の確率でランダムな行動を選択することで、探索と活用のバランスを取る役割を持つ。
解答・解説をみる
○ 正しい
普段は現時点で最も価値が高いとされる行動を選びつつ、一定確率でランダムな行動を試す仕組みが探索と活用のバランスに当たります。

