1. 定義と概要
TD学習とは、エピソードの終了を待たずに、1ステップ進むたびに得られる即時報酬と次の状態の価値の推定値を使って、現在の状態の価値の推定値を更新していく強化学習の手法です。更新に使う誤差はTD誤差(今まで予測していた価値と、実際に得られた報酬+次の状態の予測値との差)と呼ばれます。
1ステップ先までを使う最も基本的な形であるTD(0)では、δ_t = r_t + γV(s_{t+1}) − V(s_t) という式で表されます。この差分をもとに、価値関数はV(s_t) ← V(s_t) + α・δ_tという式で更新されます。
式に出てくる記号は、それぞれ次の役割を担っています。
| 記号 | 表しているもの |
|---|---|
| r_t | そのステップで実際に得られた即時報酬 |
| γ | 割引率(将来もらえる報酬を今の価値としてどれだけ割り引いて評価するかを表す0〜1の数値) |
| V(s_t) | 状態価値関数(ある状態にいるとき、この先どれくらいの報酬が見込めるかを表す推定値)の値 |
| α | 学習率(新しく分かった情報をどれくらいの割合で今の推定値に反映するかを表す数値) |
つまり、いま持っている推定値と、1歩進んで分かった報酬+次の推定値とのずれを、学習率の分だけ推定値に取り込んでいく形になります。
強化学習で価値関数を求める従来の方法には、動的計画法とモンテカルロ法がありました。動的計画法(環境の仕組み、状態遷移確率や報酬をあらかじめすべて把握したうえで、計算だけで最適な行動を求める手法)は、実世界の複雑な問題では環境モデルを完全に把握することが難しいという制約を抱えていました。
モンテカルロ法(1エピソード分の結果、収益がすべて出そろってから、その平均で価値を見積もる手法)は環境モデルを必要とせず経験だけから学習できます。一方で、価値の更新にはエピソードが終わるまで待つ必要があり、学習結果の反映が遅くなるという課題がありました。
TD学習は、モンテカルロ法と同様に環境モデルを必要とせず経験から直接学習しながら、動的計画法と同様に1ステップごとに他の推定値を使って推定値を更新する、両者の性質を組み合わせた手法として位置づけられます。
2. 試験対策ポイント
まず押さえておきたいのは、TD学習がエピソードの終了を待たずに1ステップ先の報酬と次状態の予測値だけで現在の推定値を更新するという即時性です。この点は、実際の収益がすべて出そろうまで更新を待つモンテカルロ法との違いにあたります。
あわせて、TD誤差の式δ_t = r_t + γV(s_{t+1}) − V(s_t)と、それを使った更新式V(s_t) ← V(s_t) + α・δ_tの対応関係も、まず押さえておきたい論点です。r_tは即時報酬、γは割引率、αは学習率という各記号の役割は、この式の意味を理解するための前提になります。
推定値を使って別の推定値を更新する仕組みはブートストラップ(確定した正解ではなく、自分自身の推定値を使って別の推定値を更新していく仕組み)と呼ばれます。この用語は統計学の「ブートストラップ法」(手元のデータの一部(標本)を繰り返し取り出し直す再標本化の手法)とは別の概念です。両者は混同しやすい組み合わせです。
また、モンテカルロ法は実際に得られた収益をそのまま使うため偏り(バイアス)が生じない一方でばらつき(分散)が大きく、TD学習は推定値をもとに更新するためバイアスが生じるものの分散は小さいという特性の違いがあります。この対比は、両手法の長所と短所を理解するうえでの中心的な論点です。
TD学習の考え方は、状態と行動の組み合わせの価値(行動価値関数)にも拡張されています。代表的な手法として、Q学習(状態と行動の組み合わせの価値であるQ値をTD誤差で更新しながら最適な行動を学ぶ代表的な手法)とSARSA(実際にとった行動をもとにQ値を更新していく、Q学習に似た手法)が知られています。TD学習という総称と個別のアルゴリズムの関係の違いも、取り違えやすい点です。
3. 関連概念との比較・相違点
モンテカルロ法との最大の違いは、価値の更新タイミングです。モンテカルロ法はエピソード終了後にまとめて実際の収益で更新するのに対し、TD学習は1ステップごとに推定値で更新します。この違いから、モンテカルロ法は実際の収益を使うためバイアスがなく分散が大きく、TD学習は推定値を使うためバイアスが生じる代わりに分散が小さいという特性が生まれます。
学習結果の反映が早いTD学習は、状況が変化しやすい環境で方策を素早く調整したい場面において実務上の利点です。学習の反映が早いか、値のばらつきが小さいかという観点は、両者を対比する軸になります。
動的計画法との最大の違いは、環境モデルの有無です。動的計画法は状態遷移確率と報酬関数を完全に把握した環境モデルが前提になるのに対し、TD学習は環境モデルを持たず経験のみから学習します。
環境モデルを持たずに済むTD学習は、状態遷移の全体像を事前に把握しにくい実世界の問題にも適用しやすいという長所です。一方で、1ステップごとに他の推定値で推定値を更新するブートストラップの発想は、TD学習と動的計画法に共通する特徴です。
3つの手法を、環境モデルの要否と価値を更新するタイミングという軸で並べると、次のようになります。
| 手法 | 環境モデル | 価値を更新するタイミング |
|---|---|---|
| 動的計画法 | 状態遷移確率と報酬関数を完全に把握した環境モデルが前提 | 他の推定値を使って1ステップごとに更新 |
| モンテカルロ法 | 不要。経験だけから学習できる | エピソード終了後にまとめて実際の収益で更新 |
| TD学習 | 不要。経験のみから学習する | 1ステップごとに推定値で更新 |
この共通点と相違点により、動的計画法・モンテカルロ法・TD学習という3つの手法の位置関係が整理されます。
4. ビジネス・実務での活用シナリオ
ゲームAIの分野では、対戦ゲームの対局中、勝敗が決まる前の局面でも1手ごとに形勢の評価値を更新できます。TD学習の仕組みを用いれば、対局の途中経過から逐次学習を進められ、最終的な勝敗が決まるのを待たずに評価の精度を高めていくことができます。対局が長時間に及ぶゲームほど、終了を待たずに評価を磨けるTD学習の性質は、実戦に近い局面での判断精度を底上げする理由です。
Web推薦や広告配信の分野では、閲覧からクリック、購入までの一連の行動が完了する前でも、行動が起きるたびに推定価値を更新できます。長いセッションの途中からでも学習を反映できる点は、ユーザーの離脱が多い実際のサービス運用にとって意味のある特性です。セッションの終盤まで待たずに学習を反映できる性質は、ユーザーが離脱する前に推薦や配信の精度を改善できる理由になります。
ロボティクス制御の分野では、一連の作業動作が完了する前の各ステップで得られるセンサー情報をもとに逐次価値を更新できます。長い作業工程でも早い段階から方策(どの状況でどう行動するかの方針)の改善に着手できる点が、TD学習を実務で使う意義です。
5. 要点まとめ
- TD学習はエピソードの終了を待たずに、1ステップ進むたびに得られる報酬と次状態の推定値を使って現在の価値の推定値を更新する強化学習の手法です。
- 更新に使う誤差はTD誤差(δ_t = r_t + γV(s_{t+1}) − V(s_t))と呼ばれ、推定値で推定値を更新する仕組みはブートストラップと呼ばれます。
- モンテカルロ法(バイアスなし・高分散、エピソード終了後に更新)と動的計画法(環境モデル前提)の両方の性質を併せ持ち、Q学習・SARSAはTD学習を行動価値に拡張した代表的なアルゴリズムです。
6. 確認問題
問1TD学習は、1つのエピソードが終了するまで待ってから、実際に得られた収益をもとに価値関数を更新する手法である。
解答・解説をみる
× 誤り
正しくは、TD学習はエピソードの終了を待たずに1ステップごとに更新する手法です。エピソード終了後にまとめて実際の収益で更新するのはモンテカルロ法の特徴であり、両者を入れ替えた記述は取り違えやすい点です。
問2TD誤差は、実際に得られた即時報酬と次状態の価値の推定値の和から、現在の状態の価値の推定値を引いた値として計算される。
解答・解説をみる
○ 正しい
TD誤差はδ_t = r_t + γV(s_{t+1}) − V(s_t)として定義されます。この差分に学習率を掛けた値を現在の推定値に加える形で、価値関数が更新されます。
問3強化学習におけるブートストラップは、統計学のブートストラップ法と同じく、手元のデータからの再標本化(リサンプリング)によって推定を行う手法を指す。
解答・解説をみる
× 誤り
正しくは、強化学習のブートストラップは推定値を使って別の推定値を更新する仕組みを指します。統計学のリサンプリングによるブートストラップ法とは別の概念であり、同じ用語で意味が異なる点が区別のポイントです。

