オフライン強化学習 (G検定)

オフライン強化学習

1. 定義と概要

オフライン強化学習とは、事前に収集済みの固定データセット(状態・行動・報酬の記録)のみを用い、環境との新たな相互作用を行わずに最適な方策(エージェントが状況に応じてどう行動するかを決めるルール)を学習する強化学習の手法です。バッチ強化学習とも呼ばれます。過去の診療記録から治療方針を学習する、過去の走行ログから運転方策を学習する、といった場面が代表的な例です。

従来の強化学習、いわゆるオンライン強化学習(エージェントが実際の環境と試行錯誤しながら方策を改善する、強化学習の基本的な枠組み)は、エージェントが実際の環境と相互作用しながら試行錯誤を重ねて方策を改善する枠組みを前提としてきました。

しかし医療や自動運転、ロボティクスのように、最適化前の未熟な方策を実環境で試すこと自体に危険や高いコストが伴う領域では、この試行錯誤が現実的ではありません。そこで、過去に蓄積済みのログデータだけから安全に方策を学習するオフライン強化学習が、深層強化学習の応用例として注目を集めています。

2. 試験対策ポイント

ここでの要点は、オンライン強化学習との対比です。オンラインは環境との相互作用を継続しながら方策を更新するのに対し、オフラインは固定データセットのみを使い、環境との新たな相互作用を行いません。この違いは、深層強化学習の応用例を整理するうえで出発点になる考え方です。

もう一つの要点は、分布シフト(データを集めたときの行動パターンと、学習中の方策の行動パターンにずれが生じること)という課題です。データ収集時とは異なる行動を学習中の方策がとろうとすると、データに含まれない行動を誤って高く評価してしまう外挿誤差(データに含まれない行動を評価しようとして生じる推定のずれ)につながり、実環境での性能低下を招きます。

模倣学習(人間の手本を真似ることで方策を学習する手法)との違いも試験対策のポイントです。模倣学習は、手本の記録であるデモンストレーション(手本として与えられる行動の記録データ)をもとに、行動クローニングに代表されるように、教師あり学習(正解データから入力と出力の関係を学習する手法)に近い枠組みで学ぶ手法が中心です。一方でオフライン強化学習は、報酬(エージェントの行動の良し悪しを数値で表すシグナル)の最大化に基づいて方策を評価・改善する強化学習の枠組みです。

さらに、モデルフリー(環境の仕組みを明示的に学習せず、経験データから直接方策や価値を学ぶ手法)という手法があります。モデルベース(環境の仕組み、次にどう変化するかを表すモデルを学習し、それを使って行動を計画する手法)という手法もあり、いずれの枠組みもオフライン強化学習に適用できます。固定データセットからの学習が試みられている点は、この両方の手法に共通する特徴です。

3. 関連概念との比較・相違点

オンライン強化学習との最大の違いは、環境との相互作用の有無にあります。オンラインは相互作用を継続しながら学習を進めるのに対し、オフラインは固定データセットのみで学習が完結します。

実環境で試行錯誤できない状況を前提にする点が、オンライン強化学習と対をなすオフライン強化学習という枠組みの存在意義そのものです。医療や自動運転のように、未熟な方策を試すこと自体にリスクが伴う領域ほど、この違いが重視されます。

模倣学習との最大の違いは、学習の枠組みにあります。模倣学習は行動クローニングをはじめとする教師あり学習に近い枠組みで学ぶ手法が中心である一方、オフライン強化学習は報酬最大化に基づく強化学習です。

3つの枠組みを、使うデータと方策を評価する基準という軸で並べると次のように整理できます。

枠組み 使うデータ 方策を評価する基準
オンライン強化学習 環境と相互作用しながら集め続ける 報酬の最大化
オフライン強化学習 事前に収集した固定データセットのみ 報酬の最大化
模倣学習 事前に収集したデモンストレーション 手本の行動をどれだけ再現できるか

オフライン強化学習と模倣学習は、事前に収集したデータのみを使う点で共通していますが、何を基準に方策を評価するかという原理が異なります。この原理の違いは、深層強化学習の応用範囲を理解するうえでの分かれ目になります。

未熟な方策を実環境で試すリスクが大きい領域では、手本の模倣にとどまらず報酬に基づいて方策を改善できるオフライン強化学習が選ばれる場面があります。

4. ビジネス・実務での活用シナリオ

医療分野では、未検証の治療方針を患者に試すリスクを避けるため、過去の診療記録というデータセットのみから治療方策を学習する取り組みが進んでいます。実際の患者に新しい治療法を試行錯誤で試すことは倫理的に許されないため、蓄積された記録から安全性を保ちながら学習できるオフライン強化学習の枠組みが意思決定支援に意義を持ちます。

自動運転の分野では、危険な状況を実車で試行錯誤させることなく、過去の走行ログから運転方策を学習する動きがあります。事故のリスクと開発コストを抑えながら方策を改善できる点は、実車走行を前提とする従来の強化学習にはない利点です。

ロボティクスの現場では、実機での試行錯誤が機体の損耗や作業停止コストを伴うため、過去の操作ログから方策を学習する手法が採用されています。危険を伴う作業を行うロボットの制御において、実機を壊すことなく方策を改善できる点は、オフライン強化学習ならではの価値です。

5. 要点まとめ

  • オフライン強化学習は、過去に集めた固定データセットのみを使い、環境との新たな相互作用を行わずに方策を学習する手法で、バッチ強化学習とも呼ばれます。
  • データの行動パターンと学習中の方策の行動パターンがずれる分布シフトが生じると、データにない行動を誤って高く評価する外挿誤差につながります。
  • 模倣学習は行動クローニングなど教師あり学習に近い枠組みで学ぶ手法が中心で、オフライン強化学習は報酬最大化に基づく強化学習という枠組みの違いがあり、モデルフリー・モデルベースいずれの手法でも適用できます。

6. 確認問題

問1オフライン強化学習は、事前に収集した固定データセットのみを用い、環境との新たな相互作用を行わずに方策を学習する手法である。

解答・解説をみる

○ 正しい

これがオフライン強化学習の定義そのものです。バッチ強化学習とも呼ばれ、オンライン強化学習と対になる考え方です。

問2オフライン強化学習では、データ収集時の行動パターンと学習中の方策の行動パターンにずれが生じる分布シフトにより、データにない行動を誤って高く評価する外挿誤差が課題となる。

解答・解説をみる

○ 正しい

分布シフトと外挿誤差は、オフライン強化学習に特有の課題にあたります。データにない行動を過大評価してしまう仕組みとあわせて理解しておく範囲です。

問3オフライン強化学習は模倣学習と同じく、人間の手本を模倣して方策を学習する教師あり学習の枠組みである。

解答・解説をみる

× 誤り

誤りです。模倣学習は、行動クローニングに代表されるように教師あり学習に近い枠組みで学習する手法が中心ですが、オフライン強化学習は報酬の最大化に基づく方策の評価・改善を行う強化学習の枠組みです。両者は事前収集データのみを使う点は共通しますが、学習の原理が異なります。