1. 定義と概要
世界モデルとは、エージェントが環境の観測データから状態遷移や因果関係(ある出来事が別の出来事を引き起こす関係)、物理法則といった構造を学習し、その内部に仮想的な環境シミュレータを構築する仕組み、またはそのモデル自体です。2018年に「David Ha」と「Jürgen Schmidhuber」が発表した論文「World Models」で提唱されました。
原論文の代表的な構成は、V・M・Cという3つの要素です。どの記号がどの仕組みを担い、何をする部分なのかは、次のように対応します。
| 要素 | 担う仕組み | 役割 |
|---|---|---|
| V | VAE(高次元データを特徴を保ったまま小さな数値の並びに圧縮する仕組みで、「Variational Autoencoder」の略) | 画像などの観測を潜在空間(データの本質的な特徴だけを取り出して表現する、圧縮された数値空間)へ圧縮する |
| M | MDN-RNN(複数の確率分布の組み合わせで将来を予測するリカレントニューラルネットワーク) | 時間発展や次の状態を予測する |
| C | コントローラー(次にとるべき行動を決める意思決定部分) | 圧縮された状態から行動を決める |
観測の圧縮・時間発展の予測・行動の選択という3段構えになっている点が、世界モデルの骨格にあたります。
従来の強化学習は、環境のモデルを持たないモデルフリー強化学習(環境モデルを持たず、経験から直接方策や価値を学習する手法)が主流で、方策(ある状態でどの行動を取るかを決めるルール)を磨くために環境との試行錯誤を大量に繰り返す必要がありました。ロボットや自動運転のように、実世界での試行錯誤にコストや事故リスクが伴う領域では、この非効率さが課題になります。
そこで、環境の因果関係やルールをニューラルネットワークで学習し、圧縮した潜在空間の中で仮想的な試行錯誤を行いながら方策を学習するアプローチが2018年に提案されました。これが世界モデルであり、後続のDreamerシリーズなどモデルベース強化学習の研究に発展しています。
近年は生成AI(文章などの指示から新しい画像や動画を作り出すAI)の文脈でも、世界モデルという言葉が使われるようになっています。動画生成AIの「Sora」、対話的に3D環境を生成する「Google DeepMind」の「Genie 3」(2025年8月発表)、そして「World Labs」が2025年11月に発表した3D環境生成サービス「Marble」がその例です。
2. 試験対策ポイント
まず整理したいのは、「David Ha」と「Jürgen Schmidhuber」による原論文の枠組みです。その枠組みは、V(VAEによる観測の圧縮)・M(MDN-RNNによる時間発展の予測)・C(コントローラーによる行動選択)という3要素構成にまとめられます。名称と役割の対応関係は取り違えやすい点です。
もう一つの重要な論点は、世界モデルの位置づけです。世界モデルは、状態遷移と報酬を予測する関数である環境モデルを、ニューラルネットワークで高度に学習した発展的な実装であり、これを利用して計画・学習する手法がモデルベース強化学習という位置づけにあります。
モデルベース強化学習はサンプル効率(少ない試行回数でどれだけ学習が進むかを表す指標)に優れる一方、環境モデルの誤差が方策の学習に影響するというトレードオフを持ちます。仮想の環境が実際の環境からずれていれば、その中で磨いた方策も現実からずれていくためです。
画像などの高次元の観測データを扱いやすい小さな特徴量(データの特徴を数値で表した量)に変換する状態表現学習は、世界モデルのV(VAE部分)が担う処理そのものであり、あわせて見ておきたい関連用語にあたります。
また、シミュレーション環境で学習した方策を実環境(実機)に適用する技術であるsim2real(シム・ツー・リアル)は、世界モデル内部での仮想的な試行錯誤という発想と問題意識が重なる論点として扱われます。
3. 関連概念との比較・相違点
環境モデルとの最大の違いは、抽象概念と実装の関係にあります。環境モデルは、エージェントが行動した結果、次にどんな状態になり、どんな報酬を得るかを予測する関数という概念全般を指します。これに対して世界モデルは、それを高次元の観測からニューラルネットワークで学習し、潜在空間内でのシミュレーションまで行う発展的な実装形態を指します。
環境モデルという言葉だけでは、ニューラルネットワークを使うかどうか、どんな粒度で学習するかは決まっていません。世界モデルはその具体像の一つという関係になります。
モデルベース強化学習との最大の違いは、手法と構成要素の関係にあります。モデルベース強化学習は、環境モデル(世界モデルを含む)を使って計画・学習を行う手法の名称であり、世界モデルはその手法の中で使われる環境シミュレータ本体という部品にあたります。
3つの語がどの層に属するのかを並べると、次のように整理できます。
| 用語 | 層 | 中身 |
|---|---|---|
| 環境モデル | 概念 | 行動の結果として次の状態と報酬を予測する関数の総称 |
| 世界モデル | 実装 | 環境モデルを高次元の観測からニューラルネットワークで学習し、潜在空間内でのシミュレーションまで行う発展形 |
| モデルベース強化学習 | 手法 | 環境モデル(世界モデルを含む)を利用して計画・学習を行う枠組み |
つまり、環境モデルという概念を世界モデルが実装し、その世界モデルをモデルベース強化学習が利用するという三層の関係が成り立ちます。この三層構造を取り違えると、世界モデルとモデルベース強化学習を同じ階層の同義語として混同してしまうため、階層の違いとして整理しておく必要があります。
4. ビジネス・実務での活用シナリオ
自動運転の分野では、世界モデルが学習した仮想的な運転環境の中で多様な走行シナリオを試行することで、実車を走らせずに稀な事故シナリオまで学習でき、開発コストと事故リスクの両方を抑えられます。実車テストだけでは遭遇しにくい稀な状況を仮想空間で先に経験できる点が、この手法の意義にあたります。
ロボティクスの分野では、ロボットアームの動作計画を世界モデル内での仮想的な試行錯誤で先に学習し、実機を壊すリスクを抑えながら方策を磨いたうえで「sim2real」により実機へ適用します。実機での試行錯誤を最小限にとどめられるため、開発サイクルの短縮につながります。
コンテンツ制作・エンタメの分野では、「Genie 3」や「Marble」のような対話的3D環境生成モデルが、ゲームやバーチャル空間の背景・地形をテキストや画像から生成する事例が登場しています。従来は人手で作り込んでいた3D空間の土台部分を生成AIが肩代わりすることで、制作工程の効率化につながっています。
5. 要点まとめ
- 世界モデルは、環境の観測データから状態遷移や物理法則を学習し、内部に仮想的なシミュレータを構築する仕組みで、2018年の「David Ha」と「Jürgen Schmidhuber」の論文で提唱されました。
- VAEによる観測の圧縮(V)・MDN-RNNによる時間発展の予測(M)・コントローラーによる行動選択(C)という3要素構成が原論文の枠組みで、圧縮した潜在空間内での学習がサンプル効率を高めます。
- 環境モデルの発展的な実装が世界モデルであり、モデルベース強化学習はこれを利用する手法、状態表現学習は観測を圧縮する要素技術という関係にあります。
6. 確認問題
問1世界モデルは、「David Ha」と「Jürgen Schmidhuber」が2018年に発表した論文で提唱された概念であり、VAE・MDN-RNN・コントローラーの3要素で構成される。
解答・解説をみる
○ 正しい
論文「World Models」の枠組みどおりで、観測の圧縮を担うV・時間発展の予測を担うM・行動選択を担うCという3要素構成にあたります。名称と役割を対応づけて覚えておく必要がある論点です。
問2世界モデルはモデルフリー強化学習の一種であり、環境のモデルを持たずに経験から直接方策を学習する手法である。
解答・解説をみる
× 誤り
正しくは、世界モデルは環境モデルをニューラルネットワークで学習し内部に構築する仕組みであり、モデルベース強化学習の枠組みに位置づけられます。モデルフリーとモデルベースを取り違える記述は、順序が逆になりやすい点です。
問3世界モデルの利点の一つは、圧縮した潜在空間内で仮想的な試行錯誤を行うことで、実環境でのサンプル数を減らせる点にある。
解答・解説をみる
○ 正しい
モデルベース強化学習全般に共通する利点で、実世界での試行錯誤にかかるコストや事故リスクを抑えられます。サンプル効率の高さが世界モデルの価値を支えています。

