1. 定義と概要
マルチエージェント強化学習(MARL)とは、同一の環境の中で複数のエージェントが同時に相互作用しながら、それぞれ試行錯誤によって方策(ポリシー。エージェントが状況に応じてどんな行動を取るかを決めるルール)を学習していく強化学習の枠組みです。単一のエージェントだけを対象とする従来の強化学習とは異なり、他のエージェントの行動によって環境そのものが変化する点が、大きな特徴です。
代表例としては、対戦型ゲームで人間のトップ層に並んだ次の2つが挙げられます。
| 代表例 | 対戦ゲーム | 到達点 |
|---|---|---|
| AlphaStar(DeepMind、2019年) | StarCraft II | グランドマスター(対戦ゲームのランキングにおける最上位クラス)相当の実力 |
| OpenAI Five(2019年4月) | Dota 2 | 前年王者OGを破る |
いずれも、複数の意思決定主体が同時に動く環境の中で学習を重ねた事例にあたります。
従来の強化学習は、単一のエージェントが他者の影響を受けない静的な環境と相互作用する設定を前提としてきました。しかし、複数ロボットの協調搬送や交通信号網の制御、対戦型ゲームなど、現実の多くの課題では複数の意思決定主体が同時に存在します。
こうした状況で単一エージェント向けの手法をそのまま適用すると、他のエージェントも学習を続けることで環境が絶えず変化する非定常性(周囲の他のエージェントも学習中で振る舞いが変わり続け、環境が一定に留まらない性質)の問題に直面します。その結果、学習は不安定になります。この課題に対応する枠組みとして、マルチエージェント強化学習が発展してきました。
2. 試験対策ポイント
試験対策としてまず重要になるのは非定常性です。自分以外のエージェントも学習を続けるため、各エージェントから見た環境は時間とともに変化します。この性質は、単一エージェントの強化学習には無い、マルチエージェント特有の課題として扱われます。
学習パラダイムには、各エージェントが他者を環境の一部とみなして個別に学習する独立学習(他のエージェントの存在を意識せず、それぞれが単独で強化学習を行う方式)があります。もうひとつがCTDE(中央集権型学習・分散型実行、学習中だけ全エージェントの情報をまとめて使い、実際に動くときは各エージェントが自分の観測だけで判断する仕組み)です。
CTDEは、学習時のみ全エージェントの情報を集約し、実行時は各エージェントが自分の観測だけで行動する方式です。両者の使い分けが、ここでの分かれ目になります。
エージェント間の関係性は、それぞれの利得がどう噛み合うかによって3つに分類されます。
| 関係性の分類 | エージェント間の利得の関係 |
|---|---|
| 協調(cooperative) | 共通の目標の達成を目指す |
| 競争(competitive) | 互いの利得が相反する |
| ミックス(mixed) | 協調と競争が混在する |
対戦型ゲームの多くは、一方の得点が他方の損失に直結し利得の合計が常に一定になるゼロサム(一方の得点が他方の損失に直結し、利得の合計が常に一定になる関係)の構造を持ち、競争の典型例となります。
自分自身や過去のバージョンと対戦を重ねて方策を鍛える自己対戦(セルフプレイ、自分自身や過去の自分のコピーと対戦を繰り返して方策を鍛える学習方法)は、代表的な学習手法のひとつです。もうひとつが、複数の役割を持つエージェント群を並行して育てるリーグ学習(役割の異なる複数のエージェント群を並行して育て、特定の戦略に偏らないよう鍛える仕組み)で、両者は試験対策として位置づけられます。
StarCraft IIのAlphaStarやDota 2のOpenAI Fiveは、こうした学習を経て人間のトッププレイヤーに匹敵する成績を収めた代表事例です。
3. 関連概念との比較・相違点
深層強化学習(シングルエージェント)との最大の違いは、単一のエージェントが他者の影響を受けない静的な環境と相互作用するか、複数エージェントが互いに影響し合う動的な環境で学習するかという、非定常性の有無にあります。前者は環境のルールが固定されているのに対し、マルチエージェント強化学習では他のエージェントの行動それ自体が環境の一部として変化し続けます。
ゲーム理論との関係は、包含関係として整理できます。ゲーム理論は複数の主体が絡む意思決定を数理的に分析する枠組みであり、マルチエージェント強化学習はその枠組みの中で試行錯誤を通じて方策を学習する手法という位置づけです。
協調・競争・ミックス(mixed)といった関係性の分類はもともとゲーム理論の概念に基づいており、マルチエージェント強化学習はこれを学習によって実現するアプローチにあたります。
4. ビジネス・実務での活用シナリオ
物流・倉庫ロボティクスの現場では、倉庫内で稼働する複数の搬送ロボットが、互いの位置と動きを考慮しながら経路を分担しています。台数が増えるほど衝突のリスクと待ち時間の増加が発生しやすくなるため、各ロボットが他のロボットの動きを踏まえて経路を調整するマルチエージェント強化学習の枠組みが、衝突回避と搬送効率の両立に応用されています。
交通・都市インフラの分野では、交差点ごとの信号機が近隣の信号機の状態を踏まえて点灯タイミングを協調的に調整する取り組みが進んでいます。個々の信号機が単独で最適化を図ると近隣との連携が崩れて渋滞を招きやすいため、周辺の信号機を含めた協調的な学習が渋滞緩和への応用として位置づけられています。
ゲーム・エンターテインメントの分野では、StarCraft IIのAlphaStarやDota 2のOpenAI Fiveが、リーグ学習や自己対戦を通じて人間のプロに匹敵する成績を収めました。複雑な連携と駆け引きが求められる対戦型ゲームでのこの到達点は、複数エージェントの協調・競争学習が実世界の複雑な意思決定にも応用しうることを示す事例です。
5. 要点まとめ
- マルチエージェント強化学習は、同一環境で複数のエージェントが相互作用しながら方策を学習する枠組みで、他のエージェントも学習し続けることによる非定常性が単一エージェントの強化学習には無い課題となります。
- 学習パラダイムには独立学習とCTDEがあり、エージェント間の関係は協調・競争・ミックス(mixed)の3分類で整理されます。
- 自己対戦とリーグ学習によって鍛えられたAlphaStar(StarCraft II)やOpenAI Five(Dota 2)が、試験対策上の代表的な事例となります。
6. 確認問題
問1マルチエージェント強化学習では、自分以外のエージェントも学習を続けるため、各エージェントから見た環境は時間とともに変化する非定常な性質を持つ。
解答・解説をみる
○ 正しい
非定常性は、単一エージェントの強化学習には無い、マルチエージェント特有の課題として扱われます。他のエージェントの方策が変化し続けることが、各エージェントから見た環境の変化として現れます。
問2AlphaStarは、メインエージェント(強くなることを目指す役割)やエクスプロイター(弱点を突く役割)などのエージェント群をリーグ形式で並行学習させ、StarCraft IIでグランドマスター相当の実力を達成した。
解答・解説をみる
○ 正しい
DeepMindが2019年に発表したAlphaStarは、メインエージェントと2種類のエクスプロイター(メインエクスプロイター・リーグエクスプロイター)から成るリーグ内で自己対戦を重ねました。特定の戦略への偏りを防ぎながら強くなった点が特徴です。
問3CTDE(中央集権型学習・分散型実行)は、実行時にも全エージェントの情報を1つのモデルに集約して意思決定する方式である。
解答・解説をみる
× 誤り
CTDEは学習時のみ全エージェントの情報を集約し、実行時は各エージェントが自分自身の観測だけをもとに個別に行動を決定します。正しくは、学習は中央集権型で行い、実行は分散型で行うという組み合わせです。

