OpenAI Five (G検定)

OpenAI Five

1. 定義と概要

OpenAI Fiveとは、OpenAIが開発した、5対5のマルチプレイヤーオンラインバトルアリーナ(MOBA)ゲーム「Dota 2」をプレイする人工知能システムです。5体のAIエージェントがそれぞれ1体のキャラクターを操作し、チームとして協調行動を学習する点に特徴があります。

2017年にプロ選手Dendiとの1対1のデモンストレーションから始まり、2018年には5体のフルチームとして機能するようになりました。2019年4月には、前年にあたる2018年の世界大会The Internationalで優勝したチームOGとの対戦に勝利しています。

従来、AIが人間に勝利したゲームであるチェスや将棋、囲碁は、1対1・完全情報・手番制という特徴を持っていました。一方でDota2は、5対5のチーム戦であり、相手の位置など見えない情報があるFog of War(画面上で見えていない情報がある状態)が生じます。

さらに手番のないリアルタイム進行、1試合平均45分という長時間の展開、1ティックあたり約1,000通りの行動選択肢という広い行動空間を持ちます。これらの特徴により、従来の対戦型AIより複雑な意思決定が求められます。

OpenAI Fiveはこの複雑さに、強化学習(試行錯誤を繰り返しながら報酬が多くもらえる行動を学んでいく機械学習の方法)のアルゴリズムで挑んだ事例です。採用されたPPO(近接方策最適化)とは、行動の選び方を急に大きく変えすぎないように調整しながら学習を安定させる手法です。

あわせて、分散学習とは、複数のコンピュータを同時に使って学習を効率よく進めるやり方です。また自己対戦(セルフプレイ)とは、AIが自分自身のコピーと対戦を繰り返しながら少しずつ強くなっていく学習のやり方です。OpenAI Fiveは、これらの手法を組み合わせて訓練されました。

2. 試験対策ポイント

G検定における重要な論点は、強化学習の応用事例としてOpenAI Fiveが5対5のマルチプレイヤーゲームであるDota2で5体のエージェントの協調行動を学習した点です。あわせて、方策勾配法(AIの行動方針=方策を、報酬が増える方向に少しずつ改善していく学習手法の総称)の一種であるPPOを採用した点も試験で扱われる観点です。

OpenAI Fiveは2018年6月30日から2019年4月22日までの単一の学習実行で、約10か月にわたり訓練されました。この訓練では256基のGPU(画像処理などの並列計算を得意とする演算装置)と128,000個のCPUコアが用いられています。大規模な分散学習によって、長時間かつ広い行動空間を持つゲームへの対応が可能になりました。

また、チーム全体の報酬を個々のエージェントの間で分配する仕組みとして、Team Spirit(チームの成果を仲間同士で分け合うようにする仕組み)が挙げられます。個人プレーではなく協力プレーを促すこの設計は、OpenAI Fiveに特徴的な試験対策のポイントです。

加えて、同じゲームAIの系譜にあるAlphaStar(DeepMindが開発した、StarCraft IIという別のゲームをプレイするAI)との対比も重要なテーマです。具体的には、模倣学習(人間の操作データをお手本にして最初の行動の型を覚えさせる学習方法)の有無や、対戦相手の作り方の違いが比較の分かれ目です。

3. 関連概念との比較・相違点

AlphaStarとの最大の違いは、対象とするゲームと学習の初期化方法にあります。2つのゲームAIを並べると次のように整理できます。

観点 OpenAI Five AlphaStar
対象のゲーム Dota2 StarCraft II
学習の初期化 模倣学習を行わず自己対戦のみから始める 人間のリプレイデータによる模倣学習で初期化する
対戦相手の作り方 自己対戦を中心に据える 複数のエージェントが競い合うリーグ戦形式

人間のプレイデータをどこまで使うかという点が、両者を分ける軸になります。

もう一つの比較対象であるAlphaGo(囲碁を1つのエージェントでプレイするAI)との最大の違いは、情報の完全性とエージェントの数です。AlphaGoは相手の手がすべて見える完全情報の囲碁を1つのエージェントで打つのに対し、OpenAI FiveはFog of Warのある不完全情報のDota2を、5体のエージェントがチームとして協調しながらプレイします。

この違いは、単独の意思決定で完結するか、複数の主体が連携する意思決定が必要かという点に表れています。

4. ビジネス・実務での活用シナリオ

物流・倉庫ロボティクスの分野では、複数のロボットが役割を分担しながら搬送や仕分けを行うマルチエージェント(複数のAIが同時に存在し、互いに影響を与え合いながら行動する状況)制御の研究が進んでいます。ここに、OpenAI Fiveのようなチーム協調の学習手法が応用されています。1台ずつ個別に最適化するよりも、全体の作業効率が高まる点に意義があります。

自動運転・交通の分野では、複数車両が互いの動きを踏まえて協調行動するシミュレーションに、マルチエージェント強化学習の知見が生かされています。個々の車両の性能だけでなく、交通全体の流れを最適化する狙いがあります。

ゲーム・エンターテインメントの分野では、対戦相手や協力プレイの相手として振る舞う高度なゲームAI、練習相手となるAIの開発に、大規模な自己対戦による強化学習のノウハウが活用されています。

5. 要点まとめ

  • OpenAI Fiveは、OpenAIが開発した5対5のDota2をプレイするAIで、5体のエージェントがチームとして協調行動を学習し、2019年に前年の世界チャンピオンチームOGとの対戦に勝利しました。
  • 学習アルゴリズムのPPO、256基のGPUと128,000個のCPUコアによる大規模分散学習、報酬をチーム内で分配するTeam Spiritという仕組みが試験対策の論点です。
  • 同じゲームAIのAlphaStar(模倣学習で初期化・リーグ戦形式)やAlphaGo(完全情報・単一エージェント)との違いが比較の切り口です。

6. 確認問題

問1OpenAI Fiveは、5対5のマルチプレイヤーゲームであるDota2において、5体のAIエージェントがチームとして協調行動を学習するシステムである。

解答・解説をみる

○ 正しい

OpenAI Fiveは5体のエージェントがそれぞれ1体のキャラクターを操作し、チームとして協調するように学習した点が特徴で、この記述は正しいものです。個々の最適化ではなくチーム単位の協調行動を学ぶ点が、OpenAI Fiveを理解するうえでの中心的な論点です。

問2OpenAI Fiveの学習には、方策勾配法の一種であるPPO(近接方策最適化)というアルゴリズムが用いられた。

解答・解説をみる

○ 正しい

PPOは方策の更新幅を抑えて安定的に学習を進める強化学習アルゴリズムであり、OpenAI Fiveの訓練に採用されました。256基のGPUと128,000個のCPUコアによる大規模分散学習と組み合わされた点も試験対策の論点です。

問3OpenAI FiveはAlphaStarと同様に、まず人間のプレイデータによる模倣学習で方策を初期化してから強化学習を進める手法を採った。

解答・解説をみる

× 誤り

OpenAI Fiveは人間のプレイデータによる模倣学習を行わず、自己対戦のみから学習を始めた点がAlphaStarとの相違点にあたります。正しくは、人間データによる初期化を行うのはAlphaStarの側です。