1. 定義と概要
AlphaStarとは、DeepMind社が開発したリアルタイムストラテジーゲーム『StarCraft II』を対象とする人工知能です。2019年8月、Battle.net(StarCraft IIのオンライン対戦・ランキングを扱う公式サーバー)の公式ランク戦でグランドマスター(StarCraft IIのランク帯で上位0.2%に入る最高位の称号)に到達しています。3種族(Protoss・Terran・Zerg)すべてでの到達だった点も特徴です。
なお、これに先立つ2018年12月には、プロプレイヤーMaNa(Grzegorz Komincz)に5対0で勝利したエキシビジョンマッチも行われました。
AI研究では従来、囲碁の「AlphaGo」のように盤面全体が見える完全情報・ターン制のボードゲームで人間を上回る成果が先行していました。しかし、不完全情報ゲーム(盤面の一部しか見えない状態で意思決定を行うゲーム)かつ即座の判断が求められるリアルタイムのビデオゲームでの人間超えは、長らく難しい課題でした。
DeepMind社はStarCraft IIを新たな挑戦の舞台に選び、2018年12月のエキシビジョンマッチ(この際は人間と同等でない操作条件との指摘を受け、後日より厳格な制約下で再検証されました)を経ました。そして2019年8月には人間と同じ操作制約下でグランドマスターへ到達し、不完全情報・リアルタイム環境でも高度な戦略を学習できることを示しました。
2. 試験対策ポイント
理解するうえで中心になるのは、StarCraft IIと囲碁の性質の違いです。盤面全体を常に把握できる完全情報・ターン制の囲碁と異なり、StarCraft IIはカメラ視点でしか周囲を把握できない不完全情報かつリアルタイムに進行するゲームです。この違いが「AlphaGo」から「AlphaStar」への技術的な発展点として扱われます。
両者の性質を軸ごとに並べると、次のように整理できます。
| 軸 | 囲碁(「AlphaGo」の舞台) | StarCraft II(「AlphaStar」の舞台) |
|---|---|---|
| 情報の見え方 | 完全情報(盤面全体を常に把握できる) | 不完全情報(カメラ視点でしか周囲を把握できない) |
| 進行の仕方 | ターン制 | リアルタイム |
| 行動空間 | 比較的限定的 | 10の26乗通りともいわれる広さ |
行動空間(その場面でAIが選べる行動の選択肢全体の広がり)が桁違いに広いことに加えて、数千手にわたる長期的な戦略が要求される点も、囲碁との比較で押さえておきたいポイントです。
学習はまず、人間のプレイデータを模した模倣学習(人間の操作データをお手本にして、まず基本的な動き方を真似て覚える学習方法)で基本的な立ち回りを覚えます。その後、強化学習(試行錯誤を通じて、報酬が最大になる行動を学習させる機械学習の一分野)による自己対戦(セルフプレイ。AI同士を何度も対戦させて経験を積ませる学習方法)で腕を磨くという2段階の構成をとります。
自己対戦は『リーグ』と呼ばれる仕組み(複数のタイプのAIを混在させて対戦を繰り返す訓練の仕組み)で行われます。勝つことだけを目指す主要エージェントに加えて、その弱点だけを突く専用のexploiterエージェント(主力AIの弱点だけを狙って攻略する専門の対戦相手役AI)を混在させます。これにより、特定の戦略に固執してしまう堂々巡り(じゃんけんの循環に例えられる現象)を防いでいます。
到達水準としては、2019年8月にBattle.netの公式ランク戦で、人間と同じ操作制約下、3種族(Protoss・Terran・Zerg)すべてでグランドマスターに到達した点がここでの要点です。3種族すべてでの到達は、特定の戦法に依存しない汎用的な強さを示す成果として扱われます。
3. 関連概念との比較・相違点
「AlphaGo Zero」との最大の違いは、対象とするゲームの性質と学習の出発点にあります。囲碁は完全情報・ターン制で行動空間も比較的限定的であり、「AlphaGo Zero」は人間の対局データを一切使わずゼロから自己対戦のみで学習しました。これに対し「AlphaStar」は、不完全情報・リアルタイムのStarCraft IIを対象にし、人間のプレイデータを使った模倣学習から学習を始めるという違いがあります。
「OpenAI Five」との違いは、開発元と学習アルゴリズムにあります。「OpenAI Five」も同じくリアルタイム戦略ゲーム(Dota 2)で人間のプロチームに勝利したマルチエージェント学習(複数のAIが互いに影響し合いながら同時に学習する仕組み)によるAIです。しかし開発元はOpenAIであり、学習も大規模並列環境でのPPO(Proximal Policy Optimization。方策を少しずつ安定的に改善していく強化学習アルゴリズムの一種)による自己対戦で進められました。
三者を軸ごとに並べると、位置づけの違いがはっきりします。
| 項目 | 「AlphaStar」 | 「AlphaGo Zero」 | 「OpenAI Five」 |
|---|---|---|---|
| 開発元 | DeepMind社 | DeepMind社 | OpenAI |
| 対象ゲーム | StarCraft II(不完全情報・リアルタイム) | 囲碁(完全情報・ターン制) | Dota 2(リアルタイム戦略ゲーム) |
| 学習の進め方 | 模倣学習から始め、『リーグ』形式の自己対戦へ | 人間の対局データを使わず自己対戦のみ | 大規模並列環境でのPPOによる自己対戦 |
同じマルチエージェント学習でも、「AlphaStar」は模倣学習と『リーグ』形式のexploiterエージェントを組み合わせる点で、「OpenAI Five」とは異なるアプローチをとっています。
4. ビジネス・実務での活用シナリオ
ロボティクス・搬送システムの分野では、倉庫や工場内で複数台のロボットが互いの動きを踏まえて経路や作業を協調的に調整する場面で、自己対戦型のマルチエージェント学習の考え方が協調行動の学習手法として参考にされています。個々のロボットが周囲の状況を完全には把握できない環境で判断を下す点は、「AlphaStar」が直面した不完全情報下での意思決定と共通する課題といえます。
ゲーム開発の分野では、対戦ゲームのNPC(プレイヤーが操作しないキャラクター)の強さ調整やマッチメイキングが応用の場面です。リーグ方式のように多様なタイプの相手と学習させることで、単一の必勝パターンに偏らない振る舞いを学習させる考え方が参考にされています。特定の攻略法だけに強い相手を混ぜて鍛える発想は、ゲームバランスの調整にも通じます。
資源配分・需給調整のシミュレーションの分野でも、電力網の需給調整や交通信号の制御など、複数の意思決定主体が限られた情報の中で同時に判断する状況を模した研究に、マルチエージェント強化学習の枠組みが使われています。それぞれの主体が全体を見渡せない中で最適な判断を積み重ねる構造は、StarCraft IIの対戦環境と通じるところがあります。
5. 要点まとめ
- 「AlphaStar」はDeepMind社が開発したStarCraft II用のAIです。2019年8月にBattle.netの公式ランク戦で3種族(Protoss・Terran・Zerg)すべてでグランドマスター(上位0.2%)に到達しました。
- StarCraft IIは不完全情報・リアルタイム・広大な行動空間という点で完全情報・ターン制の囲碁と大きく異なり、この違いが「AlphaGo」からの技術的な発展点になっています。
- 学習は人間のプレイデータを使った模倣学習から始め、その後『リーグ』形式のマルチエージェント自己対戦(exploiterエージェントを含む)で強化する2段階構成をとります。
6. 確認問題
問1「AlphaStar」は、DeepMind社が開発したリアルタイムストラテジーゲームStarCraft II用のAIであり、2019年8月にBattle.netの公式ランク戦でグランドマスターに到達した。
解答・解説をみる
○ 正しい
2019年8月、3種族(Protoss・Terran・Zerg)すべてで上位0.2%のグランドマスターに、人間と同じ操作制約下で到達しました。
問2「AlphaStar」の学習は、人間のプレイデータを使った模倣学習と、自己対戦による強化学習を組み合わせた2段階で行われた。
解答・解説をみる
○ 正しい
まず人間のリプレイデータを模した模倣学習で基本的な立ち回りを覚え、その後リーグ形式の自己対戦(強化学習)で腕を磨く構成になっています。
問3「AlphaStar」の自己対戦は、単一の主要エージェント同士の対戦のみで行われ、弱点を突く専用のエージェントは用いられていない。
解答・解説をみる
× 誤り
正しくは、主要エージェントに加えて弱点だけを突くexploiterエージェントを混在させる『リーグ』方式が用いられ、特定の戦略への固執を防いでいます。

