AlphaZero (G検定)

AlphaZero

1. 定義と概要

AlphaZeroとは、DeepMind社が2017年12月に発表した汎用ゲームAIです。チェス・将棋・囲碁という3種類のボードゲームを、ルール以外の人間の知識を一切与えず、単一のアルゴリズムによる自己対戦だけで習得した点が特徴です。この自己対戦はセルフプレイとも呼ばれ、AI同士を対局させて対局データを増やしながら学習する方法を指します。

学習後には、チェスプログラムのStockfish(ストックフィッシュ)や将棋プログラムのElmo(エルモ)、そして前身の囲碁AIであるAlphaGo Zeroのいずれも上回る成績を収めました。Stockfish(ストックフィッシュ)は、当時世界最強クラスとされたチェス専用プログラムです。Elmo(エルモ)は、当時世界最強クラスとされた将棋プログラムです。

AlphaGo Zeroは2017年10月、人間の棋譜を使わず自己対戦のみで囲碁を学習し、AlphaGo(2016年に世界トップ棋士に勝利した、人間の棋譜も使って学習した囲碁AI)を上回る強さを示しました。ただし盤面の対称性(盤面を回転・反転しても同じ形とみなせる囲碁特有の性質)を利用するなど、囲碁というゲームに合わせた工夫を含む専用システムでした。

DeepMind社は同年12月、この学習アルゴリズムから囲碁固有の工夫を取り除いて整理し直し、チェス・将棋にも適用できる汎用形としてAlphaZeroを発表しました。1つのゲームのために作り込む従来の発想から、ルールを入力するだけで様々な二人対戦ゲームに適用できる仕組みへと発展させた点が、AlphaGo Zeroからの前進にあたります。

2. 試験対策ポイント

AlphaZeroの学習方法として、人間の棋譜や事前知識を一切使わず、ゲームのルールだけを与えられた状態から自己対戦のみで強くなる点が重要な論点です。学習にかかった時間はチェス・将棋で数時間、囲碁でも2週間程度とされ、いずれも比較的短期間で当時世界最強クラスのプログラムを上回る結果を残しました。

AlphaGo Zeroとの違いとして、AlphaGo Zeroが盤面の対称性を利用するなど囲碁固有の工夫を含んでいたのに対し、AlphaZeroはそうした個別ゲームに特化した工夫を取り除いた点が比較の軸になります。整理し直すことで、チェス・将棋・囲碁のいずれにも使える汎用的なアルゴリズムになりました。

加えて、チェス・将棋のように引き分けが起こり得るゲームにも対応できるよう学習の枠組みを一般化しています。当時世界最強クラスのStockfish、Elmo、AlphaGo Zeroを、自己対戦だけで鍛えた単一のアルゴリズムでいずれも上回った成績は、試験でセットで扱われる知識です。

技術要素としては、次の一手の候補を絞り込み盤面を評価するディープラーニングと、それを使って有望な手を先読みするモンテカルロ木探索(手を実際にシミュレーションして勝率を確かめながら有望な手を絞り込む探索方法)を組み合わせる仕組みがあります。この探索と評価を組み合わせる仕組み自体はAlphaGo Zeroから引き継いだものです。

こうした学習の枠組みは、深層強化学習(試行錯誤で得た結果をもとに、ディープラーニングでより良い行動の選び方を学習していく手法)の代表例として扱われます。探索・評価そのものの詳しい仕組みは、モンテカルロ法・モンテカルロ木探索の解説と合わせて理解を深められます。

3. 関連概念との比較・相違点

AlphaGo Zeroとの最大の違いは、対応するゲームの範囲にあります。AlphaGo Zeroは囲碁専用に設計されたシステムであるのに対し、AlphaZeroはチェス・将棋・囲碁の3種目に対応する汎用アルゴリズムです。

AlphaGoとの違いは、学習データの有無という根本的な部分にあります。AlphaGoは人間の棋譜による事前学習を経てから自己対戦による強化学習に進むのに対し、AlphaZeroは人間の棋譜を一切使わず、ゲームのルールだけを与えられた状態からゼロで自己対戦のみで学習します。

3つのAIを軸ごとに並べると、世代ごとの前進がはっきりします。

項目 AlphaGo AlphaGo Zero AlphaZero
学習データ 人間の棋譜+自己対戦 人間の棋譜を使わず自己対戦のみ 人間の棋譜を使わず自己対戦のみ
対応ゲーム 囲碁 囲碁 チェス・将棋・囲碁
ゲーム固有の工夫 囲碁専用に設計 盤面の対称性の利用など囲碁固有の工夫を含む 囲碁固有の工夫を取り除いた汎用設計

こうして並べると、AlphaGo Zeroが取り払ったのは人間の棋譜であり、AlphaZeroが取り払ったのはゲーム固有の作り込みだった、という違いが見えてきます。

ディープ・ブルー(1997年に世界チャンピオンを破った、人手設計のルールと計算力で動く従来型のチェスAI)との違いは、探索方式にあります。ディープ・ブルーは人手で設計した評価関数と、ミニマックス法・アルファベータ法(自分と相手が交互に最善手を選ぶと仮定して先の局面まで読み切り、有望でない手を計算途中で切り捨てて効率化する探索方法)による網羅的な探索が中心でした。

一方でAlphaZeroは、ディープラーニングで有望な手を絞り込み、モンテカルロ木探索で先読みするという、データから学習した評価に基づく探索を行います。この点で両者は設計思想が根本的に異なります。

4. ビジネス・実務での活用シナリオ

人間の知識に頼らずルールと報酬設計だけから最適な手順を学習する発想は、研究開発の分野にも応用されています。同じDeepMind社が開発したタンパク質構造予測AIのAlphaFoldなど、探索対象が膨大で人手による設計が難しい創薬・材料開発の領域で、この考え方が生かされています。

生産計画や配送ルートのように正解データが乏しい組み合わせ最適化の問題では、あらかじめ正解を教え込むのではなく、シミュレーションと自己対戦のような試行錯誤を通じて最適な戦略を獲得する仕組みが応用の対象になります。製造業・物流の現場では、この発想が問題設計の考え方として紹介されます。

ゲーム・エンタメ業界では、AlphaZero以降、特定のゲーム専用ではなく複数のゲームに応用できる汎用的な学習アルゴリズムを目指す開発方針が広がりました。将棋・チェスソフトの評価関数の設計にも、自己対戦による強化学習の考え方が取り入れられています。

5. 要点まとめ

  • AlphaZeroはDeepMind社が2017年12月に発表した汎用ゲームAIで、人間の棋譜を使わず自己対戦のみでチェス・将棋・囲碁の3種目を同一のアルゴリズムで習得しました。
  • AlphaGo Zeroとの違いは対応ゲームの範囲(囲碁専用から3ゲーム対応へ)と、盤面対称性の利用など囲碁固有の工夫を取り除いた汎用設計にあります。
  • 学習後は当時最強クラスのStockfish(チェス)・Elmo(将棋)・AlphaGo Zero(囲碁)をいずれも上回り、ディープラーニングとモンテカルロ木探索を組み合わせる仕組みはAlphaGo Zeroから引き継いでいます。

6. 確認問題

問1AlphaZeroは、チェス・将棋・囲碁のいずれについても人間の棋譜データを使わず、ゲームのルールのみを与えられた状態から自己対戦だけで学習した。

解答・解説をみる

○ 正しい

AlphaZeroの核心は、人間の知識を使わない自己対戦のみの学習にあります。この方針はAlphaGo Zeroから引き継がれています。

問2AlphaZeroは、囲碁専用に開発されたAlphaGo Zeroの盤面対称性を利用する仕組みなど、ゲーム固有の工夫をそのまま維持した状態でチェス・将棋にも展開した。

解答・解説をみる

× 誤り

正しくは、AlphaZeroは盤面対称性の利用のような囲碁固有の工夫を取り除き、チェス・将棋・囲碁のいずれにも使える汎用的なアルゴリズムに整理し直したものです。ゲーム固有の工夫をそのまま流用したという記述は取り違えやすい点です。

問3AlphaZeroは学習後の対戦で、当時最強クラスのチェスプログラムStockfish、将棋プログラムElmo、そして前身の囲碁AIであるAlphaGo Zeroのいずれも上回る成績を収めた。

解答・解説をみる

○ 正しい

3種目ともに当時トップクラスとされたプログラムを上回り、単一のアルゴリズムの汎用性を裏付ける結果となりました。