1. 定義と概要
AlphaGo Zeroとは、DeepMind社が2017年10月に発表したAlphaGoの後継バージョンです。学習を開始する時点で囲碁のルール以外の知識を一切持たない状態から出発し、人間の棋譜データを使った教師あり学習(正解データ、ここではプロ棋士の棋譜、を手本にして学習する方法)の段階を経ないまま、自己対戦だけで学習した囲碁AIです。
学習開始からわずか3日間の自己対戦で、AlphaGo Lee(2016年に李世乭九段を破ったバージョンのAlphaGo)に100戦100勝という成績を収めました。
初代のAlphaGoは、プロ棋士の棋譜データを模倣する教師あり学習でまず基礎的な打ち方を身につけました。そのうえで、自己対戦による強化学習(試行錯誤を繰り返し、結果が良ければ報酬を与えて学習させる手法)で腕を磨くという二段階の学習プロセスを踏んでいました。
これに対しAlphaGo Zeroは教師あり学習の段階を経ず、囲碁のルールだけを与えられたランダムな状態から自己対戦のみで学習を始めています。DeepMind社の共同創業者兼CEO(最高経営責任者)のデミス・ハサビス氏は、この手法について人間の知識の限界に制約されない学習が可能になった点を成果として挙げています。
2. 試験対策ポイント
まず整理しておきたいのは、AlphaGo ZeroとAlphaGoの学習方法の違いです。AlphaGo Zeroは人間の棋譜データを使った教師あり学習を経ず、囲碁のルールのみを与えられた状態から自己対戦による強化学習だけで学習します。人間の棋譜という手本を用いずに強くなった点が、AlphaGoとの違いにあたります。
ネットワーク構成の違いも試験対策の論点です。AlphaGoはpolicy network(次に打つべき有望な手の候補を絞り込むディープラーニングのしくみ)と、value network(盤面を見てどちらが優勢かを判断するディープラーニングのしくみ)を別々に持っていました。
これに対しAlphaGo Zeroはこの2つを1つのネットワークに統合し、入力も人間が設計した特徴量(データのどこに注目するかを人間があらかじめ数値の項目として設計したもの)を使わず、盤上の石の配置のみとしています。
探索の面でも違いがあります。AlphaGoはプレイアウト(ロールアウト。ある局面から終局まで手をランダムに指し進め、勝敗だけを確認する試行)を、モンテカルロ木探索(手を実際にシミュレーションして勝率を確かめながら有望な手を絞り込む探索方法)の中で行っていました。これに対しAlphaGo Zeroはこのプレイアウトを廃止し、統合したネットワークが出力する評価値だけで局面を評価します。
学習の到達度を示す数値も試験対策の論点です。自己対戦の開始からの日数と到達した水準を並べると、次のようになります。
| 経過日数 | 到達した水準 |
|---|---|
| 3日 | AlphaGo Leeに100戦100勝 |
| 21日 | AlphaGo Master(柯潔九段と対局したAlphaGoの強化版)の水準に到達 |
| 40日 | それまでの全バージョンを上回る強さに到達 |
3つの日数と成績は、セットでまとめて押さえておきたいところです。
3. 関連概念との比較・相違点
AlphaGoとの最大の違いは、学習に人間のデータを使うかどうかという点にあります。AlphaGoはプロ棋士の棋譜による教師あり学習を経てから自己対戦で腕を磨くのに対し、AlphaGo Zeroは人間の棋譜を一切使わず、ルールのみから自己対戦だけで学習します。構成面もあわせて並べると、次のように整理できます。
| 観点 | AlphaGo | AlphaGo Zero |
|---|---|---|
| 学習データ | プロ棋士の棋譜による教師あり学習を経てから自己対戦 | 人間の棋譜を使わずルールのみから自己対戦だけで学習 |
| ネットワーク | 手の候補を絞り込むものと盤面を評価するものを別々に持つ | 1つのネットワークに統合 |
| プレイアウト | モンテカルロ木探索の中で行う | 廃止し、評価値だけで局面を評価 |
学習データの有無だけでなく、ネットワークの持ち方や探索の進め方まで含めて設計が見直された点が、両者を分ける軸になります。
AlphaZero(AlphaGo Zeroの学習方法を囲碁以外のチェス・将棋にも広げた汎用版AI)との違いは、対応するゲームの範囲にあります。AlphaGo Zeroは囲碁専用のアルゴリズムであるのに対し、AlphaZeroはAlphaGo Zeroの学習アルゴリズムを一般化したものです。
盤面の対称性を利用したデータ拡張など囲碁固有の設定を取り除くことで、チェス・将棋にも同じ枠組みで対応できるようにしています。名称は似ていますが、AlphaGo Zeroが囲碁一本に特化したバージョンであるのに対し、AlphaZeroは複数のボードゲームに対応する後継の枠組みという関係にあります。
4. ビジネス・実務での活用シナリオ
創薬・生命科学の分野では、人間の設計した特徴量に頼らず自己対戦だけで人間を超える性能に到達したという発想が、同じDeepMind社が手がけたタンパク質の立体構造を予測するAlphaFoldの開発姿勢にも引き継がれています。人間の先入観に縛られないデータ活用という考え方が、生命科学分野に広がっています。
ロボティクス・自動制御の分野では、人手によるラベル付きデータを用意しなくても、シミュレーション環境での自己対戦・試行錯誤を通じて高度な方策を獲得できるという知見があります。この知見は、ロボットアームの動作獲得など強化学習を使う制御分野の研究に応用の視点を提供しています。
事業戦略・意思決定支援の分野では、人間の過去の判断パターン(棋譜に相当するデータ)に頼らず、ゼロから試行錯誤で最適な打ち手を導く発想が、既存の慣習にとらわれない戦略立案やシミュレーションベースの意思決定支援の考え方として紹介されます。
5. 要点まとめ
- AlphaGo Zeroは2017年10月にDeepMind社が発表した囲碁AIで、人間の棋譜データを一切使わず、囲碁のルールのみを与えられた状態からの自己対戦だけで学習した点がAlphaGoとの違いです。
- ネットワークは、次の一手を絞り込む機能(policy network)と盤面の優劣を判断する機能(value network)を1つに統合しています。入力は盤上の石の配置のみとし、モンテカルロ木探索でのプレイアウトも廃止して評価値のみで局面を判断する構成です。
- 自己対戦開始から3日でAlphaGo Leeに100戦100勝、21日でAlphaGo Masterの水準に到達、40日で全旧バージョンを上回る成績を収めています。対応ゲームを囲碁以外に広げたAlphaZeroとは区別されます。
6. 確認問題
問1AlphaGo Zeroは、AlphaGoと同様にプロ棋士の棋譜データを用いた教師あり学習を経てから、自己対戦による強化学習で棋力を高めた。
解答・解説をみる
× 誤り
正しくは、AlphaGo Zeroは人間の棋譜データを一切使わず、囲碁のルールのみを与えられた状態から自己対戦のみで学習しました。教師あり学習の段階を経る点はAlphaGoの特徴であり、Zeroとの違いにあたります。
問2AlphaGo Zeroは、自己対戦の開始からわずか3日間で、李世乭九段を破ったAlphaGo Leeに対して100戦100勝という成績を収めた。
解答・解説をみる
○ 正しい
AlphaGo Zeroは3日間の自己対戦でAlphaGo Leeに100戦100勝、21日でAlphaGo Masterの水準に到達し、40日で全旧バージョンを上回る強さに達しました。
問3AlphaZeroは、AlphaGo Zeroの学習アルゴリズムを一般化したものであり、囲碁に加えてチェスや将棋にも対応している。
解答・解説をみる
○ 正しい
AlphaZeroはAlphaGo Zeroの枠組みから囲碁固有の設定を取り除いて一般化したもので、囲碁だけでなくチェス・将棋のトップAIを上回る強さを示しました。

