1. 定義と概要
大域最適解とは、ある関数の定義域全体を通してその関数の値が最小(または最大)となる、真の最適解です。機械学習や深層学習の文脈では、誤差関数(損失関数とも呼ばれ、予測値と正解値のズレの大きさを数値で表す関数)の値を最も小さくする、パラメータ(重みとも呼ばれ、モデルの中で学習によって調整される数値)の組み合わせを指します。
モデルの学習は、勾配降下法(誤差関数の傾きを使ってパラメータを少しずつ更新していく手法)によってパラメータを繰り返し更新し、この大域最適解に少しでも近づこうとする過程だと言えます。ただし大域最適解はあくまで理論上の到達目標です。深層学習のように複雑な誤差曲面(パラメータの値と誤差の関係を立体的な地形として表したイメージ)を持つ問題では、学習によって必ずそこに到達できるとは限りません。
線形回帰の二乗誤差のように比較的単純なモデルでは、誤差関数が凸関数(グラフに描くと谷が一つしかない、お椀のような形をした関数)になることが多く、勾配降下法によって確実に大域最適解へ到達できることが理論的に保証されてきました。しかし層とパラメータ数が飛躍的に増えたニューラルネットワークや深層学習では、誤差関数がつくる誤差曲面が複雑な起伏を持つ非凸関数(谷や山が複数存在する、複雑な形状をした関数)になります。
非凸な誤差曲面では、学習が局所最適解(その周辺だけを見れば誤差が最も小さい谷)や鞍点(ある方向から見ると谷、別の方向から見ると山になっている点)に足を取られ、大域最適解に届かないまま停滞するリスクが高まります。関数が凸かどうかという数学的な性質こそが、大域最適解への到達を理論的に保証できるかどうかの分かれ目です。
2. 試験対策ポイント
凸関数を最適化する場合に局所最適解と大域最適解が一致し、勾配降下法が理論上必ず大域最適解に到達できるという関係が重要な論点です。これに対し深層学習の誤差関数は非凸関数であり、局所最適解と大域最適解は一致しません。学習の初期値やアルゴリズムによっては、大域最適解ではなく局所最適解で学習が止まってしまう可能性があるという関係にあります。
誤差曲面上には大域最適解のほかに、鞍点や、停留点(勾配=傾きがゼロになる点の総称)、プラトー(誤差関数が広い範囲で平坦になり学習が停滞する状態)も存在します。いずれも学習が大域最適解へ到達する前に足踏みする要因として位置づけられ、混同しやすい用語群です。ただし各用語の細かな定義や見分け方は、大域最適解の理解そのものとは別の論点として扱われます。
実務では大域最適解への到達を厳密に保証できないため、十分に誤差が小さい解が得られた時点で学習を打ち切る割り切りが標準的な考え方です。
モーメンタム法(過去の勾配の移動方向を蓄積し、慣性のように反映させてパラメータを更新する最適化手法)や、Adam(モーメンタムの発想などを組み合わせた代表的な最適化アルゴリズムの一つ)が代表例です。これらの最適化アルゴリズムの工夫は、大域最適解に少しでも近づくための道具として位置づけられます。各アルゴリズムの内部的な計算のしくみは、別の論点として扱われます。
3. 関連概念との比較・相違点
大域最適解と局所最適解の最大の違いは、解が有効な範囲にあります。局所最適解はその周辺だけを見れば誤差が最小に見える解であるのに対し、大域最適解は定義域全体で誤差が最小となる、真の解です。両者が一致するかどうかは、次に述べる関数の性質によって決まります。
その関数の性質による違いを並べると、次のように整理できます。
| 関数の性質 | 誤差曲面の形 | 局所最適解と大域最適解 | 勾配降下法での到達 |
|---|---|---|---|
| 凸関数 | 谷が一つしかない、お椀のような形 | 常に一致する | 理論的に保証される |
| 非凸関数 | 谷や山が複数存在する複雑な形 | 別々の場所に存在しうる | 保証されず、局所最適解や鞍点で停滞することがある |
大域最適解を理解するうえで最も大きな決め手になるのは、関数が凸関数か非凸関数かという性質そのものです。凸関数では谷が一つしかないため局所最適解と大域最適解が常に一致し、勾配降下法による到達が理論的に保証されます。非凸関数では谷や山が複数存在し、局所最適解と大域最適解が別々の場所に存在しうるため、到達は保証されません。
個々の谷がどのような形をしているかよりも、誤差関数全体がどのような地形を描く関数かという性質の違いこそが、大域最適解への到達可能性を左右します。
4. ビジネス・実務での活用シナリオ
画像認識や自然言語処理(人間の言葉をコンピュータに扱わせる技術分野)のモデル開発では、大規模なニューラルネットワークの学習において誤差関数が非凸であるため、大域最適解に到達できたかどうかを検証する手段がありません。そこで検証データ(モデルの性能を確認するために学習には使わず取っておくデータ)での精度が一定の水準を超え、それ以上改善しなくなった時点で学習を打ち切り、その時点の解を実用上十分なものとして採用します。理論上の理想である大域最適解を追い求めるのではなく、実測できる指標の伸びで判断を下す姿勢が、この分野の学習運用を支えています。
自動運転やロボティクスの経路計画でも、誤差関数にあたる評価の基準が非凸であるため、複数の局所最適解が生まれます。開発の現場では、パラメータの初期値を変えた複数回の試行や、発見的な探索手法(経験則に基づいて良さそうな解を効率よく探す手法)によって比較的良好な解を選び出し、理論上の大域最適解の探索を近似的に済ませます。走行中の判断には時間の制約が大きいため、探索に時間をかけすぎず現実的な解へ落ち着かせる工夫が重視されます。
MLOps(機械学習モデルの開発から運用までを継続的に回すための取り組み)の現場でハイパーパラメータ(学習を始める前に人が設定する値)を探索する場面でも、事情は同じです。学習率やネットワーク構造といった設定を調整するときも、対象となる関数は誤差関数と同様に非凸です。
そのため、グリッドサーチ(候補の組み合わせを網羅的に試す探索方法)やベイズ最適化(過去の試行結果を踏まえて次に試す候補を効率よく選ぶ探索方法)によって有望な領域を絞り込みます。ここでも目指すのは理論上の大域最適解ではなく実務上十分な性能を発揮する組み合わせであり、大域最適解という到達点は探索の方向性を示す基準として機能します。
5. 要点まとめ
- 大域最適解とは、関数全体で誤差(損失)が最小となる、真の最適解であり、機械学習の学習が目指す理論上の到達点です。
- 凸関数では局所最適解と大域最適解が一致して到達が保証されるのに対し、深層学習の誤差関数は非凸であり、局所最適解や鞍点に阻まれて大域最適解に届かない場合があります。
- 実務では大域最適解への到達を厳密に保証できないため、十分に誤差が小さい解が得られた時点で学習を打ち切る割り切りが標準的な考え方です。
6. 確認問題
問1大域最適解とは、関数の定義域全体を通して誤差(損失)が最小となる、真の最適解を指す。
解答・解説をみる
○ 正しい
定義どおりの内容です。局所的な範囲だけで最小に見える局所最適解とは異なり、あらゆるパラメータの組み合わせの中で最も誤差が小さい解を指します。
問2谷が一つしかない凸関数を最適化する場合、局所最適解と大域最適解は一致するため、勾配降下法は理論上必ず大域最適解に到達できる。
解答・解説をみる
○ 正しい
凸関数では谷が一つしかないため、局所的に最小な点がそのまま全体でも最小な点になります。この性質により、単純な誤差関数を持つモデルでは大域最適解への到達が理論的に保証されます。
問3深層学習の誤差関数は凸関数であるため、勾配降下法を使えば局所最適解に阻まれることなく必ず大域最適解に到達できる。
解答・解説をみる
× 誤り
正しくは、深層学習の誤差関数は谷や山が複数存在する非凸関数です。局所最適解や鞍点に足を取られ、大域最適解に到達できないまま学習が停滞する場合があります。凸関数と取り違える記述は誤りです。

