1. 定義と概要
潜在空間(latent space)とは、画像やテキストなど高次元の入力データから、ニューラルネットワークのエンコーダ(入力データを圧縮したベクトルに変換する処理・ネットワークの前半部分)がデータの本質的な特徴を抽出した空間のことです。抽出した特徴は、より少ない次元のベクトルとして圧縮・表現されます。
この変換を担う代表例が、VAE(変分オートエンコーダ、データを圧縮して潜在空間に変換し、そこから新しいデータを生成する代表的な生成モデルの一種)です。もう一つの代表例がGAN(敵対的生成ネットワーク、生成器と識別器という2つのネットワークを競わせながら学習し、本物そっくりのデータを作れるようにする生成モデル)です。さらに、画像生成AI(テキストなどの指示をもとに新しい画像を作り出すAI)の「Stable Diffusion」が、画像を圧縮した潜在空間上で拡散処理を行う設計も、潜在空間の代表的な活用例として挙げられます。
同じ潜在空間という言葉を使っていても、モデルごとに関わり方は違います。代表的な3つを並べると次のようになります。
| モデル | 潜在空間との関わり方 |
|---|---|
| VAE | エンコーダが入力を潜在ベクトルへ圧縮し、デコーダが元のデータに近いものを復元する |
| GAN | 生成器がランダムノイズベクトルから画像を生成し、エンコーダを経由しない |
| 潜在拡散モデル | 画像そのものではなく、圧縮した潜在空間の上で拡散処理を行う |
VAEのエンコーダは、画像を数十〜数百次元の潜在ベクトルに変換して圧縮します。入口の作り方はモデルによって異なりますが、低次元のベクトルを手がかりにデータを扱う点は共通しています。
従来、データを低次元に要約する次元削減(データの本質的な情報をなるべく保ったまま、扱う数値の個数を減らす処理)には、線形の手法が主流でした。代表例が主成分分析(PCA、データのばらつきが最も大きい方向を軸として選び、直線的にデータを低次元へ要約する伝統的な統計手法)です。そこにニューラルネットワークによる非線形変換を行うオートエンコーダ(入力データを一度圧縮し、それを元の形に復元するよう学習させるニューラルネットワーク)が登場し、より複雑な特徴を保持したまま圧縮できるようになりました。
この流れの先に、深層生成モデルであるVAE・GAN・拡散モデル(データに少しずつノイズを加えて壊し、その逆の手順を学習することで新しいデータを生成する仕組み)が確立しました。潜在空間上の点から新しいデータをデコーダ(圧縮されたベクトルから元のデータに近いものを復元・生成する処理・ネットワークの後半部分)で復元・生成する仕組みが、生成モデルの標準的な構造になっています。
2. 試験対策ポイント
まず整理しておきたいのは、生成モデルの基本構造です。VAEやオートエンコーダ系の生成モデルでは、エンコーダが入力データを潜在空間上のベクトルに変換し、デコーダ(生成器)が潜在空間上の点からデータを復元・生成する構造が基本になる、という一連の流れが押さえておきたいポイントです。ただし、GANの生成器はランダムノイズを起点に画像を生成する構造をとり、この流れとは異なります。
あわせて重要なのが、潜在空間の性質です。意味的・視覚的に似たデータ同士が空間内で近い位置に配置されるという連続性があり、この性質を利用すると、潜在空間内で点を少しずつ動かす操作によって画像を滑らかに変化させられます。
VAEは、通常のオートエンコーダと異なり、潜在空間があらかじめ定めた確率分布に従うよう学習します。この確率分布はガウス分布(正規分布とも呼ばれる、平均値付近にデータが集中する釣鐘型の確率分布)で、この分布に近づける仕組みは正則化(モデルが極端な形に学習されないよう、あらかじめ制約を加えて調整すること)と呼ばれます。この点が、通常のオートエンコーダとの違いとして取り違えやすい点です。
「Stable Diffusion」などの潜在拡散モデル(Latent Diffusion Model、拡散モデルの処理を画像そのものではなく圧縮した潜在空間上で行うことで計算量を抑えた仕組み)があります。この仕組みでは、ピクセル空間ではなく圧縮した潜在空間内で拡散・逆拡散過程を行います。この設計により、計算コストとメモリ使用量を抑えられる点が試験対策として重要です。
加えて、エンコーダとデコーダの役割分担、VAEと通常のオートエンコーダの違い、拡散モデルと潜在拡散モデルの関係といった用語の束もあわせて整理しておきたいところです。
3. 関連概念との比較・相違点
潜在変数との最大の違いは、空間と点の関係にあるという点です。潜在空間は潜在変数(潜在空間上の1つの点を表す具体的な数値の並びで、個々のデータに対応する値そのもの)が取りうる値全体からなる空間そのものであり、潜在変数は潜在空間上の1点にあたる、個々のデータに対応した具体的なベクトル値です。潜在変数の詳しい仕組みは別記事に譲りますが、潜在空間の中の一点一点を指す値である、という関係にあります。
主成分分析(PCA)による次元削減との最大の違いは、線形か非線形かという点です。PCAはデータを線形にしか低次元へ写像(あるルールに従って別の空間の点に対応づけること)できないのに対し、ニューラルネットワークが作る潜在空間は非線形な変換が可能で、より複雑なデータ構造を保持できます。
両者の違いは、PCAと深層学習ベースの次元削減とで取り違えやすい点です。線形の手法と非線形の手法という軸で整理しておくと、それぞれの得意・不得意を混同せずに済みます。
4. ビジネス・実務での活用シナリオ
画像生成の分野では、「Stable Diffusion」などの潜在拡散モデルが、画像を圧縮した潜在空間上で拡散処理を行います。フルサイズの画像空間でそのまま処理する場合と比べて計算コストとメモリ使用量を抑えられるため、限られた計算資源でも高解像度な画像生成が実現しています。
製造業の異常検知では、正常な製品画像のみで学習した潜在空間上に検査対象を写像します。正常データの分布から外れた位置に写像されるデータや、再構成の誤差(エンコーダとデコーダを通して復元したデータと元のデータのずれの大きさ)が大きいデータを不良品として検知する仕組みです。不良品のサンプルを大量に集めなくても異常検知モデルを構築できる点が実務上の強みになっています。
推薦・類似検索システムでは、商品やユーザーの行動履歴を潜在空間上のベクトルとして表現します。ベクトル間の距離の近さから類似商品のレコメンドや類似画像検索を行う仕組みで、膨大な商品やユーザーを人手で分類しなくても、関連性を数値として扱える点が実務上の利点です。
5. 要点まとめ
- 潜在空間はデータの本質的な特徴を圧縮して表現した低次元ベクトル空間で、VAE・GAN・拡散モデルなどの深層生成モデルはエンコーダで潜在空間へ変換し、デコーダで復元・生成する構造をとります。
- 潜在空間は意味的に近いデータが空間的にも近くなる連続性を持ち、点を動かして滑らかにデータを変化させる操作に利用されます。
- 潜在変数は潜在空間上の個々の点を指す値であり、主成分分析(PCA)が線形な次元削減であるのに対し、潜在空間はニューラルネットワークによる非線形な次元削減を可能にします。
6. 確認問題
問1潜在空間とは、高次元のデータをニューラルネットワークが本質的な特徴を保持したまま低次元のベクトルとして圧縮・表現した空間である。
解答・解説をみる
○ 正しい
定義のとおりです。VAEではエンコーダがこの変換を担い、GANでは生成器が潜在空間のノイズベクトルから画像を生成します。
問2潜在空間内で意味的に似たデータ同士は、空間上でも近い位置に配置される傾向がある。
解答・解説をみる
○ 正しい
この連続性の性質により、潜在空間内の点を少しずつ移動させることで画像を滑らかに変化させる操作が可能になります。
問3潜在空間を作るための次元削減は、主成分分析(PCA)のようなニューラルネットワークを使わない線形の手法に限られる。
解答・解説をみる
× 誤り
誤りです。潜在空間はオートエンコーダやVAEなど、ニューラルネットワークによる非線形の次元削減でも作られます。PCAは線形の次元削減の代表例ですが、潜在空間の作り方はそれに限られません。

