t-SNE法 (G検定)

t-SNE法

1. 定義と概要

t-SNE法とは、高次元のデータにおける点同士の近さ(類似度)の関係をできるだけ保ったまま、2次元や3次元の低次元空間に圧縮する手法です。「t-distributed Stochastic Neighbor Embedding」の略です。圧縮した結果を可視化するためのアルゴリズムです。非線形(直線や平面だけでは表せない、曲がりくねった複雑な関係性)の構造を保てる次元削減(多くの項目を持つデータを、情報をなるべく保ったまま少ない項目数に置き換えること)の手法として位置づけられます。

2008年、Laurens van der Maaten氏とGeoffrey Hinton氏が、先行手法のSNE(Stochastic Neighbor Embedding)を改良する形で発表しました。代表例として、手書き数字の画像を集めた機械学習の定番データセットであるMNIST(各画像は784次元のデータ)があります。0から9までの数字ごとにまとまりが分かれて表示されるよう、2次元の散布図(データ点を座標平面上にプロットしたグラフ)に落とし込むデモがよく知られています。

高次元のデータ、つまり数百から数千の項目を持つデータは、人間がそのままの形で全体像を把握することが難しく、可視化のために低次元へ圧縮する必要があります。従来は主成分分析(PCA。データのばらつきが最も大きい方向を見つけて情報を圧縮する、直線的な次元削減の代表的な手法)のような線形の手法が使われてきました。

しかし、線形の変換では捉えきれない複雑な非線形の構造を持つデータでは、まとまりがうまく分離されず可視化が難しいという課題がありました。t-SNEは、高次元空間での点同士の近さを確率分布(ある値がどれくらい起こりやすいかを数値で表したもの)として表現し、低次元空間でも同じ近さの関係を再現するように最適化することで、非線形の構造を保ったまま可視化できる手法として登場しました。

2. 試験対策ポイント

まず押さえておきたいのは、t-SNEが2つの確率分布の差を最小化するという仕組みです。高次元空間での点同士の近さは、正規分布(データの多くが平均値の周辺に集まり、左右対称の釣り鐘型に分布する確率分布)に基づく条件付き確率(ある点を基準にしたときに、別の点が近くにある確からしさ)で表現されます。一方、低次元空間での近さは、自由度1のt分布(正規分布より裾(両端)が厚く、極端な値がやや出やすい確率分布)で表現されます。

この2つの確率分布の差はKL情報量(カルバック・ライブラー情報量。2つの確率分布がどれくらい似ていないかを数値で表す指標)と呼ばれ、これを最小化するように低次元側の点の配置を勾配降下法で決めていきます。勾配降下法とは、誤差を少しずつ減らす方向にパラメータ(モデル内部の調整値)を更新していく最適化の手法です。

どの空間で何を使うのかを対応させると、次のようになります。

対象 使う分布・指標
高次元空間での点同士の近さ 正規分布に基づく条件付き確率
低次元空間での点同士の近さ 自由度1のt分布
2つの分布の差 KL情報量。勾配降下法で最小化する

高次元側と低次元側で異なる分布を使い分けているところが、この手法の骨格にあたります。

低次元側にt分布を使う理由は、正規分布より裾が厚いという性質にあります。高次元空間で中程度の距離にある点同士も、低次元では適度に離して配置できるため、先行手法のSNEで生じていたクラウディング問題(点同士の距離関係をうまく低次元に落とし込めず、多くの点が中心付近に密集してしまう現象)が緩和されます。

あわせて、Perplexity(パープレキシティ)は、それぞれの点について考慮する近傍点の実質的な数を左右する設定値です。この値によって可視化結果の見え方が変わる点も試験対策上のテーマです。目安として、5から50程度の範囲で設定されます。

制約としては、計算コストがデータの個数の2乗に比例して増える点と、乱数による初期化に依存するため実行のたびに結果が変わりうる点の2つが挙げられます。あわせて、可視化結果に現れるまとまり同士の距離やまとまりの大きさ自体には意味がなく近傍関係のみが保存されている点、そして学習後に新しいデータ点をそのまま当てはめる変換式を持たない点も、セットで挙げられる制約です。

3. 関連概念との比較・相違点

主成分分析(PCA)との最大の違いは、線形か非線形かという点にあります。PCAはデータ全体の分散(データのばらつきの大きさを表す指標)が最大になる方向を見つける線形の変換で、学習後に得られる射影の式(高次元のデータを低次元の座標に変換するための計算式)を新しいデータ点にもそのまま当てはめられます。

一方でt-SNEは、点同士の近さの確率分布を保つ非線形の変換であり、大域的な距離の解釈や新しいデータ点への当てはめには向きません。

両者の違いを観点ごとに並べると、次のようになります。

観点 主成分分析(PCA) t-SNE
変換の種類 線形 非線形
保とうとするもの 分散が最大になる方向 点同士の近さの確率分布
新しいデータ点 射影の式をそのまま当てはめられる 当てはめには向かない

線形か非線形かという軸と、新しいデータへの適用可否という軸の両方が、ここでの要点になります。

UMAP(t-SNEと同じ非線形の可視化手法で、計算が速くまとまり同士の位置関係も保ちやすい代替手法)との対比では、同じ非線形の可視化手法同士という共通点があります。t-SNEは局所的な構造の保持を得意とする一方、計算コストがデータの個数の2乗に比例し、実行のたびに結果が変わりやすいという特徴を持ちます。

これに対してUMAPは近似計算によって高速に処理でき、まとまり同士の大域的な位置関係も比較的保ちやすいとされ、近年はt-SNEと並んで、あるいは代替として使われる場面が増えています。

4. ビジネス・実務での活用シナリオ

研究開発やモデルの検証の現場では、画像認識モデルの中間層が出力する特徴量(数百次元のデータ)をt-SNEで2次元に圧縮し、種類ごとにまとまりが分離できているかを散布図で確認する使われ方があります。学習が進んだモデルほど、異なる種類の画像が明確に離れたまとまりとして表示されるため、モデルの学習状況を検証する手がかりになります。

自然言語処理(コンピュータに人間の言葉を扱わせる技術分野)の分野では、単語や文章の埋め込み表現(分散表現。単語や文章の意味を数値の並びで表したもの)をt-SNEで可視化し、意味が近い単語や文書が近接して配置されるかを確認する用途があります。埋め込みの品質を人の目で直感的に検証できるため、モデルの改善に向けた手がかりを得られます。

創薬やバイオインフォマティクスの分野でも活用が広がっています。単一細胞RNAシーケンシング(1つ1つの細胞が持つ遺伝子の働き具合を網羅的に測定する技術)で得られる数千次元の遺伝子発現データをt-SNEで2次元に圧縮し、細胞の種類ごとのまとまりを可視化して分類する用途で広く使われています。

5. 要点まとめ

  • t-SNEは、高次元データの近さの関係を保ちながら2次元や3次元に圧縮して可視化する非線形の次元削減手法で、線形の変換である主成分分析(PCA)とは仕組みが異なります。
  • 高次元側は正規分布、低次元側は自由度1のt分布で類似度を表現し、KL情報量を最小化する最適化によって低次元側の配置を決めており、t分布の裾の厚さが先行手法SNEのクラウディング問題を緩和しています。
  • 可視化結果に現れるまとまり同士の距離やまとまりの大きさ自体には意味がなく、新しいデータ点への当てはめもできない点、Perplexity(パープレキシティ)の設定によって結果の見え方が変わる点が制約として挙げられます。

6. 確認問題

問1t-SNEは、高次元空間における点同士の近さを正規分布に基づく条件付き確率で表し、低次元空間における近さを自由度1のt分布で表し、両者の確率分布の差を最小化するように低次元側の配置を最適化する手法である。

解答・解説をみる

○ 正しい

高次元側は正規分布、低次元側は自由度1のt分布で類似度を表現し、KL情報量の最小化によって低次元側の配置を勾配降下法で決めていきます。この仕組みは試験対策上も中心的な論点です。

問2t-SNEは主成分分析(PCA)と同じくデータ全体の分散を最大化する線形の変換によって次元削減を行うため、学習後に新しいデータ点にも同じ変換式をそのまま適用できる。

解答・解説をみる

× 誤り

t-SNEは点同士の近さの確率分布を保つ非線形の手法で、PCAのような明示的な射影の式を持たないため、新しいデータ点への当てはめには向きません。線形の変換で新しいデータ点にも適用できるのはPCA側の特徴であり、手法を取り違えた記述です。

問3t-SNEの低次元側で自由度1のt分布(正規分布より裾が厚い分布)を用いることで、先行手法SNEで生じていたクラウディング問題(点が中心付近に密集する現象)を緩和している。

解答・解説をみる

○ 正しい

t分布は正規分布より裾が厚いため、高次元空間で中程度の距離にある点同士も低次元で適度に離して配置でき、SNEの課題であったクラウディング問題を緩和します。