1. 定義と概要
内部表現とは、ニューラルネットワークの中間層(隠れ層とも呼ばれます)が、入力データについて内部的に保持している表現のことです。層が深くなるにつれて捉える特徴が抽象化していく性質があります。
画像認識で例えると、入力に近い浅い層はエッジや色といった単純で低レベルな特徴を捉える内部表現を持ちます。一方、出力に近い深い層は物体の部分や全体的なまとまりといった、より抽象度の高い内部表現を持ちます。
従来の機械学習では、モデルに入力する特徴量(データの特徴を表す数値)を人間の専門家が手作業で設計する必要がありました。
多層のニューラルネットワーク(ディープラーニング)が登場したことで、各中間層は誤差逆伝播(出力の誤差を使って重みを調整し、学習を進める仕組み)を通じて、データをどう変換すれば予測タスクに役立つかを自ら学習できるようになったのです。こうして各層が持つに至った表現が内部表現であり、人が設計した特徴量ではなくモデルが学習によって獲得する点に特徴があります。
2. 試験対策ポイント
まず整理したいのは、入力層・中間層・出力層という基本構造のうち、中間層が保持する表現が内部表現である位置づけです。中間層は隠れ層とも呼ばれます。
層が深くなるほど内部表現の抽象度が上がっていく性質も、あわせて確認できます。画像認識に使われるCNN(畳み込みニューラルネットワーク。画像の特徴を段階的にとらえるのが得意なニューラルネットワークの一種)を例にすると、層の位置と捉える特徴は次のように対応します。
| 層の位置 | 内部表現が捉える特徴 | 抽象度 |
|---|---|---|
| 入力に近い浅い層 | エッジ・色・輪郭 | 低い |
| 出力に近い深い層 | 物体の部分・全体的なまとまり | 高い |
低レベルな特徴が深い層へ向かうにつれて高レベルな特徴へと積み上がる、階層的な変化です。どちらが抽象的かは取り違えやすいので、対応づけて覚えておきたいところです。
内部表現は、人間が明示的に定義する特徴量ではなく、モデルが学習によって自動的に獲得するものである点も、特徴量エンジニアリングとの対比で押さえておきたいポイントです。人が設計するかモデルが獲得するかという主体の違いは、表現学習(特徴表現学習。データから有用な表現を自動的に学ぶ考え方)の視点で内部表現をとらえ直すことにもつながります。
内部表現は多数の数値の並び(ベクトル)として保持されており、人間にとって意味を直接読み取りにくい形式です。この解釈のしづらさが、ブラックボックス問題(AIがなぜその結論を出したのか、人間には理由が分かりにくいという問題)につながる一因になっている点も見落とせません。
3. 関連概念との比較・相違点
人が設計する特徴量(特徴量エンジニアリング)との最大の違いは、特徴を明示的に定義する主体にあります。定義するのが人かモデルかという軸で並べると、両者は次のように整理できます。
| 観点 | 特徴量エンジニアリング | 内部表現 |
|---|---|---|
| 特徴を定義する主体 | 人間の専門家 | モデル自身 |
| 定義のしかた | 専門知識に基づいてあらかじめ設計する | 学習を通じて自動的に獲得する |
| 必要になるもの | 分野ごとの専門知識と設計作業 | 大量のデータと学習 |
特徴量エンジニアリングでは専門知識に基づく設計作業が欠かせないのに対し、内部表現では大量のデータと学習さえあれば、表現そのものの設計を省く形になります。
潜在表現(情報を圧縮して低次元のベクトルとして表した表現)とは、焦点の当て方が異なります。潜在表現はエンコーダ(入力データを圧縮した表現に変換する部分)の出力など、情報を圧縮した低次元のベクトル(情報のボトルネック)を指す言葉です。
これに対して内部表現は、各層が持つ表現全般を指す、より広い概念です。両者の違いは、圧縮に焦点を当てるか、各層の表現全般に焦点を当てるかという点です。
4. ビジネス・実務での活用シナリオ
画像認識・コンピュータビジョンの分野では、CNNの浅い層はエッジや色、深い層は物体の部分やまとまりを捉える内部表現の性質が活用されています。可視化ツールで各層の反応を確認したり、既存モデルの内部表現を別タスクへ再利用する転移学習(あるタスクで学習した内部表現を、別のタスクに再利用する学習方法)に応用したりする使い方があります。
学習済みの内部表現を土台にできるため、新しいモデルをゼロから学習させる手間や時間を大きく減らせることが利点です。
自然言語処理(人間が使う言葉をコンピュータに処理させる技術分野)の分野では、文章を処理するモデルの中間層が保持する内部表現(数値ベクトル)を取り出し、文同士の意味的な類似度計算や検索、文書分類の下地として活用します。
文章そのものを直接比較するのではなく、内部表現というベクトルの近さで意味の近さを測れるため、大量の文書からの検索や分類を効率よくこなせます。
金融の与信審査や医療診断のように、AIの判断根拠の説明が求められる領域では、内部表現が人に解釈しづらい形式であることがブラックボックス問題の一因です。判断根拠を可視化・説明するXAI(説明可能なAI。AIの判断過程を人間が理解・検証できるようにする技術)への取り組みが進められており、内部表現をどう扱うかは、AI導入の説明責任を果たすうえでの土台になっています。
5. 要点まとめ
- 内部表現とは、ニューラルネットワークの中間層(隠れ層)が入力データについて内部的に保持している表現のことで、層が深くなるにつれて抽象化が進みます。浅い層は低レベルな特徴、深い層は高レベルな特徴を捉えます。
- 内部表現は人が明示的に設計する特徴量とは異なり、モデルが学習によって自動的に獲得する点が、特徴量エンジニアリングとの対比で整理されます。
- 内部表現は数値ベクトルとして保持され人に解釈しづらいため、AIの判断根拠が分かりにくいブラックボックス問題につながる一因になります。
6. 確認問題
問1内部表現とは、ニューラルネットワークの中間層が入力データについて内部的に保持している表現のことである。
解答・解説をみる
○ 正しい
内部表現の定義そのものであり、中間層(隠れ層)が入力データをどのように変換・保持しているかを指します。層が深くなるほど抽象度が上がっていく性質とあわせて整理しておきたい基本事項です。
問2ニューラルネットワークの内部表現は、入力に近い浅い層ほど抽象度の高い特徴を捉え、出力に近い深い層になるほど単純な特徴しか捉えられなくなる。
解答・解説をみる
× 誤り
実際には逆です。浅い層はエッジや色といった単純で低レベルな特徴を捉え、深い層になるほど物体の部分やまとまりといった抽象度の高い特徴を捉えます。層の浅さ・深さと抽象度の方向を入れ替えた記述であり、取り違えやすい典型です。
問3内部表現は、人間が明示的に定義した特徴量とは異なり、モデルが学習によって自動的に獲得するものである。
解答・解説をみる
○ 正しい
従来の機械学習で人間の専門家が手作業で設計していた特徴量エンジニアリングとは対照的に、内部表現はモデル自身が誤差逆伝播などの学習過程を通じて自動的に獲得する表現です。

