1. 定義と概要
多層パーセプトロン(Multilayer Perceptron、MLP)とは、入力層と出力層の間に1つ以上の隠れ層を持つ、最低3層構造のニューラルネットワークです。隠れ層に非線形な活性化関数(層に入ってきた値の合計を、次の層に渡す値へ変換する数式)を用いることで、入力と出力の間に曲線的な境界線を引く非線形分類が可能になります。
隠れ層の活性化関数には、シグモイド関数(入力を0〜1の範囲の値に変換する関数)やReLU関数といった非線形の関数が使われます。これに対し単純パーセプトロン(入力層と出力層のみの2層構造)は、線形分離可能(1本の直線や平面で2つのグループをきれいに分けられる性質)な問題しか解けません。多層パーセプトロンと単純パーセプトロンは、層の数という一見わずかな違いによって、解ける問題の幅が大きく変わる関係にあります。
1958年、フランク・ローゼンブラットが考案した単純パーセプトロンは、この線形分離可能な問題しか解けないという制約を抱えていました。1969年にはマービン・ミンスキーとシーモア・パパートが著書『Perceptrons』で、単純パーセプトロンがXOR(排他的論理和。2つの入力が異なるときだけ1を返す論理演算)のような線形分離不可能な問題を解けないことを数学的に指摘しています。
この指摘は単層構造への批判にとどまるものでしたが、ニューラルネットワーク研究全体への失望につながり、第1次AIブーム(AI研究への期待が高まった最初の時期)の終焉につながる一因になったとされています。
この制約を克服したのが隠れ層を導入した多層パーセプトロンです。1986年にデビッド・ラメルハートらが誤差逆伝播法(バックプロパゲーション。出力の誤差を逆方向にたどって各層の重みを調整する学習方法)を発表したことにより、多層構造のネットワークを効率的に学習させる方法が確立されました。
2. 試験対策ポイント
まず整理したいのは、多層パーセプトロンが入力層・隠れ層・出力層の3層以上で構成される点です。単純パーセプトロンとの違いは隠れ層の有無にあり、隠れ層を持つことで非線形分類が可能になるという関係にあります。
あわせて、XOR問題は線形分離不可能な問題の代表例で、単純パーセプトロンでは解けません。多層パーセプトロンの登場でこの問題が解けるようになった経緯は、1969年のミンスキーとパパートによる指摘、そして第1次AIブームの終焉というAIの歴史とも結び付く形で整理できます。
多層パーセプトロンの学習には誤差逆伝播法が用いられ、出力の誤差を逆方向にたどりながら各層の重み(入力の重要度を表す数値)を更新します。重みのように学習を通じて調整される数値をパラメータと呼びます。1986年のラメルハートらによる発表は、第2次AIブーム(1980年代にAI研究への期待が高まった時期)のニューラルネットワーク研究に転機をもたらした出来事として位置づけられます。この学習方法の確立によって、隠れ層を持つ多層構造のネットワークを実用的に訓練できるようになりました。
隠れ層に非線形な活性化関数を用いることは、非線形分類を可能にする条件です。線形関数だけを層として重ねても、全体としては1つの線形変換にしかならず、非線形分類はできません。この点が非線形分類の可否を分ける分かれ目です。
また多層パーセプトロンは、情報が入力層から出力層へ一方向に伝わる順伝播型ニューラルネットワーク(フィードフォワードネットワーク。情報が入力から出力へ一方向にだけ流れるネットワークの総称)の一種に位置づけられます。層をさかのぼる経路を持たないシンプルな構造でありながら、隠れ層と非線形な活性化関数の組み合わせによって複雑な境界線を表現できる点が、多層パーセプトロンの核心です。
3. 関連概念との比較・相違点
単純パーセプトロンとの最大の違いは、隠れ層の有無と、それによって解ける問題の範囲にあります。単純パーセプトロンは入力層と出力層のみの2層構造で、線形分離可能な問題しか扱えません。一方、多層パーセプトロンは隠れ層を挟むことで、XORのような線形分離不可能な問題も解けるようになります。
両者の違いを観点ごとに並べると、次のように整理できます。
| 観点 | 単純パーセプトロン | 多層パーセプトロン |
|---|---|---|
| 層の構造 | 入力層と出力層のみの2層 | 入力層・隠れ層・出力層の3層以上 |
| 解ける問題 | 線形分離可能な問題のみ | 線形分離不可能な問題も扱える |
| XOR問題 | 正しく分類できない | 隠れ層を挟むことで解ける |
たとえばXORでは、2つの入力がともに0またはともに1のときは0を、入力が異なるときは1を返す必要があり、この境界は1本の直線では引けないため単純パーセプトロンは正しく分類できません。同じ「パーセプトロン」という名前を持ちながら、扱える問題の複雑さには大きな開きがある関係です。名前が似ているために取り違えやすい組み合わせです。
誤差逆伝播法との位置づけは、単純パーセプトロンとの対比とは性質が異なります。多層パーセプトロンはネットワークの「構造」を指す用語で、誤差逆伝播法はその構造を学習させる「アルゴリズム」を指す用語です。両者は対になって語られますが、同じ階層の概念ではありません。
多層パーセプトロンという構造があり、その構造の重みを調整する具体的な手順が誤差逆伝播法という役割分担で理解すると、両者の違いが整理できます。「多層パーセプトロンとは誤差逆伝播法のことである」のように構造とアルゴリズムを同一視するのは、混同しやすい組み合わせです。構造の説明を求められているのか、学習アルゴリズムの説明を求められているのかを見分けることが、この2つを区別するうえでの分かれ目になります。
4. ビジネス・実務での活用シナリオ
小売・需要予測の分野では、季節性や複数の要因が絡み合う非線形な売上の関係を、多層パーセプトロンによる回帰モデル(数値を予測するモデル)で捉える取り組みが行われています。単純な線形回帰では表現しきれない売上の変動パターンを、隠れ層を通じて学習できる点が活用の背景にあります。
金融・与信スコアリングの分野では、顧客の複数の属性が複雑に絡み合う与信リスクの判定に、非線形な関係を扱える多層パーセプトロンが基礎的な分類モデル(カテゴリーを判定するモデル)として使われています。単一の指標だけでは捉えきれないリスクの組み合わせを評価できることが、実務での採用につながっています。
画像認識に強いCNNや時系列データに強いRNNといった専用の構造を使うほどではない構造化データ、いわゆる表形式データの分析全般でも、多層パーセプトロンは基本的な非線形モデルとして実務で用いられています。特徴となるのは、用途に応じて出力層の設計を使い分ける点です。
| 用途 | 出力層に採用する関数 |
|---|---|
| 数値を予測する回帰 | 恒等関数(入力された値をそのまま出力する関数) |
| 複数のカテゴリーへの分類 | ソフトマックス関数(複数の出力を確率のような比率に変換する関数) |
同じ構造を土台にしながら出力層だけを差し替えられる柔軟さが、多層パーセプトロンが幅広い業務で使われている理由のひとつです。
5. 要点まとめ
- 多層パーセプトロンは入力層と出力層の間に隠れ層を持つ3層以上のニューラルネットワークで、隠れ層の非線形な活性化関数により非線形分類が可能になります。
- 単純パーセプトロン(2層構造)が解けなかったXOR問題は、隠れ層を挟む多層パーセプトロンの登場によって克服されました。
- 多層パーセプトロンの学習には誤差逆伝播法が用いられ、1986年の発表は第2次AIブームでのニューラルネットワーク研究再興につながりました。
6. 確認問題
問1多層パーセプトロンは、入力層と出力層の間に1つ以上の隠れ層を持つニューラルネットワークである。
解答・解説をみる
○ 正しい
多層パーセプトロンの定義そのものであり、単純パーセプトロンとの違いは隠れ層の有無にあります。隠れ層を持つことで、直線では分けられない非線形な分類が可能になります。
問2単純パーセプトロンは隠れ層を持たない2層構造だが、多層パーセプトロンと同様にXOR問題のような線形分離不可能な問題も解くことができる。
解答・解説をみる
× 誤り
単純パーセプトロンは線形分離可能な問題しか解けず、XOR問題は解けません。正しくは、隠れ層を持つ多層パーセプトロンの登場によってこの限界が克服されたという流れです。
問3多層パーセプトロンの学習には誤差逆伝播法(バックプロパゲーション)が用いられ、出力の誤差を逆方向にたどって各層の重みを更新する。
解答・解説をみる
○ 正しい
1986年にデビッド・ラメルハートらが発表した学習方法で、多層構造のネットワークを効率的に学習させる仕組みとして定着しました。

