LeNet (G検定)

LeNet

1. 定義と概要

LeNet(LeNet-5)とは、ヤン・ルカン(Yann LeCun)氏らが1998年の論文で発表した、手書き数字認識のための畳み込みニューラルネットワーク(CNN)です。

構造は、畳み込み層(画像の一部分ずつをフィルターでなぞり、線や模様といった特徴を抽出する層)とプーリング層(サブサンプリング層。画像の情報を間引いて縮小し、多少の位置ずれに強くする層)のセットを2回重ねます。その後に全結合層(それまでの層で抽出した特徴をすべてつなぎ合わせ、最終的な判定を行う層)を3層重ねる構成で、全体で7層のニューラルネットワークとなります。パラメータ(学習によって調整される、モデル内部の重みの数)は約6万です。

用途としては、手書き数字データセットMNIST(0から9までの手書き数字画像を集めた、画像認識の学習・評価によく使われるデータセット)の認識に使われ、米国の銀行における小切手の手書き数字読み取りシステムに実用化されました。

従来の画像認識は、人間があらかじめ設計した特徴量(エッジや模様など)を抽出してから分類器にかける手法が中心でした。

1979年から1980年にかけて福島邦彦氏が提案したネオコグニトロン(畳み込み・プーリングに相当する構造を先駆けて備えたモデル)が、この構造を先駆けて示しました。ただし学習には自己組織型のAdd-if-silent法(正解が得られない場合に新しい素子を追加していく自己組織型の学習方法)を用いており、効率的な学習の仕組みを持ちませんでした。

ヤン・ルカン氏らはこの構造に誤差逆伝播法(バックプロパゲーション。出力の誤差を逆向きにたどってネットワークの重みを自動調整する学習方法)を組み合わせ、勾配降下法(誤差が小さくなる方向に少しずつパラメータを更新していく最適化の手法)で重みを自動調整できるモデルとしてLeNetを確立しました。CNNが研究段階から実用段階へ進んだ流れの、ひとつの到達点にあたります。

2. 試験対策ポイント

まず押さえておきたいのは、LeNet-5の構造です。畳み込み層とプーリング層のセットを2回繰り返した後、全結合層を3層つなげる7層構成になっています。パラメータ数は約6万で、現代の大規模モデルに比べてコンパクトな点もあわせて整理しておきたいところです。

ネオコグニトロンとの違いが分かれ目になります。ネオコグニトロンは自己組織型学習(Add-if-silent法)で素子を調整するのに対し、LeNetは誤差逆伝播法による教師あり学習(正解データをもとに誤差を計算し、その誤差からパラメータを調整する学習方式)でパラメータを更新します。この学習方式の転換が、CNNを実用レベルに引き上げた要点にあたります。

LeNetが対象としたのはMNIST(0から9の手書き数字、10クラス)の認識です。AlexNetが挑んだImageNet(1000クラスに分類された大量の一般物体画像を集めた、画像認識研究の代表的なデータセット)とは、扱う対象の規模が異なります。1000クラス分類の実績と混同しないよう区別しておきたいところです。

活性化関数(ニューロンの出力にひとひねり加えて、複雑なパターンを表現できるようにする関数)には、現代主流のReLU(正規化線形関数。入力が0以下なら0、0より大きければそのまま出力する、現在主流の活性化関数)ではなく、シグモイド関数やtanh(双曲線正接関数。入力を一定の範囲の値に変換する、初期のニューラルネットワークでよく使われた活性化関数)系が使われていました。

プーリングの方式も、現代主流のMaxプーリング(区画ごとに最大値だけを取り出して情報を圧縮する、現在主流のプーリング方式)ではなく、平均的な処理(サブサンプリング)が採用されていました。この二点は、後続モデルとの世代差にあたります。

3. 関連概念との比較・相違点

ネオコグニトロンとの最大の違いは、学習方式にあります。ネオコグニトロンはS細胞層・C細胞層(ネオコグニトロンにおける、特徴を抽出する層と特徴をまとめる層で、現在の畳み込み層・プーリング層にあたります)による畳み込み・プーリング相当の構造を先駆けて備えていました。ただし学習は自己組織型のAdd-if-silent法によるものでした。

一方のLeNetは誤差逆伝播法を採用しており、この違いがCNNを研究段階から実用段階へ進める転換点となりました。構造の先駆けと、学習方式の確立を分けて捉えると、両者の関係が整理しやすくなります。

AlexNetとの違いは、層の深さやパラメータ数、対象データセット、活性化関数など複数の軸にまたがります。主な軸を並べると、次のように対応します。

比較の軸 LeNet AlexNet
パラメータ数 約6万 約6000万規模
対象データセット MNIST。0から9の手書き数字、10クラス ImageNet。1000クラスの一般物体画像
活性化関数 シグモイド関数やtanh系 ReLU

いずれの軸でも規模や手法が置き換わっており、これらの差がLeNetからAlexNetまでの世代差を示しています。

GoogLeNetやResNetなど、さらに後続のモデルとの関係では、層を深くしても学習を安定させる工夫が加わった点が要点になります。GoogLeNetは複数の大きさのフィルターを並列に使うInceptionモジュール(複数の大きさのフィルターを並列に使い、多様な特徴を同時に捉える仕組み)を導入しています。ResNetは層を飛び越えて情報を伝える残差接続(層を飛び越えて情報を伝える経路を作り、層を深くしても学習が崩れにくくする工夫)を導入しています。

工夫の中身は異なりますが、LeNetが確立した畳み込みとプーリングを繰り返す構成は、これらのモデルにも系譜として引き継がれています。

4. ビジネス・実務での活用シナリオ

金融の分野では、米国の銀行でLeNetが手書き数字の小切手読み取りシステムに組み込まれ、大量の小切手処理を自動化した実例があります。人手による目視確認に頼っていた作業を機械が代替したことで、CNNが研究段階から実業務に投入された初期の事例として位置づけられます。

郵便・物流の分野では、手書き郵便番号のような、文字の種類や書式が限定された領域でCNNの実用性が示されました。読み取り対象を絞り込むことで認識精度を確保しやすく、現代のOCR(光学文字認識。画像に写った文字をコンピューターが読み取り、テキストデータに変換する技術)技術の源流の一つに位置づけられます。

AI開発全般においては、LeNetが確立した「畳み込みとプーリングを繰り返して特徴を抽出し、全結合層で分類する」という設計パターンが、その後のAlexNetやVGGNetなど現代の画像認識モデルの基本設計に継承されています。個別の応用を超えて、CNNという枠組みそのものの土台を築いた点に意義があります。

5. 要点まとめ

  • LeNetは1998年にヤン・ルカン氏らが発表した、畳み込み層とプーリング層を交互に重ねる構成を確立した最初期の実用的なCNNです。手書き数字データセットMNISTの認識や小切手処理に実用化されました。
  • ネオコグニトロンとの最大の違いは学習方式にあり、自己組織型学習に代えて誤差逆伝播法による教師あり学習を導入した点が転換点となりました。
  • LeNet-5は7層構成・パラメータ約6万というコンパクトなモデルで、後続のAlexNetやGoogLeNet・ResNetなど層の深いモデルとの世代差を対比させて理解しておきたいところです。

6. 確認問題

問1LeNetは、畳み込み層とプーリング層を交互に重ねる構成を確立した最初期の実用的な畳み込みニューラルネットワーク(CNN)であり、1998年の論文でLeNet-5が示された。

解答・解説をみる

○ 正しい

LeNetはヤン・ルカン氏らが1998年に発表したCNNで、畳み込み層とプーリング層のセットを2回繰り返した後に全結合層を重ねる7層構成を持ちます。パラメータ数は約6万です。

問2LeNetとネオコグニトロンの最大の違いは、LeNetが誤差逆伝播法による学習を導入した点にある。

解答・解説をみる

○ 正しい

ネオコグニトロンは自己組織型学習(Add-if-silent法)で素子を調整するのに対し、LeNetは誤差逆伝播法によってパラメータを自動調整する教師あり学習を採用しています。この転換がCNNを実用段階へ進めました。

問3LeNet-5が手書き数字認識の学習・評価に用いたデータセットは、1000クラスの一般物体画像を集めたImageNetである。

解答・解説をみる

× 誤り

正しくは、0から9の手書き数字(10クラス)を集めたMNISTです。1000クラスのImageNetを扱ったのは後続のAlexNetであり、対象データセットの規模を混同しないよう区別しておきたいところです。