1. 定義と概要
AlexNetとは、トロント大学のSuperVisionチームが開発した、CNNをベースに画像を分類するモデルです。2012年のILSVRC(ImageNet Large Scale Visual Recognition Challenge)に提出され、優勝を果たしました。
ネットワーク構造は、5つの畳み込み層(画像の局所的な特徴、エッジや模様などを検出する層)と3つの全結合層(前の層のすべてのユニットと結びつき、最終的な分類判断を行う層)からなる計8層です。画像分類のtop-5エラー率(モデルが予測した上位5候補に正解が含まれていない割合を示す評価指標)は15.3%で、2位の手法のエラー率26.2%との差は10ポイント以上に達しました。
論文名は「ImageNet Classification with Deep Convolutional Neural Networks」です。NIPS(機械学習分野の代表的な国際学会)2012で発表され、著者にはジェフリー・ヒントンを含む3名の研究者が名を連ねています。
2012年以前のILSVRCでは、画像のどの特徴に注目するかを人間があらかじめ設計する手法が主流で、精度向上には限界がありました。AlexNetモデルは、大量のラベル付き画像データセットであるImageNet(1000クラス・120万枚以上の画像を集めた大規模な画像データセット)を学習に用いました。あわせて2枚のGPU(大量の計算を並列に処理できる演算装置)による並列計算を活用しています。
CNNが自らデータから特徴量(分類や予測の手がかりとなるデータの特徴)を抽出する方式で、従来手法を圧倒しました。この結果、以降のコンピュータビジョン(コンピューターに画像を認識させる研究分野)の研究は、CNNベースの手法へ一気に転換しました。AlexNetモデルの成功は、第3次AIブームの発端となった出来事の一つとされています(第3次AIブーム自体の全体像は別記事に譲ります)。
2. 試験対策ポイント
G検定の試験対策としては、ILSVRC 2012でAlexNetモデルが記録したtop-5エラー率15.3%という数値が重要な論点です。2位の手法のエラー率は26.2%で、AlexNetモデルとの差は10ポイント以上に達し、それまでの改善幅を大きく上回る結果でした。
精度を支えた技術的な工夫も、あわせて押さえておきたいところです。主な要素と中身を並べると、次のように整理できます。
| 要素 | 内容 |
|---|---|
| ネットワーク構造 | 5つの畳み込み層と3つの全結合層からなる計8層 |
| 活性化関数 | ReLU(ランプ関数)を採用 |
| 過学習を防ぐ工夫 | ドロップアウトとデータ拡張の組み合わせ |
| 計算資源 | NVIDIA GTX580を2枚並列で使用 |
活性化関数(入力信号を次の層に伝える際の変換を担う関数)に採用されたReLU(ランプ関数)は、入力が0以下なら0、0より大きければそのまま出力する、計算が単純な関数です。シグモイド関数やtanh関数を用いる場合と比べて、学習速度が向上しました。
過学習(学習データに適応しすぎて、未知のデータへの対応力が下がる現象)を防ぐ工夫も特徴です。使われたのは、ドロップアウト(学習時に一部のニューロンをランダムに無効化して過学習を防ぐ手法)と、データ拡張(画像の反転・切り出し・色調変更などで学習データを人工的に増やす手法)の2つになります。
開発したのはトロント大学のSuperVisionチーム(ジェフリー・ヒントンらが所属したチーム)です。AlexNetモデルは、そのチームが2012年のILSVRCに提出したモデルという関係にあります(チーム・大会・人物それぞれの詳細は別記事に譲ります)。
AlexNetモデルの成功以降、VGGNetモデルやGoogLeNetモデル、ResNetモデルなど層をより深くするCNNアーキテクチャの研究が急速に進みました。CNN研究の転換点にあたる点も試験対策の論点です。
3. 関連概念との比較・相違点
AlexNetモデルとILSVRC、SuperVisionチームの最大の違いは役割にあります。3つの名称は同じ出来事のなかで並んで登場するため、それぞれが何を指すのかを対応づけておくと混同を避けられます。
| 名称 | 何を指すか |
|---|---|
| AlexNetモデル | CNNのモデル名 |
| ILSVRC | そのモデルが2012年に優勝した画像認識コンペティションの名称 |
| SuperVisionチーム | モデルを開発・提出したトロント大学のチーム名 |
つまりモデル・大会・開発した主体という別々の層にあたる名称で、どれか一つを他の意味で覚えてしまうと出来事の関係がつかみにくくなります(大会・チームそれぞれの詳細は別記事で扱います)。
AlexNetモデルの前後でCNNを比べると、規模と設計思想の違いが際立ちます。AlexNetモデル以前の手書き文字認識向けCNN(LeNet等)は層が浅く、小規模データでの学習が前提でした。
一方、AlexNetモデル以降はGPUを活用した大規模データでの学習が前提となり、VGGNetモデルやGoogLeNetモデル、ResNetモデルのように層を深くする方向へ設計が進化しました。
4. ビジネス・実務での活用シナリオ
EC・小売業界では、商品画像から類似商品を探す画像検索やレコメンド機能に、CNNによる高精度な物体認識技術が使われています。この技術基盤はAlexNetモデル以降に確立したもので、テキスト検索では拾いきれない視覚的な類似性をもとにした提案を可能にしました。
医療画像診断の分野では、レントゲンやCT画像から病変候補を検出する診断支援システムの実用化が進んでいます。AlexNetモデルが示したCNNの分類精度の高さは、この分野の研究開発を加速させる契機の一つになりました。
セキュリティ・防犯の分野でも、監視カメラ映像から不審物や特定の人物を検知するシステムが実用化されています。こうしたシステムは、AlexNetモデル以降に確立した高精度な画像分類・物体検出技術の応用として発展してきました。
5. 要点まとめ
- AlexNetモデルは、2012年のILSVRCでSuperVisionチームが提出した、CNNをベースに画像を分類するモデルであり、top-5エラー率15.3%という従来手法を大差で上回る精度で優勝しました。
- 5つの畳み込み層と3つの全結合層からなる8層構造に、ReLU関数・ドロップアウト・データ拡張・GPU2枚並列学習などの工夫を組み合わせています。
- AlexNetモデルの成功はCNN研究の転換点となり、第3次AIブームの発端となった出来事の一つに位置づけられます。
6. 確認問題
問1AlexNetモデルは、2012年のILSVRCにおいて、2位の手法に10ポイント以上の差をつけるtop-5エラー率15.3%を記録して優勝した。
解答・解説をみる
○ 正しい
2位の手法のエラー率は26.2%で、AlexNetモデルの15.3%との差は10ポイント以上に達しました。それまでの改善幅を大きく上回る結果です。
問2AlexNetモデルの学習には1枚のGPUのみが使用され、その計算資源だけでネットワーク全体が処理された。
解答・解説をみる
× 誤り
正しくは、メモリ容量の制約からGTX580を2枚並列で使用し、ネットワークの一部を2つのGPUに分担させて学習しました。1枚のみという記述は誤りです。
問3AlexNetモデルが活性化関数にReLU関数を採用したことは、シグモイド関数やtanh関数を用いる場合と比べて学習速度を高める効果があった。
解答・解説をみる
○ 正しい
ReLU関数は入力が0以下なら0、0より大きければそのまま出力する単純な関数で、勾配消失(学習が深い層まで進むにつれて誤差の伝わりが弱まる現象)の影響を受けにくく、学習の高速化に寄与しました。

