1. 定義と概要
ディープラーニング(深層学習)とは、人間の脳の神経回路を模したニューラルネットワーク(脳の神経細胞のつながりを数式的に模した計算の仕組み)を多層に重ねた機械学習の一種です。データから特徴量(データの特徴を数値で表したもの)を自動的に抽出しながら学習します。
「ディープラーニング」は英語表記のカタカナ読みで、「深層学習」はその日本語訳にあたり、両者は同じ対象を指します。以下、この記事ではどちらの表記も同じ意味で用います。
代表例としては、画像認識に使われるCNN(畳み込みニューラルネットワーク。画像の特徴を捉えるのに適したネットワーク構造)と、時系列データや自然言語の処理に使われるRNN(再帰型ニューラルネットワーク。時系列データや文章のような順序のあるデータを扱うのに適したネットワーク構造)が挙げられます。
従来の機械学習では、データのどの特徴に着目するかを人間があらかじめ設計する特徴量エンジニアリングが前提でした。ディープラーニングでは、多層のニューラルネットワークが特徴量そのものを自動的に抽出する点が最大の転換点になっています。人が着目点を決めなくても、層を通るたびにデータから手がかりが取り出されていく仕組みです。
ニューラルネットワークの研究自体は数十年前から続いていましたが、2012年の画像認識コンテストILSVRC(ImageNet Large Scale Visual Recognition Challenge。画像認識の精度を競う国際的なコンテスト)が転機になりました。トロント大学ヒントン教授のチームが開発した「AlexNet」というモデルが、従来手法を大きく上回る精度で優勝したためです。
この結果を後押ししたのが、GPU(大量の計算を並列に処理できる演算装置)による計算能力の向上と、ビッグデータの蓄積という2つの環境変化でした。多層のネットワークを現実的な時間で学習させる条件が整い、この結果が「第3次AIブーム(ディープラーニングの実用化を背景に人工知能への関心が急速に高まった時期)」の火付け役になりました。
2. 試験対策ポイント
機械学習とディープラーニングの違いは、特徴量抽出を人間が設計するか、ネットワークが自動で抽出するかという点です。ディープラーニングはこの自動抽出の性質によって、画像・音声・自然言語といった扱いの難しいデータからも高い精度でパターンを見出せるようになりました。
ニューラルネットワークの基本構造は、データを受け取る入力層、データの特徴を段階的に処理する隠れ層(中間層。入力層と出力層の間にある層)、結果を出力する出力層の3種類で構成されます。
学習では、出力側で生じた誤差を逆方向にたどってネットワークの重みを少しずつ修正する誤差逆伝播法(バックプロパゲーション)と呼ばれる手法が使われます。層を重ねるほど計算量は増えますが、この手法によって多層のネットワークでも精度を高めていくことができます。
代表的なネットワーク構造は、扱うデータの種類と次のように対応しています。
| 構造 | 正式名称 | 適したデータ |
|---|---|---|
| CNN | 畳み込みニューラルネットワーク | 画像などの空間的なパターンを持つデータ |
| RNN | 再帰型ニューラルネットワーク | 時系列データや文章のように順序のあるデータ |
用途に応じた使い分けは、G検定で取り違えやすい論点のひとつです。あわせて、過学習(オーバーフィッティング)とは、訓練データに適合しすぎて未知のデータへの対応力が下がってしまう現象のことです。その対策として、学習の際に一部のニューロンをランダムに無効化するドロップアウト(過学習を防ぐ手法)や、モデルの複雑さに制約を加える正則化にも触れておきます。
ディープラーニングの制約としては、大量の学習データと高い計算資源、とくにGPUが必要になる点が挙げられます。加えて、判断の根拠を人間が説明しづらいブラックボックス性も、実務での活用を考えるうえで無視できない制約です。学習に時間とコストがかかる点、判断根拠の説明が難しい点は、メリットと対で押さえておきたいところです。
3. 関連概念との比較・相違点
機械学習との最大の違いは、特徴量設計を人間が行うか、ネットワークが自動で抽出するかという点にあります。両者の関係は、次のように整理できます。
| 観点 | 従来の機械学習 | ディープラーニング |
|---|---|---|
| 特徴量の設計 | 人間があらかじめ設計する | 多層のニューラルネットワークが自動的に抽出する |
| 位置づけ | データからパターンを学ぶ手法群の全体 | そのなかで多層のネットワークを用いる一手法 |
ディープラーニングは機械学習という大きな分野に含まれる一手法であり、両者は対立関係ではなく包含関係にあります。この包含関係を取り違えると、機械学習とディープラーニングを別々の技術として並べてしまう誤解につながります。
ネットワーク構造どうしの比較では、まず押さえておきたいのはCNNとRNNの違いです。最大の違いは扱うデータ構造にあり、CNNは画像などの空間的なパターン抽出に適している一方、RNNは時系列データや文章のように順序のあるデータの扱いに適しています。
画像を扱う問題ではCNN、時系列や自然言語を扱う問題ではRNNという対応関係を、用途の側から結びつけて整理すると覚えやすくなります。この2つのネットワーク構造は、名称と適用対象を入れ替えた記述が混同されやすく、どちらがどちらのデータに適しているかを正確に区別する必要があります。
4. ビジネス・実務での活用シナリオ
製造業では、工場の製造ラインで撮影した画像をCNNで解析し、製品の傷や欠陥を検出する外観検査に活用されています。目視検査は検査員の熟練度や集中力によって精度が左右されますが、ディープラーニングによる画像解析はより高速かつ均質な判定を実現し、品質のばらつきを抑える効果があります。
医療の分野では、MRIやCT画像をディープラーニングで解析し、病変の候補領域を検出する画像診断支援に活用されています。膨大な画像を一枚ずつ読影する医師の負担は大きく、見落としのリスクもゼロではありません。ディープラーニングによる候補領域の提示は医師の読影を補助する役割を担い、見落としリスクの低減に寄与します。
自動運転・モビリティの分野では、車載カメラの映像をCNNで解析して歩行者・標識・車線を認識する仕組みが使われています。周辺状況は刻一刻と変化するため、認識結果を継続的に更新しながら運転判断へ反映する処理が求められます。人の目に匹敵する認識精度をリアルタイムで維持できるかどうかが、この分野でディープラーニングが担う役割の核心にあたります。
5. 要点まとめ
- ディープラーニング(深層学習)は多層のニューラルネットワークでデータから特徴量を自動抽出する機械学習の一種で、特徴量を人間が設計する従来の機械学習と対比されます。
- 学習は誤差逆伝播法で重みを更新し、画像認識向けのCNN・時系列や文章向けのRNNなど、用途別のネットワーク構造が使い分けられます。
- 2012年のILSVRCでの「AlexNet」の高精度な結果を契機に第3次AIブームが起こり、GPU性能の向上とビッグデータの蓄積がディープラーニングの実用化を後押ししました。
6. 確認問題
問1ディープラーニングと従来の機械学習との違いは、データから特徴量を自動的に抽出できるかどうかにある。
解答・解説をみる
○ 正しい
従来の機械学習は人間があらかじめ特徴量を設計するのに対し、ディープラーニングは多層のニューラルネットワークが特徴量を自動的に抽出する点が違いにあたります。この対比が、機械学習とディープラーニングを区別する軸になります。
問2ディープラーニングのネットワーク構造のうち、CNNは時系列データの処理に、RNNは画像認識に適している。
解答・解説をみる
× 誤り
正しくはCNN(畳み込みニューラルネットワーク)が画像認識に、RNN(再帰型ニューラルネットワーク)が時系列・文章などのデータの処理に適したネットワーク構造です。用途を逆にした組み合わせは、混同しやすい記述です。
問3ディープラーニングが実用面で急速に普及した契機の一つに、2012年の画像認識コンテストで従来手法を大きく上回る精度を示した事例がある。
解答・解説をみる
○ 正しい
2012年のILSVRCでトロント大学ヒントン教授チームの「AlexNet」というモデルが優勝し、この結果が第3次AIブームの火付け役になりました。

