1. 定義と概要
ドロップアウトとは、ニューラルネットワークの学習時に、あらかじめ定めた割合であるドロップアウト率に従ってランダムに一部のニューロンを一時的に無効化しながら学習を進める正則化手法です。2012年にジェフリー・ヒントンらが提案し、2014年に発表された論文で確立された手法として知られています。
具体例として、全結合層(各ノードが前後の層のすべてのノードとつながっている層)にドロップアウト率0.5を設定した場合を考えます。この場合、各イテレーション(学習の繰り返し単位)ごとに、およそ半数のニューロンが無効化された状態で順伝播(入力から出力へ計算を進める処理)・逆伝播(出力の誤差を逆向きに伝えて重みを更新する処理)の計算が行われます。
ディープラーニングはパラメータ(モデルの内部で調整される数値)の数が膨大になりやすく、訓練データに過剰に適合してしまう過学習(訓練データに適合しすぎて未知のデータへの対応力が下がること)が起きやすいという性質を抱えています。対策としては、重みの大きさにペナルティを課すL1正則化・L2正則化などの手法が従来から用いられてきました。
これに対しドロップアウトは、ネットワークの構造そのものを学習のたびにランダムに変化させ、特定のニューロンへの依存(共適応)を防ぐ手法として提案されました。以降、ディープラーニングのモデルで広く採用されるようになった手法です。
ネットワークの一部が常に同じ組み合わせで結果を出す状態が続くと、その組み合わせに特化した学習になり、未知データへの対応力が下がります。ドロップアウトはこの組み合わせを毎回崩すことで、個々のニューロンが単独でも役立つ特徴を学習するよう促す仕組みです。
2. 試験対策ポイント
まず押さえておきたいのは、学習時にどのニューロンを無効化するかという選び方です。ドロップアウトでは、各ニューロンを確率p(ドロップアウト率)でランダムに無効化しますが、この無効化の対象はミニバッチ(学習データをいくつかの小さなまとまりに分けたときの1つのまとまり)やイテレーションごとに選び直されます。
固定された一部のニューロンを常に無効化し続けるわけではなく、学習のたびに異なる組み合わせのニューロンが働く点が仕組みの中心です。この選び直しによって、学習が進むたびに少しずつ異なる形のネットワークが生まれることになります。
この毎回異なる部分ネットワークで学習が進むという性質から、ドロップアウトは多数の異なるネットワークを組み合わせて学習しているとみなすことができ、アンサンブル学習(複数のモデルの予測を組み合わせて精度を高める手法)の近似効果を持つとされます。言い換えると、無数の異なる部分ネットワークによる予測を平均化しているのに近い状態になり、特定の経路に依存しない予測につながるとされます。
一方、推論(学習済みモデルを使って答えを出す処理)時にはニューロンの扱いが変わります。学習時と推論時の違いを並べると、次のとおりです。
| 局面 | ニューロンの扱い | 出力のスケール |
|---|---|---|
| 学習時 | ドロップアウト率に従って一部をランダムに無効化する | 生き残ったニューロンの出力を、無効化しなかった割合の逆数倍に補正する |
| 推論時 | すべてのニューロンを有効にする | 追加の補正は行わない |
この学習時のスケール補正を行うインバーテッド・ドロップアウトという実装方式が一般的です。学習時と推論時で出力のスケールがずれないよう先に補正しておくため、推論時に追加の補正を行わずに済みます。このスケーリングを行わないまま推論すると、学習時よりも出力の合計が大きくなり、モデルの挙動が学習時とずれてしまいます。
早期終了(検証データへの誤差が悪化し始めた時点で学習を打ち切る手法)、重みにペナルティを課す正則化、学習データを人工的に増やすデータ拡張など、他の過学習対策と並べて理解しておきたいところです。これらの手法はそれぞれ異なる角度から過学習を防ぐため、複数を組み合わせて使うモデルも珍しくありません。
また、ニューロンではなく接続そのものをランダムに無効化するドロップコネクトという類似手法も存在し、ドロップアウトとの違いは取り違えやすい点です。
3. 関連概念との比較・相違点
ドロップアウトは、他の学習テクニックと並べて登場します。何を操作する手法で、狙いがどこにあるのかで切り分けると、混同を避けやすくなります。
| 手法 | 何を操作するか | 主目的 |
|---|---|---|
| ドロップアウト | 学習時にニューロンをランダムに無効化し、ネットワーク構造を毎回変える | 過学習の抑制(正則化効果) |
| 早期終了 | 検証データへの誤差の悪化を検知して学習を打ち切る | 過学習の抑制 |
| バッチ正規化 | 各層への入力データの分布を整える | 学習の安定・高速化(正則化効果は副次的) |
早期終了との最大の違いは、「ネットワーク構造」を毎回変える手法か「学習の止め時」を制御する手法かという点にあります。ドロップアウトはニューロンを無効化しながら学習を継続する手法であるのに対し、早期終了は検証データへの誤差の悪化を検知して学習そのものを打ち切る手法です。
過学習を防ぐという目的は共通していますが、学習を継続しながら構造を変えるか、学習の進行自体を止めるかという点で仕組みが異なります。ドロップアウトの適用有無と早期終了の判定基準は、別の観点の知識として整理しておく必要があります。
バッチ正規化との違いは主目的にあります。ドロップアウトの主目的は過学習の抑制という正則化効果ですが、バッチ正規化(各層への入力データの分布を整えて学習を安定させる手法)の主目的は、各層への入力データの分布を整えて学習を安定・高速化させることです。
バッチ正規化にも副次的な正則化効果があるとされますが、狙いそのものが異なる点は取り違えやすい部分です。過学習を抑えたいのか学習そのものを安定させたいのかという目的の違いに沿って、両者の役割を切り分けて理解しておくことが試験対策になります。
4. ビジネス・実務での活用シナリオ
医療画像診断の分野では、学習データが限られる医療画像診断モデルの全結合層にドロップアウトを適用する事例があります。手に入る症例画像の数が少ない領域では過学習が起きやすいため、ドロップアウトによって特定のパターンへの依存を抑え、未知の症例画像に対する汎化性能(未知のデータに対してどれだけ正しく予測できるかという能力)を確保する狙いがあります。
少数の症例画像にモデルが過度に適合すると、臨床現場で新たに出会う症例画像を誤って判定してしまうリスクが高まります。ドロップアウトの適用は、この分野では診断の信頼性を左右する要素になります。
自然言語処理(人間が使う言葉をコンピュータに処理させる技術)を用いたチャットボット(自動で応答を返す対話プログラム)の開発でも、ドロップアウトは使われています。対話モデルの全結合層や埋め込み層(単語などを数値のベクトルに変換する層)に組み込む事例が代表的です。限られた対話データへの過剰適合を防ぐことで、想定していなかった言い回しの入力に対しても、安定した応答を返せるモデルに近づきます。
学習データに含まれる特定の言い回しのパターンだけに反応するモデルになると、実際の利用者が使う多様な表現に対応できなくなります。想定外の入力にどこまで耐えられるかという観点で、この効果には実務上の意味があります。
需要予測や金融分野のモデルでも、ドロップアウトは活用されています。過去のデータに強く適合しすぎたモデルは、相場の急変など想定外の局面で予測精度が大きく崩れる恐れがあります。ドロップアウトで汎化性能を確保しておくことは、実運用時のモデルの頑健性を高める効果につながります。
市場環境が過去のパターンから外れた局面でこそ、汎化性能の高さが収益や損失に直結します。そのため、この分野では特に意識されるポイントになっています。
5. 要点まとめ
- ドロップアウトは学習時にランダムに一部のニューロンを無効化して過学習を抑える正則化手法で、無効化の対象はミニバッチ・イテレーションごとに選び直されます。
- 毎回異なる部分ネットワークで学習が進むことから、アンサンブル学習の近似とみなされます。
- 推論時は全ニューロンを使用し、インバーテッド・ドロップアウトによる学習時のスケーリングで出力の整合性を保ちます。早期終了・正則化・データ拡張など他の過学習対策と並ぶ柱です。
6. 確認問題
問1ドロップアウトでは、学習の各イテレーションにおいて無効化するニューロンをランダムに選び直す。
解答・解説をみる
○ 正しい
ミニバッチやイテレーションごとに無効化の対象を選び直す点が仕組みの中心です。固定した一部のニューロンを常に無効化し続けるわけではありません。
問2ドロップアウトを適用したネットワークは、毎回異なる部分ネットワークで学習が進むため、アンサンブル学習の近似効果を持つとされる。
解答・解説をみる
○ 正しい
多数の異なる部分ネットワークを組み合わせて学習しているとみなせる点が、アンサンブル学習との関係を理解するうえでの中心的な論点です。
問3ドロップアウトは推論(テスト)時にも、学習時と同じ割合でニューロンを無効化した状態で予測を行う。
解答・解説をみる
× 誤り
正しくは、推論時には全ニューロンを有効にします。学習時にインバーテッド・ドロップアウトで出力をスケーリングしておくことで、推論時に追加の補正なしで出力の整合性を保ちます。

