ノイジーネットワーク (G検定)

ノイジーネットワーク

1. 定義と概要

ノイジーネットワーク(Noisy Network、Noisy Net)とは、強化学習(試行錯誤を通じて、得られる報酬が最大になるように行動の選び方を学習していく機械学習の一分野)の代表的な手法であるDQNの拡張手法です。DQNは、Q値(ある状態で特定の行動をとったときに将来得られる価値の期待値を表す数値)をニューラルネットワークで出力する手法です。

ノイジーネットワークは、そのネットワークの重みに学習可能なノイズを加え、行動選択に確率的なゆらぎを持たせて探索を促します。ノイズにはガウスノイズ(平均とばらつきの決まった分布に従ってランダムに生じる数値のゆらぎ)などが使われ、2017年にDeepMind社の研究者らが論文「Noisy Networks for Exploration」で提案されました。

この手法は、DQNのε-greedy法(一定の確率でランダムな行動を選び、それ以外は価値が最も高い行動を選ぶ探索手法)に代わる手法です。A3C(複数のエージェントを並列に動かして学習を進める強化学習の手法)のエントロピー報酬(行動の選び方に偏りが出すぎないよう、ばらつきの大きさに応じてボーナスを与える探索の仕組み)に代わる手法でもあります。ノイズの大きさ自体もネットワークのパラメータ(重みと同じく学習によって調整される内部の数値)として学習される点が特徴です。

従来のDQNはε-greedy法で探索を確保していましたが、状態によらず一様な確率でランダム行動を挿入するため、局所的な行動に固執しやすい課題があり、ノイジーネットワークはこれを改善する手法として登場しました。

2. 試験対策ポイント

まず整理しておきたいのは、ノイジーネットワークがDQNの拡張手法の一つとして、ε-greedy法に代わる探索手法という位置づけです。ε-greedy法は一定の確率でランダムな行動を選ぶのに対し、ノイジーネットワークはネットワークの重みにノイズを加えることで行動選択に確率的なゆらぎを持たせます。

ノイズの大きさ(ばらつきの度合い)自体が学習可能なパラメータとして扱われる点も重要です。学習の初期は探索の度合いが大きく、学習が進むにつれてノイズの大きさが自動的に調整されます。

また、ノイジーネットワークはRainbowの構成要素の一つです。Rainbowとは、DQNの複数の改良手法を統合したアルゴリズムです。具体的な構成要素は、Double DQN・Prioritized Experience Replay・Dueling Network・Multi-step learning・Distributional RL・Noisy Netの6つです。

ノイジーネットワークは、探索と活用のトレードオフ(未知の行動を試す探索と、既知の良い行動を選ぶ活用のバランスを取る強化学習共通の課題)を改善する手法の一つです。内発的報酬(外部から与えられる報酬ではなく、たとえば未知の状態を訪れること自体にボーナスを与えるような仕組み)など、他の探索手法との対比も重要なテーマです。

3. 関連概念との比較・相違点

ε-greedy法や内発的報酬との違いは、探索をどう促すか、どこに手を入れるかという点にあります。3つの探索手法を並べると次のように整理できます。

手法 探索の促し方 手を入れる場所
ε-greedy法 状態にかかわらず一定の確率でランダムな行動を挿入する 行動の選び方
ノイジーネットワーク 重みに学習可能なノイズを加え、状態に応じたゆらぎを生む ネットワークの内部構造
内発的報酬 未知の状態や行動を訪れること自体に報酬を与える 報酬設計

ε-greedy法との最大の違いは、探索の仕組みそのものです。ノイジーネットワークはネットワークの重みにノイズを加えて状態に応じた探索を実現し、ノイズの大きさもネットワーク自体が調整するため、学習の進み具合に応じた柔軟な探索が可能です。

内発的報酬との違いは、探索を促す仕組みの位置にあります。ノイジーネットワークがネットワークのパラメータへの介入によって探索を促すのに対し、内発的報酬は報酬設計への介入によって探索を促します。G検定ではどちらも探索を改善するアプローチとして併記されることがあります。

4. ビジネス・実務での活用シナリオ

ゲームAI開発の分野では、Atariタイトルを使った強化学習のベンチマークが評価の場になっています。ここでは、ε-greedy法よりも効率的な探索によって、エージェント(学習と行動選択を担うAIプログラムの意)のスコアが人間の熟練者を上回る水準まで改善した事例が報告されています。効率的な探索は、学習に必要な試行回数の削減につながります。

ロボティクスの分野では、実機のロボットを使った試行錯誤には時間とコストがかかるため、少ない試行回数で効率よく探索できる手法が実用上重視されます。ノイジーネットワークのように状態に応じた探索を行う仕組みは、無駄な試行を減らし、実機での検証コストを抑えるうえで意義を持ちます。

推薦・広告配信システムの分野でも、探索と活用のバランス調整は共通の課題です。新しい選択肢を提示するか、効果が確認済みの選択肢を選ぶかという判断は強化学習全般に共通するテーマであり、ノイジーネットワークのような探索手法の考え方が応用の議論対象となっています。

5. 要点まとめ

  • ノイジーネットワークは、DQNのネットワークの重みに学習可能なノイズを加えることで探索を促すDQNの拡張手法です。
  • ε-greedy法が一定確率でランダム行動を挿入するのに対し、ノイジーネットワークは状態に応じた探索を実現し、ノイズの大きさ自体も学習対象となります。
  • DQNの複数の改良手法を統合したRainbowの構成要素の一つであり、内発的報酬など他の探索手法とあわせて比較の対象となります。

6. 確認問題

問1ノイジーネットワークは、DQNのネットワークの重み(パラメータ)に学習可能なノイズを加えることで探索を促す手法である。

解答・解説をみる

○ 正しい

ノイジーネットワークはDeepMind社が2017年に提案した手法で、価値関数ネットワークの重みに学習可能なノイズを加えて行動選択に確率的なゆらぎを持たせ、探索を促します。

問2ノイジーネットワークは、ε-greedy法と同様に、一定の確率でランダムな行動を選択することで探索を行う手法である。

解答・解説をみる

× 誤り

一定の確率でランダム行動を挿入するのはε-greedy法の仕組みです。ノイジーネットワークはネットワーク自体にノイズを加えることで状態に応じた探索を実現する点が異なります。

問3ノイジーネットワークは、DQNの複数の改良手法を統合したRainbowの構成要素の一つに含まれる。

解答・解説をみる

○ 正しい

Rainbowは、DQNの複数の改良手法を統合したアルゴリズムです。具体的には、Double DQN・Prioritized Experience Replay・Dueling Network・Multi-step learning・Distributional RL・Noisy Netの6つです。ノイジーネットワークは、その構成要素の一つです。