1. 定義と概要
MnasNetとは、Googleが2018年に発表した、モバイル端末向けの畳み込みニューラルネットワーク(画像の特徴を段階的に抽出していく、画像認識などで使われるネットワークの一種)をNASによって自動設計する手法です。その手法で得られたモデル自体も、MnasNetと呼ばれます。
最大の特徴は、精度だけでなく、実際にスマートフォン上でモデルを動かして計測した、推論(学習済みモデルを使って答えを出す処理)にかかるレイテンシを目的関数に直接組み込む点にあります。これは「プラットフォーム認識(Platform-Aware、実際にモデルを動かす端末の性能や制約を探索の段階から考慮に入れること)」と呼ばれるNASの特徴です。論文では、Pixelフォン上で78ミリ秒のレイテンシと、画像認識の精度を示すImageNet top-1精度75.2%を達成したと報告されています。
従来のNASの多くは精度の最大化のみを目的とし、モバイル向けに速度を考慮する場合でも、モデルが1回の推論で行う計算量を表す指標であるFLOPSのような間接的な指標を代理として使うにとどまっていました。しかし、FLOPS数と実機での実際の速度は必ずしも一致しないという課題がありました。
そこでMnasNetは、実機で直接レイテンシを測定して目的関数に組み込むという発想へ転換し、精度と速度の望ましいバランス(トレードオフ)を持つモデルを探索できるようにした、という流れです。
2. 試験対策ポイント
まず整理したいのは、精度とレイテンシを同時に扱う多目的最適化(精度と速度のように、複数の評価基準を同時に良くしようとする最適化の考え方)という発想です。片方だけを最大化するのではなく、精度が高くレイテンシが低いモデル群、いわゆるパレート最適(ある指標を良くしようとすると別の指標が悪化してしまう関係の中で、複数の指標のバランスが取れた状態)を探す考え方が、この手法の軸になります。
レイテンシの測り方も取り違えやすい点です。計算量(FLOPS)のような間接的な代理指標ではなく、実機で実際にモデルを動かして計測した値を用いる点が、プラットフォーム認識という名称の由来にあたります。この違いは、NASの手法を比べるうえで中心的な論点です。
探索の枠組み自体は、強化学習(試行錯誤を繰り返しながら、得られる報酬が最大になるような行動の選び方を学習する仕組み)ベースのコントローラを用いる点で、NASNetと共通します。NASNet(強化学習ベースのコントローラで構造を自動探索する、NASの代表的な先行手法)固有の探索空間の工夫は、姉妹記事のテーマです。
しかし、目的関数と探索空間(NASが候補として調べるネットワーク構造の集合)が異なります。MnasNetでは層ごとに異なる構造を許す階層的な探索空間を採用し、探索範囲を絞り込んでいる点もあわせて押さえておきたいところです。
得られたモデルが、MobileNetV2(人手で設計されたモバイル向けの軽量な畳み込みニューラルネットワーク)を精度・速度の両面で上回ったという成果も、NASによる自動設計が実用段階に達したことを示す論点として押さえておきたいポイントです。
3. 関連概念との比較・相違点
NASNetとの最大の違いは、目的関数と探索空間にあります。NASNetは精度のみを重視し、小規模なデータで探索した構造をより大きなタスクへ転用する設計であるのに対し、MnasNetは実機レイテンシを目的関数に加えてモバイル向けに直接探索します。NASNet固有の探索空間の工夫は、姉妹記事のテーマです。
MobileNetとの最大の違いは、設計方法にあります。MobileNetはDepthwise Separable Convolution(通常の畳み込みを空間方向とチャンネル方向に分けて計算量を抑える工夫)などを用いた、人手による軽量化アーキテクチャ設計です。対してMnasNetは、NASによる自動設計です。MobileNetの構成そのものについては、姉妹記事で扱う内容です。
論文で報告されている比較結果を並べると、次のように整理できます。
| 比較対象 | 設計のしかた | MnasNetとの差(論文報告) |
|---|---|---|
| NASNet | 精度のみを重視するNASによる自動設計 | MnasNetが2.3倍高速・精度は1.2ポイント高い |
| MobileNetV2 | 人手による軽量化アーキテクチャ設計 | MnasNetが1.8倍高速・精度は0.5ポイント高い |
自動設計どうしの比較でも人手設計との比較でも速度と精度の両方で上回った点が、この手法の成果です。
4. ビジネス・実務での活用シナリオ
スマートフォンアプリやカメラアプリの分野では、端末上でリアルタイムに画像認識や顔検出を行うアプリのバックボーン(土台となるネットワーク構造)として活用が検討されます。通信を介さずに低遅延で推論できるモデルであることが、アプリの応答性を左右する条件です。
AIモデル開発やMLOps(機械学習モデルの開発・運用を継続的に回す取り組み)の現場では、人手による試行錯誤に頼っていたモデル設計を自動探索に置き換える動きが進んでいます。精度とレイテンシのバランスが取れたモデルを効率よく得られる点が、開発サイクルの短縮につながる利点です。
エッジデバイス(データが発生する現場の近くで情報を処理する機器)の製造分野では、電力や計算資源が限られた端末に合わせてネットワーク構造を最適化することで、省電力かつ低遅延な推論を実現できます。端末の制約を無視した設計は実運用に耐えないため、実機計測に基づく最適化が欠かせません。
5. 要点まとめ
- MnasNetは、モバイル端末での実機レイテンシを精度とあわせて目的関数に組み込んだプラットフォーム認識型NASで設計されたモデルです。
- 探索の枠組みは強化学習ベースのコントローラを用いる点でNASNetと共通しますが、目的関数と探索空間が異なり、実機計測によるレイテンシの扱いが特徴です。
- 人手設計のMobileNetV2を精度・速度の両面で上回る成果を報告しており、NASによる自動設計が実用段階に達したことを示す例といえます。
6. 確認問題
問1MnasNetは、モバイル端末上で実際に計測した推論レイテンシを、精度とあわせて目的関数に組み込むニューラルアーキテクチャサーチの手法である。
解答・解説をみる
○ 正しい
MnasNetの中心的な特徴は、精度のみでなく実機レイテンシを目的関数に直接組み込む多目的最適化にあります。精度とレイテンシの両方を満たすモデル群を探す発想が、従来のNASとの違いです。
問2MnasNetは、計算量(FLOPS)のような間接的な指標ではなく、実機で計測した実際のレイテンシを最適化の目的関数に用いている。
解答・解説をみる
○ 正しい
計算量(FLOPS)のような代理指標ではなく、実機で計測した実際のレイテンシを使う点が、プラットフォーム認識(Platform-Aware)という名称の由来です。FLOPS数と実機の速度は必ずしも一致しないため、この転換に意味があります。
問3MnasNetによって得られたモデルは、人手で設計されたMobileNetV2よりも精度・速度の両面で劣る結果となった。
解答・解説をみる
× 誤り
正しくは逆で、MnasNetはMobileNetV2よりも高い精度と低いレイテンシを達成したと報告されています。人手設計を自動探索が上回った例として押さえておきたい成果です。

