1. 定義と概要
DeepLab(シリーズ)とは、Google(検索エンジンで知られる米国のIT企業)の研究チームが開発したセマンティックセグメンテーションのモデル群です。Liang-Chieh Chen氏らを筆頭著者とする論文にもとづきます。
中核技術はAtrous Convolution(拡張畳み込み。別名Dilated Convolution)です。これは、畳み込みに使うフィルタの各要素間に隙間を空けることで、パラメータ(モデルの挙動を決める数値)の数を増やさずに受容野(フィルタが一度に参照できる画像上の範囲の広さ)を広げる手法です。プーリング(特徴マップを縮小する処理)による解像度の低下を抑えたまま受容野を広げられる点が特徴です。
初版のDeepLabv1は2014年に論文が公開され、2015年の国際会議ICLRで発表されました。この技術に加えて後処理として全結合の条件付き確率場(CRF。隣り合うピクセル同士の関係を考慮し、物体の境界線をなめらかに整える手法)を組み合わせ、PASCAL VOC-2012という画像データセットのセグメンテーション課題で当時最高水準の精度を達成しています。
従来のCNN(畳み込みニューラルネットワーク。画像の特徴を捉えるのに適したネットワーク構造)を使ったセグメンテーションは、プーリング処理によって特徴マップの解像度が下がってしまう点と、画像分類向けに設計されたネットワークをそのまま転用している点に課題を抱えていました。解像度を保ちながら広い範囲の文脈情報を捉える手法が求められるようになり、DeepLabシリーズは拡張畳み込みの採用によってこの課題に応えました。
その後もASPP(Atrous Spatial Pyramid Pooling。間隔の異なる拡張畳み込みを並列に適用し、大小さまざまな物体を同時に捉える仕組み)の導入やCRFの扱いの見直しといった改良を重ね、v1からv3、そしてv3+へとバージョンを重ねています。
2. 試験対策ポイント
バージョンを追うと見えてくるのは、バージョンごとの改良点と、CRF・ASPPという要素技術の扱いの変化です。発表の時期と主な改良点、CRFの扱いを並べると、次のように対応します。
| バージョン | 発表 | 主な改良点 | CRFによる後処理 |
|---|---|---|---|
| DeepLabv1 | 2014年に論文公開・2015年ICLR | 拡張畳み込みとCRFの組み合わせ | あり |
| DeepLabv2 | 2016年に公開・のちにTPAMIに掲載 | ASPPの導入 | あり |
| DeepLabv3 | 2017年発表 | ASPPの改良 | 廃止 |
v2で導入されたASPPは、拡張率の異なる複数の拡張畳み込みを並列に適用する仕組みです。v3ではこのASPPをバッチ正規化(学習を安定させるために各層の出力を正規化する処理)と画像レベルの特徴で改良し、CRFによる後処理を用いない構成へと切り替えました。
v3までの流れでとくに取り違えやすいのが、CRFの扱いの変化です。v1・v2では出力を後処理としてCRFで精緻化していましたが、v3ではネットワーク自体の改良によって精度を高め、CRFなしでも高い精度を実現しました。「CRFはバージョンを重ねるごとに強化される」という理解は逆向きで、正しくはv3の段階で後処理としての役割を終えています。
さらに発展させたDeepLabv3+(2018年発表・ECCV)は、エンコーダ・デコーダ構造を新たに組み合わせた後継版として位置づけられています。エンコーダ・デコーダ構造とは、画像を圧縮して特徴を捉える部分であるエンコーダと、元の解像度に復元する部分であるデコーダから成るネットワークの構成です。
DeepLabシリーズの開発元はGoogleで、著者にはLiang-Chieh Chen氏らが名を連ねています。拡張畳み込みやASPPそのものの詳しい仕組みは別の記事に譲りますが、DeepLabシリーズの名称とあわせて整理しておきたい論点です。
3. 関連概念との比較・相違点
FCN(Fully Convolutional Network。全結合層を使わず畳み込み層のみで構成し、ピクセル単位の出力を得るセグメンテーションの基礎モデル)との最大の違いは、解像度を保つ仕組みにあります。
FCNはプーリングで特徴マップの解像度を段階的に落とし、最後にアップサンプリング(縮小した特徴マップを元の解像度に近づけるよう引き伸ばす処理)で復元する構成です。これに対してDeepLabシリーズは、拡張畳み込みを使って解像度を落とさずに特徴抽出を行う点が異なります。
もう一つの重要な対比はDeepLabv3+です。本記事で扱うv1からv3までは、拡張畳み込み・ASPP・CRFの扱いの発展が軸になっているのに対し、v3+はさらにエンコーダ・デコーダ構造を組み合わせた後継版という位置づけにあります。同じDeepLabシリーズでも、CRFを使う初期のバージョンとCRFを使わない後期のバージョンとでは設計思想が異なります。
4. ビジネス・実務での活用シナリオ
自動運転の分野では、車載カメラの映像から道路・歩行者・車両をピクセル単位で塗り分け、走行可能な領域を高精度に認識する用途に使われています。解像度を落とさずに広い範囲の文脈を捉えられる性質は、細かい境界を見誤ると事故につながりかねない自動運転において欠かせない要件です。
医療画像診断の分野では、CTやMRIの画像から臓器や病変の領域をピクセル単位で抽出し、医師の診断や治療計画の支援に活用されています。病変の境界をわずかに見誤るだけで治療方針が変わりかねないため、解像度を保ったまま広い文脈を踏まえて判定できる性質が診断支援の精度に直結します。
衛星画像・都市計画の分野では、衛星画像から建物・道路・農地などをセグメンテーションし、都市計画やインフラの点検、災害状況の把握に応用されています。広域を一度に扱いながら細かい地物の輪郭も見分ける必要がある用途では、解像度を保ったまま受容野を広げられる性質が実用上の強みになります。
5. 要点まとめ
- DeepLabシリーズはGoogleが開発したセマンティックセグメンテーションのモデル群で、中核技術は拡張畳み込み(Atrous Convolution)による受容野の拡大にあります。
- v1・v2はCRFによる境界の精緻化を伴い、v2でASPPが導入され、v3ではASPPの改良とともにCRFによる後処理が廃止されました。
- v3+はエンコーダ・デコーダ構造を加えた発展形で、DeepLabシリーズの中では別バージョンとして扱われます。
6. 確認問題
問1DeepLabシリーズはGoogleが開発したセマンティックセグメンテーションのモデル群であり、中核技術として拡張畳み込み(Atrous Convolution)を用いている。
解答・解説をみる
○ 正しい
DeepLabシリーズはGoogleのLiang-Chieh Chen氏らが開発したモデル群で、拡張畳み込みによって解像度を保ったまま受容野を広げる点が中核技術です。
問2DeepLabv2で導入されたASPP(Atrous Spatial Pyramid Pooling)は、拡張率の異なる複数の拡張畳み込みを並列に適用し、複数のスケールの物体に対応する仕組みである。
解答・解説をみる
○ 正しい
ASPPはDeepLabv2で導入され、拡張率の異なる複数の拡張畳み込みを並列に適用することで、大小さまざまな物体のセグメンテーション精度を高める仕組みです。
問3DeepLabv3では、v1・v2で用いられていた条件付き確率場(CRF)による後処理がさらに強化され、必須の構成要素として維持されている。
解答・解説をみる
× 誤り
正しくはDeepLabv3の段階でCRFによる後処理は廃止されました。ASPPをバッチ正規化と画像レベルの特徴で改良することで、CRFなしでも高い精度を実現しています。バージョンが進むほど後処理への依存が強まるというのは逆向きの理解です。

