PSPNet (G検定)

PSPNet

1. 定義と概要

PSPNetとは、PPMによって特徴マップを複数の解像度で領域ごとに分割し、平均プーリング(決めた範囲の値を平均して1つにまとめる処理)した結果を組み合わせるモデルです。この仕組みによって、画像全体の大域的な文脈情報を取り込むセマンティックセグメンテーションを実現しています。

Hengshuang Zhao氏らが2017年のCVPR(コンピュータビジョン分野の主要な国際会議)で発表しました。ILSVRC 2016に併設されたImageNet Scene Parsing Challenge(シーン解析部門)で1位を獲得しています。

従来のFCN(Fully Convolutional Network。畳み込み層のみで構成し、入力画像と同じ解像度で各ピクセルのクラスを予測するセマンティックセグメンテーションの基本形)系のモデルは、畳み込みとプーリングを積み重ねて局所的な特徴を抽出する構造が中心でした。そのため、画像全体の状況を判断材料に取り込みにくいという課題を抱えていました。例えば水辺の近くにある物体はボートである可能性が高いといった、周囲の状況をふまえた判断は苦手でした。

「PSPNet」は、この課題に対してPPMで複数スケールの領域情報を統合し、局所特徴だけでは捉えきれない大域的な文脈情報を補う設計として提案されました。

2. 試験対策ポイント

PPMの処理の流れは、「PSPNet」を理解するうえでの論点です。処理は次の4段階で構成されています。

手順 処理の内容
1 特徴マップを1×1・2×2・3×3・6×6という4段階の異なるサイズのグリッドに分割する
2 それぞれの領域ごとに平均プーリングを行う
3 各出力に1×1畳み込みを施してチャンネル数を削減する
4 双線形補間(bilinear interpolation。周りの値から滑らかに埋め合わせて元の大きさに戻す方法)でアップサンプリング(元の解像度まで引き伸ばす処理)し、元の特徴マップと結合する

粗いグリッドは広い範囲を、細かいグリッドは局所に近い範囲を受け持ち、これらを重ねて結合するところが大域的な文脈情報の取り込みにあたります。

バックボーン(特徴抽出を担う土台となるネットワーク構造)には、拡張畳み込みを適用したResNetを用います。拡張畳み込み(dilated convolution)とは、畳み込みのマス目の間隔を広げて、一度に見渡せる範囲を広げる手法です。ResNetは、層を深く積み重ねても学習が崩れにくいよう工夫された代表的な画像認識モデルです。

ResNetモデルの終盤にあたる層のダウンサンプリング(データを間引いて解像度を下げる処理)を抑えることで、受容野(畳み込み処理が一度に参照できる画像上の範囲の広さ)を広げながら解像度を保ちます。こうして、広い範囲の情報を特徴抽出に反映させる設計になっています。

加えて、ResNetモデルの中間層には補助損失(auxiliary loss。ネットワークの途中にも採点基準を設けて、深い層の学習を安定させる工夫)が追加されています。最終層の損失と合わせて最適化することで、層の深いネットワークの学習を安定させています。

大会成績も、提唱の背景を理解するうえで押さえておきたい情報です。ImageNet Scene Parsing Challenge部門で1位を獲得しました。PASCAL VOC 2012・Cityscapesデータセットのベンチマークでも、mIoU(正解領域との重なり具合を示す指標)で当時最高水準の精度を記録しています。局所的な特徴の積み上げだけでは捉えられない大域的な文脈情報の取り込みを主眼とする設計思想が、FCN系のモデルとの違いにあたります。

3. 関連概念との比較・相違点

DeepLab系のASPP(Atrous Spatial Pyramid Pooling)との最大の違いは、複数スケールの文脈情報を取り込む方式にあります。「PSPNet」のPPMは、特徴マップを複数サイズのグリッドに分割して平均プーリングで集約する『プーリング型』の手法です。一方、DeepLab系のASPPは、拡張率(dilation rate。畳み込みのマス目の間隔を示す倍率)の異なる畳み込みを並列に適用して受容野を変える『畳み込み型』の手法という違いがあります。

集約の仕方がプーリングか畳み込みかという点での枝分かれです。ASPP自体の詳細な設計は、別の記事に譲ります。

FCN(Fully Convolutional Network)との最大の違いは、文脈情報の捉え方にあります。FCNは畳み込みとプーリングの積み重ねによる局所特徴の抽出が中心で、大域的な文脈情報を捉えにくいという制約を抱えていました。これに対し「PSPNet」は、PPMでこの制約を補う後継的な位置づけにあり、局所特徴と大域的な文脈情報を組み合わせて予測の精度を高める設計になっています。

4. ビジネス・実務での活用シナリオ

自動運転の分野では、車載カメラの映像から道路・歩道・建物・空・車両などシーン全体をピクセル単位で分類し、走行可能な領域や周辺状況を大域的な文脈をふまえて把握する用途に「PSPNet」のような設計思想が応用されています。個別の物体を検出するだけの手法では見落としやすい、物体同士の位置関係やシーン全体の状況をふまえた把握が可能になり、安全な走行判断を支える意義があります。

都市計画・インフラ管理の分野では、衛星画像やドローン画像から建物・道路・緑地といった土地利用区分を広域にわたって自動分類する用途に活用されています。広い範囲を1枚ずつ人手で確認する作業を省力化できるため、都市計画の立案や災害後の被害状況の把握を迅速に進められる効果があります。

精密農業の分野では、衛星やドローンで撮影した画像から農地全体の作物や土地被覆を広域に分類する用途に用いられています。区画ごとの生育状況のばらつきを画像全体の文脈から捉えられるため、施肥や灌漑の計画をきめ細かく調整する判断材料になります。

5. 要点まとめ

  • 「PSPNet」はPPMで特徴マップを1×1・2×2・3×3・6×6の4段階のスケールに分割して平均プーリングし、大域的な文脈情報を取り込むセマンティックセグメンテーションのモデルです。
  • バックボーンには拡張畳み込みを適用したResNetモデルを用い、中間層に補助損失を加えて深いネットワークの学習を安定させる工夫がなされています。
  • Hengshuang Zhao氏らが2017年のCVPRで発表しました。ILSVRC 2016に併設されたImageNet Scene Parsing Challenge部門で1位、PASCAL VOC 2012・Cityscapesデータセットのベンチマークでも高い精度を記録しました。

6. 確認問題

問1「PSPNet」のPyramid Pooling Module(PPM)は、特徴マップを1×1・2×2・3×3・6×6という異なるサイズのグリッドに分割して平均プーリングを行い、大域的な文脈情報を集約する。

解答・解説をみる

○ 正しい

4段階の異なるスケールで平均プーリングした結果を1×1畳み込みで圧縮し、双線形補間でアップサンプリングしたうえで元の特徴マップと結合する処理が、PPMの中核です。

問2「PSPNet」は局所的な特徴のみに基づいて推論を行う設計であり、画像全体の大域的な文脈情報は利用していない。

解答・解説をみる

× 誤り

「PSPNet」の設計思想はこの逆で、局所特徴の積み上げだけでは捉えられない大域的な文脈情報をPPMで取り込むことを主眼としています。正しくは、局所的な特徴と大域的な文脈情報の両方を組み合わせて推論する設計です。FCN系のモデルが抱えていた課題を補う位置づけとして整理しておきたい点です。

問3「PSPNet」のバックボーンには、受容野を広げつつ解像度を保つための拡張畳み込みを適用したResNetモデルが用いられる。

解答・解説をみる

○ 正しい

ResNetモデルの終盤のダウンサンプリングを抑え、拡張畳み込みで受容野を広げることで、解像度を保ちながら広い範囲の情報を特徴抽出に反映させています。