インスタンスセグメンテーション (G検定)

インスタンスセグメンテーション

1. 定義と概要

インスタンスセグメンテーションとは、画像内に写る物体を検出したうえで、同じクラスに属する複数の物体であっても個体ごとに区別し、それぞれの輪郭を画素単位で分離する画像認識タスクです。具体例として、写真に犬が3匹写っている場面を考えると、3匹それぞれを別々の領域として塗り分ける点が挙げられます。

同じ種類の物体を一括りに扱うセマンティックセグメンテーションとの違いが、ここに表れています。個体を区別できれば、画像に写る物体の数や配置まで把握できる点が、このタスクならではの強みです。

画像認識の枠組みは、画像全体に1つのラベルを付ける画像分類、物体の位置をバウンディングボックス(物体の位置を囲む四角形の枠)で囲む物体検出、そして画素単位で領域を分割するセグメンテーションへと段階的に精緻化されてきました。セグメンテーションのなかでもクラス単位でしか塗り分けないセマンティックセグメンテーションでは、同じ種類の物体が重なって存在する場面で個体数や個々の輪郭が分からないという課題が残ります。

この課題に応える形で、物体検出が持つ個体識別の要素と、セグメンテーションが持つ画素単位の領域抽出の要素を組み合わせたインスタンスセグメンテーションが位置づけられています。物体検出とセグメンテーションという二つの技術の発展が交わる地点で生まれたタスクだと整理できます。

2. 試験対策ポイント

G検定では、画像分類・物体検出・セマンティックセグメンテーション・インスタンスセグメンテーションという画像認識タスクの整理のなかで、インスタンスセグメンテーションがどこに位置づけられるかを整理しておきたいところです。認識の粒度が段階的に細かくなっていく流れと、個体を区別するかどうかという2つの軸で並べると、それぞれの違いがつかみやすくなります。

タスク 領域の表し方 個体を区別するか
画像分類 画像全体に1つのラベルを付ける 区別しない
物体検出 個々の物体の位置をバウンディングボックスで示す 区別する
セマンティックセグメンテーション 画素単位でクラスごとに塗り分ける 区別しない
インスタンスセグメンテーション 画素単位で個体ごとに塗り分ける 区別する

この並びから分かるとおり、個体を区別しながら画素単位で領域を切り分けるという二つの性質を併せ持つ点が、インスタンスセグメンテーションと他のタスクとの識別ポイントです。

もう一つ押さえておきたいのは、認識の対象になる範囲です。インスタンスセグメンテーションは、空や道路のように輪郭や個数が定まらない背景領域を認識の対象としません。車や人のように個数を数えられる物体だけを、個体ごとに検出して塗り分けます。

街並みを撮影した画像であれば、車や歩行者は個体ごとに塗り分けられますが、空や道路、建物の壁面といった背景は個体として扱われません。この「数えられるかどうか」という基準は、背景まで含めて塗り分けるセマンティックセグメンテーションとの違いを見分ける基準になります。

代表的なモデルにMask R-CNN(物体を検出しながら、その物体の輪郭を画素単位で塗り分けられるAIモデル)があります。物体検出モデルのFaster R-CNN(画像から物体の位置と種類を検出する代表的なAIモデル)を土台に、検出した各領域へマスクという画素単位の領域を予測する分岐を追加した構造を持ち、物体検出とセグメンテーションを同時に行う点が特徴です。

位置とクラスの特定はFaster R-CNN由来の部分が担います。そこにマスク予測の分岐が加わることで、輪郭まで塗り分けられるようになりました。

3. 関連概念との比較・相違点

セマンティックセグメンテーションとの最大の違いは、個体を区別するかどうかにあります。セマンティックセグメンテーションは同じクラスの物体をまとめて同じ色で塗り分けるのに対し、インスタンスセグメンテーションは同じクラスの物体でも個体ごとに異なる領域として塗り分けます。

道路に自転車が2台並んで写っている場面を考えると、セマンティックセグメンテーションではどちらも「自転車」という同じ塗り分けになりますが、インスタンスセグメンテーションでは1台目・2台目として別々に塗り分けられます。この違いは、画像に写る物体の「数」や「個々の動き」を扱えるかどうかという実務上の差にも直結します。

物体検出との最大の違いは、領域の表し方にあります。物体検出は物体の位置をバウンディングボックスという四角形の枠で囲んで示すのに対し、インスタンスセグメンテーションは物体の輪郭に沿って画素単位で領域を特定します。四角形の枠には物体以外の背景も含まれますが、画素単位の領域であれば物体の形そのものを正確に把握できるという違いがあります。

物体の大まかな位置だけで足りる場面では物体検出、物体の正確な形状まで必要な場面ではインスタンスセグメンテーションが選ばれる、という判断基準が成り立ちます。セマンティックセグメンテーション・パノプティックセグメンテーション(セマンティックとインスタンスの両方の結果を組み合わせて画像全体を塗り分ける手法)・Mask R-CNNそれぞれの内部構造の深掘りは、個々のキーワードを扱う別記事に譲ります。

4. ビジネス・実務での活用シナリオ

自動運転の分野では、歩行者や車両が重なって写る場面でも個体ごとに輪郭を分離して追跡できることが、衝突回避の判断精度を高めます。前を歩く2人の歩行者が近接していても、それぞれを別の個体として認識できれば、片方が急に進路を変えた場合でも進路の変化を個別に捉えられます。個体ごとの動きの違いを捉えられることは、複数の対象が同時に移動する市街地の走行で欠かせない要素です。

医療画像診断の分野では、CTやMRIの画像に複数写る腫瘍やポリープを個体ごとに検出し、それぞれの大きさや個数を計測する用途に使われています。複数の病変が近接している場合でも個体を分けて把握できるため、診断や治療方針の検討に必要な情報を医師に提供します。画像だけでは見落としがちな病変の個数を機械的に数え上げられる点は、医師の診断負担を軽減する効果も持ちます。

農業や小売の分野では、農作物や商品棚の商品を個体ごとにカウントする個体計数に活用されています。収穫前の果実を1つずつ数えれば収穫量の推定に使え、商品棚の商品を個体単位で数えれば、欠品や補充のタイミングを自動で把握する仕組みにつながります。個体単位のデータが蓄積されれば、季節や店舗ごとの需要傾向を分析する材料としても役立ちます。

5. 要点まとめ

  • インスタンスセグメンテーションは、物体を個体単位で区別しながら画素単位で領域を切り分ける画像認識タスクです。
  • セマンティックセグメンテーションとの違いは個体を区別するかどうかにあり、空や道路など数えられない背景領域は対象外です。
  • 代表モデルのMask R-CNNは、Faster R-CNNをベースに、各物体領域のマスクを予測する分岐を加えた構造を持ちます。

6. 確認問題

問1インスタンスセグメンテーションは、同じクラスに属する複数の物体が画像内に存在する場合、それらを個体ごとに区別して認識する。

解答・解説をみる

○ 正しい

インスタンスセグメンテーションはクラス分類に加えて個体の識別まで行うため、同じ種類の物体でも1匹目・2匹目のように別々の領域として区別します。クラス単位でまとめるセマンティックセグメンテーションとの違いにあたります。

問2インスタンスセグメンテーションは、空や道路といった数えられない背景領域も、他の物体と同様に個体単位で分離して認識対象とする。

解答・解説をみる

× 誤り

正しくは、インスタンスセグメンテーションは車や人のように個数を数えられる物体だけを認識対象とし、空や道路のように輪郭や個数が定まらない背景領域は対象としません。背景まで含めて塗り分けるのはセマンティックセグメンテーションの範囲です。

問3インスタンスセグメンテーションの代表的なモデルであるMask R-CNNは、物体検出モデルのFaster R-CNNをベースに、各物体領域のマスクを予測する分岐を追加した構造を持つ。

解答・解説をみる

○ 正しい

Mask R-CNNはFaster R-CNNの構造にマスク予測の分岐を加えることで、物体検出とセグメンテーションを同時に行うモデルです。