1. 定義と概要
バウンディングボックスとは、画像や映像に写る物体の位置を矩形(四角い枠)で囲んで示す表現方法のことです。物体検出(画像の中から物体の位置と種類を両方見つけ出すタスク)では、画像内の物体それぞれについてこの矩形を求めます。
モデルは検出した物体ごとに、バウンディングボックスの座標と、物体が何であるかを示すクラス(検出した物体が何の種類であるかを示す分類のラベル)を組にして出力します。自動運転車が歩行者や他車両を検知する場面では、車載カメラの映像に写った物体それぞれの位置がこの矩形で示されます。
画像認識には、画像全体が何であるかを当てる画像分類、画像内の物体の位置とクラスを特定する物体検出、そして画素単位で物体の形をなぞるセグメンテーション(物体の形を画素単位で輪郭に沿ってなぞる手法)といった段階があります。このうち、バウンディングボックスは物体検出タスクの出力形式にあたります。
画素単位の輪郭を求めるセグメンテーションに比べて、矩形で囲むだけのバウンディングボックスは計算コストとアノテーション(画像に正解の枠やラベルを人手で付ける作業)コストが低く、リアルタイム性が求められる用途で広く採用されています。動画のように短い時間で大量のフレームを処理する場面や、大規模な画像データセットを短期間で整備する場面でも、矩形による表現の軽さが選ばれる理由になります。
2. 試験対策ポイント
座標の表し方・IoU・NMS・アノテーションという物体検出の一連の流れは、G検定の学習において柱になる範囲です。まず論点になるのは、バウンディングボックスの座標をどう表すかという点で、表し方には次の2種類があります。
| 表し方 | 使う4つの値 |
|---|---|
| 矩形の左上と右下の2点座標 | xmin、ymin、xmax、ymax |
| 矩形の中心座標と幅・高さ | center_x、center_y、width、height |
YOLO系のモデルは、このうち中心座標と幅・高さの方式を採用します。どちらの方式でも同じ矩形を表せますが、値の意味づけが異なる点は押さえておきたいところです。
予測したバウンディングボックスと正解のバウンディングボックスがどれだけ重なっているかを示す評価指標がIoU(Intersection over Union。予測した枠と正解の枠がどれだけ重なっているかを0から1の数値で表す指標)です。計算式は「重なっている部分の面積÷2つの矩形を合わせた部分(和集合)の面積」で表され、値は0(重なりなし)から1(完全一致)の範囲を取ります。
IoUがあらかじめ定めた閾値(正解とみなすかどうかの境目となる基準値。例えば0.5)以上であれば、その検出を正解とみなす判定に使われます。閾値をどこに置くかによって、同じ検出結果でも正解として数えられる件数は変わります。
同一の物体に対してモデルが複数の重複したバウンディングボックスを出力してしまう問題を解消する後処理がNMS(Non-Maximum Suppression、非最大値抑制。同じ物体に対して重複して出た複数の枠を、最も確からしい1つに絞り込む処理)です。信頼度スコア(検出結果がどれだけ確からしいかを表す数値)が最も高いボックスを残し、それとIoUが一定以上重なる他のボックスを間引く手順によって、最終的に1つの物体に1つのボックスへ整理されます。
あわせて、バウンディングボックスのアノテーションは、画素単位で輪郭をなぞるセグメンテーションのアノテーションよりも作業コストが低いものの、大量の画像データセットに対して人手で矩形を描く必要があり、依然としてコストがかかります。作業者ごとに矩形の厳密さ(物体にぴったり合わせるか、余白を持たせるか)にばらつきが生じると、学習データの品質のばらつきにつながります。
3. 関連概念との比較・相違点
セマンティックセグメンテーションやインスタンスセグメンテーションとの最大の違いは、位置の表し方が矩形(大まかな範囲を示す表現)か、画素単位のマスク(物体の輪郭に沿った形を示す表現)かという点にあります。物体検出はバウンディングボックスで大まかな位置を高速に示す一方、セグメンテーションは物体の輪郭まで精密に示す分、計算コストとアノテーションコストが高くなる関係にあります。求める精度と許容できるコストのバランスに応じて、どちらの表現形式を選ぶかが変わります。
バウンディングボックスとアンカーボックス(デフォルトボックス。モデルが物体を探すときにあらかじめ用意しておく、大きさや形の異なる候補の枠のひな形)との違いは、検出結果として最終的に出力される矩形か、検出の過程で使われる候補の枠のひな形かという点です。SSDやYOLOv2以降のモデルは、あらかじめ用意した大きさ・縦横比の異なる候補枠を基準に、どれだけ位置やサイズを調整すればよいかを学習し、その結果としてバウンディングボックスを出力します。
紛らわしい3つの表現を、形と役割の面から並べると次のようになります。
| 用語 | 形 | 役割・位置づけ |
|---|---|---|
| バウンディングボックス | 矩形 | 検出結果として最終的に出力される枠 |
| セグメンテーションのマスク | 画素単位の輪郭 | 物体の形まで精密に示す表現 |
| アンカーボックス | 矩形 | 検出の過程であらかじめ用意する候補の枠のひな形 |
同じ矩形の形をしていても、検出処理のどの段階に位置するものかという点で、バウンディングボックスとアンカーボックスは区別されます。
4. ビジネス・実務での活用シナリオ
自動運転の分野では、車載カメラの映像から歩行者・車両・標識をバウンディングボックスで検知し、それぞれの位置を衝突回避や経路計画に反映します。リアルタイム性が求められるため、計算コストの低いバウンディングボックスでの検出が基本になります。処理の遅れがそのまま安全上のリスクにつながる領域では、この軽さが前提条件になります。
小売・物流の現場では、店舗の棚や倉庫の画像から商品をバウンディングボックスで検出し、欠品や誤配置の把握、在庫数の自動カウントに活用します。矩形単位の検出で十分な用途では、セグメンテーションほど精密な形状把握を必要としないため、アノテーションコストを抑えられます。多店舗・大量在庫を日次で確認するような運用では、このコストの差が採否を左右します。
医療画像診断の領域では、レントゲンやCT画像から病変の候補位置をまずバウンディングボックスで粗く絞り込み、精査が必要な範囲を医師に提示する一次スクリーニングに使われます。形状まで正確に把握したい段階では、セグメンテーションへ処理を引き継ぐという役割分担になります。粗い絞り込みと精密な確認を分業させることで、限られた読影の時間を効率よく配分できます。
5. 要点まとめ
- バウンディングボックスは物体を囲む矩形の枠で、座標は左上・右下の2点、または中心座標と幅・高さのいずれかで表されます。
- IoUは予測と正解の重なり度合いを0から1で示す評価指標で、NMSは重複したボックスを信頼度スコアの高い1つに絞り込む後処理です。
- 画素単位で形をなぞるセグメンテーションとは矩形か輪郭かという精度とコストのトレードオフの関係にあり、アンカーボックスは検出モデル内部で使う候補枠のひな形である点で区別されます。
6. 確認問題
問1IoU(Intersection over Union)は、予測したバウンディングボックスと正解のバウンディングボックスの重なっている部分の面積を、2つの矩形の和集合の面積で割った値である。
解答・解説をみる
○ 正しい
IoUの計算式そのものであり、0(重なりなし)から1(完全一致)の範囲で予測の正確さを評価する指標です。この閾値をもとに検出の正解・不正解を判定します。
問2NMS(Non-Maximum Suppression)は、同一の物体に対して出力された複数の重複するバウンディングボックスのうち、信頼度スコアが最も高いものを残し、それとIoUが高い他のボックスを除去する処理である。
解答・解説をみる
○ 正しい
NMSの基本手順そのものであり、この後処理によって1つの物体に1つのボックスへ整理されます。
問3バウンディングボックスは、物体の輪郭を画素単位で正確になぞって表現する方式である。
解答・解説をみる
× 誤り
画素単位で輪郭をなぞるのはセグメンテーションの表現方式です。正しくは、バウンディングボックスは物体を矩形で大まかに囲む表現であり、輪郭には沿いません。両者は似た表現と混同しやすいところです。

