1. 定義と概要
YOLO(You Only Look Once)とは、2016年にJoseph Redmon、Santosh Divvala、Ross Girshick、Ali Farhadi氏らが発表した物体検出モデルです。入力画像をグリッド(画像を格子状に区切った小さなマス目)に分割し、1回の順伝播(入力データがネットワークを通り抜けて出力の値を計算する一連の処理)で、物体の位置とクラスを同時に予測します。候補領域(物体が写っていそうな範囲の候補)を絞り込む工程を挟まず、1回の処理で物体の位置と種類をまとめて予測するこの検出方式は、1段階検出器と呼ばれます。
名称は「一度見るだけ」という意味で、画像全体を1回だけ確認して検出を終える仕組みに由来します。監視カメラ映像からのリアルタイムな人物検知などが、代表的な活用例です。
YOLO以前の物体検出は、まず物体がありそうな候補領域を提案し、その候補領域ごとに分類と位置調整を行う2段階検出器が主流でした。候補領域の提案と分類を2つの工程に分けるこの方式は、精度は高い一方で処理速度に課題を抱えていました。YOLOは物体検出を、画像全体から位置とクラスを直接求める1つの回帰問題(位置や大きさのような連続した数値を予測するタスク)として定式化し、候補領域の提案工程を省いて単一のネットワークで一括処理する設計にしました。
論文では、Titan X GPU上で秒間45フレームを達成し、同時期のFast R-CNN(毎秒0.5フレーム)やFaster R-CNN(毎秒7フレーム)より高速な処理を実現したと報告されています。この結果は、リアルタイム物体検出を実用段階に押し上げた点で意義を持ちます。
2. 試験対策ポイント
YOLOの仕組みでは、入力画像をS×Sのグリッド(YOLOv1では7×7)に分割し、各グリッドセルが物体の中心を担当領域内に持つかどうかを判定します。そのうえで、バウンディングボックス(画像内の物体を囲む四角い枠)の位置、信頼度スコア(その枠に物体が写っている確からしさを表す数値)、クラス確率を1つのネットワークの1回の処理でまとめて予測します。
各グリッドセルはバウンディングボックスの候補を複数個ずつ予測しつつ、それぞれに信頼度スコアを割り当てます。信頼度スコアは、そのボックスに物体が実際に存在する確からしさと、予測した位置がどれだけ正確かを掛け合わせた値で、値が高いボックスほど検出結果として採用されやすくなります。
加えて各セルはクラス確率も算出し、信頼度スコアとクラス確率を掛け合わせることで、どの物体がどこにどれだけの確信度で存在するかを一括して求めます。位置とクラスの予測を1回の処理でまとめて行う点が、候補領域の提案と分類を別工程に分ける2段階検出器との最大の違いです。
1段階検出器であるYOLOは、候補領域の提案を経ずに検出を完了できるため、処理速度で優位に立ちます。一方、2段階検出器のFaster R-CNNは、候補領域を絞り込んでから分類する分、精度の面で優位になりやすい関係にあります。この速度と精度のトレードオフは、1段階検出器と2段階検出器を対比するうえで取り違えやすい点です。トレードオフの向きを逆に記述した誤りには注意が必要です。
YOLOはグリッドセル単位で物体を担当させる設計のため、1つのセルに複数の小さな物体や密集した物体が存在すると、それぞれを個別に検出しづらくなります。小さな物体や密集した物体の検出精度が低下しやすいという傾向は、グリッド分割という設計に起因する制約として知られています。
YOLOは、2016年のv1発表以降もバージョンを重ねています。v2は2017年、v3は2018年にRedmon氏らによって発表され、マルチスケール検出(大きさの異なる複数の特徴マップを使い分けて、小さい物体から大きい物体まで検出する工夫)などが導入されました。v4以降は開発主体が多様化しながら、改良が継続的に重ねられています。
バージョンについては、特定バージョンの詳細よりも、YOLOが継続的に改良が重ねられているモデル群であるという理解が重要です。バージョンごとの技術的な差分そのものよりも、YOLOという名称が単一の完成形ではなく改良を重ねてきたモデル群を指すという大枠の理解が、ここでの要点です。
3. 関連概念との比較・相違点
Faster R-CNNとの最大の違いは、2段階検出器か1段階検出器かという設計の違いにあります。Faster R-CNNは、まず物体がありそうな候補領域を提案し、その候補領域ごとに分類と位置調整を行う2段階検出器で、工程を分ける分だけ精度を優先しやすい設計です。一方のYOLOは、候補領域の提案という工程を経ずに、画像全体から1回の処理で位置とクラスを求める1段階検出器で、速度を優先する設計です。この設計の違いが、そのまま速度と精度のトレードオフとして表れます。
学習のさせ方にも差が出ます。候補領域を提案するネットワークと分類するネットワークを組み合わせるFaster R-CNNは、学習の手順が複雑になりやすい設計です。一方のYOLOは単一のネットワークを一括で学習させるため、モデルを整える工程をシンプルに保ちやすいという違いもあります。
同じ1段階検出器同士であるSSDとの最大の違いは、マルチスケール特徴の扱いにあります。SSDは、ネットワーク内にある複数の解像度の特徴マップを使い分けて、小さい物体から大きい物体まで幅広いサイズを検出する設計を採用しています。これに対してYOLO(v1)は単一スケールのグリッドで検出する設計のため、小さい物体の検出に弱い傾向があります。
三者の位置づけは、検出の方式とそこから生じる傾向の違いとして整理できます。
| モデル | 検出の方式 | 設計から生じる傾向 |
|---|---|---|
| YOLO | 1段階検出器 | 速度で優位。単一スケールのグリッドのため小さい物体に弱い |
| Faster R-CNN | 2段階検出器 | 精度で優位になりやすい。学習の手順は複雑になりやすい |
| SSD | 1段階検出器 | 複数の解像度の特徴マップを使い分け、幅広いサイズを検出できる |
同じ1段階検出器であっても、内部でどのように特徴マップを扱うかによって得意・不得意が分かれる点は、比較の軸として重要です。
4. ビジネス・実務での活用シナリオ
自動運転の分野では、車載カメラ映像から歩行者・車両・標識をリアルタイムに検出し、衝突回避やブレーキ判断に反映します。候補領域を提案してから分類する2段階の処理を挟むと、検出から制御までの間にわずかな遅れが生じ、走行中の衝突回避ではその遅れが致命的な差になりかねません。衝突を避ける判断は一瞬の遅れが事故につながるため処理速度が最優先される場面であり、候補領域の提案工程を経ずに1回の処理で完結する1段階検出器としてのYOLOの高速性が活きます。
製造業の外観検査では、製造ラインをカメラで撮影し、不良品や異物の混入をリアルタイムに検出します。従来は人の目による目視検査が中心で、疲労や集中力の低下による見落としと、生産速度に検査が追いつかないという課題を抱えていました。
YOLOの導入によって、ライン速度を落とさずに全数を検査対象にできるようになりました。異常を検知した瞬間にラインを停止できなければ不良品が大量に流れてしまうため、検出から対応までの速さが品質管理の要になります。
小売・防犯の分野では、店舗内の監視カメラ映像から来店客の動きや不審物をリアルタイムに検出し、混雑状況の把握や防犯対応に活用します。従来は録画映像を後から確認する運用が中心で、不審な動きに気づいた時には対象者がすでに店外に出ているといった対応の遅れが課題でした。来店客が多い時間帯ほど人の目による監視には限界があるため、リアルタイムに検出し続けられる仕組みが現場に取り入れられ、異常の兆候をその場で把握して声かけや対応につなげられるようになりました。
5. 要点まとめ
- YOLOは、画像をグリッドに分割し、1回の順伝播で物体の位置とクラスを同時に予測する1段階検出器の代表モデルで、2016年にRedmon氏らが発表しました。
- 2段階検出器のFaster R-CNNに比べて速度を優先する設計ですが、グリッドセル単位で処理するため、小さな物体や密集した物体の検出精度は低下しやすい傾向にあります。
- 同じ1段階検出器のSSDとはマルチスケール特徴の扱いで異なり、YOLO自体もv1以降バージョンを重ねて改良が続けられています。
6. 確認問題
問1YOLOは、画像をグリッドに分割し、1回の順伝播で物体の位置とクラスを同時に予測する1段階検出器である。
解答・解説をみる
○ 正しい
グリッド分割と1回の処理で位置とクラスをまとめて予測する仕組みが、名称(You Only Look Once)の由来であり、1段階検出器の代表例として扱われます。
問2YOLOはグリッドセル単位で物体を検出するため、1つのセルに複数の小さな物体や密集した物体が存在すると検出精度が低下しやすい傾向がある。
解答・解説をみる
○ 正しい
グリッドセル単位で処理する設計上の制約から、小さい物体や密集した物体の検出精度が下がりやすい点は、YOLOの傾向として知られています。
問3YOLOは候補領域の提案(Region Proposal)を経てから分類を行う2段階検出器であり、Faster R-CNNより処理速度が遅い。
解答・解説をみる
× 誤り
正しくは、YOLOは候補領域の提案を経ずに画像全体から直接位置とクラスを予測する1段階検出器であり、2段階検出器のFaster R-CNNより高速に処理できる設計です。1段階と2段階を取り違える記述には注意が必要です。

