1. 定義と概要
姿勢推定(Pose Estimation)とは、画像や動画に写る人物の関節点を検出し、その位置関係から体勢を推定する画像認識タスクです。ポーズ推定や骨格推定とも呼ばれ、代表的な出力は関節点の座標と、それらをつないだ骨格線になります。
画像内に人物が1人だけ写る場合を単一人物姿勢推定、複数人が写る場合を複数人物姿勢推定と呼んで区別します。複数人物姿勢推定では、検出した関節点がどの人物に属するかを対応づけるグルーピング(検出した関節点を人物ごとにまとめて整理する処理)が追加で必要になります。単一人物姿勢推定はこの対応づけの処理が不要な分、複数人物姿勢推定よりも計算の流れがシンプルになります。
従来の画像認識では、対象物の位置を矩形で示す物体検出(画像の中から対象物の位置をバウンディングボックスと呼ばれる四角い枠で示すタスクです)が中心でした。しかし、スポーツのフォーム分析や高齢者の見守りのように、人物の細かな動きや姿勢を捉えるニーズが高まり、関節点という点の集合で人体を表現する姿勢推定が発展してきました。
対象物の位置を大まかに示すだけでは把握しきれない、姿勢や動きそのものを捉える技術へのニーズの高まりが、この発展の背景にあります。ディープラーニングの導入によって関節点検出の精度が大きく向上し、リアルタイムに近い速度で処理できる手法も登場しています。
2. 試験対策ポイント
単一人物姿勢推定では人物検出の工程を省略できますが、複数人物姿勢推定では画像内の人物をどう扱うかによって処理方式が分かれます。重要なテーマになるのは、この複数人物姿勢推定における2つの処理方式の違いです。
トップダウン方式は、先に人物検出(物体検出の処理)を行い、検出した人物領域ごとに個別の姿勢推定を繰り返す方式です。一方のボトムアップ方式は、画像全体からすべての関節点をまず検出したのち、それらを人物ごとにグルーピングする方式です。処理の順序が逆になるため、計算量の増え方も難所も違ってきます。
2つの方式の性質を並べると、次のように整理できます。
| 方式 | 処理の流れ | 計算量 | 技術的な難所 |
|---|---|---|---|
| トップダウン方式 | 先に人物検出を行い、人物領域ごとに姿勢推定を繰り返す | 写る人数が増えるほど繰り返し回数も増え、人数に応じて増加する | 人物検出の精度に結果が左右される |
| ボトムアップ方式 | 画像全体の関節点をまとめて検出し、人物ごとにグルーピングする | 人数によらず安定する | どの関節点が同じ人物に属するかの対応づけ |
ボトムアップ方式の代表例として、OpenPose(複数人物の姿勢を一度に推定できる手法として知られるモデルです)が挙げられます。関節点同士のつながりの向きと強さをベクトルで表すPart Affinity Fields(PAFs)という仕組みを用いる点が特徴です。この仕組みにより、離れた関節点同士が同じ人物に属するかどうかを効率よく判定できます。
このほか、画像平面上での関節点の位置のみを推定する2次元姿勢推定と、奥行きの情報も含めて立体的な関節位置を推定する3次元姿勢推定の区別も欠かせない視点です。
加えて、姿勢推定は関節点という点の集合とその連結関係で人体を表します。この点で、矩形によって対象の位置を示す物体検出や、ピクセル単位で領域を塗り分けるセグメンテーション(画像を意味のある領域ごとにピクセル単位で塗り分ける技術です)とは出力形式が異なります。この出力形式の違いも押さえておきたい点です。
3. 関連概念との比較・相違点
物体検出との最大の違いは、出力形式にあります。関連する画像認識タスクの出力を並べると、その違いがはっきりします。
| タスク | 出力の形式 |
|---|---|
| 物体検出 | 対象物の位置を示す矩形(バウンディングボックス) |
| 姿勢推定 | 関節点の座標と、それらをつないだ骨格線 |
| セグメンテーション | ピクセル単位で塗り分けた領域 |
物体検出の出力はあくまで対象物が存在するおおよその範囲であるのに対し、姿勢推定は関節点の座標という、より細かい情報まで踏み込んで人体の状態を表現します。両者は無関係ではなく、トップダウン方式の姿勢推定は物体検出を前段の人物検出処理として利用する関係にあります。
行動認識との違いは、扱う時間軸にあります。姿勢推定は静止画やフレーム単位で関節点の位置を検出する処理です。これに対し行動認識(姿勢の時間的な変化を追って、歩く・座るといった動作の種類を判定するタスクです)は、姿勢の時系列変化を追ってジャンプや歩行などの動作を分類する上位のタスクです。
姿勢推定の出力である関節点の並びが1枚の画像に対する結果であるのに対し、行動認識はそれを複数フレームにわたって追跡し、動作というまとまりとして判定する点で、扱う情報の粒度が異なります。行動認識では姿勢推定の出力を入力として利用することが多く、両者は連続した処理の関係にあります。
4. ビジネス・実務での活用シナリオ
スポーツの分野では、選手の競技フォームから関節点を検出し、関節角度や動きの変化を数値化する取り組みが進んでいます。感覚に頼りがちだったフォームの評価を数値データに置き換えることで、客観的なコーチングやフォーム改善につながります。感覚的な指導ではなく、関節角度という共通のものさしで比較できるようになる点が実務上の意義です。
高齢者の見守りや介護の現場では、施設内カメラの映像から姿勢の変化をリアルタイムに検知する仕組みが使われています。転倒などの異常姿勢を早期に把握できれば、スタッフが常時付き添わなくても異変への対応を早めることができ、見守り体制を支える役割を果たします。スタッフが持続的に目視で確認しなくても、姿勢の変化を継続的に把握できる点が、見守り体制を支えるうえでの意義です。
リハビリテーションの領域では、歩行時の関節点の動きを解析して歩行パターンや関節可動域を評価する用途があります。関節の動きを継続的に記録できるため、運動フォームの確認や回復状況の追跡に役立ちます。感覚的な回復の実感だけでなく、関節可動域という数値の推移で経過を確認できる点が、リハビリテーションにおける意義です。
5. 要点まとめ
- 姿勢推定は、画像・動画から関節点(キーポイント)を検出して人物の姿勢を推定するタスクで、単一人物と複数人物とで必要な処理が異なります。
- 複数人物の姿勢推定には、人物検出を先に行うトップダウン方式と、全関節点を検出してから人物ごとに紐づけるボトムアップ方式があり、それぞれ特性が異なります。
- スポーツのフォーム解析、高齢者の見守り、リハビリテーションの動作評価など、幅広い実務分野で活用されています。
6. 確認問題
問1複数人物姿勢推定のボトムアップ方式では、画像全体からすべての関節点を検出したのち、それらを人物ごとにグルーピングする処理を行う。
解答・解説をみる
○ 正しい
ボトムアップ方式は、先に画像全体の関節点をすべて検出し、そのうえでどの関節点が同一人物に属するかを対応づける、つまりグルーピングする方式です。人数によらず計算量が安定する点が特徴です。
問2トップダウン方式の姿勢推定は、人物検出をあらかじめ行わず、画像全体から直接すべての人物の関節点を一括で検出する方式である。
解答・解説をみる
× 誤り
正しくは、トップダウン方式は先に人物検出(物体検出の処理)を行い、検出した人物領域ごとに個別の姿勢推定を繰り返す方式です。人物検出を経ずに関節点を一括検出してから人物ごとに紐づけるのはボトムアップ方式の特徴で、方式を入れ替えた説明は、取り違えやすい記述です。
問3奥行きの情報を含めて立体的な関節位置を推定する手法を3次元姿勢推定という。
解答・解説をみる
○ 正しい
画像平面上の位置のみを推定する2次元姿勢推定に対し、奥行きの情報も加えて立体的な関節位置を推定する手法を3次元姿勢推定と呼びます。

