1. 定義と概要
DPマッチングとは、動的計画法を用いて、2つの時系列データ(時間の経過とともに値が変化していくデータ。音声の波形や株価の推移などが例にあたります)の時間軸を伸縮させながら対応付ける手法です。動的計画法によるマッチングという意味の名称で、英語ではDynamic Time Warping、DTWとも呼ばれます。
この伸縮は非線形に、つまり一定の割合で均一にではなく部分ごとに度合いを変えて行われ、両者が最もよく対応する最短距離の経路を求めます。具体例として、あらかじめ用意したテンプレート(比較の基準となるパターンデータ)音声と、実際に入力された音声パターンとの距離を計算する場面が挙げられます。
最も近いテンプレートを認識結果として出力する孤立単語認識(単語と単語の間に区切りがある状態で、1語ずつ発話された音声を認識する方式)は、この考え方の代表的な用途です。
時間軸を伸縮させながら照合する考え方は伸縮マッチングと呼ばれ、DPマッチングはその考え方を動的計画法によって具体的なアルゴリズムとして実現した手法という関係にあります。時間軸の伸縮がなぜ必要になるかという背景は、関連記事「伸縮マッチング」で扱っています。
DPマッチングは1970年代に音声認識の分野で確立され、ディープラーニングが普及する以前の音声認識を支えた手法の一つに位置づけられます。
2. 試験対策ポイント
まず整理したいのは、DPマッチングが動的計画法を用いて2つの時系列パターン間の最短距離の対応付けを求める手法であるという定義そのものです。時間軸を伸縮させながら対応点を探すため、話す速さの違いによる時間的なズレを吸収できる点が特徴です。
音声認識の分野では、あらかじめ用意したテンプレート音声と入力音声の距離を計算し、最も近いテンプレートを認識結果とする孤立単語認識に使われてきました。ディープラーニングが普及する以前の音声認識を支えた手法の一つという位置づけです。
一方でDPマッチングには、話者や発話ごとのばらつきを確率分布(値がどれくらいの確率でどの範囲に現れるかを表す統計的な表現)として扱えないという制約があります。この制約を確率的に拡張する形で、隠れマルコフモデル(HMM)が導入されました。隠れマルコフモデル(HMM)とは、音の並びを確率的な状態の移り変わりとしてとらえる統計的な手法です。
DPマッチングからHMM、さらに深層学習へという発展の経緯もあわせて整理しておきたいところです。現在は音声認識に限らず、手書き文字・ジェスチャ・遺伝子発現の時系列データ・経済データなど、長さや周期が異なる時系列データ同士の類似度を計算する手法として幅広く使われている点も押さえておきたいところです。
3. 関連概念との比較・相違点
隠れマルコフモデル(HMM)との最大の違いは、距離計算に基づく決定的な照合手法か、状態遷移確率・出力確率に基づく確率モデルとして統計的に扱う手法かにあります。状態遷移確率・出力確率とは、状態がどのように移り変わりやすいか、各状態でどの音がどれくらいの確率で出やすいかを表す統計的な指標です。
DPマッチングはテンプレートとの距離を一意に計算する決定的な手法であるのに対し、HMMは話者や発話ごとのばらつきを確率分布として扱う統計的な手法です。HMMはDPマッチングを確率的に拡張した位置づけにあります。
決定的な手法か確率的な手法かという軸で両者を見分けられるかがポイントです。観点ごとに並べると、次の対応になります。
| 観点 | DPマッチング | 隠れマルコフモデル(HMM) |
|---|---|---|
| 照合の考え方 | テンプレートとの距離を一意に計算する決定的な手法 | 状態遷移確率・出力確率に基づく確率モデル |
| 話者・発話のばらつき | 確率分布としては扱えない | 確率分布として統計的に扱う |
| 時期と位置づけ | 1970年代に音声認識の分野で確立 | DPマッチングを確率的に拡張した後継 |
この対応を押さえておくと、どちらの説明かを取り違えにくくなります。
伸縮マッチングとの違いは、時間軸を伸縮させて照合する考え方そのものか、その考え方を動的計画法で具体的に実現したアルゴリズムかにあります。DPマッチングは伸縮マッチングの考え方を実装した代表的な手法にあたり、考え方の背景については関連記事「伸縮マッチング」に譲ります。
考え方である伸縮マッチングと、その実装であるDPマッチングとの抽象度の違いを踏まえ、両者の記述を混同しないことが重要です。
4. ビジネス・実務での活用シナリオ
音声認識・音声応答システムの分野では、ディープラーニング以前の孤立単語音声認識において、あらかじめ登録した単語のテンプレートと入力音声を照合するコマンド認識にDPマッチングが使われてきました。話者ごとの発話速度の違いを吸収できる仕組みが、当時の実用化を支えました。
時系列データ分析の分野では、長さや周期がわずかに異なる2つの時系列データ、たとえばセンサー波形や需要曲線の類似度を比較し、パターンの近さから異常検知や分類を行う場面でDPマッチングが用いられます。需要予測や異常検知の精度を高める手法の一つに数えられます。
手書き文字・ジェスチャ認識の分野でも、書く速さや動作の速さが人によって異なる軌跡データを、時間軸のズレを吸収しながら照合する用途にDPマッチングが応用されています。
5. 要点まとめ
- DPマッチングは動的計画法を用いて2つの時系列パターンの時間軸を伸縮させながら最短距離の対応付けを求める手法で、英語ではDynamic Time Warping(DTW)とも呼ばれます。
- 音声認識ではテンプレート音声と入力音声の距離を計算する孤立単語認識に使われ、話者や発話のばらつきを確率的に扱えない制約を補う形で隠れマルコフモデル(HMM)へと発展しました。
- 現在も手書き文字・ジェスチャ・経済データなど、長さの異なる時系列データ同士の類似度計算に幅広く使われています。
6. 確認問題
問1DPマッチングは、動的計画法を用いて2つの時系列パターンの時間軸を伸縮させながら、最も対応する最短距離の経路を求める手法である。
解答・解説をみる
○ 正しい
これがDPマッチングの定義そのもので、英語ではDynamic Time Warping(DTW)とも呼ばれます。
問2DPマッチングは、話者や発話ごとの音声のばらつきを確率分布として扱う統計的な手法であり、隠れマルコフモデル(HMM)よりも後の時代に確立された。
解答・解説をみる
× 誤り
性質と時系列がいずれも逆です。DPマッチングはテンプレートとの距離を一意に計算する決定的な手法で、HMMより先の1970年代に確立されました。確率分布として話者・発話のばらつきを扱う統計的な手法は、HMMの説明にあたります。
問3DPマッチングは話す速さの違いによる時間軸のズレを吸収できるため、同じ単語でも発話ごとに長さが異なる音声パターン同士を比較できる。
解答・解説をみる
○ 正しい
時間軸を非線形に伸縮させながら対応点を探すため、発話速度の違いを吸収して比較できます。この性質は、伸縮マッチングと呼ばれる考え方の具体的な実現にあたります。

