1. 定義と概要
隠れマルコフモデル(HMM)とは、直接観測できない「隠れた状態」の系列が背後に存在し、実際に観測されるデータの並びはその隠れた状態から確率的に生成されると仮定する統計的モデルです。英語では「Hidden Markov Model」と呼ばれ、土台になっているのはマルコフ性(今の状態だけで次の状態が決まり、それより前の経緯には左右されない性質)です。
これをもとに、状態遷移確率(ある状態から別の状態へ移る確率を表す値)と出力確率(各状態がどの観測値を生み出すかを表す値)という2種類の確率で構成されます。前者が状態の移り変わり方を、後者が状態から見えるデータの出方を受け持ちます。
音声認識では、実際に観測される音の特徴量(音の性質を数値化したデータ)の並びから、その背後にある音素(「あ」「か」のように言葉の音を区切る最小単位)の並びを推定する用途で使われてきました。
音声認識では従来、あらかじめ用意した音声パターンと入力音声の形の距離を計算して照合するDPマッチング(動的計画法にもとづき、テンプレートと入力の対応関係を求める決定的な照合手法)が使われていました。しかし、多数の話者による発音や声質のばらつきを十分にモデル化できない課題を抱えていたのが実情です。
そこでDPマッチングを確率的に拡張する形で導入されたのがHMMです。音素ごとに学習したモデルを単語と音素列の対応辞書にしたがって連結することで、話者ごとの発音のゆれを確率分布(起こりうる結果それぞれにどれくらいの確率が割り当てられるかを表したもの)として柔軟に扱えるようになりました。ディープラーニングが普及する以前は、音声認識における標準的な統計的手法として長く使われた経緯があります。
2. 試験対策ポイント
まず整理したいのは、HMMが観測できない隠れた状態の系列を状態遷移確率と出力確率の2種類の確率で表す統計モデルであるという定義そのものです。隠れた状態の並びを効率よく求める計算手法としてビタビアルゴリズム(観測されたデータから最もそれらしい隠れた状態の並びを効率よく探し出す計算手順)も知られており、定義とあわせて押さえておきたいところです。
用途の面では、音声認識において入力される音の特徴量の系列から、背後にある音素の並びを推定するために使われてきた点も要点になります。観測されるものと隠れた状態が音声認識では何にあたるのか、対応を並べると次のようになります。
| HMM上の役割 | 音声認識での中身 |
|---|---|
| 観測される系列 | 入力される音の特徴量の並び |
| 隠れた状態の系列 | 背後にある音素の並び |
この対応をつかんでおくと、どちらが観測でどちらが隠れた状態かを取り違えずにすみます。あわせて、テンプレートとの距離を測る決定的な手法であるDPマッチングを確率的に拡張する形でHMMが導入され、話者ごとの発音や声質のゆれを確率分布として扱えるようになった経緯も、関連する論点として取り上げられます。
立ち位置の変化も重要なテーマです。HMMはディープラーニングが普及する以前の標準的な統計的手法として音声認識で長く使われてきました。現在はRNN(前の情報を記憶しながら順番に処理するニューラルネットワーク)やLSTM(RNNを改良し、長い系列の情報を扱いやすくした手法)といったディープラーニング手法に置き換わりつつあります。
状態遷移確率・出力確率・ビタビアルゴリズム・DPマッチングといった関連用語の束は、HMMの仕組みを支える一式として整理しておきたいところです。
3. 関連概念との比較・相違点
HMMは名前の似た概念や、同じ音声認識で使われてきた手法と混ざりやすいところがあります。比較対象ごとに立ち位置の違いを並べると、次のように整理できます。
| 比較対象 | それ自体の位置づけ | HMMとの違い |
|---|---|---|
| DPマッチング | テンプレートとの距離を測る決定的なパターン照合 | HMMはこれを確率的に拡張したモデルで、発音のゆれを確率的に吸収できる |
| マルコフ決定過程(MDP) | 行動を選んで報酬を最大化する意思決定のモデル | HMMは観測から隠れた状態を推定する認識のモデル |
| マルコフ性 | 状態遷移そのものが持つ性質 | HMMはその性質を土台に組み立てられた具体的なモデル |
DPマッチングとの最大の違いは、テンプレートとの距離を測る決定的なパターン照合か、状態遷移確率・出力確率にもとづく確率モデルとして統計的に扱うかという点です。
マルコフ決定過程(MDP)は、強化学習(試行錯誤をとおして得られる報酬をもとに、より良い行動を学習していく枠組み)にもとづき、行動と報酬の考え方を数式で表したものです。HMMには行動や報酬にあたる要素がなく、観測データの背後にある状態を読み取ることに専念します。
マルコフ性との関係も取り違えやすいところです。マルコフ性は状態遷移そのものが持つ性質を指すのに対し、HMMはその性質を土台に、状態自体は直接観測できず出力確率を通じてしか推測できない仕組みです。性質そのものと、その性質を使って組み立てられた具体的なモデルとの違いにあたります。
4. ビジネス・実務での活用シナリオ
音声認識・音声応答システムの分野では、電話の自動音声応答(IVR、電話などで音声を使って自動的に応答するシステム)や音声入力インターフェースで、ディープラーニング以前からHMMが採用されてきました。話し手ごとに発音やイントネーションは揺れますが、HMMは出力確率という形でそのゆれを確率的に吸収できるため、決まったテンプレートに頼る方式より幅広い話者に対応できるという利点があります。
自然言語処理(人間の言葉をコンピューターに処理させる技術分野)の形態素解析(文を単語に区切り、品詞や意味を判定する処理)では、品詞タグ付け(単語ひとつひとつに「名詞」「動詞」などの品詞ラベルを付ける処理)が行われます。HMMは、この品詞タグ付けの古典的な手法として使われてきました。
しくみとしては、文中に並ぶ単語列を観測、その背後にある品詞列を隠れた状態とみなして推定します。単語ひとつだけを見て判定するより、前後の並びを踏まえて品詞を推定できるため、精度の高い解析につながりました。
バイオインフォマティクス(生命科学のデータをコンピューターで解析する分野)では、観測されるDNAの塩基配列の背後にある遺伝子領域の状態を推定するなど、生命科学分野の配列解析にも応用されています。塩基配列という一見ランダムに見える並びの背後にある構造を統計的に読み解けるため、遺伝子領域の予測にHMMの考え方が役立っています。
5. 要点まとめ
- HMMは直接観測できない隠れた状態の系列を仮定し、観測データはその状態から確率的に生成されると考える統計的モデルで、状態遷移確率と出力確率の2種類の確率で構成されます。
- 音声認識ではテンプレートとの距離を測る決定的な手法であるDPマッチングを確率的に拡張したモデルとして導入され、ディープラーニング以前の標準的な手法として音素の並びの推定に使われました。
- 観測データから隠れた状態を推定する認識のモデルである点で、行動と報酬を扱う意思決定モデルのマルコフ決定過程(MDP)とは区別されます。
6. 確認問題
問1隠れマルコフモデル(HMM)は、直接観測できない隠れた状態の系列を仮定し、観測されるデータはその状態から確率的に生成されると考える統計的モデルである。
解答・解説をみる
○ 正しい
これがHMMの定義そのもので、状態遷移確率と出力確率という2種類の確率で構成されます。隠れた状態の並びを効率よく求める計算手法としてビタビアルゴリズムもあわせて押さえておきたいところです。
問2隠れマルコフモデルは、あらかじめ用意したテンプレートとの距離を計算して照合する決定的な手法であり、確率的な要素を持たない。
解答・解説をみる
× 誤り
テンプレートとの距離計算による決定的な照合はDPマッチングの説明にあたります。正しくはHMMは状態遷移確率・出力確率という確率的な要素を持つモデルであり、DPマッチングを確率的に拡張した位置づけにあります。
問3音声認識分野において隠れマルコフモデルは、ディープラーニングが普及する以前に広く用いられた標準的な統計的手法である。
解答・解説をみる
○ 正しい
HMMは音素ごとに学習し単語辞書にしたがって連結する形で、ディープラーニング以前の音声認識の標準的な手法として長く使われました。

