1. 定義と概要
メル周波数ケプストラム係数(MFCC)とは、音声信号の周波数情報をメル尺度で圧縮し、声道の共鳴特性を少数の係数列で表した音声特徴量(AIモデルへの入力として使われる、データの特徴を数値化したもの)です。
メル尺度とは、低い音の変化に敏感で高い音の変化に鈍いという人間の聴覚特性に合わせて作られた周波数の目盛りを指します。声道の共鳴特性はスペクトル包絡とも呼ばれ、声の音色を決める、周波数ごとの音の強さのおおまかな輪郭にあたります。名称に含まれるケプストラムとは、音の周波数成分に含まれる周期的なパターンを分析した結果を指す言葉です。
具体例としては、音声認識や話者識別(声の特徴から話している人物を特定する技術)で広く使われてきた代表的な特徴量が挙げられます。
従来の音声認識では、生の周波数スペクトルをそのまま扱うと情報量が多く、話者や収録環境による揺らぎの影響を受けやすいという課題がありました。人間の耳は低音域の変化に敏感で高音域の変化に鈍いという聴覚特性を踏まえてスペクトルを圧縮し、声道の共鳴特性を少数の係数に要約する手法としてMFCCが考案されています。
隠れマルコフモデル(HMM)は、音素(言葉の意味を区別する最小の音の単位)の並び方を確率的に推定する、ディープラーニング以前に主流だった統計モデルです。ディープラーニングが普及する以前の音声認識では、この統計モデルと組み合わせてMFCCが入力特徴量として使われ、長く中心的な役割を担ってきました。
2. 試験対策ポイント
まず重要になる論点の一つが、MFCCが人間の聴覚特性を反映したメル尺度に基づく特徴量であるという点です。人間の耳は低音域の変化に敏感で高音域の変化には鈍いという性質を持ち、この聴覚の癖に合わせて周波数を区切り直したものがメル尺度にあたります。
算出の流れは窓かけ(音声を短い時間の区切りに分けて取り出す前処理)から始まります。次にフーリエ変換(音の波形をどの周波数の成分がどれだけ含まれているかに分解する計算)で周波数スペクトルを求め、メルフィルタバンク(メル尺度に沿って周波数帯域を区切って集計するフィルタの集まり)でメル尺度に変換します。
その後、対数変換を経て、離散コサイン変換(DCT。並んだ数値の関連性を整理して少数の代表的な数値にまとめる計算)で係数化するという順序です。この順序は要点になりますが、各処理の詳細な計算式そのものより流れの理解が中心です。段階ごとに何をしているのかを順に並べると、全体の見通しが立ちます。
| 順序 | 処理 | 何をする段階か |
|---|---|---|
| 1 | 窓かけ | 音声を短い時間の区切りに分けて取り出す |
| 2 | フーリエ変換 | 波形をどの周波数の成分がどれだけ含まれるかに分解する |
| 3 | メルフィルタバンク | メル尺度に沿って周波数帯域を区切って集計する |
| 4 | 対数変換 | 得られた値を対数に変換する |
| 5 | 離散コサイン変換 | 並んだ数値の関連性を整理して少数の代表的な数値にまとめる |
前半で人間の聴覚に合わせて周波数を捉え直し、後半で情報を少数の係数へ絞り込む、という2段構えになっています。
ディープラーニング以前の音声認識では、隠れマルコフモデル(HMM)と組み合わせて音素列を推定する枠組みの入力としてMFCCが使われてきたという歴史的な位置づけもあわせて押さえておきたいところです。
近年は、MFCCを介さず、係数化する前段のメルスペクトログラム(メル尺度に変換した後、係数化せず時間と周波数ごとの強さをそのまま並べた表現)をニューラルネットワークへ直接入力する手法も広がっています。この流れの理解も、あわせて要点になります。
3. 関連概念との比較・相違点
生の周波数スペクトルとの最大の違いは、次元数と頑健性(環境や個人差の影響を受けにくい性質)です。生のスペクトルは次元が大きく、話者差や収録環境による揺らぎの影響を受けやすい一方、MFCCは少数の係数に圧縮されているため次元が少なく、話者差に対して頑健という関係にあります。次元が少ないことは、限られた計算資源で処理する場面や、統計的なモデルへ入力する場面で扱いやすいという利点にもつながります。音声の表現は、処理をどこまで進めるかによって性質が変わります。
| 表現 | 処理の到達点 | 次元と性質 |
|---|---|---|
| 生の周波数スペクトル | 周波数への分解結果をそのまま使う | 次元が大きく、話者差や収録環境の揺らぎの影響を受けやすい |
| メルスペクトログラム | メル尺度への変換までにとどめる | 時間と周波数の2次元表現 |
| MFCC | 離散コサイン変換で係数化まで行う | 少数の係数に圧縮され、話者差に頑健 |
メルスペクトログラムとの最大の違いは、離散コサイン変換で係数化するかどうかという点です。MFCCは係数列まで圧縮した特徴量であるのに対し、メルスペクトログラムはメル尺度への変換までにとどめた時間と周波数の2次元表現にあたります。
深層学習ではこのメルスペクトログラムをそのままニューラルネットワークへ直接入力する方式も広がっており、係数化の工程を経るMFCCとは扱いが分かれます。どちらを使うかは、モデルが特徴量を自動的に学習できる構造かどうかという観点で選び分けられています。
4. ビジネス・実務での活用シナリオ
スマートスピーカーや音声アシスタントの分野では、発話区間から算出したMFCCが音声コマンドや話者識別の基盤技術として組み込まれてきました。少ない次元数で声の特徴を表せるため、限られた処理能力のデバイス上でも扱いやすい特徴量として選ばれてきた経緯があります。
コールセンターや音声品質分析の現場では、通話音声から抽出したMFCCが本人確認や応対品質の分析における前処理特徴量として活用されています。話者差に頑健という性質は、収録環境の異なる通話データを横断して分析する場面で意味を持ちます。
音声合成や音声変換の研究開発では、声質の特徴を少数の係数で扱えるMFCCが、モデルの評価指標や中間表現の設計に利用されています。声道の共鳴特性を凝縮した情報として扱えるため、声の質感を数値で比較する際の手がかりになります。
5. 要点まとめ
- MFCCは人間の聴覚特性(メル尺度)を踏まえて音声のスペクトルを圧縮し、声道の特徴(スペクトル包絡)を少数の係数で表す音声特徴量です。
- 算出は窓かけ→フーリエ変換→メルフィルタバンク→対数変換→離散コサイン変換という流れで行われ、ディープラーニング以前は隠れマルコフモデル(HMM)と組み合わせて音声認識に使われてきました。
- 生のスペクトルと比べて次元が少なく話者差に頑健な一方、近年はメルスペクトログラムを直接ニューラルネットワークへ入力する方式も広がっています。
6. 確認問題
問1MFCCは、人間の耳が低音域の変化には敏感で高音域の変化には鈍いという聴覚特性を反映したメル尺度を用いて、音声のスペクトル情報を圧縮した特徴量である。
解答・解説をみる
○ 正しい
MFCCの核となる性質はメル尺度による聴覚特性の反映であり、MFCCの基本定義にあたります。
問2MFCCはディープラーニングの登場とともに考案された特徴量であり、ディープラーニングが普及する以前の音声認識では使われていなかった。
解答・解説をみる
× 誤り
正しくは、MFCCはディープラーニングが普及する以前から隠れマルコフモデル(HMM)と組み合わせて音声認識に使われてきた代表的な特徴量であり、登場時期の記述が逆になっています。
問3MFCCの算出では、フーリエ変換で得た周波数スペクトルをメルフィルタバンクでメル尺度に変換したのち、対数変換と離散コサイン変換を経て少数の係数列が得られる。
解答・解説をみる
○ 正しい
窓かけ→フーリエ変換→メルフィルタバンク→対数変換→離散コサイン変換という算出の流れに沿った記述であり、正しい内容です。

