音声合成 (G検定)

1. 定義と概要

音声合成とは、テキストデータをもとに人の声に近い音声を人工的に生成する技術で、TTS(Text-to-Speech。文字のデータから音声を作り出す技術の略称)とも呼ばれます。生成された音声そのものを指す言葉として「合成音声」が使われることもあります。音声アシスタントの応答音声、カーナビの音声案内、電子書籍やニュース記事の読み上げなど、身近な場面で幅広く利用されている技術です。

音声合成の方式は、大きく3段階で発展してきました。最初期に主流だったのは、あらかじめ録音しておいた音声の断片(音声素片)をつなぎ合わせる波形接続方式(録音済みの音声素片をつなぎ合わせて音声を作る方式)です。素片の質が高ければ自然な音になる一方、つなぎ目に歪みが生じやすく、話者ごとに大量の録音を用意しなければならないという制約がありました。

その後登場したのが、統計的パラメトリック方式(録音した音声から声の特徴を統計的なモデルに学習させ、その出力をもとに音声を生成する方式)です。声の特徴を学習したモデルが出力する数値データ(パラメータ)をもとに、音声を生成します。隠れマルコフモデル(音の変化を確率的なつながりとして扱うモデル)などが用いられ、少ないデータ量でも声質や話し方を調整しやすくなった一方、生成される音声の自然さは波形接続方式に劣る傾向がありました。

2010年代半ば以降は、ニューラルネットワーク(人間の脳の仕組みを模した計算モデル)を用いて音声波形やその特徴を直接生成する深層学習方式(ニューラルネットワークを使って音声を生成する方式)が主流となりました。この方式により、人間の発話に近い自然な音声を生成できるようになっています。

2. 試験対策ポイント

重要な論点になるのが、音声合成の方式が波形接続方式から統計的パラメトリック方式、そして深層学習方式へと移り変わってきた変遷です。それぞれの方式には、自然さ、必要な録音データ量、つなぎ目の歪みの有無といったトレードオフがあり、方式ごとの違いとあわせて整理されます。年代の前後関係では、この3方式の並び順そのものが論点になります。

3つの方式の違いを、音声の作り方という同じ観点で並べると次のようになります。

方式 音声の作り方 特徴・課題
波形接続方式 録音済みの音声素片をつなぎ合わせる 素片の質が高ければ自然。つなぎ目の歪みと大量の録音が課題
統計的パラメトリック方式 学習したモデルが出力する数値データから生成する 少ないデータでも声質を調整しやすい。自然さは波形接続方式に劣る傾向
深層学習方式 ニューラルネットワークで波形や特徴を直接生成する 人の発話に近い自然さ。多様な声質や感情表現も再現しやすい

3方式の並びは、そのまま音声の作り方が「つなぐ」から「生成する」へ移ってきた流れとしても読み取れます。

処理の流れも重要な論点です。音声合成はまず、入力テキストの読みやアクセント位置を推定するテキスト解析(読み方やアクセントの位置を推定する処理)を行います。次に経るのが、声の高さ・長さ・イントネーションといった韻律情報を作る韻律生成(声の高さ・長さ・イントネーションといったリズムに関わる情報を作る処理)です。

最後に、その情報をもとに実際の音声波形を作り出す波形生成(韻律情報をもとに音声の波形データを作り出す処理)へと進みます。この3段階の骨組みは、方式が波形接続から深層学習に変わっても共通の見取り図になります。

深層学習方式の代表的なモデルとして、WaveNet(2016年にDeepMind社が発表した、深層学習で音声波形を直接生成する代表的な音声合成モデル)が挙げられます。CNN(畳み込みニューラルネットワーク。画像や音声のパターンを捉えるのに使われるニューラルネットワークの一種)をもとに音声波形を直接生成するモデルで、音声合成の自然さを大きく引き上げた代表例として名称と位置づけが取り上げられます。

音声合成の技術は、人になりすました偽の音声を作る目的で悪用されるおそれも指摘されています。いわゆるディープフェイク音声(AIで本人の声に似せて作られた偽の音声で、なりすましなどへの悪用リスクが指摘される)です。声質を柔軟に再現できる利点と表裏の課題として扱われます。

3. 関連概念との比較・相違点

音声認識との最大の違いは、変換の方向にあります。音声合成はテキストを入力として音声を出力するのに対し、音声認識は音声を入力としてテキストを出力する、逆向きの技術です。この2つは同じ音声処理分野の対として扱われ、変換の方向を取り違えやすい組み合わせです。

入力と出力の対応を並べると、逆向きの関係がはっきりします。

技術 入力 出力
音声合成 テキスト 音声
音声認識 音声 テキスト

入力と出力が逆転する関係にあるため、片方の定義を覚えれば、もう片方は変換の向きを反転させるだけで説明できるという整理の仕方もできます。

波形接続方式と深層学習方式の違いは、音声をどう作るかという発想の差にあります。波形接続方式は録音済みの音声素片をつなぎ合わせる方式で、声質そのものは高品質になりやすい一方、つなぎ目の歪みと話者ごとの大量録音が課題でした。

これに対し深層学習方式は、ニューラルネットワークで音声波形やその特徴を生成する方式で、比較的少ない調整で自然な音声や多様な声質・感情表現を再現しやすいという特徴があります。中間に位置する統計的パラメトリック方式は、少ないデータでも声質を調整しやすい反面、生成音声の自然さでは両者の折衷にとどまる位置づけとして整理されます。

4. ビジネス・実務での活用シナリオ

コールセンターや問い合わせ窓口では、IVR(電話の問い合わせに、あらかじめ用意した音声案内を流す自動応答システム)やチャットボット(文字や音声でユーザーと自動的にやり取りするプログラム)の回答テキストを音声合成で読み上げる使い方があります。有人対応を介さずに、一定品質の案内を24時間提供できる点が利点です。テキストを差し替えるだけで案内内容を更新できるため、繁忙期の問い合わせ増加にも柔軟に対応できます。

交通・公共インフラの分野では、カーナビの音声案内や駅・車内の自動放送に音声合成が活用されています。路線変更や新しい案内文が生じても、テキストを差し替えるだけで即座に音声化でき、収録し直す手間がかかりません。多言語対応の案内を短期間で用意できる点も、公共インフラならではの利点です。

メディア・アクセシビリティの分野でも、電子書籍やニュース記事の読み上げ、動画のナレーション生成に使われています。収録の手間なく多言語・多様な声質の音声を用意できるほか、視覚に障がいのある利用者が情報にアクセスする手段としても支えになっています。ナレーターの収録スケジュールに縛られず、記事更新のたびに音声版を用意できる点も実務上の利点です。

5. 要点まとめ

  • 音声合成はテキストをもとに人の声に近い音声を人工的に生成する技術で、波形接続方式から統計的パラメトリック方式、深層学習方式という順で発展してきました。
  • 処理はテキスト解析、韻律生成、波形生成という3段階で進み、深層学習方式の代表例として「WaveNet」が位置づけられます。
  • テキストから音声を扱う音声合成と、音声からテキストを扱う音声認識は、変換の方向が逆の技術として対比されます。

6. 確認問題

問1音声合成の方式は、波形接続方式、統計的パラメトリック方式、深層学習方式という順で発展してきた。

解答・解説をみる

○ 正しい

録音した音声素片をつなぎ合わせる波形接続方式が最初に普及し、その後統計モデルを用いる統計的パラメトリック方式、さらにニューラルネットワークを用いる深層学習方式へと発展しました。

問2音声合成の処理は、テキスト解析、韻律生成、波形生成という順で進む。

解答・解説をみる

○ 正しい

入力テキストの読みやアクセントを推定するテキスト解析、声の高さや長さといった韻律情報を作る韻律生成、その情報をもとに音声波形を作る波形生成という順序で処理が進みます。

問3音声認識と音声合成は、いずれもテキストを入力として音声を出力する、同じ方向の変換を行う技術である。

解答・解説をみる

× 誤り

変換の方向が逆です。正しくは、音声合成がテキストを入力として音声を出力し、音声認識は音声を入力としてテキストを出力します。方向を混同させる記述は、取り違えやすい典型です。