1. 定義と概要
合成音声とは、音声合成によって生成された音声そのものを指す言葉です。具体例としては、音声アシスタントの応答音声、カーナビや駅の案内放送、電子書籍やニュース記事の読み上げ音声などが挙げられます。
近年は、企業の自動応答窓口やオンライン講座のナレーションなど、活用の場面もさらに広がっています。深層学習方式(ニューラルネットワークを使って音声を生成する方式)の普及により、人間が実際に話している音声とほぼ同等の自然さを持つ合成音声を生成できるようになっています。
従来の合成音声は機械的で単調な発話に聞こえることが多く、抑揚の乏しさや不自然な間の取り方から、人間の声との違いが比較的わかりやすいものでした。しかし、深層学習を用いた音声合成技術の発展により、生成される音声の自然性が大きく向上した結果、声だけを聞いて人間か合成音声かを判断することが難しくなっています。
この自然性の向上は活用の幅を広げる一方で、生成された音声の品質をどう測るか、そして自然すぎる合成音声が悪用されたときにどう見分け対処するかという新しい論点を生んでいます。
2. 試験対策ポイント
合成音声の自然さを測る手法の一つに、MOS(Mean Opinion Score、平均オピニオン評点)と呼ばれる主観評価があります。複数の評価者が音声を聞いて1〜5点の5段階で採点し、その平均値を算出する方法で、数値化しやすい客観指標だけでなく、人がどう感じるかという主観的な物差しが品質評価に使われる点は押さえておきたいポイントです。
テキストや画像の生成物とは違い、耳で聞いた印象そのものが評価の基準になる点も合成音声ならではの特徴です。
深層学習方式による合成音声は自然性が向上した結果、人間の声との聞き分けが難しくなっており、合成音声の見分け方が課題として意識されるようになっています。この性質は活用の幅を広げる利点である一方、人になりすました偽の音声を作る目的で悪用されるリスクとも表裏の関係にあり、あわせて確認しておきたいところです。
具体例として、家族や取引先の担当者、企業幹部の声を模倣した合成音声を使い、電話などで金銭の振り込みを誘導するボイスフィッシング(ビッシング。電話などで偽の音声を使って相手をだまし、送金などを誘導する詐欺の手口)型のなりすまし詐欺が国内外で報告されています。
こうした悪用の土台になっているのが、音声クローン(ボイスクローンとも呼ばれる、ごく短い音声データから特定の人物の声色を再現する技術)です。被害の正確な件数や金額を把握するのは難しいものの、実在の人物と同じ声色を再現できる技術が悪用の余地を広げている点は各所で指摘されています。
声そのものを直接保護する法律は、日本では2026年時点で整備されておらず、肖像権やパブリシティ権(有名人の氏名や姿・声などが持つ経済的な価値を守るための権利)に類する権利として保護できないかという議論が進められている段階です。
あわせて、AIによって生成・改変された音声であることを示す透明性義務(AIが作った・改変した音声や画像であることを分かるように示す仕組みや決まり)を求める動きも広がっています。たとえばEUのAI法では、生成AI(新しいテキストや画像、音声などを作り出すAI)による生成物に表示・ラベル付けを求める規定があり、生成AIの統治や運用管理に関わる論点として教材で扱われます。
3. 関連概念との比較・相違点
音声合成との最大の違いは、プロセスか成果物かという視点にあります。音声合成はテキストや音声データから人の声に近い音声を人工的に生成する技術・処理そのものを指すのに対し、合成音声はその技術によって生成された音声というアウトプットを指す言葉です。
生成方式の変遷や処理の流れといった仕組みの詳細は音声合成側の論点であり、本記事で扱う合成音声は生成された音声そのものの自然性や活用、リスクに焦点を当てています。
音声クローン(ボイスクローン)との違いは、指し示す範囲の広さです。合成音声は生成された音声全般を指す包括的な言葉であるのに対し、音声クローンはごく短い音声データから特定の人物の声色を模倣して再現する技術・音声を指す、より狭い概念です。なりすまし詐欺の文脈では、この音声クローンの技術が土台になっている場合が多く、両者の関係は取り違えやすい点です。
3つの用語が何を指しているかを並べると、次のように整理できます。
| 用語 | 指しているもの | 位置づけ |
|---|---|---|
| 音声合成 | 人の声に近い音声を人工的に生成する技術・処理そのもの | プロセスの側 |
| 合成音声 | 音声合成によって生成された音声そのもの | 成果物の側。生成された音声全般を指す包括的な言葉 |
| 音声クローン | ごく短い音声データから特定の人物の声色を再現する技術・音声 | 合成音声より狭い概念。なりすまし詐欺の土台になりやすい |
この3語の関係を押さえておくと、自然性の評価は合成音声の論点、生成方式は音声合成の論点、なりすましのリスクは音声クローンの論点というように、教材で扱われる話題を切り分けて整理しやすくなります。
4. ビジネス・実務での活用シナリオ
音声アシスタント・スマートスピーカーの分野では、応答音声に合成音声が使われており、自然な発話がユーザーとの対話体験を支えています。機械的な読み上げでは実現しにくい、聞き手が心地よく感じる抑揚やテンポを再現できることが、対話型サービスの利用継続につながっています。
医療福祉の分野では、音声バンキングと呼ばれる取り組みが進められています。ALS(筋萎縮性側索硬化症)など発話が困難になる可能性がある病気の患者が、発話機能を失う前に自分の声を録音・保存しておき、症状が進行した後も視線入力などと組み合わせて自分の声の合成音声でコミュニケーションを続けられるようにする仕組みです。合成された声であっても本人らしさが保たれることが、患者本人や家族にとっての意義になっています。
メディア・出版の分野では、ニュース記事や電子書籍の読み上げ、動画のナレーション生成に合成音声が使われています。人による収録の手間をかけずに、多様な声質や言語の音声を短期間で用意できることが、コンテンツの多言語展開や更新頻度の向上を後押ししています。
5. 要点まとめ
- 合成音声は音声合成の技術によって生成された音声そのものを指す言葉で、深層学習方式の普及により自然性が大きく向上し、人間の声との聞き分けが難しくなっています。
- 自然さの評価には、複数の評価者が採点した点数の平均値であるMOS(平均オピニオン評点)という主観評価の手法が用いられます。
- 自然性の向上は音声アシスタントや音声バンキングなど活用の幅を広げる一方、なりすまし詐欺への悪用リスクや声の権利・AI生成物の透明性といった課題とも表裏の関係にあります。
6. 確認問題
問1合成音声の自然さは、複数の評価者が採点した点数の平均値であるMOS(平均オピニオン評点)という主観評価の手法で測られることがある。
解答・解説をみる
○ 正しい
MOSは複数の評価者が音声を聞いて1〜5点の5段階で採点し、その平均値を算出する主観評価の手法です。客観的な数値だけでなく、人がどう感じるかという主観的な物差しが品質評価に用いられる点が特徴です。
問2オレオレ詐欺などのなりすまし詐欺は映像を偽造するディープフェイクのみで行われ、音声のなりすましが用いられることはない。
解答・解説をみる
× 誤り
正しくは、家族や取引先の声を模した合成音声を使うボイスフィッシング(ビッシング)型のなりすまし詐欺が国内外で報告されており、音声クローン技術が悪用の土台になる事例が確認されています。映像だけでなく音声のなりすましも現実の脅威です。
問3日本において、声そのものを直接保護する法律は2026年時点で整備されておらず、肖像権やパブリシティ権に類する権利として保護できないかという議論が進められている段階である。
解答・解説をみる
○ 正しい
声の権利を直接保護する法律は現時点で存在せず、肖像権・パブリシティ権に類する権利としての保護のあり方が検討段階にあります。あわせて、AI生成物であることを示す透明性の取り組みも広がりつつあります。

