EchoraEchora
モデル一覧に戻る

NaturalSpeech 3:音声は一つのものではない。それなら、なぜ一つのものとして生成するのか?

2026年9月3日
•
6分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

ほとんどの TTS モデルは音声を、内容、調子、声、質感が絡み合った一つの信号として扱い、すべてを一度に生成します。Microsoft の NaturalSpeech 研究シリーズの最新版である NaturalSpeech 3 は、異なる前提から出発します。まずそれらの要素を引き離し、それぞれに適した方法で生成してから、もう一度組み合わせるという考え方です。これは音声合成に分割統治を持ち込むアプローチであり、NaturalSpeech 3 はまさにこの発想を中心に構築されています。

NaturalSpeech 3 とは?

NaturalSpeech 3 は、Microsoft Research Asia と Microsoft Azure Speech が、中国科学技術大学、香港中文大学、浙江大学の研究者と共同で開発したゼロショットのテキスト読み上げシステムです。NaturalSpeech 研究シリーズの最新版に当たります。初代 NaturalSpeech は単一話者のベンチマークで人間同等の品質を達成し、NaturalSpeech 2 は潜在拡散によってゼロショット、複数話者、歌声合成へと規模を広げました。NaturalSpeech 3 が取り組むのは、どちらの先行モデルも特に対象としていなかった問題です。内容、韻律、声色、音響的な質感がすべて一つの絡み合った表現としてモデル化されていたこともあり、音声品質には類似度と制御性の面でなお改善の余地がありました。

NaturalSpeech 3 の中核となるのは因子分解です。音声を異なる属性に対応する個別の部分空間へ分解し、それぞれを別々にモデル化したうえで、最後に組み合わせます。これを可能にするのが、分離のために専用設計されたニューラルコーデックと、因子分解された各属性を順に生成する拡散モデルという二つのコンポーネントです。

FACodec:圧縮だけでなく、分離するためのニューラルコーデック

大半のニューラルオーディオコーデックは、音声をできるだけ効率よく token に圧縮することを目的に設計されており、その token が意味の上で何を表すかは特に重視しません。NaturalSpeech 3 が導入した FACodec は、正反対の目標を中心に設計されています。Factorized Vector Quantization(FVQ、因子分解ベクトル量子化)を使い、音声波形を区別のない一本のコード列にするのではなく、内容、韻律、声色、音響ディテールに対応する別々の部分空間へ意図的に分解します。

各部分空間に、本来は別の部分空間が担うべき情報が漏れ出さないよう、真に明確な分離を実現するには、学習時に複数の具体的な手法を重ねる必要がありました。特定の部分空間に属さない属性を取り除く情報ボトルネック、各部分空間に担当すべき属性を明示的に教える専用の教師あり損失、敵対的学習、さらに部分空間同士の混在を抑える勾配反転です。デコード側では、最終的な波形を再構成する際、声色の部分空間をほかのすべてと単純に連結するのではなく、条件付きレイヤー正規化によって再び取り込みます。

因子分解拡散モデル

音声をこれらの属性部分空間に確実に分割できるようになると、NaturalSpeech 3 は、その因子分解構造専用に構築された拡散モデルで各要素を生成します。長さ、韻律、内容、音響ディテールを順番に生成し、それぞれを、それ以前に生成された属性と音素レベルのテキスト入力の両方で条件付けます。このシステムは非自己回帰型で、処理の基準となる明示的なタイミング信号を必要とするため、長さは韻律に含めず、独立した一つのステップとして明示的にモデル化されます。

この設計が実用上もたらす利点は、真に独立した制御性です。各属性が固有の部分空間と生成ステップを持つため、属性ごとに異なるプロンプトで条件付けできます。一つの参照クリップから目的の声色を取り込み、別の信号で韻律を形作ることも可能です。単一の絡み合った表現では何か一つを調整するとほかのすべての属性まで引きずられるおそれがあるため、このような細粒度の制御は実現できません。

ベンチマークの数値

NaturalSpeech 3 は、話者類似度で当時の新たな最先端結果を記録しました。Sim-O スコアは 0.67、SMOS(similarity mean opinion score)は 4.01 で、当時最も強力だったベースラインシステムの 0.64 Sim-O と 3.69 SMOS を上回っています。この有意義な向上は、FACodec が声色をほかの要素からより明確に分離したことに特に起因するとされています。より広く見ると、このシステムは品質、類似度、韻律、明瞭度で従来の最先端 TTS システムを上回り、実際の人間による録音と同等の品質を達成したと報告しています。このアーキテクチャは大規模環境でも検証され、約 10 億パラメータと 20 万時間の学習データまで拡張すると結果がさらに向上しました。NaturalSpeech 2 の時点ですでに大規模だった 4.4 万時間の学習セットから見ても、これは大きな飛躍です。

NaturalSpeech 3 のシリーズ内での位置付け

この研究シリーズの各世代は、段階的に異なる問題を解決してきました。初代 NaturalSpeech は、人間同等の品質について厳密で統計的に検証可能な定義を確立し、単一話者のベンチマークでその基準を満たしました。NaturalSpeech 2 は、自己回帰型の離散 token 生成を連続潜在拡散に置き換えることで、その目標を複数話者、ゼロショット、実環境データからの生成、そして特にゼロショット歌声合成へと広げました。NaturalSpeech 3 が取り組むのは、まったく別の弱点です。強力なゼロショットクローンが可能になっても、制御性と明確な属性分離には限界が残っていました。因子分解コーデックと因子分解拡散は、まさにその問題を解決するために構築されています。

NaturalSpeech 3、NaturalSpeech 2、NaturalSpeech の比較

NaturalSpeech 3NaturalSpeech 2NaturalSpeech(初代)
中核手法因子分解コーデック(FACodec)+ 因子分解拡散連続潜在表現 + 潜在拡散VAE ベース、エンドツーエンド
解決した問題独立した属性制御、類似度複数話者、ゼロショット、歌声合成単一話者で人間同等の品質
話者類似度(Sim-O)0.67(公開時点で新たな最先端)直接比較できる指標ではない該当なし(単一話者)
独立した属性制御あり、個別の部分空間とプロンプトで実現話者/スタイル全体のプロンプトに限定該当なし
学習規模10 億パラメータ、20 万時間4.4 万時間単一話者のベンチマークデータセット
公式公開なし(研究論文のみ)なし(コミュニティによる再実装あり)なし(コミュニティによる再実装あり)

NaturalSpeech 3 の具体的な貢献は、音声を一つの不可分な信号ではなく、分離可能な属性として扱うことで、品質と制御性の両方を同時に向上できると証明したことです。特定の弱点を正確に定義し、その隙間を埋めるためのアーキテクチャを設計するという、シリーズを貫く流れをさらに前進させました。

よくある質問

NaturalSpeech 3 における「因子分解」とは何ですか?

音声を内容、韻律、声色、音響ディテールという、分離されて互いに絡み合わない部分空間へ分解し、それぞれをある程度独立してモデル化・生成することです。音声を一つの絡み合った表現として一度に生成する方法とは異なります。

FACodec とは何ですか?

FACodec は NaturalSpeech 3 が導入したニューラル音声コーデックです。Factorized Vector Quantization を用いて音声波形を内容、韻律、声色、音響ディテールの個別の部分空間へ分割し、情報ボトルネックや敵対的学習などの手法で、それらの部分空間を明確に分離した状態に保ちます。

NaturalSpeech 3 は NaturalSpeech 2 とどう違いますか?

NaturalSpeech 2 は連続潜在拡散を使い、ゼロショットクローンを複数話者、実環境データ、歌声合成へ拡張することに重点を置きました。NaturalSpeech 3 はその規模を土台としつつ、類似度と独立した制御性を主な対象とし、因子分解コーデックと拡散手法によって話者類似度の新たな最先端スコアを達成しました。

NaturalSpeech 3 をダウンロードしたり実行したりできますか?

公式にはできません。Microsoft は公開コードや事前学習済みの重みをリリースしておらず、NaturalSpeech 2 とは違って、NaturalSpeech 3 固有のアーキテクチャを再現した定評あるコミュニティ実装も、この記事の執筆時点では広く利用できません。

NaturalSpeech 3 は初代 NaturalSpeech のように人間同等の品質を達成していますか?

公開された結果では、人間の録音と同等の品質を達成したと報告されています。シリーズ当初の人間同等品質という目標を、初代の単一話者ベンチマークから、はるかに難しいゼロショットかつ複数属性を制御できる環境へと広げています。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →