NaturalSpeech 2:一度も歌ったことのない声に歌わせるモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
NaturalSpeech 2 で最も際立つのは、次の点です。歌声も、メロディーも、音楽的な要素も一切ない、ただ誰かが話している数秒間の音声を与えるだけで、その同じ声がまったく別の曲を、音程もタイミングも合わせて歌う音声を生成できます。Microsoft が初代 NaturalSpeech の後継として開発したこのモデルは、前身よりはるかに難しい問題を解くために作られました。人間同等の品質を、スタジオで録音された一人の声から、任意の話者やスタイルへ、さらには結果的にまったく別種の発声表現へと拡張することです。
NaturalSpeech 2 は実際にどのような問題を解こうとしたのか?
初代 NaturalSpeech は、単一話者のスタジオ品質ベンチマークで人間同等の品質を達成できることを証明しました。同じ品質を、異なる話者の個性や韻律、歌唱のようなスタイルまで含む、大規模で多様な実環境データセットへ広げることは、実際にはまったく別の問題でした。当時の大規模 TTS システムの多くは、音声を離散 token に量子化し、自己回帰型言語モデルで一つずつ生成することでこの問題に取り組んでいました。VALL-E が広めたのと同じ大まかな手法です。しかしこの手法には、韻律が不安定になり、単語を飛ばしたり繰り返したりしやすい傾向があります。さらに、学習データの多様性が増えるほど音声品質が低下します。
NaturalSpeech 2 は構造的に異なる道を選びました。自己回帰的に予測する離散 token の代わりに、残差ベクトル量子化器を備えたニューラル音声コーデックで連続潜在ベクトルを生成し、入力テキストを条件とする潜在拡散モデルでそのベクトルを生成します。前身と同じ非自己回帰の思想を、はるかに難しく多様なデータ環境へ適用したものです。
ゼロショット生成を支える音声プロンプト機構
この規模でゼロショット生成を安定して機能させるため、NaturalSpeech 2 は専用の音声プロンプト機構を導入しました。潜在拡散モデルと、独立した長さ・音高予測器の両方で文脈内学習を可能にするために特別に設計されています。実際には、短い参照クリップは最終的な音声生成段階を条件付けるだけではありません。新しい内容のタイミングと音高輪郭をモデルがどう予測するかにも影響します。これは、パイプラインの一つの段階に話者埋め込みを追加するだけの設計とは、明確に異なります。
ゼロショット歌声合成の仕組み
これは NaturalSpeech 2 自身の副題にある「自然かつゼロショットの音声・歌声合成器」が指す能力です。ブラックボックスの余興として扱うのではなく、実際の仕組みを理解する価値があります。
モデルの学習データは、音声と歌声を合わせて約 44,000 時間まで拡大されました。歌唱部分はウェブから収集したボーカル録音で構成され、専用の音源分離処理によって背景音楽と伴奏を除去し、ASR に基づくチェックで位置合わせのずれたサンプルを排除しています。合計約 30 時間の歌声データをアップサンプリングし、より大規模な音声学習セットへ混合しました。
実際に歌唱を生成する際、モデルは既存の歌唱参照から正解の音高と長さの輪郭を借り、選択した音声プロンプトを適用して、特定の歌い手の音色でそのメロディーとタイミングを再現します。本当に注目すべき発見は、音声プロンプトが歌唱録音である必要はまったくないことです。話し声のプロンプトだけで、NaturalSpeech 2 はその話者の音色による新しい歌声を生成できます。これにより、参照話者が実際に行った録音が存在しない表現形式へ、ゼロショット生成が拡張されました。
性能
未知の話者を対象としたゼロショット評価で、NaturalSpeech 2 は韻律と音色の類似度、堅牢性、音声全体の品質において、従来の大規模 TTS システムを大幅に上回りました。LibriSpeech と VCTK のテスト条件では参照プロンプトに対して特に高い韻律類似度を示し、わずか 3 秒のプロンプトでも十分に良好な結果を維持しました。
現在 NaturalSpeech 2 を試すには
初代 NaturalSpeech と同様に、Microsoft は NaturalSpeech 2 の公式コードも学習済みの重みも公開していません。公開されているのは、研究論文とプロジェクトのデモページにある音声サンプルです。コミュニティの取り組みがその空白を埋めていますが、重要な注意点があります。
lucidrains/naturalspeech2-pytorchの再実装を確認する。 これは論文で説明されたアーキテクチャを PyTorch で実装した、活発に開発中のプロジェクトです。ニューラルコーデックとして EnCodec を中心に構築され、生成処理にノイズ除去拡散を使用します。- これは学習済みモデルではなく、ゼロから学習するためのフレームワークだと理解する。 研究だけが公開されたモデルのコミュニティ再現版の多くと同様に、独自のデータセットと学習が必要です。論文で報告された品質をそのまま提供する公式またはコミュニティ学習済みの checkpoint はありません。
- 利用を前提にする前に、プロジェクト自体の開発状況を確認する。 ドキュメントには、学習中の長さ・音高予測の改良や、注意機構のさらなる改善など、作業中の項目が記載されています。完成した安定版ではなく、発展途上の研究ツールとして扱ってください。
- 歌声合成が具体的な目標なら、独自の歌唱データセットを用意する。 NaturalSpeech 2 の歌唱能力は、慎重に収集・選別したウェブ由来のデータを、はるかに大きな音声コーパスへ混ぜることで得られました。その結果を再現するには、一般的な音声データセットで学習するだけではなく、同じように計画的なデータ収集が必要です。
NaturalSpeech 2 を理解するためのポイント
- 評価するときは二つの主要な主張を分ける。 大規模なゼロショット音声クローンと、話し声だけのプロンプトによるゼロショット歌声合成は、それぞれ別の、単独でも注目すべき成果です。自分のユースケースに本当に関係するものを判断するとき、両者を混同しないでください。
- 離散 token 言語モデリングに対する、アーキテクチャ上の逆張りを理解する。 NaturalSpeech 2 が、VALL-E のような同時代のモデルが使う離散コーデックと自己回帰型言語モデルの組み合わせではなく、連続潜在拡散を選んだのは、後者が生み得る不安定性と単語の脱落への直接的な対応です。アーキテクチャを幅広く評価するなら、有用な比較点になります。
- 研究や再現では、プロンプトの長さを重視する。 研究では、プロンプトの長さに応じて韻律類似度がどう変化するかを、3 秒、5 秒、10 秒のプロンプトで具体的に測定しました。一般に長いプロンプトほど一致度の高い結果になっています。類似の手法を応用するなら考慮すべき細部です。
- 責任ある AI という枠組みを、定型文ではなく実際の制約として扱う。 この手法は、まったく異なる表現場面である歌唱でも声のアイデンティティを非常に効果的に再現できます。そのため、Microsoft が説明する同意と検出の安全対策は、単に読み飛ばす法律表現ではなく、類似技術を責任をもって使うあらゆる場面に直接関係します。
NaturalSpeech 2、NaturalSpeech、VALL-E の比較
| NaturalSpeech 2 | NaturalSpeech(初代) | VALL-E | |
|---|---|---|---|
| 中核的な手法 | 連続潜在表現 + 潜在拡散 | VAE ベースのエンドツーエンド方式 | 離散コーデック token + 自己回帰型言語モデル |
| 最も適した場面 | 複数話者、ゼロショット、実環境、歌唱 | 単一話者、スタジオ品質 | 短いプロンプトからのゼロショットクローン |
| 歌声合成 | 対応、ゼロショット、話し声だけのプロンプトでも可能 | 主眼ではない | 主眼ではない |
| 学習規模 | 約 44,000 時間(音声 + 歌声) | より小規模な単一話者ベンチマーク | 約 60,000 時間 |
| 既知の堅牢性の問題 | 離散 token の不安定性を避けるために特別に設計 | 非自己回帰のため該当しない | 反復・不安定性は後の VALL-E 2 で対処 |
| 公式公開版 | なし(研究デモのみ) | なし(コミュニティ再実装のみ) | なし |
NaturalSpeech 2 の真の貢献は、VALL-E が広めた離散 token・自己回帰の道だけがゼロショット TTS を拡張する方法ではないと示したことです。連続潜在拡散の手法は、堅牢性と品質でそれに並ぶか上回り、さらにモダリティをまたぐ音声表現転移という真に新しい能力を実現できました。
よくある質問
NaturalSpeech 2 は、一度も歌ったことがない人を本当に歌わせられますか?
はい。公開された研究によると、話し声のプロンプトだけを使い、その話者の音色で新たな歌唱を生成することは、明確に強調され、検証された能力の一つです。
NaturalSpeech 2 は NaturalSpeech とどう違いますか?
初代 NaturalSpeech は、単一話者のスタジオ品質合成を中心に研究・評価されました。NaturalSpeech 2 は、はるかに難しい大規模・複数話者・ゼロショット・実環境での合成を対象とし、初代の VAE ベース設計ではなく潜在拡散の手法を使います。
Microsoft は、なぜ VALL-E のような自己回帰型言語モデルではなく拡散を使ったのですか?
離散音声 token を自己回帰的に生成すると、特に大規模環境では韻律の不安定化や単語の脱落・反復が起こることがあります。NaturalSpeech 2 の連続潜在拡散は、こうした失敗モードを避けるために特別に設計されました。
NaturalSpeech 2 には音声クローンの同意に関する懸念がありますか?
はい。Microsoft はこの問題を直接取り上げています。研究は、ユーザーが対象話者になることへ同意しているという前提で実施され、実環境への導入には同意プロトコルと合成音声検出の安全対策が必要だと説明されています。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。