EchoraEchora
モデル一覧に戻る

StyleTTS 2:リスナーが合成音声を本物の録音より自然と評価したモデル

2026年8月31日
•
約7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

TTSモデルが「ほぼ人間のように聞こえる」という主張は、今では背景雑音のように感じられるほど一般的です。初代StyleTTSを開発したコロンビア大学の同じチームによるStyleTTS 2は、より具体的で検証しやすい主張を示しました。単一話者のLJSpeechデータセットを使った聴取評価で、英語を母語とするリスナーは、その合成出力を、学習に使われた実際の人間の録音より自然だと評価したのです。複数話者のVCTKデータセットでは、人間の録音を上回るのではなく同等でした。より難しく多様なタスクでは控えめな結果ですが、それでも注目に値します。

初代StyleTTSから変わった点

StyleTTS 2は、スタイルを生成から明示的に分離された制御可能な要素として扱うという前身の中核的な考え方を引き継ぎつつ、スタイルの取得方法を変更し、新たなフィードバック源を中心に学習プロセスを再構築しています。

参照クリップから抽出するのではなく、拡散によってスタイルをサンプリング。 初代StyleTTSでは、スタイルエンコーダーでスタイルベクトルを抽出するために、参照用のメルスペクトログラムが必要でした。StyleTTS 2では、スタイルを拡散によって生成される潜在確率変数としてモデル化します。そのため、参照音声がまったくなくても、与えられたテキストに適した自然なスタイルを生成できます。これが2つのバージョン間で最も大きな実用上の変化です。StyleTTS 2なら、表現豊かで多様な出力を得るために音声サンプルを用意する必要がありません。

大規模音声言語モデルを識別器として利用。 StyleTTS 2は、従来型の識別器だけで学習するのではなく、WavLMを含む大規模な事前学習済み音声言語モデルを導入し、生成音声がどれほど説得力のある人間らしさを持つかを判定します。さらに、システム全体を別々の段階ではなくend-to-endで学習できる、新しい微分可能な長さモデリング手法を組み合わせています。

アブレーションの数値:本当に重要だったもの

StyleTTS 2の研究では、これらの設計が有効だと主張するだけでなく、比較平均オピニオン評点(CMOS)テストを用いて、それぞれの寄与を個別に測定しました。コンポーネントを1つずつ除去し、知覚される自然さを再評価しています。

  • スタイル拡散を除去し、代わりにランダムな参照スタイルベクトルを使用すると、テスト対象の中で最大の品質低下が生じました。これは、テキスト依存のスタイル拡散が人間レベルの出力にどれほど大きく貢献しているかを最も明確に示しています。
  • 微分可能な長さアップサンプラーの除去と、WavLMベースの識別器の除去は、それぞれ単独でも大幅な品質低下を引き起こしました。新しい2つのアーキテクチャ要素は、片方だけでなく両方が実際に機能していたことが確認できます。
  • 韻律スタイルエンコーダーを完全に除去した場合も、自然さは測定可能なほど損なわれました。これは、初代StyleTTSの基盤であるスタイルベクトルの概念が、新しい拡散アプローチに単純に置き換えられたのではなく、今も実質的な貢献要素であることを裏付けます。
  • 特に分布外テキストを敵対的学習から除外すると、未知の入力に対するモデルの堅牢性が低下しました。テストした要素の中では最小ですが、それでも意味のある影響です。

Zero-shot話者適応

LibriTTSで学習したStyleTTS 2は、特にzero-shot話者適応において、それまで利用できたオープンモデルを上回りました。短い参照クリップだけを基に、モデルが一度も遭遇したことのない声でも説得力のある音声を生成します。拡散ベースのスタイルサンプリングと組み合わせることで、StyleTTS 2は2つの独立した方法で変化を加えられます。参照音声がなくても新しい発話スタイルを作り、参照クリップがある場合は話者のアイデンティティをクローンできます。

始める前に知っておきたいこと

StyleTTS 2を実際に動かすうえで、いくつかの実用的な詳細が重要です。

最高品質の推論にはGPLライセンスのコンポーネントが必要。 ライセンス上の理由から、メインリポジトリには直接同梱されていません。GPLライセンスのコミュニティforkには、実験的なストリーミングAPIを含むimport可能な推論スクリプトがあります。一方で、gruutフォネマイザーを使う完全なMITライセンスの別パッケージも存在しますが、フォネマイザーとgruutの不一致により、出力品質は多少低くなります。

古いGPUでは聞き取れるアーティファクトが発生することがある。 浮動小数点精度の違いによって、古いグラフィックカードで高音の背景ノイズが生じる既知の問題があります。文書化された回避策は、より新しいGPUを使うか、CPU推論に切り替えることです。

英語以外の合成には対応するPL-BERTモデルが必要。 StyleTTS 2は他の言語でも学習できますが、その言語専用の事前学習済みPL-BERTモデルが必要です。この目的に使える、14言語をカバーしたコミュニティ学習の多言語PL-BERTが提供されています。

ここでの音声クローンには同意が求められる。 元のオープンアクセス学習データセットに含まれない話者を参照して事前学習済みモデルを使う場合、プロジェクトの利用規約では、その話者から許可を得るか、結果の音声を公開する前に合成音声であることを明確に開示するよう求めています。

StyleTTS 2を始める方法

  1. リポジトリをクローンします。 公式のyl4579/StyleTTS2プロジェクトをgit cloneし、求める品質とライセンス上の制約に応じて、MITライセンスの推論経路かGPLライセンスのforkを選びます。
  2. 事前学習済みLibriTTSチェックポイントをダウンロードします。 Hugging Faceで入手でき、zero-shot話者適応と汎用生成の両方に推奨される出発点です。
  3. 拡散サンプリングのパラメータを設定します。 推論ではalpha、beta、diffusion_steps、embedding_scaleなどのパラメータを利用できます。サンプラーはancestral方式なので、拡散ステップを増やすと生成は遅くなる一方、サンプルの多様性が高まります。用途で多様性と速度のどちらが重要かに応じて調整してください。
  4. まず付属のデモnotebookで実際の音を確認します。 リポジトリの推論notebookは、モデルが公開しているデモサンプルを再現し、real-time factorを直接計算します。自分のハードウェアで具体的な速度基準を得られます。
  5. GPUの世代を期待する出力品質に合わせます。 予想外の高音アーティファクトが発生した場合は、設定ミスだと判断する前に、古いGPUで動かしていないかを確認してください。
  6. 英語以外の出力が必要なら、先にPL-BERTを準備します。 学習を始める前に、対象言語向けの事前学習済みPL-BERTモデルが存在することを確認するか、コミュニティの多言語PL-BERTを使用してください。途中で要件に気づく事態を避けられます。

より良い結果を得るためのヒント

  • 拡散ステップを増やすのは多様性のためで、品質だけのためではありません。 ステップを増やすと、同じテキストの生成ごとの差が広がります。複数の異なるテイクが欲しいときには有用ですが、速度が重要なら既定で最大にするような設定ではありません。
  • 出力品質を優先し、ライセンス上問題がなければGPLライセンスのforkを使います。 MITのみの経路はライセンスの柔軟性のために用意されており、品質とのトレードオフが明示されています。プロジェクトでどの制約が重要かを踏まえて意図的に選んでください。
  • 導入を決める前に、対象とする具体的な声でzero-shotクローンを試します。 公開結果で強力なzero-shot適応が示されているのは、特にLibriTTSベンチマークです。すべての声で一様な性能が得られると仮定せず、自分の参照話者で品質を検証してください。
  • 「人間の録音を上回る」という主張は、実際の文脈で捉えます。 これは単一話者のLJSpeechデータセットを使った特定の聴取評価の結果です。複数話者のVCTKでは人間の録音に勝ったのではなく同等で、より難しい複数話者タスクとしては典型的でありながら、依然として印象的な結果です。
  • クローン音声に関する開示と同意の要件を守ります。 これは単なる法的な形式ではありません。特に出力が非常に説得力を持ち得ることを考えると、真剣に扱うことは技術を責任を持って使う一部です。

StyleTTS 2、StyleTTS、その他のクローンモデルの比較

StyleTTS 2StyleTTS(初代)XTTS-v2
スタイルのソース拡散でサンプリング、参照不要スタイルエンコーダーで参照音声から抽出参照クリップベースの話者潜在表現
識別器大規模音声言語モデル(WavLMなど)標準的な敵対的識別器N/A(異なるアーキテクチャ)
Zero-shot話者適応前身より向上対応17言語に対応
報告された自然さLJSpeechで人間の録音を上回り、VCTKでは同等高水準、この主張より前に登場高水準、人間の録音との直接ベンチマークなし
学習方法End-to-end、微分可能な長さモデリング複数モジュール、敵対的GPT型の自己回帰
多言語コミュニティのPL-BERTモデル経由英語中心17言語に標準対応

StyleTTS 2の中核的な進歩は、表現豊かなスタイルを作るうえで参照音声への依存をなくしながら、少なくとも1つの標準ベンチマークで人間の録音に並ぶか上回るほど自然さを高めた点です。「人間に近い」という表現が曖昧に使われがちな分野では、極めて珍しく、具体的で、独立に検証できる主張です。

よくある質問

StyleTTS 2は本当に人間の録音より良く聞こえますか?

特定の評価では、英語を母語とするリスナーは、単一話者のLJSpeechデータセットにおけるStyleTTS 2の出力を、実際の人間の録音より自然だと評価しました。より難しい複数話者のVCTKデータセットでは、人間の録音を上回るのではなく同等でした。どちらも注目すべき結果ですが、普遍的な主張として扱わず、具体的な評価の文脈を意識する必要があります。

StyleTTS 2を使うには参照音声クリップが必要ですか?

一般的に表現豊かで自然な音声を生成するだけなら必要ありません。参照音声なしでも拡散によってスタイルをサンプリングできます。特定話者のzero-shot音声クローンには、参照クリップが引き続き役立ちます。

リポジトリがGPLライセンスの問題に触れているのはなぜですか?

最高品質の推論はGPLライセンスのコンポーネントに依存するため、MIT形式のメインリポジトリには直接同梱されていません。最高品質を得るにはGPLライセンスのコミュニティforkを使うか、多少の品質低下と引き換えにgruutフォネマイザーを使う完全なMITライセンスの代替版を利用できます。

StyleTTS 2は英語以外の音声も生成できますか?

はい。対象言語向けの事前学習済みPL-BERTモデルが必要です。コミュニティで学習された多言語PL-BERTはすでに14言語をカバーしており、それ以外の言語向けに独自モデルを学習することもできます。

一部のユーザーが報告する高音ノイズの原因は何ですか?

古いGPUハードウェアにおける浮動小数点精度の違いに関連する既知のアーティファクトです。より新しいGPUを使うか、CPU推論に切り替えると解消します。

Echoraでテキストを音声に変換

テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。

テキストから音声を生成 →