EchoraEchora
モデル一覧に戻る

YourTTS:異なる2つの仕事を、1つのモデルで

2026年9月8日
•
7分で読めます

テキストと録音を、聴ける作品に

ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。

  • テキスト読み上げも、ボイスクローンも
  • ステムを分離、またはカバーを生成
  • 登録して試聴。聴いてから決められる
無料で作り始める

未知の声で新しい音声を生成することと、既存の録音を別の話者の声に変換することは、関連する問題のように思えます。しかし、ほとんどのTTSシステムはその一方しか行えないように作られています。Coquiの研究者が開発したYourTTSは、同じ基盤モデルでゼロショット・マルチスピーカー音声合成とゼロショット音声変換の両方を行うために作られました。そして、ゼロショット・マルチスピーカーTTSに真の多言語手法を持ち込んだ、初の発表済みアプローチとなりました。

YourTTSとは?

YourTTSは、Edresson CasanovaとCoquiの同僚が開発した研究モデルで、VITSアーキテクチャを土台としています。VITSは、変分オートエンコーダー、敵対的学習、正規化フローを組み合わせ、音響モデルとボコーダーを別々の段階に分けることなく、テキストから波形を直接生成するエンドツーエンドモデルです。YourTTSは、このVITSの基盤にいくつかの具体的な変更を重ね、ゼロショット、多言語、マルチスピーカー生成に特化して調整されています。

VITSをベースにした実質的な変更

2つの設計上の選択は、従来研究の段階的な調整ではなく、本質的な転換として際立っています。第一に、YourTTSは音素ではなく生のテキストを入力に使います。従来のシステムは一般に音素化へ依存していました。音素化は、成熟した高品質な書記素・音素変換ツールがある言語ではうまく機能しますが、そのようなツールがない言語では性能にばらつきが生じます。生のテキストを直接扱えば、この依存関係を回避できます。これは特に、低リソース言語へ手法を拡張するうえで重要です。第二に、専用の話者エンコーダーが各学習発話から話者埋め込みを抽出し、モデルの条件付けに使います。さらに、生成音声から抽出した埋め込みと元話者の埋め込みをコサイン距離で比較するSpeaker Consistency Lossとともに学習します。つまり、単に理解できる音声を出すのではなく、実際に対象話者らしく聞こえるようモデルを直接最適化します。

明確に異なる2つの能力

ゼロショット・マルチスピーカーTTSは、短いサンプルから計算した参照埋め込みだけを使い、モデルが学習したことのない声で新しい音声を生成します。ゼロショット音声変換は、それと関連しつつも本質的に異なるタスクです。既存の音声録音を受け取り、元の内容を保ったまま対象話者の声へ変換します。新しいテキストを生成するのではなく、すでに話された内容を変換するのです。YourTTSは、第一のタスクで最先端の結果を、第二のタスクで最先端に匹敵する結果を達成しました。いずれもVCTKベンチマークで測定されています。だからこそ、単にTTSモデルへ音声変換機能を付け加えたのではなく、真に2つの用途を持つシステムだと言えます。

低リソース言語への確かな貢献

YourTTSは、目立つベンチマーク値以外にも、特に有用な成果を示しました。学習時に対象言語の話者データが1人分しかなくても、その言語で有望なゼロショット結果を得たのです。公開された学習設定は、これを端的に示しています。英語話者は1,000人以上使われた一方で、フランス語話者は5人、ポルトガル語話者はわずか1人でした。そこで言語バッチバランサーが、少数言語へ学習バッチを意図的に多く割り当て、不均衡を補いました。これほど偏ったデータセットから実用的な多言語・マルチスピーカーシステムが生まれたことは、英語ほど話者の多様な大規模データセットを持たない言語にも、この手法がゼロショットTTSと音声変換を広げられる可能性を示す具体的な証拠です。

難しい声に対応するファインチューニング

声や録音の特徴が学習データのどれとも大きく異なる話者に対して、YourTTSは1分未満の追加音声によるファインチューニングをサポートします。こうした難しいケースでも、声の類似度で最先端の結果を達成したと報告されています。珍しいアクセント、特殊な条件での録音など、ベースモデルのゼロショット能力では十分にカバーされていない素材を扱う際に、実用上重要な機能です。

YourTTSを使い始める

最も直接的な方法は、Coqui TTSライブラリのコマンドラインインターフェースを使うことです。YourTTSモデル、対象話者の参照ファイル、音声変換で必要に応じて使う内容参照ファイル、言語コードを指定すれば、ライブラリがモデルの読み込みと推論を処理します。元の研究リポジトリではリンクが切れているため、現在、動作するチェックポイントを入手するには、元論文のGitHubページではなくCoqui TTS、または活発に保守されているコミュニティフォークからモデルを取得するほうが確実です。

より良い結果を得るためのヒント

  • 実際に行うタスクを明確にしてください。 ゼロショットTTS(新しいテキスト、新しい声)と音声変換(既存の音声、新しい声)では、YourTTSの使い方が異なります。ワークフローの取り違えは混乱を招く一般的な原因なので、パイプラインを設定する前にプロジェクトで必要な方を決めてください。
  • 対象の声が特殊な場合はファインチューニングしてください。 元話者のアクセントや録音特性が独特で、一般的な学習データに十分含まれていない場合、ゼロショットだけで完璧に処理できると期待せず、文書に記載された1分未満のファインチューニング工程を見込んでください。
  • 元のリポジトリではなく、コミュニティが保守するCoqui TTSフォークを使ってください。 Coquiが2024年に閉鎖した後、Edressonの元のGitHubページではリンクが切れています。活発に保守されているライブラリのフォークが、動作するモデルを入手するうえでより信頼できる情報源です。
  • 実在する人物の声をクローンまたは変換するときは、同意を尊重してください。 YourTTSのクローン機能が音声認証の詐称に利用されうることを示した研究が報告されています。特定の人物の声を使う現実の導入では、その人物の明示的な許可が必要だと考えてください。

YourTTSと関連するCoqui・音声転送モデルの比較

YourTTSXTTS-v2VoiceCraft
ゼロショット・マルチスピーカーTTS対応、発表時点で最先端対応対応
ゼロショット音声変換対応、発表時点で最先端に匹敵主目的ではない非対応(代わりに編集が中心)
ベースアーキテクチャVITS + 話者エンコーダー + Speaker Consistency LossGPT-2型自己回帰 + VQ-VAE因果マスキング + 遅延スタッキングによる自己回帰
多言語アプローチこの研究分野で初17言語英語中心
テキスト入力生のテキスト(音素化器に依存しない)標準的なテキスト処理標準的なテキスト処理
現在の保守Coqui TTSのコミュニティフォーク経由Coqui TTSのコミュニティフォーク経由元の作者が活発に保守

YourTTSは、この系譜において、多言語ゼロショット・マルチスピーカーTTSが実現可能であることを確立した初期のCoqui研究という位置を占めます。その成果を後のXTTSモデルがさらに発展させる一方で、YourTTS自体は、音声変換を後付けではなく第一級の能力として扱った点で今も独自性を保っています。

よくある質問

YourTTSのTTSモードと音声変換モードは何が違いますか?

TTSモードはテキストから対象の声で新しい音声を生成します。音声変換は既存の録音を受け取り、元の発話内容を保ったまま対象話者の声に変換します。同じモデルが扱う、関連しながらも異なる2つのタスクです。

YourTTSは今でも利用できますか?

はい。主にCoqui TTSライブラリと、活発に保守されているコミュニティフォークを通じて利用できます。Coqui AIが2024年に閉鎖され、元のホスティングサーバーが消去されたため、元の研究リポジトリにあるモデルのダウンロードリンクは切れています。

YourTTSで声をクローンするには、どのくらいのデータが必要ですか?

ゼロショットクローンは短い参照サンプルだけで機能し、ファインチューニングは不要です。学習データと大きく異なる声については、1分未満の追加音声でファインチューニングすると、類似度が明らかに向上すると文書で報告されています。

YourTTSを開発したのは誰ですか?

YourTTSはEdresson CasanovaとCoquiの共同研究者によって開発され、ICML 2022で発表されました。

YourTTSは無料で使えますか?

オープンソースのCoqui TTSライブラリを通じて利用できます。Coqui AIの閉鎖後に生まれたコミュニティ保守のフォーク間でライセンスの詳細が異なる可能性があるため、実際に使うパッケージやフォークの現行ライセンス条件を確認してください。

既存の録音を別の声に変換

話している内容や表現を保ちながら録音の声を変えたい場合は、Echoraのボイスチェンジャーを利用できます。音声録音をアップロードし、内蔵の変換先音声または使用許可を得た参照音声を選ぶと、ブラウザで変換後の音声を生成できます。

録音の声を変換 →