XTTS-v2:開発元が消えた後も生き続ける音声クローンの基準
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
多くのオープンソースモデルは、ほかの何かと比べられるより先に XTTS-v2 と比較されます。開発元の Coqui AI が2024年初頭に完全閉鎖したことを考えると、これはモデルとして異例の立ち位置です。それでも XTTS-v2 はその評価を定着させました。開発元が消えても存在感がほとんど揺らがないほど優れた、多言語ゼロショット音声クローンシステムです。
XTTS-v2 とは
XTTS-v2 は Coqui AI が開発したオープンソースの多言語テキスト読み上げ・音声クローンモデルで、元の XTTS アーキテクチャを改良したモデルとして2023年に公開されました。わずか6秒の参照音声から話者の声をクローンでき、アラビア語、ブラジルポルトガル語、中国語(標準中国語)、チェコ語、オランダ語、英語、フランス語、ドイツ語、イタリア語、ポーランド語、ロシア語、スペイン語、トルコ語、日本語、韓国語、ハンガリー語、ヒンディー語の17言語に対応します。
アーキテクチャの面では、XTTS-v2 は拡散ベースではなく GPT ベースです。同じ分野にある新しい flow matching モデルとの間に、意味のある違いがあります。まず VQ-VAE が正解音声を離散的な音響コードへ変換し、それを学習目標として使います。続いて GPT-2 スタイルの言語モデルが、入力テキストと話者の潜在表現を条件として音声トークンを予測します。この潜在表現は Perceiver ベースのエンコーダーが参照メルスペクトログラムを処理し、話者の個性を捉えたコンパクトなベクトルとして算出したものです。最後に HiFi-GAN ボコーダーがトークン列を 24kHz の音声波形へ変換します。
元の XTTS から改善された点
バージョン2の変更は、クローンがデモでそれらしく聞こえるだけでなく、実際の運用で信頼できるようにする領域へ的確に集中しています。具体的には、話者条件付けの改善、複数の参照クリップと話者間の補間への対応、全体的な韻律と音質の向上、そして初期版と比べて明確に高まった推論の安定性です。元モデルの言語横断クローン機能も引き継いでおり、ある言語で参照クリップを録音し、話者の声の個性を保ちながら別の言語で自然な音声を生成できます。また、個別に手動調整するコントロールではなく、参照エンコーダーを通じて感情とスタイルが自動的に転写されます。
独立したテストでは、完全なゼロショット条件で話者類似度スコア(SECS)が約 0.59、さらに約10分の追加データでファインチューニングすると約 0.72 まで向上すると報告されています。ゼロショットクローンだけでプロジェクトに十分なのか、特定の声でファインチューニングする追加工程に価値があるのかを判断するうえで、役立つ基準です。
Coqui の閉鎖が実際に意味すること
XTTS-v2 を使って何かを構築する前に、この点は明確に理解しておく価値があります。元 Mozilla DeepSpeech エンジニアが設立したベルリンのスタートアップ Coqui AI は2024年1月に閉鎖し、ホスティング型の Coqui Studio と Coqui API を完全に終了しました。会社は買収されることなく事業を終え、元の GitHub リポジトリも創業チームによる正式な開発が行われなくなっています。
実際のところ、変わったことは予想ほど多くありません。コードとモデルの重みは今も完全に公開され、ダウンロードできます。活発なコミュニティフォーク(idiap/coqui-ai-TTS)が、元のメンテナーが対応できなかった問題を修正しながら、現在の Python と PyTorch との互換性を維持しています。元の TTS パッケージをインストールして新しい Python でエラーが出た場合は、代わりにコミュニティフォークのパッケージを導入すると、その大半を解決できます。実務上の欠点は公式サポート窓口がなくなったことです。そして実質的に大きく変わったのはライセンスです。Coqui は以前、非商用の XTTS-v2 モデルの重みに対する商用ライセンスを販売していましたが、会社が存在しない今、その有料商用ライセンスという選択肢は事実上なくなりました。
XTTS-v2 の使い方
- 新しい Python を使っている場合は、コミュニティが保守するパッケージをインストールします。 活発に保守されているフォークの
pip install coqui-ttsは、最近の PyTorch と Python 3.10–3.12 の組み合わせでは、元のpip install TTSパッケージより一般的に安定しています。 - どちらの場合も同じ API でモデルを読み込みます。
from TTS.api import TTSに続けてTTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)を実行する方法は、どちらのパッケージをインストールしても同じです。 - PyTorch 2.6 のセキュリティ制限に注意します。 新しい PyTorch は、デフォルトの
weights_only=True設定では XTTS-v2 独自のXttsConfigクラスをブロックします。モデルを読み込む前にtorch.serialization.add_safe_globalsで明示的に許可しないと、生成は読み込み段階で失敗します。 - クローン音声を生成します。
tts.tts_to_file(text="your text", speaker_wav="reference.wav", language="en", file_path="output.wav")だけで、基本的なゼロショットクローンの流れを数行で実行できます。 - デプロイ前に VRAM を確認します。 基本的な推論には最低でも約 3GB の GPU VRAM が必要です。本番環境で安定してリアルタイムより速く生成するなら、8GB 以上あれば長い合成処理中のメモリ問題を避けられます。
- ゼロショットの品質で足りなければファインチューニングします。 元の Coqui チームが正式な保守を終了した後も、コミュニティフォークはファインチューニングに必要な学習スクリプトを維持しています。全面的なサポートがある商用製品より、手作業の多いセットアップが必要だと考えてください。
より良い結果を得るためのヒント
- ノイズがなく、適切に録音された6秒以上の参照クリップを使います。 クローン品質は録音条件に直接左右されます。参照音声の背景ノイズや歪みは、一部の新しいアーキテクチャよりも目立って忠実度を下げます。
- 安定した声の個性を得るため、複数の参照クリップを試します。 XTTS-v2 は複数の話者参照とその間の補間に対応しているため、短いクリップ1つだけを使うより一貫した声を生成できます。1回の録音では明瞭に捉えにくい声で特に効果的です。
- 言語をまたぐ品質への期待値は声ごとに設定します。 学習データでの代表性が低い声は、一般的な声のプロフィールより話者類似度が低くなる場合があります。本番パイプラインを決める前に、対象の声と言語の組み合わせを実際にテストしてください。
- 有料製品を出荷する前に、商用ライセンスの経路を確認します。 Coqui の元の商用ライセンスは現在販売されていないため、現行の Coqui Public Model License の条件を慎重に確認してください。商用デプロイが目的なら、Apache 2.0 や MIT など、より寛容なライセンスのモデルも検討できます。
- 気軽な実験を超える用途では、コミュニティフォークを優先します。 元のリポジトリの保守が縮小しているため、長く続けるプロジェクトには、活発にパッチが適用されるフォークのほうが信頼できる土台になります。
XTTS-v2 とほかのゼロショットクローンモデルの比較
| XTTS-v2 | F5-TTS | Chatterbox Multilingual | |
|---|---|---|---|
| アーキテクチャ | GPT-2 スタイルの自己回帰 + VQ-VAE | Diffusion Transformer + flow matching | 拡散ベース |
| 参照クリップの長さ | 約6秒 | 約5〜15秒 | 約5〜10秒 |
| 言語 | 17 | 主に英語向け | 23 |
| 複数の参照クリップ / 補間 | 対応 | 中核機能ではない | 中核機能ではない |
| 公式の保守 | なし(コミュニティフォークのみ) | あり | あり |
| 重みのライセンス | Coqui Public Model License(非商用) | CC-BY-NC | MIT |
XTTS-v2 が長く支持されているのは、オープンな選択肢がほとんどなかった時期に、多言語ゼロショットクローンへの早期かつ本当に堅実な答えを示したからです。そのアーキテクチャと言語対応は十分に時代を乗り越え、開発元が消えて何年たっても標準的な比較対象であり続けています。
よくある質問
Coqui AI は今も XTTS-v2 を開発していますか?
いいえ。Coqui AI は2024年1月に会社として閉鎖しました。コードとモデルの重みは今も公開され、活発に保守されるコミュニティフォークによって現在のソフトウェアでも動作しますが、Coqui 公式のサポートや開発はもうありません。
XTTS-v2 は今も商用利用できますか?
慎重な対応が必要です。基盤となる TTS ライブラリのコードは商用利用しやすい Mozilla Public License 2.0 ですが、XTTS-v2 のモデルの重み自体は非商用の Coqui Public Model License で公開されています。Coqui は以前、重みに対する商用ライセンスを別途販売していました。しかし会社が存在しないため、その有料オプションはもう利用できません。商用利用の前に、必ず現行のライセンス条件を直接確認してください。
XTTS-v2 のクローンにはどれくらいの参照音声が必要ですか?
最短6秒です。ただし独立したテストでは、特定の声について約10分の音声を追加してファインチューニングするなど、データを増やすことで話者類似度がさらに向上しています。
新しい Python や PyTorch でインストールが失敗することがあるのはなぜですか?
元の TTS パッケージは新しい環境で互換性の問題が起きる場合があります。コミュニティが保守する coqui-tts フォークをインストールすれば、その大半を解決できます。また、PyTorch 2.6+ では XTTS-v2 独自の設定クラスを読み込むために、torch.serialization.add_safe_globals を明示的に呼び出す必要があります。
XTTS-v2 は F5-TTS や CosyVoice3 などの新しいモデルと比べてどうですか?
XTTS-v2 は今も競争力のある多言語対応と安定したクローン品質を備えていますが、公式開発は継続していません。また、新しいモデルの中には遅延がより短いものや、より寛容なライセンスを採用するものもあります。最先端の速度より、幅広い言語対応とコミュニティで検証された安定性を重視する場合に、今も有力な選択肢です。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。