CosyVoice3:あらゆるアクセントに応えるモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
CosyVoice2 は、初回パケット遅延 150ms のストリーミング合成によって遅延の課題を解決し、リアルタイム音声チャットで利用できるようになりました。一方、対応範囲の広さには課題が残っていました。中国語話者向けの音声製品には標準中国語だけでなく、広東語、四川方言、上海語、さらに十数種の地域アクセントが必要です。それがなければ、地域らしさのない画一的な声になってしまいます。CosyVoice3 は、この課題に対する Alibaba FunAudioLLM の答えです。同じストリーミング基盤をさらに多くの言語と中国語方言へ拡張し、再トレーニングなしで発音を修正する新しい方法も加えました。
CosyVoice3 の新機能
CosyVoice3(Fun-CosyVoice3-0.5B として公開)は、CosyVoice2 と同じ 0.5B パラメータ規模を維持した改良版で、ゼロから作り直したモデルではありません。前世代でチームが特定した3つの弱点、コンテンツの一貫性、話者類似度、韻律の自然さに狙いを定めています。Alibaba が公開したベンチマークによると、その結果、同じコンパクトなパラメータ数を維持しながら、より大規模な複数の競合システムを上回るモデルとなりました。
方言と言語の対応範囲を大幅に拡大
これが最大の変更点であり、CosyVoice3 がマイナーアップデートではなく独立したリリースとして存在する理由です。CosyVoice3 は、中国語、英語、日本語、韓国語、ドイツ語、スペイン語、フランス語、イタリア語、ロシア語の9言語に対応します。さらに、広東語、四川方言、上海語、東北官話、陝西、山西、天津、山東、寧夏、甘粛の各方言を含む、18を超える中国各地の方言とアクセントを扱えます。単一の checkpoint でここまで細かな方言差に対応するオープンソース TTS モデルは多くありません。一種類の「標準中国語」の声では、聞き手が実際に使う地域アクセントを自然に再現できないため、この特長によって CosyVoice3 は中国市場向け製品に特に適しています。
発音修正(Pronunciation Inpainting)
CosyVoice3 は、以前のバージョンにはなかった機能を導入しました。正しい Pinyin または音素列を直接与えることで、特定の誤読単語(一般的には中国語の多音字や珍しい用語)を、モデルの再トレーニングやファインチューニングなしで修正できます。1つの読み間違いがクリップ全体の信頼性を損ないかねない医療、法律、技術コンテンツなどの本番用途では、これまで対処が難しかった誤読を直接修正できるようになります。
クロスリンガル音声クローンの改善
中国語の参照クリップから音声をクローンして自然な英語を生成すること(またはその逆)は以前のバージョンでも可能でしたが、CosyVoice3 はこの場面を明確な改善対象としました。チームが掲げた目標は、参照言語と生成言語が一致しない場合にも、話者らしさをより確実に維持することです。
ベンチマーク結果
Alibaba が公開した評価では、CosyVoice3 は自社の前世代モデルと、より大規模なサードパーティモデルの両方に対して優位な結果を示しています。
- RL で調整したバリアントの中国語文字誤り率は 0.81%。F5-TTS の 1.52%、VibeVoice-1.5B の 1.16% より低く、CosyVoice3 のパラメータ数は VibeVoice のおよそ3分の1です。
- **英語の単語誤り率は 1.68%**で、ここでも F5-TTS(2.00%)と VibeVoice-1.5B(3.04%)を上回ります。
- 話者類似度は中国語で 78.0%、英語で 71.8%。中国語の数値は、同じ評価で実際に人間が再録音した音声による類似度ベンチマークを上回ったと報告されています。
実用上の要点は、パラメータ数が決定要因ではないということです。CosyVoice3 の優位性は、単に規模を拡大した結果ではなく、より優れた token 表現、改善されたトレーニング、対象を絞った方言データといった具体的なアーキテクチャ改良から生まれています。
CosyVoice3 の始め方
- サブモジュールを含めてリポジトリをクローンします。 CosyVoice3 は以前のバージョンと同じ GitHub リポジトリを共有しています:
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git。Matcha-TTS の依存関係を取得するため、--recursiveフラグが必須です。 - Fun-CosyVoice3-0.5B を明示的にダウンロードします。 ModelScope の
snapshot_downloadを使うか、Hugging Face から取得します。古い CosyVoice2 や元の CosyVoice のモデルディレクトリではなく、必ず 3.0 checkpoint を指定してください。 - 必要な場合は方言または言語を明示的に選びます。 特定の地域アクセントが必要なユースケースでは、汎用中国語モデルが文脈から推測することに頼らず、該当する方言の音声または指示を選んでください。
- 統合前に WebUI を起動してテストします。
python3 webui.py --port 50000 --model_dir pretrained_models/Fun-CosyVoice3-0.5Bで Gradio インターフェースが開き、クローン、方言選択、発音修正を直接テストできます。 - 大規模運用で推論速度がボトルネックになったら TensorRT-LLM を使います。 プロジェクトは、標準の Transformers 推論と比べて言語モデル部分が約4倍高速になると報告しています。大量のリクエストを処理する本番環境では、セットアップに手間をかける価値があります。
- セルフホストを望まないチームはホスト型 API を検討します。 Alibaba Cloud の Model Studio は CosyVoice3 をマネージド API(
cosyvoice-v3-flash/cosyvoice-v3-plus)として提供しており、初回パケット遅延は最短 150ms とされています。独自の推論スタックを運用することが優先事項でなければ選択肢になります。
より良い結果を得るためのヒント
- 単語を修正できないと判断する前に、発音修正を使います。 多音字や専門用語の誤読は通常、1行の音素修正で対応できます。クリップ全体を再生成したり、そのコンテンツでモデルの利用を諦めたりする必要はありません。
- 方言は暗黙的に任せず、明示的に指定します。 18以上の方言を利用できる場合、文脈からモデルに推測させるより、対象アクセントを直接指定するほうが確実です。特に寧夏や甘粛のように使用例の少ない方言では重要です。
- 言語の組み合わせを個別に検証します。 クロスリンガル音声クローンは確かに改善されていますが、品質は特定の言語ペアによって変わります。9言語すべてで一様な結果が得られると考えず、製品に必要な入力言語と出力言語の組み合わせを正確にテストしてください。
- ノイズのない 3〜10 秒の参照クリップを使います。 これは現在もモデルのゼロショットクローンが調整されている時間範囲です。どのバージョンを実行する場合でも、ノイズが多い音声や異常に長い参照音声は話者類似度を低下させます。
- 習慣で最大のモデルを選ばないでください。 CosyVoice3 が VibeVoice-1.5B などの大規模モデルを上回ったベンチマーク結果は、単純なパラメータ数よりアーキテクチャとトレーニングデータが重要だと示しています。他のより大きなモデルが優れていると決めつける前に、実際のコンテンツで評価してください。
CosyVoice3、CosyVoice2、元の CosyVoice の比較
| CosyVoice3 | CosyVoice2 | CosyVoice(オリジナル) | |
|---|---|---|---|
| パラメータ | 0.5B | 0.5B | 300M |
| 言語 | 9 | 多言語(方言は少ない) | 5 |
| 中国語方言 | 18+ | 限定的 | 重視していない |
| 発音修正 | あり | なし | なし |
| ストリーミング | あり | あり、このバージョンで導入 | なし |
| クロスリンガル音声クローン | 改善 | 対応 | 対応 |
| 中国語 CER(最良バリアント) | 0.81% | より高い | ベースライン |
各バージョンは異なる制約を解決しました。オリジナルは教師あり token が教師なし token より優れることを証明し、CosyVoice2 はリアルタイム利用に必要なストリーミングアーキテクチャを追加しました。CosyVoice3 は同じ基盤をさらに多くの言語と方言へ拡張しながら、発音精度を高めています。製品で本物らしい中国の地域アクセントや、再トレーニングなしで誤読を修正する方法が特に必要なら、CosyVoice3 はそのために作られたバージョンです。
よくある質問
CosyVoice2 と比べた CosyVoice3 の主なアップグレードは何ですか?
主に方言と言語の対応範囲です。CosyVoice2 の対応範囲がより限定的なのに対し、CosyVoice3 は9言語と18を超える中国の地域方言をカバーします。さらに、新しい発音修正機能と、クロスリンガル音声クローン精度の改善も加わりました。
発音修正とは何ですか?
正しい Pinyin または音素列を直接与えることで、特定の誤読単語(通常は中国語の多音字や珍しい用語)をモデルの再トレーニングなしで修正できる CosyVoice3 の機能です。
CosyVoice3 はストリーミングによる低遅延生成に引き続き対応しますか?
はい。CosyVoice3 は CosyVoice2 で導入されたストリーミングアーキテクチャを基盤としており、ホスト型 API では初回パケット遅延が最短 150ms とされています。
CosyVoice3 は VibeVoice や F5-TTS などの大規模モデルと比べてどうですか?
Alibaba が公開したベンチマークでは、CosyVoice3 は中国語と英語の誤り率、音声クローンの話者類似度の両方でこれらを上回りました。特に VibeVoice-1.5B より少ないパラメータ数で動作しています。
CosyVoice3 は無料のオープンソースですか?
はい。モデルの重みとコードは FunAudioLLM/CosyVoice の GitHub リポジトリと ModelScope から入手できます。マネージドサービスを希望するチーム向けには、Alibaba Cloud が別途ホスト型 API も提供しています。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。