Chatterbox Multilingual:1つのクローン音声を23言語で、アクセントのずれなく再現
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- 音軌を分離するか、カバーを生成
- 登録して試聴。聴いてから決められる
多くの多言語 TTS システムで英語の声をクローンし、それをスペイン語に切り替えると、どこかが崩れます。アクセントがずれ、リズムが変わり、まったく別人のような出力になってしまいます。Chatterbox Multilingual はまさにこの失敗を解決するために作られました。1つのオープンソースモデルで一度だけ声をクローンし、市場ごとに再学習したりモデルを切り替えたりせず、23言語にわたって声の個性—声色、アクセント、話すリズム—を維持します。
Chatterbox Multilingual とは?
Chatterbox Multilingual は Resemble AI の汎用多言語テキスト読み上げモデルです。オリジナルの英語モデルや低レイテンシの Turbo と同じ、オープンソースで MIT ライセンスの Chatterbox ファミリーに属します。現行の V3 は前世代と同じ5億パラメーターのアーキテクチャを維持しながら、3つの点を重点的に改善しています。言語を切り替えたときの話者類似度、ハルシネーションの低減(不要な繰り返しやプロンプトから外れた続きを減らすこと)、そして対応するすべての言語での、より自然で会話らしい話し方です。
標準で23言語に対応します。アラビア語、中国語、デンマーク語、オランダ語、英語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ヘブライ語、ヒンディー語、イタリア語、日本語、韓国語、マレー語、ノルウェー語、ポーランド語、ポルトガル語、ロシア語、スペイン語、スワヒリ語、スウェーデン語、トルコ語です。広く使われる言語だけでなく、スワヒリ語やマレー語のように対応サービスが比較的少ない言語も同じリリースでカバーします。
本当に重要な機能:言語をまたぐ音声転送
「多言語」TTS という宣伝の多くは、言語ごとに別のモデル、または別のファインチューニングを提供するという意味で、切り替えた後も声の個性が保たれる保証はありません。Chatterbox Multilingual の仕組みは異なります。任意の言語で1つの参照クリップを渡すと、元の話者の声の特徴を保ったまま、残り22言語のどれでも音声を生成できます。英語話者をクローンしてフランス語を話させることも、ヒンディー語の参照クリップからドイツ語を生成することもできます。参照音声の言語と生成する言語を一致させる必要はありません。23個の別々のモデルではなく、1つの言語横断モデルを使う意義はそこにあります。
特定市場をより厳密に制御したいプロジェクト向けに、Resemble AI は Single Language Pack も提供しています。これは6つの優先言語と地域バリエーション(標準中国語、ラテンアメリカのスペイン語、スペインのスペイン語、ブラジルのポルトガル語、ポルトガルのポルトガル語、ヒンディー語)専用のファインチューニングで、幅広い対応範囲より方言の正確さや地域の発音が重要な場合に適しています。
Chatterbox Multilingual の始め方
- パッケージをインストールする。
pip install chatterbox-ttsで多言語クラスを含む Chatterbox ファミリー全体が導入されるため、別のパッケージを探す必要はありません。 - 多言語モデルを明示的に読み込む。
chatterbox.mtl_ttsからChatterboxMultilingualTTSをインポートし(英語のみの生成に使う標準のChatterboxTTSクラスではありません)、t3_model="v3"を指定して現行リリースを読み込みます。 - 参照クリップと言語 ID を指定する。 5〜10秒(またはそれ以上)の音声サンプルを声の参照として渡し、出力先の言語には2文字の言語コード(
fr、ja、ruなど)を指定します。 - 言語横断生成向けに
cfg_weightを調整する。cfg_weightを 0.0 にすると、参照クリップの元言語のアクセントが混ざるのを最小限に抑えられます。デフォルトの 0.5 は同一言語での生成向けで、言語横断転送向けの調整ではありません。 - ローカル環境を構築する前にブラウザで試す。 Resemble AI は多言語モデルの Hugging Face Space を公開しており、パイプラインに組み込む前に声と言語の品質を確認できます。
言語横断の結果を改善するためのヒント
- 可能なら参照クリップの言語タグを合わせる。 言語横断転送が目的でない場合は、
cfg_weightの調整で差を埋めるよりも、生成する言語と同じ言語の参照クリップを使うほうが予測しやすい出力になります。 - ノイズのない5〜20秒のクリップを使う。 参照音声の背景ノイズは、そこから生成するすべての言語に引き継がれます。後から言語ごとにアーティファクトを調べるより、最初に元クリップを適切に整える価値があります。
- 市場に精度が必要なら Single Language Pack を選ぶ。 ある言語が単なる対応言語ではなく製品の中核なら、専用のファインチューニングは通常、方言の正確さと地域の発音で汎用多言語モデルを上回ります。
- 初期段階では多少のばらつきを見込む。 コミュニティのテストでは、参照クリップによって時折アーティファクトやアクセント転送の不整合が起こると報告されています。言語ごとの最初の数回は、最終結果ではなく調整段階として扱ってください。
- 適度な VRAM を確保する。 実環境のテストでは、最新の GPU で 4GB 程度の VRAM があれば多言語生成が無理なく動作すると報告されています。23言語モデルとして十分に入手しやすいハードウェアです。
Chatterbox Multilingual と他のファミリーモデルを比較
| Chatterbox Multilingual | Chatterbox(オリジナル) | Chatterbox Turbo | |
|---|---|---|---|
| 言語 | 23 | 英語のみ | 英語のみ |
| パラメーター | 5億 | 約5億 | 3.5億 |
| 言語をまたぐ音声転送 | 対応、中核機能 | 該当なし | 該当なし |
| 適した用途 | グローバル/ローカライズされたコンテンツ、多言語エージェント | 英語ナレーション、創造的な表現 | リアルタイムでレイテンシが重要な音声エージェント |
| 透かし | PerTh を内蔵 | PerTh を内蔵 | PerTh を内蔵 |
| ライセンス | MIT | MIT | MIT |
1つのクローン音声で複数の言語を話す必要がある製品には、Multilingual がその目的のために作られたモデルです。オリジナル版と Turbo は設計上、英語のみに対応します。
よくある質問
Chatterbox Multilingual は実際に何言語に対応していますか?
汎用 V3 モデルは23言語に対応しています。スペイン語、中国語、アラビア語のように広く使われる言語から、スワヒリ語、マレー語、デンマーク語のように対応サービスが比較的少ない言語まで含まれます。
ある言語で声をクローンし、別の言語で音声を生成できますか?
はい。この言語をまたぐ音声転送が Chatterbox Multilingual の中核機能です。対応する任意の言語で参照クリップを用意し、話者の声の個性を保ちながら別の任意の言語で出力できます。cfg_weight を 0.0 にすると、言語横断で最も混ざりの少ない結果が得られます。
音声クローンにはどれくらいの参照音声が必要ですか?
最短5〜10秒です。ただし、特に言語横断転送では、より長いクリップ(最大約20秒)のほうが安定した結果になる傾向があります。
汎用多言語モデルと Single Language Pack の違いは何ですか?
汎用モデル(V3)は1組の重みで23言語すべてをカバーします。Single Language Pack は6つの優先言語—標準中国語、スペイン語/ポルトガル語の3つの地域バリエーション、ヒンディー語—専用のファインチューニングを提供し、汎用モデルより高い方言精度が必要な用途に対応します。
Chatterbox Multilingual は商用利用できますか?
はい。Chatterbox ファミリーの他のモデルと同様に MIT ライセンスで公開され、生成されるすべてのクリップには出所確認のために Resemble AI の PerTh 透かしが組み込まれます。
同様の多言語音声クローン機能を試す
Chatterbox Multilingual 自体は Resemble AI のオープンソース実装と公式デモから利用できます。ブラウザで多言語音声クローンを試したい場合は、同様の機能として音声クローンを利用できます。これは Chatterbox Multilingual ではなく、Chatterbox モデルも実行しませんが、ローカルでモデルを構築せずに似た音声クローンの流れを試せます。
自分が所有する声、または明示的な利用許可を得た声だけをクローンしてください。