Chatterbox TTS:ブラインドテストで ElevenLabs を上回ったオープンソース音声クローンモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- 音軌を分離するか、カバーを生成
- 登録して試聴。聴いてから決められる
「ElevenLabs のオープンソース代替」をうたうモデルの多くは、実際に並べて比較すると評価が揺らぎます。しかし、Chatterbox は違いました。Podonos を通じて行われたブラインドテストでは、参加者が Chatterbox と ElevenLabs の音声サンプルをペアで試聴しました。ラベルも背景情報もなく、どちらのモデルが各クリップを生成したかも知らされていません。その結果、63.75% の比較で Chatterbox の出力が選ばれました。この結果に、商用利用にも対応する自由度の高い MIT ライセンスが加わり、Chatterbox は今年最も注目を集めるオープンウェイト TTS の1つとなっています。
Chatterbox とは?
Chatterbox は Resemble AI が公開したオープンソースのテキスト読み上げモデル群です。3人のチームによって開発され、MIT ライセンスで提供されています。特に優れているのは、短い参照音声から行うゼロショット音声クローンと、感情表現の誇張度を調整する機能です。後者のパラメーターを使うと、平坦で控えめな声から、ドラマチックで表現力豊かな声まで調整できます。Resemble AI は、この機能をオープンソース TTS で初めてのものと説明しています。
Chatterbox は当初の英語モデルから発展し、現在は目的の異なる3つのバリエーションで構成されています。
- Chatterbox(オリジナル) — 音質と感情表現の幅を重視した基本の英語モデルです。
- Chatterbox Multilingual(V3) — 5億パラメーターで20以上の言語に対応します。同じクローン音声が別の言語を話すときも、一般的なアクセントへ変化することを抑え、声質、アクセント、リズムを保つよう設計されています。
- Chatterbox Turbo — 速度を優先した3.5億パラメーターのモデルです。レイテンシは約75ミリ秒、生成速度はリアルタイムの約6倍で、最大限の表現力より応答時間が重要な音声アシスタントなどに適しています。
仕組み:音声クローン、感情制御、透かし
ゼロショット音声クローン。 Chatterbox は、わずか5~10秒の参照音声から目標の声を再現できます。ファインチューニングや別途の学習は不要で、音声クリップを渡すだけで、その声を使って新しい文章を読み上げられます。
2つの調整パラメーター。 出力は主に、感情の強さを制御する exaggeration と、参照音声への忠実さと入力テキストの反映度のバランスを取る cfg_weight で調整します。どちらもデフォルト値は 0.5 で、多くの場面でそのまま利用できます。exaggeration を上げると、Chatterbox らしいドラマチックな話し方になります。
パラ言語タグ。 Chatterbox Turbo は、ため息、息をのむ音、咳などの反応を指定するテキストタグに対応しています。別に録音した効果音を後から加えるのではなく、クローンした声と感情に合う形でモデル自身が演じます。
組み込みの透かし。 Chatterbox が生成する各クリップには、生成時に Resemble AI の PerTh(Perceptual Threshold)透かしが埋め込まれます。聴取者には聞こえませんが、圧縮や基本的な編集を経ても残るよう設計されており、生成音声の出所を追跡する助けになります。音声の来歴が重要な製品に音声クローンを導入する場合、信頼性を支える有用な機能です。
Chatterbox の始め方
- 実行環境を準備する。 Chatterbox は
pipでインストールします。プロジェクトは Python 3.11 で開発・テストされており、依存関係のバージョンをそろえるため、公式手順ではconda環境が推奨されています。 - コードまたはモデルを取得する。 GitHub から
resemble-ai/chatterboxをクローンします。ローカルにリポジトリを置く必要がなければ、Hugging Face からチェックポイントを直接読み込むこともできます。 - 用途に合うモデルを選ぶ。 表現力豊かな英語ナレーションにはオリジナル版、複数言語で同じクローン音声を保ちたい場合は Chatterbox Multilingual、レイテンシを優先する場合は Chatterbox Turbo を選びます。
- 組み込む前に試す。 Resemble AI は Hugging Face Spaces で公式 Gradio デモを公開しています。統合コードを書く前に、ブラウザで音声クローンと
exaggerationパラメーターを試せます。 - 必要に応じて運用規模を拡大する。 Resemble AI は同じモデル群をベースにしたホスト型 TTS サービスも提供しています。自社で GPU を運用せず、管理された環境で拡張したいチーム向けの選択肢です。
Chatterbox の出力を改善するヒント
- 参照音声と生成先の言語を合わせる。 Chatterbox Multilingual では、参照音声の言語タグを生成する言語と一致させてください。一致しないと、出力が対象言語の自然な発音ではなく、参照音声のアクセントを引き継ぐ場合があります。完全に一致する音声がない場合は、
cfg_weightを 0 にすると影響を抑えられます。 - 感情表現はデフォルト値から始める。 0.5 は幅広いプロンプトで機能するよう調整されています。高い値は最初から常用するのではなく、ドラマチックな話し方を狙う場合の意図的な表現として使いましょう。
- インタラクティブ用途には Turbo を使う。 音声エージェント、アシスタント、ライブデモなど、ユーザーが応答を待つ場面では、大きなモデルによるわずかな品質向上より、Turbo の約75ミリ秒というレイテンシが重要になります。
- コンプライアンス設計で透かしを考慮する。 すべての出力にデフォルトで PerTh 透かしが入るため、AI 生成音声の開示に関する製品文書やポリシーにも記載しておくとよいでしょう。
- ノイズのない7~20秒の参照音声を用意する。 Resemble AI はベンチマークでこの長さを使用しています。より短いサンプルにも対応しますが、ゼロショットクローンで安定した品質を得るための実用的な目安です。
Chatterbox、ElevenLabs、その他のオープンモデルを比較
| Chatterbox | ElevenLabs | その他のオープン TTS(Dia、Dia2) | |
|---|---|---|---|
| ライセンス | MIT(自由度の高いライセンス) | クローズドな商用 API | Apache 2.0 |
| 音声クローン | ゼロショット、5~10秒の参照音声 | 対応、サブスクリプションの制限あり | モデルにより異なる、音声コンディショニング |
| 感情制御 | 明示的な exaggeration パラメーター | 限定的なスタイル制御 | 中心的な機能ではない |
| 透かし | デフォルトで組み込み(PerTh) | 標準機能ではない | 標準機能ではない |
| セルフホスティング | 対応、完全なローカル展開 | 不可 | 対応 |
| ElevenLabs とのブラインド比較 | Podonos の調査で 63.75% が Chatterbox を選択 | — | 直接比較なし |
Chatterbox の本当の違いは、知覚品質でクローズドな商用サービスの代表格と競えることだけではありません。MIT ライセンス、組み込みの透かし、完全なセルフホスティングを同時に提供しており、ElevenLabs API ではこの3つをまとめて利用できません。
よくある質問
Chatterbox は商用でも無料で使えますか?
はい。Chatterbox は、非常に自由度の高いオープンソースライセンスの1つである MIT ライセンスで公開されています。ライセンス表示と著作権表示の条件に従えば、商用利用、改変、再配布が可能です。
実際の品質は ElevenLabs と比べてどうですか?
Podonos を通じて行われたブラインドテストでは、同じ文章と参照音声を使い、モデル名を伏せて評価しました。その結果、ElevenLabs との比較で Chatterbox の出力が 63.75% の割合で選ばれました。
Chatterbox、Chatterbox Multilingual、Chatterbox Turbo の違いは何ですか?
オリジナル版は感情表現に優れた基本の英語モデルです。Chatterbox Multilingual は話者の特徴を保ちながら20以上の言語へ音声クローンを拡張します。Chatterbox Turbo は速度を優先し、約75ミリ秒のレイテンシでリアルタイム用途に対応します。
Chatterbox は出力音声に透かしを入れますか?
はい。すべての生成音声に Resemble AI の PerTh 透かしが自動的に入ります。聴取者には聞こえませんが、音声の出所や真正性を確認するために検出できます。
音声クローンには、どれくらいの参照音声が必要ですか?
最短5~10秒の参照音声で動作し、ゼロショットクローンに別途の学習やファインチューニングは必要ありません。より安定した結果を得るには、ノイズのない7~20秒のクリップが実用的な目安です。
同様の音声クローン機能を試す
Chatterbox 自体は、Resemble AI のオープンソース実装または公式デモから利用できます。ブラウザで音声クローンを試したい場合は、同様の機能として音声クローンを利用できます。これは Chatterbox ではなく、そのモデルも実行しませんが、Chatterbox の導入方法を決める前に、近い音声クローンの流れを試せます。
自分が所有する声、または明示的な使用許可を得た声だけをクローンしてください。