VoxCPM:多くのTTSモデルが依存するトークン化の工程を省く
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
VALL-Eのコーデックトークン、CosyVoiceの意味トークン、GPT-SoVITSの離散コードブックなど、現代のTTSアーキテクチャのほぼすべては、モデルが予測を学習する前に音声を離散単位へ圧縮することから始まります。OpenBMBのVoxCPMは、まったく異なる道を選びました。離散トークン化を完全に省き、連続空間で音声を直接モデル化します。このアーキテクチャ上の選択が、文脈を考慮した韻律と、非常に説得力のあるzero-shot音声クローンという2つの代表的な能力の基盤です。それを、中国語と英語に対応し、一般向けGPU 1基でストリーミングできるほど高速なモデルで実現しています。
VoxCPMとは
VoxCPMは、OpenBMBがMiniCPM-4言語モデルをバックボーンとして構築した、トークナイザー不要のテキスト読み上げシステムです。Apache-2.0ライセンスで公開されています。同等のシステムの多くが行うように音声を離散トークンへ変換するのではなく、エンドツーエンドの拡散自己回帰アーキテクチャを使い、テキストから連続的な音声表現を直接生成します。学習には180万時間を超える中国語・英語のバイリンガル音声が使われています。
VoxCPMの機能上の利点
- トークナイザー不要の連続モデリングにより、離散トークン化で生じ得る情報損失を避けつつ、半離散ボトルネックを通じて生成の安定性を保ちます。
- 文脈を考慮した音声生成により、手動のスタイルタグを必要とせず、入力テキストの意味から適切な韻律と感情のトーンを直接推定します。
- オープンソースシステムの中で最先端のベンチマーク結果を記録し、SEED-TTS-EVALベンチマークではIndexTTS2やCosyVoice2を含む有力モデルを上回っています。
- 実質的な低遅延を実現し、一般向けのNVIDIA RTX 4090で最小0.17のリアルタイム係数を達成します。つまり、出力音声の再生時間のおよそ6倍の速さで音声を生成します。
- 実在感の高いzero-shot音声クローンにより、対応する2言語のどちらでも高い話者類似度スコアを得ています。
- オープンライセンスとファインチューニング対応を備え、Apache-2.0で公開されるとともに、モデルをさらにカスタマイズするための教師ありファインチューニング(SFT)とLoRA適応の両方が文書化されています。
トークナイザー不要の生成は実際にどう機能するのか
これはVoxCPMを特徴づけるアーキテクチャ上の判断であり、なぜ重要なのかを理解する価値があります。離散トークン型のTTSシステムは、音声を固定されたコード語彙へ圧縮します。これは言語モデル式の予測には効率的ですが、連続的な音響の細部を限られた離散記号へ丸めるため、設計上どうしても損失が発生します。一方、VoxCPMは階層型言語モデリング、有限スカラー量子化(FSQ)、局所Diffusion Transformerを組み合わせ、連続的な音声表現を直接生成します。これによって情報のボトルネックを回避しながら、信頼性の高い学習に十分な生成の安定性も維持します。
FSQコンポーネントは、プロジェクトが「構造化された半離散表現」と呼ぶものを生成します。これは、高レベルの意味内容と細かな音響情報を、どちらも完全な離散コードへ押し込めることなく暗黙的に分離する中間的な仕組みです。この暗黙的な分離によって、文脈に応じた生成が可能になります。意味と音響的な質感が1つの表現に絡み合っていないため、表現スタイルを別の指示として指定しなくても、モデルはテキストの実際の意味から韻律と感情のトーンを推定できます。
ベンチマーク結果
SEED-TTS-EVALベンチマークにおいて、VoxCPM-0.5Bは英語で1.85%の単語誤り率、中国語で0.93%の文字誤り率を報告しました。どちらもIndexTTS2やCosyVoice2を含む有力な競合を上回りながら、話者類似度は英語で72.9%、中国語で77.2%を維持しています。より小規模で完全公開のEmiliaデータセットを使って学習した派生版(VoxCPM-Emilia)も競争力のある結果(英語WER 2.34%、中国語CER 1.11%)を記録しました。プロジェクトはこれを、単に学習データの規模に依存した結果ではなく、アーキテクチャのデータ効率を示す証拠と位置づけています。主観的な聴取評価では、VoxCPMは英語の話者類似度で首位となり、自然さでも高い評価を得ました。中国語では自然さがIndexTTS2をわずかに下回った一方、話者類似度ではわずかに上回っています。これは、VoxCPM固有の強みがクローンの一貫性にあり、IndexTTS2は特に中国語の韻律の自然さで優位に立つことを示唆します。
VoxCPMを使い始める
- まず環境要件を確認します。 VoxCPMにはPython 3.10以降(3.13未満)、PyTorch 2.5.0以降、CUDA 12.0以降が必要です。インストールを試す前に確認してください。
- パッケージをインストールし、Hugging Faceからチェックポイントを取得します。
openbmb/VoxCPM-0.5Bは最初のバイリンガル版です。openbmb/VoxCPM1.5は2025年12月の更新版で、SFTとLoRAによるファインチューニングに対応し、音声出力も初代の16kHzから44.1kHzへ向上しています。 - Pythonパッケージ
voxcpmからモデルを読み込みます。from voxcpm import VoxCPMに続けてVoxCPM.from_pretrained("openbmb/VoxCPM-0.5B")を実行すれば、わずか数行で使用可能なモデルオブジェクトを取得できます。 model.generate()で音声を生成します。 対象テキストと、cfg_value(クラシファイアフリーガイダンスの強度)やinference_timestepsなどの生成パラメーターを渡し、返された波形をsoundfileのようなライブラリで書き出します。- Hugging Faceへのアクセスが遅い場合は、代わりのダウンロード元としてModelScopeを利用します。 プロジェクトでは、同じ重みを取得する直接的な代替手段として文書化されています。
- 初期テストを超える開発へ進む前に、GitHubリポジトリ(
OpenBMB/VoxCPM)をクローンし、完全なクイックスタート資料、デモスクリプト、ライセンスの詳細を確認します。
より良い結果を得るためのヒント
- スタイルを細かく指定しすぎず、文脈を考慮した生成に任せます。 モデルはすでにテキストの意味から韻律と感情を推定するため、モデルが想定していない回避策で特定の表現を無理に指定するより、自然で描写的な入力テキストを書くほうが良い結果につながる傾向があります。
- 新しいプロジェクトでは、初代0.5B版ではなくVoxCPM1.5を使います。 44.1kHzへ向上した音声出力と追加されたファインチューニング対応により、以前の版を使う特別な理由がない限り、より実用的な出発点になります。
- 特定の声や領域には、完全な再学習ではなくLoRAでファインチューニングします。 LoRA対応が文書化されているため、zero-shotクローンを超えて特定の声やコンテンツスタイルへモデルを適応させる必要がある場合、こちらのほうがリソース効率に優れます。
- 現時点では本番対応の商用製品ではなく、研究用ソフトウェアとして扱います。 プロジェクト自身のモデルカードには研究開発目的で公開すると明記され、厳格な独立テストと安全性評価を事前に行わない本番利用や商用利用は推奨されていません。
- 安定した結果を得るには中国語と英語を使います。 中核となる学習データは広範な多言語ではなく中国語と英語に特化しているため、その他の言語の性能は保証されず、予測不能または低品質な出力になる可能性があります。
VoxCPMと有力な中英音声クローンモデルの比較
| VoxCPM | IndexTTS2 | CosyVoice2 | |
|---|---|---|---|
| 中核表現 | トークナイザー不要、連続 + FSQ半離散 | 離散トークン | 教師あり意味トークン |
| 英語WER(SEED-TTS-EVAL) | 1.85% | より高い | より高い |
| 中国語CER(SEED-TTS-EVAL) | 0.93% | より高い | より高い |
| 中国語の自然さ(主観評価) | 高い、IndexTTS2をわずかに下回る | 首位 | 高い |
| 話者類似度 | 英語・中国語で首位 | 競争力あり | 競争力あり |
| スタイル・感情制御 | 自動、文脈から推定 | 長さ制御 + 感情と声色の分離 | 指示ベース |
| ライセンス | Apache-2.0 | Bilibiliモデルライセンス(商用利用には許可が必要) | オープン、ホスト型APIあり |
VoxCPM固有の強みは、離散トークン化ではなく連続表現を選ぶという、まったく異なるアーキテクチャ上の発想です。その効果はベンチマークの数値と低遅延ストリーミングに直接表れ、中国語・英語のバイリンガル用途に特に有力な技術的選択肢となっています。ただし、明示的な指示による表現を前提に作られたモデルと比べると、スタイルを直接手動で制御できない点は実際のトレードオフです。
よくある質問
VoxCPMの「トークナイザー不要」とはどういう意味ですか?
多くの同等のTTSシステムのように、まず音声を離散トークンの語彙へ圧縮するのではなく、VoxCPMが連続的な音声表現を直接生成するという意味です。この方法は、離散トークン化によって生じ得る情報損失を避けることを目的としています。
VoxCPMで感情や話し方を直接制御できますか?
現在の版では、明示的な手動操作による制御はできません。代わりに、モデルが入力テキストの意味から適切な韻律と感情を自動的に推定します。プロジェクト自身の資料でも、スタイルを直接制御する必要がある人にとって、これは現時点の制限だと説明されています。
VoxCPMは本番環境や商用利用に対応していますか?
プロジェクト自身のモデルカードは、厳格な独立テストと安全性評価を事前に行わない利用を推奨しておらず、このリリースを研究開発目的と明記しています。
VoxCPMは中国語と英語以外にも対応していますか?
安定した対応ではありません。中国語と英語のバイリンガルモデルとして特化して学習されているため、その他の言語の性能は保証されません。より幅広い言語対応が必要な場合は、別の新しいリリースであるVoxCPM2が20億パラメーター、30言語へ拡張され、音声デザイン機能も追加されています。
VoxCPMはどのくらい高速ですか?
一般向けのRTX 4090で最小0.17のリアルタイム係数を達成します。つまり、出力音声そのものの再生時間のおよそ6倍の速さで生成できます。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。