Zonos:クローズドな商用品質を真正面から狙うオープンウェイトモデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
Zyphra は Zonos を「優れたオープンソース代替」とは位置づけていません。チーム自身が掲げるのは、実際のウェイトを完全に寛容なライセンスで公開しながら、主要な商用 TTS プロバイダーと同等、あるいはそれを上回る表現力と品質を実現するという主張です。これは曖昧な品質評価ではなく、具体的で検証可能な主張です。その裏付けとなる学習も本格的な規模で、20万時間を超える多様な音声を使用し、主に一つのレジスターだけで学習するのではなく、ニュートラルなナレーションと非常に表現力豊かな素材を意図的に組み合わせています。
Zonos とは
Zonos は、パロアルトに拠点を置く AI スタートアップ Zyphra が2025年2月にベータ版として公開した、オープンウェイトのテキスト読み上げモデルです。標準 transformer と SSM ハイブリッド構成という2種類のバックボーンがあり、どちらも16億パラメータです。両方とも Apache 2.0 ライセンスで公開されているため、コードだけでなくウェイト自体を、別途契約を結ばずに無料で商用利用できます。
内部の仕組み:eSpeak、DAC Token、2種類のバックボーン
Zonos のパイプラインは比較的わかりやすいものです。eSpeak でテキストを正規化して音素へ変換し、そのシーケンスを使って Descript Audio Codec(DAC)表現上の token を予測します。生成には、読み込んだ checkpoint に応じて transformer または SSM ハイブリッドのバックボーンが使われます。両者の実用上の違いは見かけだけではありません。ハイブリッド版は、標準的な attention に state-space model のコンポーネントを組み合わせています。この種のアーキテクチャ選択では、純粋な transformer と比べて速度やシーケンス長の処理に異なるトレードオフが生じるのが一般的です。そのため、一方をもう一方の完全な上位版と決めつけず、実際のワークロードで両方を試す価値があります。
音声クローン:話者 Embedding と Audio Prefix
Zonos は、5〜30秒の参照クリップからゼロショットで音声をクローンできますが、音声を条件として生成する2つの異なる方法を理解しておく価値があります。話者 embedding は、参照クリップから全般的な声のアイデンティティを捉えます。audio prefix は、参照音声を先に embedding へ圧縮するのではなく、文字どおりその一部を直接先頭に付ける方法です。これにより、話者 embedding だけでは再現が難しいささやき声など、特定の振る舞いも引き出せます。通常の参照クリップだけでは捉えきれない特定の話し方がプロジェクトに必要なら、audio prefix のほうが直接的な調整手段です。
参照音声をまったく用意できない場合に備えて、Zonos にはアメリカ英語とイギリス英語の男性・女性音声、ランダム音声設定などのプリセットもあります。そのため、実用的な出力を得るためにゼロショットクローンが必須というわけではありません。
感情と話し方のきめ細かな制御
声のアイデンティティに加えて、Zonos では話速、ピッチの変化、最大周波数、全体的な音質、特定の感情を直接制御できます。明示的に対応する感情は、喜び、怒り、悲しみ、恐れです。話し方の仕組みと感情的なトーンの両方を、この粒度で個別に調整できることは、「表現力豊か」という位置づけを実際に支える重要な要素です。出力全体に大まかなスタイルパラメータを一つ適用するだけではありません。
多言語対応とネイティブ 44kHz 出力
Zonos-v0.1 は英語、日本語、中国語、フランス語、ドイツ語に対応します。また、この分野には 24kHz で出力するモデルが多いなか、44kHz でネイティブに音声を生成する点も注目に値します。単に内容が聞き取れればよいのではなく、音質が厳しく確認される制作工程に出力を組み込むなら、この明確に高い忠実度の上限が意味を持ちます。
速度
RTX 4090 では、Zonos は実時間比で約2倍の速度で動作します。つまり、1秒の計算時間でおよそ2秒分の音声を生成します。高性能なコンシューマー向けハードウェアであれば、準リアルタイム用途に十分使える水準です。ただし、専用のリアルタイムモデルが目標とする 200ms 未満のストリーミング遅延に特化して設計されているわけではありません。
Zonos を使い始める
- 最初に eSpeak の依存関係をインストールします。 Zonos はテキストの正規化と音素化に eSpeak を使用するため、推論を試す前にシステムへインストールしておきます。ここを飛ばすと、初回実行時によくある失敗の原因になります。
- リポジトリをクローンしてバックボーンを選びます。 GitHub から
Zyphra/Zonosプロジェクトをgit cloneし、試したいアーキテクチャに応じてZyphra/Zonos-v0.1-transformerまたはZyphra/Zonos-v0.1-hybridを読み込みます。 - 参照クリップから話者 embedding を作成します。 Python でモデルを読み込み、参照音声に対して
make_speaker_embedding()を呼び出し、対象テキストと言語を指定してmake_cond_dict()を実行するという数行のコードで、基本的なゼロショットクローンの手順を実装できます。 - 繰り返しテストには Gradio インターフェースを使います。
python gradio_interface.pyを実行すると、生成のたびにモデルを再読み込みするオーバーヘッドを避けられます。最小構成の Python サンプルではデフォルトで毎回読み込むため、1サンプルだけでなく反復調整を始めた段階では、これは実際に役立ちます。 - ローカル設定に取りかかる前に、ホスト型 playground を試します。 Zyphra は
playground.zyphra.com/audioでホスト版を提供しており、ローカルへのインストールに時間をかける前に、出力品質や利用できる制御項目をすばやく評価できます。 - クローンしにくい振る舞いには特に audio prefix を使います。 話者 embedding だけでは、必要なささやき声、息っぽさ、その他の特定の話し方が得られない場合は、audio prefix による条件付けへ切り替えます。
より良い結果を得るためのヒント
- 実際の用途で2種類のバックボーンを試します。 transformer と SSM ハイブリッドは、単なる「旧版対新版」ではありません。実質的なアーキテクチャ上のトレードオフを表しているため、一方が常に優れていると考えるより、具体的なコンテンツの種類に合わせて両方をベンチマークするほうが確実です。
- 5〜30秒の範囲に収まる、本当にクリーンな参照クリップを使います。 ゼロショットクローンはこの長さを基準に調整されているため、範囲内の長さで適切に録音したサンプルは、極端に短いものや不必要に引き延ばしたクリップより良い結果になります。
- 感情と話し方の制御は、一つずつではなく意図的に組み合わせます。 話速、ピッチ、感情は独立して調整できるため、たとえば速いペースに特定の感情的トーンを合わせるなど、考えて重ねることで Zonos の表現力という主張が実際に現れます。一つのパラメータだけを単独で変えるのとは違います。
- 特にクローンが必要でない場合はプリセット音声を使います。 特定の実在人物の声を再現することが目的でなければ、内蔵されたアメリカ英語・イギリス英語の男性・女性プリセットを使うことで、参照クリップを探して準備する手順を省けます。
- より広い言語対応や低い遅延が必要なら、Zyphra の新しい ZONOS2 に注目します。 Zyphra はその後、はるかに大規模なデータセットで学習し、対応言語を広げ、低遅延を狙った mixture-of-experts 構成を採用した後継モデルを公開しています。要件が v0.1 の対応範囲を超える場合は、確認する価値があります。
Zonos と他の表現力豊かなクローンモデルの比較
| Zonos | Chatterbox | F5-TTS | |
|---|---|---|---|
| 開発組織 | Zyphra | Resemble AI | 独立研究(SJTU/Cambridge/Geely) |
| パラメータ数 | 1.6B(2種類のバックボーン) | ~0.5B | 主にパラメータ数で位置づけられてはいない |
| クローン用参照クリップ | 5〜30秒 | 5〜10秒 | 約5〜15秒 |
| 感情制御 | 明示的に対応:喜び、怒り、悲しみ、恐れ | Exaggeration パラメータ | 専用機能ではない |
| ネイティブ出力サンプルレート | 44kHz | この忠実度については明記なし | 標準的な TTS のレート |
| 言語 | 英語、日本語、中国語、フランス語、ドイツ語 | 英語(Multilingual:23) | 主に英語に特化 |
| ライセンス | Apache 2.0 | MIT | CC-BY-NC(非商用) |
Zonos 固有の強みは、実際に大規模で2種類のレジスターを含む学習コーパスと、完全にオープンで商用利用に寛容なウェイト、ネイティブ 44kHz の忠実度を組み合わせていることです。5言語という対応範囲は、多言語に特化した競合の一部より狭いものの、これらを一つにまとめたモデルは他では見つけにくい組み合わせです。
よくある質問
Zonos は本当に無料で商用利用できますか?
はい。transformer と SSM ハイブリッドの両モデルのウェイトは Apache 2.0 ライセンスで公開されており、別途契約を結ばずに商用利用できます。
Zonos の transformer モデルとハイブリッドモデルは何が違いますか?
ハイブリッドモデルは、標準的な transformer attention に state-space model のコンポーネントを組み合わせています。単純な上位版ではなく、異なるアーキテクチャ上のトレードオフを表すため、実際の用途で両方を試すことが確実な選び方です。
Zonos で音声をクローンするには、どのくらいの参照音声が必要ですか?
およそ5〜30秒です。全般的な声のアイデンティティには話者 embedding を、ささやき声のような特定の振る舞いには適した audio prefix を利用できます。
Zonos はどの言語に対応していますか?
v0.1 では、英語、日本語、中国語、フランス語、ドイツ語に対応しています。
何もインストールせずに Zonos を試せるホスト版はありますか?
はい。Zyphra は playground.zyphra.com/audio でホスト型 playground を提供しており、モデルの音声クローンや表現制御を直接試せます。
参照音声から似た声の音声を生成
参照音声と新しいテキストから似た声を生成する同様のワークフローには、Echoraの音声クローンを利用できます。自分の声、または使用について明示的な許可を得た参照音声をアップロードし、最大5,000文字の新しいテキストを入力すると、参照音声に似た新しい音声を生成できます。