Fish Speech:より良い声へ至る2つの道を備えたTTSプロジェクト
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
多くの音声クローンモデルが用意しているカスタム音声への道は、たった1つです。参照クリップを入力し、ゼロショットの結果が十分に良いことを期待するしかありません。Fish Audioのオープンソース音声合成プロジェクトであるFish Speechには、もう1つの選択肢があります。ゼロショットでは精度が足りないとき、対象の声でモデルを直接ファインチューニングできるのです。さらに、平板なナレーションの域を大きく超える感情とスタイルの制御も備えています。
Fish Speechとは?
Fish Speechは、二重自己回帰Transformer設計であるDualARアーキテクチャを中心に構築され、100万時間を優に超える多言語音声で学習されています。プロジェクトの1.5リリースは、英語、中国語、日本語を含む13言語に対応し、独立したベンチマークでも優れた結果を記録しました。TTS ArenaのELOスコアは1339(当時、オープンソースモデルで1位)、英語の単語誤り率は3.5%、文字誤り率は1.2%、中国語の文字誤り率は1.3%です。
このプロジェクトは1.5以降も進化を続けています。その後、Fish Audio Text to SpeechはOpenAudioシリーズとして新世代のモデルをリリースし、現在はFish Audio S2がフラッグシップモデルとなっています。1000万時間を超える音声で学習され、EmergentTTS-Eval、Seed-TTS Eval、Audio Turing Testなどの評価で現在トップクラスに位置しています。特にFish Speech 1.5を探しているなら、今も十分に堅実で、より軽量かつセルフホスト可能な選択肢です。純粋な品質ときめ細かな感情制御を優先するなら、そのために作られた新世代モデルがS2です。
ゼロショットクローンかファインチューニングか、二者択一ではない
これは、音声クローンを重視する多くの競合モデルと比べたときのFish Speechを象徴する特徴です。ゼロショットクローンは想像どおりに機能します。10〜30秒の参照クリップだけで、学習工程を必要とせず、話者の声色、スタイル、全体的な感情傾向を捉えられます。しかしFish AI Text to Speechは、その上で本格的なファインチューニングにも対応しています。繰り返し使うブランドボイスや、長期プロジェクトを通じた特定のキャラクターなど、ゼロショットクローンでは安定して実現できない精度や一貫性が求められる場合、自分の音声データでベースモデルを直接ファインチューニングできます。参照クリップからたまたま得られた結果で妥協する必要はありません。
この2つのアプローチは実務で意味を持ちます。ゼロショットは速く、ほとんどの単発用途には十分です。一方、1つのクリップだけでなく数百回の生成を通じて声の信頼性を保つ必要があるとき、制作チームが頼るのはファインチューニングです。
本当にきめ細かな感情制御
多くのTTSモデルがせいぜい1つの「誇張度」スライダーしか提供しない一方、Fish Audio S2は、テキストに直接挿入する自然言語タグによって、韻律と感情をサブワード単位で制御できます。[whisper]、[excited]、[angry]などを使い、クリップ全体に1つの感情設定を適用するのではなく、1つの文の途中で口調を切り替えられます。また、複数話者による複数ターンの会話生成にネイティブ対応し、学習中には意味の正確さ、指示への忠実度、音響品質、声色の類似度という複数の報酬信号に照らして自らの出力を評価します。感情表現が、平板なナレーションに単一のタグを後付けしたように聞こえず、しっかり成立する理由の一つです。
基盤となるDual-ARアーキテクチャは、構造的に標準的な言語モデルと似ています。そのためS2は、継続的バッチ処理、ページ化KVキャッシュ、プレフィックスキャッシュといった高スループットのLLM推論技術にもネイティブ対応しています。単発のクリップを生成するのではなく、大規模に生成リクエストを処理する場合には大きな利点です。
Fish Speechの始め方
- 優先事項に合わせてバージョンを選ぶ。 Fish Speech 1.5は、控えめなハードウェアでセルフホストするのに適した、より軽量で文書も充実した選択肢です。Fish Audio S2は、最高の品質ときめ細かな感情制御を重視した現在のフラッグシップです。
- リポジトリをクローンする。
git clone https://github.com/fishaudio/fish-speechを実行すると、対象バージョンのコード、ドキュメント、インストール手順を入手できます。 - モデルの要件とハードウェアを照合する。 Fish Speech 1.5には最低約12GBのVRAMが必要です(本番ワークロードでは24GBを推奨)。導入計画を確定する前に、GPUが要件を満たすか確認してください。
- まずゼロショットクローンを試す。 10〜30秒の参照クリップを用意し、学習なしで直接生成します。そのうえで、ユースケースに本当にファインチューニングが必要か判断してください。
- ゼロショットの精度が足りない場合だけファインチューニングする。 特定の声を大量のコンテンツで一貫させる必要があるなら、1つの参照クリップから何度も生成して一貫性を期待するのではなく、プロジェクトのファインチューニング手順に従ってください。
- S2を本番導入する場合はSGLangまたはvLLM-Omniサーバーを使う。 どちらもFish Audio S2向けの専用ドキュメントがあり、LLMに似たアーキテクチャを活用して、基本的な推論スクリプトより大幅に高いスループットを実現します。
より良い結果を得るためのヒント
- 目的に合わせて参照クリップの長さを選ぶ。 10〜30秒の範囲なら、短めのクリップでも簡単なゼロショットテストには通常十分です。結果が安定しないなら、参照クリップを徐々に長くするのではなく、ファインチューニングへ移るべき合図です。
- 感情タグは至る所ではなく、意図を持って使う。 すべての文に
[whisper]や[excited]を入れると効果が薄れます。表現の変化がコンテンツにとって本当に意味を持つ場面にだけタグを使ってください。 - ライセンスの確認を省略しない。 Fish Speechのモデルウェイトは歴史的に、研究向けで非商用寄りのライセンスで公開されてきました(1.5のウェイトはCC BY-NC-SA、S2はFish Audio独自の研究ライセンス)。MITやApache 2.0のような寛容なライセンスとは大きく異なるため、商用導入の前に現行の条件を慎重に確認してください。
- コンテンツが自然に言語を切り替えるなら、混在言語への対応を活用する。 Fish Speechは、追加設定なしで中国語と英語が混在するテキストを流暢に読み上げられるよう設計されています。2つの生成結果を分割してつなぎ合わせる必要がなく、バイリンガルの台本に便利です。
- 選ぶ前に、実際のコンテンツで両バージョンを評価する。 TTS Arenaの順位や公開された誤り率は有用な初期指標ですが、音声品質はコンテンツによって変わります。本番パイプラインを決める前に、自分の台本スタイルで1.5とS2をテストしてください。
Fish Speechと他の音声クローン重視モデルの比較
| Fish Speech (1.5 / S2) | Chatterbox | CosyVoice3 | |
|---|---|---|---|
| ゼロショットクローン | 対応、参照音声10〜30秒 | 対応、参照音声5〜10秒 | 対応、参照音声3〜10秒 |
| ファインチューニング対応 | 対応、ネイティブ | 主要ワークフローではない | 主要ワークフローではない |
| 感情制御 | サブワード単位のタグ(S2) | 誇張度パラメータ | 指示ベース |
| 言語 | 13(1.5)/ より広範(S2) | 英語(多言語版:23) | 9言語 + 18の中国語方言 |
| アーキテクチャ | 二重自己回帰Transformer | 拡散ベース | 教師ありセマンティックトークン |
| ライセンス | 研究向け/非商用寄り | MIT | オープン、ホスト型APIあり |
Fish Speechが特に適しているのは、1つの参照クリップで保証できる以上の音声一貫性を必要とするチームです。ファインチューニングという道は、単一用途のゼロショット音声クローンモデルの多くがまったく提供していない差別化要素です。
よくある質問
Fish Speech 1.5とFish Audio S2の違いは何ですか?
Fish Speech 1.5は、同じプロジェクトの系譜に属する以前の軽量なリリースで、控えめなハードウェアでのセルフホストに適しています。Fish Audio S2は現在のフラッグシップで、はるかに多くのデータを使って学習され、自然言語タグによるさらにきめ細かな感情制御を備えています。現在、複数の独立したTTS評価でトップに位置しています。
Fish Speechは本当にファインチューニングできますか、それともゼロショットクローンだけですか?
どちらにも対応しています。ゼロショットクローンは10〜30秒の参照クリップから学習工程なしで機能します。特定の声に、ゼロショットクローンでは安定して得られない一貫性が必要な場合には、ファインチューニングを利用できます。
Fish Audio S2の感情タグはどのように機能しますか?
[whisper]、[excited]、[angry]などの自然言語タグを入力テキストに直接置くと、モデルは出力全体に1つの感情設定を適用するのではなく、文中のその位置で表現を調整します。
Fish Speechは商用でも無料で使えますか?
そうだと決めつけず、現行ライセンスを慎重に確認してください。Fish Speech 1.5のウェイトはCC BY-NC-SAライセンス(非商用)で公開され、Fish Audio S2にはFish Audio独自の研究ライセンスが適用されています。どちらもMITやApache 2.0ほど寛容ではないため、商用導入の条件は直接確認する必要があります。
Fish Speechをセルフホストするにはどのようなハードウェアが必要ですか?
Fish Speech 1.5には最低約12GBのVRAMが必要で、本番ワークロードには24GBが推奨されています。S2は学習規模が大きく、一般により高いハードウェア要件が想定されるため、具体的な要件は現行ドキュメントで確認してください。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。