FireRedTTS:まったく異なる2つの用途のために作られた基盤モデル
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
Xiaohongshu の FireRed Team が目指したのは、用途の狭いデモモデルではありません。明確なデータパイプラインを備え、吹き替え用の音声クローンと、チャットボット向けのカジュアルで人間らしい音声生成という2つの具体的な下流アプリケーションで実力を証明する基盤フレームワークを構築しました。この2つは本質的に異なる課題です。一方は特定の人物らしく聞こえる必要があり、もう一方は自然な会話相手らしく聞こえなければなりません。FireRedTTS は、同じ基盤システムがその両方を適切にこなせることを示すために作られました。
FireRedTTS とは?
FireRedTTS は、Xiaohongshu の FireRed Team が開発した、言語モデルベースのオープンソース・テキスト読み上げフレームワークで、2024年9月の論文で発表されました。構成は3つの部分に分かれています。生の音声を大規模かつ豊富にアノテーションされた TTS データセットへ変換するデータ処理パイプライン、そのデータを基に構築された基盤 TTS システム、そして基盤モデルの実用範囲を示す下流アプリケーションです。この「データ、基盤、アプリケーション」という3部構成は、一般的な単一目的の研究成果よりも意図が明確で、産業用途を強く意識したものです。
FireRedTTS の機能面での利点
- 用途の狭い単一タスクモデルではなく、本物の基盤システムです。 同じ基盤アーキテクチャが、ゼロショットクローンと指示チューニングされた会話音声生成の両方に対応します。
- 安定したインコンテキスト学習能力。 モデルは、プロンプトのテキストとプロンプト音声のスタイルの両方に整合する音声を安定して合成します。これは、大規模言語モデルが明示的にファインチューニングされていないタスクにも役立つのと同じ広範な能力です。
- 少数ショットのファインチューニングでスタジオ品質を実現し、対象話者の録音をわずか1時間使用するだけで、表現力豊かなプロ品質の音声キャラクターに到達します。
- 確立されたオープンコンポーネントの上に透明性をもって構築されています。Fish Speech のテキストトークナイザー手法、BigCodec 音声コーデック、Encodec の因果畳み込み設計、SpeechBrain の ECAPA-TDNN、中国語で事前学習された HuBERT モデルなどが使われています。
基盤システムの仕組み
FireRedTTS は、意味情報を考慮する音声トークナイザーを使って音声を離散的なセマンティックトークンへ圧縮し、言語モデルがプロンプトのテキストと音声からそれらのトークンを直接生成します。これが、参照音声だけから対象音声のスタイルを捉えられるインコンテキスト学習の仕組みです。その後、2段階の波形ジェネレーターがセマンティックトークンを高忠実度の音声波形へデコードします。コードベースには、音響 LLM デコーダーと Flow Matching デコーダーという2種類のデコーダー設定が実際に同梱されています。速度、安定性、音質の特性のうち、どのトレードオフが具体的な用途に合うかに応じて生成方式を選べます。
2つの実用アプリケーション:吹き替えとチャットボット
FireRedTTS を基盤モデルとして設計した価値が実際に現れるのが、この部分です。吹き替えでは、UGC(ユーザー生成コンテンツ)に適したゼロショット音声クローンに対応し、追加学習なしで対象音声をその場でクローンできます。さらに、対象話者の録音を約1時間使った少数ショットのファインチューニングにも対応し、制作の完成度がより重視される PUGC(プロフェッショナル・ユーザー生成コンテンツ)向けに、表現力豊かなスタジオ品質の音声を実現します。チャットボットでは、FireRedTTS は指示チューニングを用いて、パラ言語的な表現や感情のニュアンスを含む、制御可能で人間らしいカジュアルな音声を生成します。吹き替えで一般的に求められるフォーマルな話し方ではなく、音声対話エージェントに必要な話し方へ特化して調整されています。
FireRedTTS ファミリー
2024年の最初のリリースは、その後も発展を続け、より幅広い系譜を形成しています。FireRedTTS-1S(2025)はシステムを真のストリーミング生成へ更新し、導入時にどの指標を重視するかに応じて、低レイテンシのマルチストリーム言語モデル方式と、リアルタイムファクターの低い Flow Matching 方式から選べるようにしました。FireRedTTS-2(2025)は、ポッドキャストやチャットボット向けの長文・複数話者対話生成へ特化してアーキテクチャを拡張し、12.5Hz のストリーミングトークナイザーを追加するとともに、同等の対話合成システムに対して業界最高水準の結果を報告しています。FireRedTTS3(2026)は統合的な生成と編集をさらに進め、指示で制御する音声デザインと、既存音声の特定区間を正確に編集する機能を追加しました。ストリーミング、複数話者によるポッドキャスト形式の対話、音声編集がプロジェクトで特に必要な場合は、最初の基盤モデルよりも、これらの後続リリースのいずれかを出発点にする方が直接的でしょう。
FireRedTTS を使い始める方法
- 専用の conda 環境を作成します。
conda create --name redtts python=3.10を実行すると、ほかのものをインストールする前に必要な Python バージョンが用意されます。 - CUDA バージョンに合った PyTorch をインストールします。 プロジェクトには CUDA 11.8 と CUDA 12.1 それぞれのインストールコマンドが明記されています。バージョン違いは実行時エラーのよくある原因なので、実際のドライバー構成に合わせてください。
- ソースから FireRedTTS をインストールします。
cd fireredtts && pip install -e .を実行し、続けてpip install -r requirements.txtを実行すると、基本的なインストールが完了します。 - プロジェクトの Model_Lists からモデルファイルをダウンロードし、
pretrained_modelsに配置します。 - コード内でデコーダーを選択します。
from fireredtts.fireredtts import FireRedTTSでインポートしてから、音響 LLM デコーダーにはconfig_path="configs/config_24k.json"、Flow Matching デコーダーにはconfig_path="configs/config_24k_flow.json"を指定して初期化します。生成の安定性と、Flow Matching 出力に特有の音質のどちらを優先するかに応じて選んでください。
より良い結果を得るためのヒント
- UGC 形式の手軽な吹き替えにはゼロショットクローンを、スタジオ向けの制作には少数ショットのファインチューニングを使います。 約1時間のデータを使うファインチューニング手法は、表現力豊かなプロ品質の音声を実現するためのものとして明記されています。高品質なコンテンツで、ゼロショットだけに同等の完成度を期待しないでください。
- チャットボット形式の出力には指示チューニングを活用します。 ナレーションや吹き替えではなく、会話エージェントの音声が目的なら、カジュアルな話し方とパラ言語情報を捉える能力こそ、FireRedTTS がその用途向けに特別に調整した機能です。
- デコーダーはデフォルトのままではなく、意図を持って選びます。 音響 LLM デコーダーと Flow Matching デコーダーの両方を実際のコンテンツで試してください。プロジェクトが両方を提供しているのは、一方が完全な上位版だからではなく、それぞれが異なるトレードオフを持つためです。
FireRedTTS と中国チームによるほかの基盤 TTS システムの比較
| FireRedTTS | IndexTTS | CosyVoice | |
|---|---|---|---|
| 開発組織 | Xiaohongshu(FireRed Team) | Bilibili | Alibaba(FunAudioLLM) |
| 中核アーキテクチャ | セマンティックトークナイザー + LM + 2段階波形デコーダー | XTTS/Tortoise ベース、GPT 形式 | 教師ありセマンティックトークン + Flow Matching |
| 実証された用途 | 吹き替え(ゼロショット + 少数ショット)とチャットボット音声 | 一般的なゼロショットクローン、中国語発音の正確さ | ゼロショット多言語クローン |
| スタジオ品質向けのファインチューニング | 対応、約1時間のデータ | 主眼ではない | 主眼ではない |
| ライセンス / 利用制限 | 学術研究用途であることを明記 | 商用利用にはウェイトの許諾が必要 | オープン、ホスト型 API あり |
FireRedTTS の具体的な独自性は、1つの基盤システムを使い、本質的に異なる2つの下流タスクで明確な検証を行った点にあります。同等の中国チーム製 TTS の多くは、単一の主要用途を前面に出していますが、FireRedTTS の論文は吹き替えとチャットボット音声を同じく中心的な実証例として位置づけています。
よくある質問
FireRedTTS と FireRedTTS-2 などの後続リリースには、どのような違いがありますか?
最初の FireRedTTS は基盤システムであり、吹き替えとチャットボット音声で実証されています。FireRedTTS-2 はポッドキャスト向けの長文・複数話者対話生成を特に対象とし、FireRedTTS3 は統合的な生成と音声編集を追加しています。最初のモデルから始める前に、実際の用途に合うリリースを確認してください。
FireRedTTS は追加学習なしで音声をクローンできますか?
はい。手軽な UGC 形式の吹き替えに適したゼロショットクローンを利用できます。より高いスタジオレベルの表現力を得るために、対象話者の録音を約1時間使う少数ショットのファインチューニング手法も用意されています。
FireRedTTS は無料で商用利用できますか?
ゼロショット音声クローン機能は学術研究のみを目的としており、違法な使用を明示的に禁止しています。商用導入の前に、現在のライセンスと利用条件を直接確認してください。
音響 LLM デコーダーと Flow Matching デコーダーのどちらを使うべきですか?
両方が用意されているのは、それぞれ異なるトレードオフがあり、一方が完全に優れているわけではないためです。実際のコンテンツで両方を試し、生成の安定性と出力音質の特性に関する優先事項に合う方を判断してください。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。