F5-TTS:テキストを入れれば音声が出る、余分な仕組みは不要
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
多くの音声クローンパイプラインには、必要以上に多くの構成要素があります。出力の長さを推定する持続時間予測器、テキストと音声を対応づける音素アライナー、システムのほかの部分とは別に学習された専用テキストエンコーダーです。F5-TTSは、そのすべてを取り除きました。入力テキストを対象音声の長さに合うようパディングし、残りをDiffusion Transformerに任せます。実際にシンプルなパイプラインでありながら高速でもあり、研究者自身のテストではリアルタイム係数(RTF)がわずか0.15でした。
F5-TTSとは?
F5-TTSは、flow matchingを基盤とし、Diffusion Transformer(DiT)をバックボーンに採用した完全非自己回帰型のテキスト読み上げシステムです。上海交通大学、ケンブリッジ大学、Geely Automobile Research Instituteの研究者によって開発され、SWivid/F5-TTSの名称でオープンソース公開されました。自己回帰モデルのように音声をトークン単位で予測するのではなく、F5-TTSは生成をノイズ除去プロセスとして扱います。ノイズから始め、入力テキストと参照音声を条件として、DiTで反復的にメルスペクトログラムへ変換します。
仕組みを理解する:F5-TTSが速い理由
持続時間モデリングの代わりにフィラートークンでパディング。 F5-TTSは各単語の長さを予測せず、テキスト入力が対象音声の長さと一致するまでフィラートークンでパディングし、ノイズ除去中のアライメントをflow matchingプロセスに委ねます。これにより、多くのTTSアーキテクチャが不可欠と考える構成要素、つまり持続時間モデルを丸ごと取り除けます。
テキスト表現にConvNeXt V2を使用。 これは、F5-TTSが直接の前身モデルに加えた主要な改善点の一つです。初期のflow matching手法は、テキストと音声を安定して対応づけることが難しく、単語の欠落やフレーズの繰り返しが起きていました。F5-TTSは最初にConvNeXt V2でテキストを処理し、Diffusion Transformerが対応する音声とより容易にアライメントできるテキスト表現を生成します。
Sway Sampling。 生成時にflow stepをどのようにサンプリングするか調整し、再学習なしで出力品質と推論速度の両方を改善する推論時の戦略です。特筆すべき点として、この技術はF5-TTS固有のアーキテクチャに限られません。ほかの条件付きflow matchingモデルにも、そのまま適用できる推論最適化です。
これらの選択を組み合わせた結果、パイプラインは本当に簡潔になりました。持続時間モデルも、音素アライナーも、別個に学習されたテキストエンコーダーもなく、報告されたリアルタイム係数(RTF)は0.15です。つまり、実時間の約6〜7倍の速度で音声を生成でき、高度に最適化された本番用TTSシステムにも匹敵します。
E2 TTSとのつながり
F5-TTSは「テキストをパディングしてからノイズを除去する」という方法をゼロから発明したわけではありません。アライナーを使わないこの最小限の戦略がそもそも機能することを最初に証明した先行モデルであるE2 TTSを直接土台にしています。E2 TTSは概念の実現可能性を示しましたが、学習時の収束が遅く、アライメントの堅牢性にも問題があり、安定した導入は困難でした。F5-TTSはまさにその問題を解決するために作られ、ConvNeXt V2とSway Samplingを使用して、E2 TTSが明らかにした問題点に対処しています。F5-TTSの公式リポジトリには、F5モデルとともにE2TTS_Baseチェックポイントも収録されています。研究者は原論文で報告された数値だけに頼らず、両アーキテクチャを直接再現して比較できます。
ゼロショットとクロスリンガル音声クローン
F5-TTSの音声クローンは短い参照クリップで動作します。一般的には5〜15秒が目安とされ、一部の構成ではわずか6秒でも機能します。実用的な結果を得るためのファインチューニングは不要です。また、クロスリンガルクローンにも対応しています。英語の参照クリップを入力し、同じクローン音声でスペイン語、または別の対応言語の音声を生成できます。公式ドキュメントでも、この機能は特に強調されています。
ゼロショットより高い一貫性が必要なチーム向けに、F5-TTSはファインチューニングにも対応しています。学習ループは比較的シンプルで、コーデックの前処理も、多段階パイプラインの管理も不要です。必要なのは、準備した音声と対応づけられた文字起こしだけです。このシンプルさにより、完全な学習クラスターではなく、1台のコンシューマー向けGPUでカスタム音声の学習を試すチームにとって、よく使われる出発点となっています。
F5-TTSの始め方
- リポジトリをクローンする。
git clone https://github.com/SWivid/F5-TTS.gitを実行し、続いてcd F5-TTSとpip install -e .を実行します。BigVGANをボコーダーとして使う場合にのみ、必要に応じてサブモジュールを再帰的に取得してください。 - CUDAバージョンに合うPyTorchをインストールする。 プロジェクトのドキュメントには、CUDAリリースごとの正確なPyTorchとtorchaudioのバージョンが記載されています。正確に合わせることで、ほとんどのインストール問題を避けられます。
- CLIから推論を実行する。
f5-tts_infer-cli --model F5TTS_v1_Base --ref_audio "your_clip.wav" --ref_text "transcript of the clip" --gen_text "the text you want spoken"で直接クリップを生成できます。--ref_textを空欄にすると、追加のGPUメモリを消費する代わりに、ASRモデルが参照音声を自動で文字起こしします。 - 簡単なテストにはGradio WebUIを使う。
f5-tts_infer-gradio、または同等のDockerコマンドでブラウザ画面が開き、パイプラインへ組み込む前にクローンを試せます。 - VRAMが推奨仕様を満たすか確認する。 F5-TTSは約16GBのVRAMを備えたNVIDIA GPUならどれでも動作し、24GB、つまりRTX 3090/4090クラスのカードなら十分な余裕があります。本番導入を計画する前に、ハードウェアが適合するか確認してください。
- 本番規模の配信にはTensorRT-LLM/Triton構成を使う。 多数のリクエストを処理するとき、基本的なPython推論スクリプトを大規模に実行する代わりに、TritonとTensorRT-LLMを使って大幅に高速なデコードを実現する導入方法がプロジェクトに記載されています。
より良い結果を得るためのヒント
- 参照クリップをきれいに保ち、推奨される長さの範囲に収める。 純粋な音響トークンモデルと比べ、背景ノイズや5〜15秒の推奨範囲から大きく外れた長さのクリップは、クローン品質をより損ないやすい傾向があります。
- 可能なら正確な参照文字起こしを用意する。 内蔵ASRモデルによる自動文字起こしは便利ですが、手動で確認した文字起こしなら、ASRの誤りがクローン処理自体に影響するのを防げます。
- 採用を決める前に、使用する言語ペアでクロスリンガルクローンを試す。 この機能は公式ドキュメントにも明記されていますが、品質は具体的な変換元と変換先の言語の組み合わせによって変わります。プロジェクトで実際に必要な組み合わせを検証してください。
- 手動調整の前にSway Samplingのデフォルト設定を使う。 再学習なしでそのまま結果を改善するよう設計されています。フローステップの手動調整は開始時の要件ではなく、後から行う最適化として扱ってください。
- 商用利用の前にライセンス条項を読む。 F5-TTSの事前学習済みウェイトは、実環境で収集されたEmiliaデータセットを用いて学習されているため、CC-BY-NCライセンスで公開されています。研究および非商用利用は認められますが、商用導入には別途許可が必要です。
F5-TTS、E2 TTS、ほかのクローンモデルの比較
| F5-TTS | E2 TTS(前身モデル) | CosyVoice3 | |
|---|---|---|---|
| アーキテクチャ | Diffusion Transformer + flow matching | フラットU-Net Transformer | 教師ありセマンティックトークン + flow matching |
| 持続時間モデル/アライナーの必要性 | なし | なし(ただし堅牢性は低い) | なし |
| 学習の収束 | より高速で堅牢 | 低速、アライメントに問題 | N/A(異なるアーキテクチャファミリー) |
| 参照クリップの長さ | 約5〜15秒 | 同程度 | 約3〜10秒 |
| クロスリンガルクローン | 対応 | 限定的 | 対応 |
| 推論速度(RTF) | 約0.15 | より低速 | 同程度、ホスティング版では約150msのレイテンシ |
| ライセンス | CC-BY-NC(非商用) | 研究利用 | オープン、ホスト型APIあり |
F5-TTSがこのファミリーにもたらした独自の貢献は、E2 TTSが開拓した最小限のアライナー不要アプローチを、本当に高速で信頼できるものにできると証明したことです。アーキテクチャは競合する多くのクローンモデルよりシンプルで、ベンチマークの速度は後から最適化を重ねた結果ではなく、そのシンプルさを直接反映しています。
よくある質問
実際のところ、F5-TTSの「非自己回帰」とはどういう意味ですか?
モデルが音声を順番に1トークンずつ生成しないという意味です。代わりにノイズから始め、Diffusion Transformerを通じて出力全体のノイズを除去します。これが、トークン単位の自己回帰生成より推論を高速化できる理由の一つです。
F5-TTSとE2 TTSはどのような関係ですか?
E2 TTSは、持続時間モデルもアライナーも使わないTTS手法が機能することを最初に証明した先行モデルですが、学習の収束が遅く、アライメントの堅牢性にも問題がありました。F5-TTSは、ConvNeXt V2のテキスト表現とSway Samplingを使って、それらの問題を解決するために作られました。公式リポジトリには、直接比較できるようF5-TTSとE2TTS_Baseの両チェックポイントが含まれています。
F5-TTSの音声クローンにはどれくらいの参照音声が必要ですか?
一般的な目安は5〜15秒ですが、一部の構成ではわずか6秒のきれいな参照音声でも実用的な結果が報告されています。
F5-TTSは無料で商用利用できますか?
別途許可を得ない限り、商用利用はできません。事前学習済みモデルのウェイトは、学習用Emiliaデータセットのライセンス条項によりCC-BY-NCライセンスで公開されています。研究および非商用利用は認められますが、商用導入前に最新の条件を直接確認する必要があります。
F5-TTSの実行にはどのようなハードウェアが必要ですか?
約16GBのVRAMを備えたNVIDIA GPUであれば動作し、特にファインチューニングを予定している場合は、余裕を持たせるために24GB、つまりRTX 3090または4090クラスのカードが推奨されます。
Echoraでテキストを音声に変換
テキストから一人の話者による音声を作る同様のワークフローをブラウザで利用したい場合は、Echoraのテキスト読み上げを使えます。最大5,000文字を入力し、内蔵音声または保存したカスタム音声を選び、必要に応じて対応している話し方タグを追加して安定性を調整できます。生成結果はプレビューしてMP3でダウンロードできます。