GPT-SoVITS:1分の音声でクローン、中国語に強い
GPT-SoVITS は、わずか1分の音声、または5秒のゼロショットで声をクローンでき、中国語と日本語に特に強く、WebUI ツール一式も備えています。
オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。
GPT-SoVITS は、わずか1分の音声、または5秒のゼロショットで声をクローンでき、中国語と日本語に特に強く、WebUI ツール一式も備えています。
VALL-E 2 は VALL-E に反復認識サンプリングとグループ化コードモデリングを追加し、ゼロショット音声クローンのベンチマークで人間同等の性能に達したと報告されています。
VALL-E X は Microsoft による VALL-E の言語横断拡張モデルです。ある言語の声をクローンして別の言語を流暢に話させ、アクセントも制御できます。
VALL-E は、GPT がテキストを扱うように音声を離散トークンとして扱い、3秒の音声プロンプトから声をクローンする Microsoft のニューラルコーデック言語モデルです。
StyleTTS 2は参照音声なしで拡散により発話スタイルをサンプリングし、LJSpeechデータセットでは自然さが人間の録音を上回ったと報告されています。
StyleTTS は AdaIN と専用のスタイルエンコーダーで話し方と内容を分離し、非自己回帰 TTS の韻律や表現を制御可能にします。
Barkは、簡単な角括弧タグで笑い声、ため息、音楽を加えられる、Sunoによるオープンソースの生成型テキスト音声モデルで、MITライセンスで公開されています。
Tortoise TTS は Apache 2.0 のオープンソース・マルチボイスモデルです。自己回帰 Transformer と diffusion を組み合わせ、遅さと引き換えに卓越した音質を実現します。
XTTS-v2 は、わずか6秒のクリップから17言語に対応する Coqui のゼロショット音声クローンモデルです。Coqui が2024年に閉鎖した後も基準であり続けています。
E2 TTSは、Microsoftが開発した「Embarrassingly Easy(恥ずかしいほど簡単)」なゼロショットTTSです。フローマッチングを採用し、持続時間モデルもアライナーも必要とせず、F5-TTSの直接の研究上の前身に当たります。
F5-TTSは、flow matchingを用いた非自己回帰型のDiffusion Transformer TTSモデルです。わずか数秒で音声をクローンでき、リアルタイム係数(RTF)0.15で高速に推論します。
Fish Speechは、ゼロショット音声クローンとLoRAファインチューニングに対応し、[whisper]や[angry]などの感情タグも内蔵する、Fish Audioの表現力豊かなオープンソースTTSです。