EchoraEchora

AI モデル

オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。

読了時間: 約7分

VALL-E X:Microsoft の言語横断音声クローンモデル

VALL-E X は Microsoft による VALL-E の言語横断拡張モデルです。ある言語の声をクローンして別の言語を流暢に話させ、アクセントも制御できます。

VALL-E X言語横断音声クローン多言語 TTSニューラル音声コーデック言語モデルアクセント制御
続きを読む
読了目安:8分

XTTS-v2:Coqui の多言語ゼロショット音声クローン

XTTS-v2 は、わずか6秒のクリップから17言語に対応する Coqui のゼロショット音声クローンモデルです。Coqui が2024年に閉鎖した後も基準であり続けています。

TTSオープンソース TTSゼロショット音声クローン多言語 TTSXTTS-v2
続きを読む
読了約 7 分

E2 TTS:F5-TTSの研究上の直接の前身となったフローマッチング方式のゼロショットモデル

E2 TTSは、Microsoftが開発した「Embarrassingly Easy(恥ずかしいほど簡単)」なゼロショットTTSです。フローマッチングを採用し、持続時間モデルもアライナーも必要とせず、F5-TTSの直接の研究上の前身に当たります。

TTSフローマッチングゼロショット TTS音声クローンE2 TTS
続きを読む