GPT-SoVITS:1 分钟声音克隆,中文表现突出
GPT-SoVITS 只需 1 分钟音频即可克隆声音,也能用 5 秒音频进行零样本克隆,尤其擅长中文和日文,并配有完整的 WebUI 工具套件。
解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。
GPT-SoVITS 只需 1 分钟音频即可克隆声音,也能用 5 秒音频进行零样本克隆,尤其擅长中文和日文,并配有完整的 WebUI 工具套件。
VALL-E 2 在 VALL-E 的基础上加入重复感知采样和分组代码建模,据称在零样本声音克隆基准测试中达到了人类水平。
VALL-E X 是微软推出的 VALL-E 跨语言扩展模型,能克隆一种语言中的声音,让它流利地说出另一种语言,并内置口音控制。
VALL-E 是微软的神经编解码语言模型,它像 GPT 处理文字一样将语音视为离散 token,并能通过 3 秒音频提示克隆声音。
StyleTTS 2 使用扩散模型采样说话风格,无需参考音频;据称其在 LJSpeech 数据集上的自然度超越了人类录音。
StyleTTS 使用 AdaIN 和专用风格编码器将说话风格与内容分离,让非自回归 TTS 能够控制韵律与表达方式。
Bark 是 Suno 的开源生成式文本转音频模型,可通过简单的方括号标签加入笑声、叹气和音乐,并采用 MIT 许可证发布。
Tortoise TTS 是一款采用 Apache 2.0 许可证的开源多音色模型,将自回归 Transformer 与扩散模型结合,以较慢的生成速度换取出色的音频质量。
XTTS-v2 是 Coqui 的零样本声音克隆模型,只需 6 秒音频即可覆盖 17 种语言;即使 Coqui 已于 2024 年关闭,它仍是行业标杆。
E2 TTS 是微软基于流匹配构建的零样本 TTS 系统,号称“简单到令人尴尬”;它无需时长模型或对齐器,也是 F5-TTS 的直接研究前身。
F5-TTS 是一款基于流匹配的非自回归 Diffusion Transformer TTS 模型,可在数秒内完成声音克隆,实时因子(RTF)仅为 0.15,推理速度很快。
Fish Speech 是 Fish Audio 推出的富有表现力的开源 TTS,支持零样本克隆和 LoRA 微调,并内置 [whisper]、[angry] 等情绪标签。