Silero TTS:轻量级预训练文本转语音模型
Silero TTS 是一款轻量级、采用 MIT 许可证的预训练模型,只需一行代码即可通过 PyTorch Hub 加载,并对俄语、独联体国家语言和印度语言提供强大支持。
解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。
Silero TTS 是一款轻量级、采用 MIT 许可证的预训练模型,只需一行代码即可通过 PyTorch Hub 加载,并对俄语、独联体国家语言和印度语言提供强大支持。
VITS 是 2021 年推出的条件 VAE 与基于流的 TTS 模型,它证明了单阶段生成可以媲美两阶段系统,并由此催生了无数衍生项目。
MockingBird 只需 5 秒音频即可克隆声音并实时合成普通话语音,至今仍是最受欢迎的中文 TTS 仓库之一。
EmotiVoice 是网易有道开源的 TTS 引擎,拥有 2,000+ 种中英文音色,只需简单的文本提示词即可设定情绪。
YourTTS 是 Coqui 基于 VITS 构建的研究模型,是首个还能执行零样本声音转换的多语言零样本多说话人 TTS 系统。
WhisperSpeech 将 OpenAI 的 Whisper 语音识别架构反向用于从文字生成语音,并且只使用获得适当许可、可安全商用的数据。
VoiceCraft 能编辑已有语音,并用几秒音频克隆声音;在对比中,编辑后的片段有 48% 的时候比原始录音更受听众偏爱。
Voicebox 是 Meta AI 的研究模型,它根据文本和音频上下文补全语音,并利用流匹配实现零样本文本转语音、编辑与降噪。
MetaVoice 是一款采用 Apache 2.0 许可证的 TTS 模型,专为富有情感的英语语音而打造,只需 30 秒参考音频即可克隆美式和英式英语声音。
VibeVoice 是微软的开源 TTS,可生成长达 90 分钟、包含 4 位说话人的播客音频,并提供配套的 VibeVoice-ASR 模型和 4-bit 量化版本。
Sesame CSM 1B 从交错的文本与音频历史中生成语音,能够匹配对话的实际节奏和情感,而不是平淡地朗读文本。
Llasa 通过 XCodec2 语音 token 扩展 LLaMA 1B、3B 和 8B 模型,并使用 25 万小时中英语音数据训练,支持声音克隆和文本转语音。