Step-Audio:阶跃星辰统一语音理解 + TTS
Step-Audio 是阶跃星辰推出的开源模型,将语音识别、对话和声音生成统一在一个系统中,省去了从 ASR 到 TTS 的交接。
解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。
Step-Audio 是阶跃星辰推出的开源模型,将语音识别、对话和声音生成统一在一个系统中,省去了从 ASR 到 TTS 的交接。
Zonos 是 Zyphra 推出的开放权重 TTS 模型,使用超过 20 万小时语音训练,可在几秒内克隆声音,并精细控制情绪、音高和语速。
Orpheus TTS 是 Canopy Labs 基于 Llama-3B 的语音 LLM,具备 200ms 流式延迟、情绪标签和零样本克隆能力,可通过 FastAPI 服务器部署。
OuteTTS 把语音视为纯语言建模,因此能以 GGUF 格式在 llama.cpp 上原生运行,并可用 10 秒音频克隆声音,共支持 23 种语言。
GLM-TTS 是智谱 AI 开源 TTS,将 LLM 与流匹配结合,只需 3 秒即可克隆声音,并通过强化学习提升情感与发音表现。
Parler-TTS 是 Hugging Face 的开源 TTS 模型,可通过自然语言描述控制音色、音高和说话风格,无需音频。
ChatTTS 是 2noise 推出的 TTS 模型,针对中英文聊天机器人和助手对话优化,可生成自然的笑声、停顿和语气词。
MeloTTS 是 MyShell 开源的多语言 TTS,支持 CPU 实时推理,并可在同一句语音中自然进行中英文语码转换。
Piper TTS 是一款拥有 1500 万参数、仅凭 CPU 即可实时运行的神经语音模型,专为树莓派和其他边缘设备打造,无需 GPU。
NaturalSpeech 3 将语音拆分为独立的内容、韵律、音色和细节子空间,使微软这款 TTS 模型可以分别控制每一项属性。
NaturalSpeech 2 在连续音频编码上采用潜在扩散,让微软这款 TTS 模型仅凭一段说话声音提示,就能生成零样本歌声。
NaturalSpeech 是微软基于 VAE 的 TTS 模型,它正式定义了人类水平质量,随后在 LJSpeech 数据集上通过了自己提出的统计检验。