阅读约 6 分钟
CosyVoice2:流式低延迟多语言 TTS 模型
CosyVoice2 以 150ms 首包延迟流式生成语音,相比 CosyVoice 将发音错误减少 30–50%,并加入可指令控制的情绪与口音。
TTS流式 TTS低延迟 TTS声音克隆CosyVoice2
阅读更多解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。
CosyVoice2 以 150ms 首包延迟流式生成语音,相比 CosyVoice 将发音错误减少 30–50%,并加入可指令控制的情绪与口音。
CosyVoice 是阿里巴巴 FunAudioLLM 开源的 TTS 模型,采用受监督语义 token,以仅 3 亿参数实现覆盖 5 种语言的零样本声音克隆。
Kokoro-82M 是一款采用 Apache-2.0 许可证的 TTS 模型,提供覆盖 8 种语言的 54 个声音,可在无需 GPU 的 CPU 上快速运行。免费、开源且易于自托管。
Chatterbox Multilingual 只需 5–10 秒音频即可克隆声音,并用 23 种语言说话,同时保持口音和音色一致。开源,采用 MIT 许可证。
Chatterbox Turbo 将 TTS 生成从 10 步蒸馏为 1 步,把实时语音智能体的延迟降至 150 毫秒以内。快速、开源,并采用 MIT 许可证。
Chatterbox 是 Resemble AI 推出的开源 TTS 模型,支持零样本声音克隆、情绪强度控制和内置水印。了解它与 ElevenLabs 的实际对比。
Dia2 是 Nari Labs 为 Dia TTS 推出的流式升级版:在接收文本的同时实时生成多说话人对话,并保持各说话人的声音一致。了解它的工作原理。
Nari Labs 的 Dia 1.6B 是一款开源语音模型,可一次生成带有真实情绪、笑声和叹息的多说话人对话。现在即可免费在线体验。