Qwen3-TTS:阿里巴巴开源声音克隆模型
Qwen3-TTS(Qwen-TTS)是阿里巴巴的开源 TTS,延迟 97ms,只需 3 秒音频即可克隆声音,还支持文字设计音色,覆盖 10 种语言,可免费试用。
解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。
Qwen3-TTS(Qwen-TTS)是阿里巴巴的开源 TTS,延迟 97ms,只需 3 秒音频即可克隆声音,还支持文字设计音色,覆盖 10 种语言,可免费试用。
IndexTTS 2 是首个具备毫秒级时长控制和情感与音色解耦能力的自回归 TTS,专为视听配音同步而打造。
IndexTTS 是 B 站开源的 TTS,支持用拼音纠正发音和通过标点控制停顿,并在准确性方面超过 XTTS 和 F5-TTS。
CosyVoice3 覆盖 9 种语言和 18+ 种中文方言,加入发音修复功能,并在克隆准确性基准测试中击败 F5-TTS 等更大模型。
CosyVoice2 以 150ms 首包延迟流式生成语音,相比 CosyVoice 将发音错误减少 30–50%,并加入可指令控制的情绪与口音。
CosyVoice 是阿里巴巴 FunAudioLLM 开源的 TTS 模型,采用受监督语义 token,以仅 3 亿参数实现覆盖 5 种语言的零样本声音克隆。
Kokoro-82M 是一款采用 Apache-2.0 许可证的 TTS 模型,提供覆盖 8 种语言的 54 个声音,可在无需 GPU 的 CPU 上快速运行。免费、开源且易于自托管。
Chatterbox Multilingual 只需 5–10 秒音频即可克隆声音,并用 23 种语言说话,同时保持口音和音色一致。开源,采用 MIT 许可证。
Chatterbox Turbo 将 TTS 生成从 10 步蒸馏为 1 步,把实时语音智能体的延迟降至 150 毫秒以内。快速、开源,并采用 MIT 许可证。
Chatterbox 是 Resemble AI 推出的开源 TTS 模型,支持零样本声音克隆、情绪强度控制和内置水印。了解它与 ElevenLabs 的实际对比。
Dia2 是 Nari Labs 为 Dia TTS 推出的流式升级版:在接收文本的同时实时生成多说话人对话,并保持各说话人的声音一致。了解它的工作原理。
Nari Labs 的 Dia 1.6B 是一款开源语音模型,可一次生成带有真实情绪、笑声和叹息的多说话人对话。现在即可免费在线体验。