Qwen3-TTS:不到十分之一秒就能开口回应的语音模型
大多数声音克隆演示都要等上一拍才会开始播放音频——这段等待已经足以让人感觉不像在真正对话。阿里巴巴 Qwen 团队的开源语音模型 Qwen3-TTS 正是为缩短这段间隔而打造:它采用双轨架构端到端生成语音,首个音频包延迟最低可达 97 毫秒,速度快到可以接在实时语音智能体之后,而不会额外带来明显延迟。
什么是 Qwen3-TTS?
Qwen3-TTS 是一款开源文字转语音模型,使用超过 500 万小时的语音数据训练,以 Apache 2.0 许可证发布,并在 Hugging Face 和 GitHub 上公开权重。其核心是定制语音 tokenizer Qwen3-TTS-Tokenizer-12Hz,配合混合流式架构直接生成音频,而不经过单独的 diffusion 或 vocoder 阶段——这一设计既带来了低延迟,也让模型在处理更长或噪声更多的输入文本时保持稳定。
该模型覆盖 10 种主要语言——中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语——以及多种中文方言音色,并提供两种开源权重规模:追求最高质量的 1.7B 参数版本,以及面向受限硬件、同时又没有牺牲太多效果的轻量 0.6B 版本。
三种生成声音的方式
Qwen3-TTS 不会把你限制在单一用法中——它围绕三种不同的语音生成方式构建,具体选择取决于你手头有什么素材。
用 3 秒音频克隆声音。 提供一段简短参考音频及其对应文字稿,模型就能用该说话人的声音朗读新文本——这是当前开源克隆模型中对参考音频要求最短的方案之一。
用文字描述设计音色。 手头没有录音?用自然语言描述想要的声音——年龄、性别、语气、个性——Qwen3-TTS 无需任何音频参考,就能生成与描述匹配的新音色。如果你需要一种鲜明的角色声音,又不想先寻找、获得许可或录制素材,这确实是一个实用选项。
选择现成的预设音色。 如果项目只需要一个可靠的声音,不想进行任何设置,托管 API 提供了 49 个预设的多角色音色。这些音色以具名人物设定为基础,覆盖不同年龄、性别和性格,无需额外配置即可随时切换。
在这三种模式下,模型都能很好地理解上下文——它会根据文本本身的语义调整语气、节奏和情感表达,在面对杂乱或格式不够规范的输入时,也比同系列更早的语音模型表现得更稳定。
Qwen3-TTS 入门
- 在自托管和 API 之间做出选择。 自托管开源权重可以获得完整控制权,也没有按字符计费;如果你不想管理 GPU 基础设施,调用托管 API 会更快捷,例如用于快速低延迟生成的
qwen3-tts-flash,或需要自然语言指令控制时使用的qwen3-tts-instruct-flash。 - 安装软件包。 运行
pip install qwen-tts即可获得在本地加载并运行推理所需的Qwen3TTSModel类。 - 根据硬件选择合适大小的 checkpoint。
Qwen/Qwen3-TTS-12Hz-1.7B-Base是完整质量版本,大约需要 6–8GB VRAM;0.6B 版本在 4–6GB VRAM 上即可流畅运行,质量上的取舍比两者体量差异所暗示的要小。 - 生成克隆声音。 调用
generate_voice_clone(),传入目标文本、语言代码、参考音频文件及其对应文字稿。 - 为重复生成缓存参考 prompt。 如果要用同一个克隆声音制作多段音频,请复用已经计算出的 prompt 特征,不要每次调用都重新计算——这样能明显加快批量生成。
- 使用 vLLM 提升生产吞吐量。 Qwen 团队从第一天起就为 Qwen3-TTS 提供 vLLM 支持;只要不是小规模测试,它都比普通 PyTorch 推理循环更值得使用。
无需配置即可试用
官方 Hugging Face Space 和 ModelScope 演示都能让你直接在浏览器中测试声音克隆与音色设计,无需安装。阿里云还曾为通过 Model Studio API 试用该模型的开发者提供免费字符额度,Replicate 和 DeepInfra 等第三方平台也托管了这一开源权重模型;在决定投入本地基础设施或付费 API 套餐之前,这些都是低门槛评估效果的方式。
获得更好效果的技巧
- 确保克隆时的参考文字稿完全准确。 克隆质量高度依赖参考文字与音频实际内容是否一致——文字稿不匹配带来的损害,比录音质量稍低更加严重。
- 没有真实参考音频时使用音色设计。 与其寻找一段“足够接近”的现成录音,用文字描述你想要的声音往往更接近目标,同时还能避开真实录制声音可能涉及的许可问题。
- 不确定硬件条件时先用 0.6B 模型。 它的资源占用约为 1.7B 版本的一半,却足以应对大多数使用场景——只有明确需要额外保真度时再升级。
- 实时应用使用托管的低延迟模型变体。 如果你构建的应用更接近语音智能体,而不是批量内容生成,API 中快速、低延迟的选项就是专门为这一场景设计的,因此无需自行优化自托管推理。
Qwen3-TTS 与其他开源克隆模型对比
| Qwen3-TTS | CosyVoice3 | Chatterbox | |
|---|---|---|---|
| 开发机构 | 阿里巴巴(Qwen 团队) | 阿里巴巴(FunAudioLLM) | Resemble AI |
| 参数量 | 0.6B / 1.7B | 0.5B | ~0.5B |
| 克隆所需参考音频 | ~3 秒 | ~3–10 秒 | 5–10 秒 |
| 首包延迟 | ~97ms | ~150ms(托管) | 并非主要优化重点 |
| 通过文字设计音色 | 是 | 否 | 否 |
| 语言 | 10 | 9 + 18 种中文方言 | 英语(多语言版本:23 种) |
| 许可证 | Apache 2.0 | 开源,并提供托管 API | MIT |
Qwen3-TTS 的独特优势,是在单一开源权重版本中将真正的低延迟与三种不同生成路径——声音克隆、基于文字的音色设计和现成预设——结合起来;与规模相当的大多数单一用途克隆模型相比,它提供了更广的功能范围。
常见问题
Qwen-TTS 和 Qwen3-TTS 是同一个模型吗?
不完全是。Qwen-TTS 是阿里巴巴更早的语音模型,只能通过托管的 Qwen API 使用,没有公开权重。Qwen3-TTS 是更新一代,已经开源并提供可下载权重,功能范围也更广——如果你希望自托管或微调,应当选择 Qwen3-TTS。
qwen3-tts-flash 是什么意思?
这是阿里云 API 提供的 Qwen3-TTS 托管版本名称,针对快速、低延迟生成做了优化,无需自行托管。它运行的是与开源权重版本相同的底层模型家族,只是以托管服务的形式提供。
Qwen3-TTS 可以免费使用吗?
开源权重可以依据 Apache 2.0 许可证免费自托管。托管 API 曾为新开发者提供免费字符额度,超出后按量付费——确切限额请查看阿里云当前定价。
0.6B 和 1.7B 模型在实际使用中有什么区别?
1.7B 模型输出质量更高,需要更多 VRAM(大约 6–8GB);0.6B 模型更轻量(4–6GB),而质量上的取舍比参数差距所暗示的要小。
安装前可以先测试 Qwen3-TTS 吗?
可以——官方 Hugging Face Space 和 ModelScope 演示都能在浏览器内运行,Replicate 和 DeepInfra 等托管平台也提供无需本地配置的 API 访问。
使用参考音频生成相似音色语音
如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。