EchoraEchora
返回模型列表

Qwen3-TTS:不到十分之一秒就能开口回应的语音模型

2026年8月29日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

大多数声音克隆演示都要等上一拍才会开始播放音频——这段等待已经足以让人感觉不像在真正对话。阿里巴巴 Qwen 团队的开源语音模型 Qwen3-TTS 正是为缩短这段间隔而打造:它采用双轨架构端到端生成语音,首个音频包延迟最低可达 97 毫秒,速度快到可以接在实时语音智能体之后,而不会额外带来明显延迟。

什么是 Qwen3-TTS?

Qwen3-TTS 是一款开源文字转语音模型,使用超过 500 万小时的语音数据训练,以 Apache 2.0 许可证发布,并在 Hugging Face 和 GitHub 上公开权重。其核心是定制语音 tokenizer Qwen3-TTS-Tokenizer-12Hz,配合混合流式架构直接生成音频,而不经过单独的 diffusion 或 vocoder 阶段——这一设计既带来了低延迟,也让模型在处理更长或噪声更多的输入文本时保持稳定。

该模型覆盖 10 种主要语言——中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语——以及多种中文方言音色,并提供两种开源权重规模:追求最高质量的 1.7B 参数版本,以及面向受限硬件、同时又没有牺牲太多效果的轻量 0.6B 版本。

三种生成声音的方式

Qwen3-TTS 不会把你限制在单一用法中——它围绕三种不同的语音生成方式构建,具体选择取决于你手头有什么素材。

用 3 秒音频克隆声音。 提供一段简短参考音频及其对应文字稿,模型就能用该说话人的声音朗读新文本——这是当前开源克隆模型中对参考音频要求最短的方案之一。

用文字描述设计音色。 手头没有录音?用自然语言描述想要的声音——年龄、性别、语气、个性——Qwen3-TTS 无需任何音频参考,就能生成与描述匹配的新音色。如果你需要一种鲜明的角色声音,又不想先寻找、获得许可或录制素材,这确实是一个实用选项。

选择现成的预设音色。 如果项目只需要一个可靠的声音,不想进行任何设置,托管 API 提供了 49 个预设的多角色音色。这些音色以具名人物设定为基础,覆盖不同年龄、性别和性格,无需额外配置即可随时切换。

在这三种模式下,模型都能很好地理解上下文——它会根据文本本身的语义调整语气、节奏和情感表达,在面对杂乱或格式不够规范的输入时,也比同系列更早的语音模型表现得更稳定。

Qwen3-TTS 入门

  1. 在自托管和 API 之间做出选择。 自托管开源权重可以获得完整控制权,也没有按字符计费;如果你不想管理 GPU 基础设施,调用托管 API 会更快捷,例如用于快速低延迟生成的 qwen3-tts-flash,或需要自然语言指令控制时使用的 qwen3-tts-instruct-flash。
  2. 安装软件包。 运行 pip install qwen-tts 即可获得在本地加载并运行推理所需的 Qwen3TTSModel 类。
  3. 根据硬件选择合适大小的 checkpoint。 Qwen/Qwen3-TTS-12Hz-1.7B-Base 是完整质量版本,大约需要 6–8GB VRAM;0.6B 版本在 4–6GB VRAM 上即可流畅运行,质量上的取舍比两者体量差异所暗示的要小。
  4. 生成克隆声音。 调用 generate_voice_clone(),传入目标文本、语言代码、参考音频文件及其对应文字稿。
  5. 为重复生成缓存参考 prompt。 如果要用同一个克隆声音制作多段音频,请复用已经计算出的 prompt 特征,不要每次调用都重新计算——这样能明显加快批量生成。
  6. 使用 vLLM 提升生产吞吐量。 Qwen 团队从第一天起就为 Qwen3-TTS 提供 vLLM 支持;只要不是小规模测试,它都比普通 PyTorch 推理循环更值得使用。

无需配置即可试用

官方 Hugging Face Space 和 ModelScope 演示都能让你直接在浏览器中测试声音克隆与音色设计,无需安装。阿里云还曾为通过 Model Studio API 试用该模型的开发者提供免费字符额度,Replicate 和 DeepInfra 等第三方平台也托管了这一开源权重模型;在决定投入本地基础设施或付费 API 套餐之前,这些都是低门槛评估效果的方式。

获得更好效果的技巧

  • 确保克隆时的参考文字稿完全准确。 克隆质量高度依赖参考文字与音频实际内容是否一致——文字稿不匹配带来的损害,比录音质量稍低更加严重。
  • 没有真实参考音频时使用音色设计。 与其寻找一段“足够接近”的现成录音,用文字描述你想要的声音往往更接近目标,同时还能避开真实录制声音可能涉及的许可问题。
  • 不确定硬件条件时先用 0.6B 模型。 它的资源占用约为 1.7B 版本的一半,却足以应对大多数使用场景——只有明确需要额外保真度时再升级。
  • 实时应用使用托管的低延迟模型变体。 如果你构建的应用更接近语音智能体,而不是批量内容生成,API 中快速、低延迟的选项就是专门为这一场景设计的,因此无需自行优化自托管推理。

Qwen3-TTS 与其他开源克隆模型对比

Qwen3-TTSCosyVoice3Chatterbox
开发机构阿里巴巴(Qwen 团队)阿里巴巴(FunAudioLLM)Resemble AI
参数量0.6B / 1.7B0.5B~0.5B
克隆所需参考音频~3 秒~3–10 秒5–10 秒
首包延迟~97ms~150ms(托管)并非主要优化重点
通过文字设计音色是否否
语言109 + 18 种中文方言英语(多语言版本:23 种)
许可证Apache 2.0开源,并提供托管 APIMIT

Qwen3-TTS 的独特优势,是在单一开源权重版本中将真正的低延迟与三种不同生成路径——声音克隆、基于文字的音色设计和现成预设——结合起来;与规模相当的大多数单一用途克隆模型相比,它提供了更广的功能范围。

常见问题

Qwen-TTS 和 Qwen3-TTS 是同一个模型吗?

不完全是。Qwen-TTS 是阿里巴巴更早的语音模型,只能通过托管的 Qwen API 使用,没有公开权重。Qwen3-TTS 是更新一代,已经开源并提供可下载权重,功能范围也更广——如果你希望自托管或微调,应当选择 Qwen3-TTS。

qwen3-tts-flash 是什么意思?

这是阿里云 API 提供的 Qwen3-TTS 托管版本名称,针对快速、低延迟生成做了优化,无需自行托管。它运行的是与开源权重版本相同的底层模型家族,只是以托管服务的形式提供。

Qwen3-TTS 可以免费使用吗?

开源权重可以依据 Apache 2.0 许可证免费自托管。托管 API 曾为新开发者提供免费字符额度,超出后按量付费——确切限额请查看阿里云当前定价。

0.6B 和 1.7B 模型在实际使用中有什么区别?

1.7B 模型输出质量更高,需要更多 VRAM(大约 6–8GB);0.6B 模型更轻量(4–6GB),而质量上的取舍比参数差距所暗示的要小。

安装前可以先测试 Qwen3-TTS 吗?

可以——官方 Hugging Face Space 和 ModelScope 演示都能在浏览器内运行,Replicate 和 DeepInfra 等托管平台也提供无需本地配置的 API 访问。

使用参考音频生成相似音色语音

如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。

开始克隆声音 →