EchoraEchora
返回模型列表

GLM-TTS:智谱面向生产级中文 TTS 的答案,告别“够用就好”

2026年9月4日
•
7 分钟阅读

许多开源 TTS 模型不过是披着 GitHub README 外衣的研究演示。智谱 AI 与清华大学合作发布的 GLM-TTS 从一开始就瞄准了不同的目标:生产部署。它能从 3 秒音频中克隆声音,以真正精准的方式控制情感和发音;虽然只使用了相对适中的 10 万小时数据进行训练,却依然在多个开放基准上取得了最先进的结果——效率和纯粹的质量同样是重点。

什么是 GLM-TTS?

GLM-TTS 是由智谱 AI 和清华大学研究人员开发的开源工业级文字转语音系统,围绕两阶段架构构建:先用文字到 token 的自回归语言模型,再用 token 到波形的流匹配模型。这样的组合——语言模型负责内容和结构,流匹配负责声学呈现——与其他现代 TTS 系统的大体模式相似,但 GLM-TTS 的独特之处在于叠加了一组专门面向生产的工程选择:优化过的语音 tokenizer、可同时针对多个质量维度调优的强化学习训练框架,以及无需重新训练整个模型就能部署自定义声音的轻量工具。

内部原理:LLM 遇上流匹配

第一阶段是基于 Llama 架构的自回归语言模型,它将输入文本与说话人 embedding 结合,转换成一系列语音 token。该说话人 embedding 由系统前端的 CAMPPlus 模型提取——只要提供任意 3 到 10 秒的参考音频,GLM-TTS 就能立即复现该声音的音色和韵律,不需要针对每位说话人进行微调。

第二阶段使用采用连续流匹配的 Diffusion Transformer,将这些 token 转换成实际音频:先把 token 序列变成高质量梅尔频谱图,再由声码器渲染出最终波形。GLM-TTS 的语音 tokenizer 还专门加入了基频(音高)约束进行优化,这也是即便训练规模相对适中、只有 10 万小时,其音高准确度和整体语音质量依然能够保持出色的部分原因。

GRPO 强化学习:同时优化三个方面

这是 GLM-TTS 在技术上最具特色的贡献,理解它为何重要很有价值。大多数 TTS 训练都会围绕一个主要目标进行优化——通常是可懂度或说话人相似度——而把情感表现力等其他质量放在次要位置。GLM-TTS 则采用基于 GRPO(Group Relative Policy Optimization,组相对策略优化)的多奖励强化学习框架,共同优化发音准确度、说话人相似度和富有表现力的韵律,而不是依次或孤立地处理它们。正是这种联合优化机制,让 GLM-TTS 避免了许多 TTS 输出中那种平淡、“机械”的质感:它们在技术上读对了词,却听起来不像真人在说话。

情感与副语言控制

基于同一套 RL 框架,GLM-TTS 可以直接在生成过程中产生快乐、悲伤、愤怒等特定情感表达,以及笑声、呼吸声等自然的副语言声音,而不需要单独后处理。这种表现力由强化学习驱动,而不是依赖固定的情感参数,因此生成的表达往往比简单样式标签产生的结果更自然地贴合实际内容。

Phoneme-in:不牺牲灵活性的精准发音

GLM-TTS 支持一种名为“Phoneme-in”的音素与文本混合输入方案,允许你直接在普通文本输入中混入明确的音标。这项功能专门解决令许多 TTS 系统棘手的多音字和生僻词问题——某个特定字符或词语可能有多个发音选项——让你能够直接、精确地锁定问题词语或短语的正确读法,而不必把整句话都改写成音标。

基于 LoRA 的声音定制

对于需要特定且一致的自定义声音、超出零样本克隆可靠能力的部署场景,GLM-TTS 支持通过 LoRA(Low-Rank Adaptation,低秩适配)进行参数高效的定制——这种轻量微调方法能够让模型适应目标声音,而不必承担重新训练整个网络的成本和复杂性。它是在“够用”的零样本克隆与完整自定义训练流程之间务实的中间方案。

性能与流式生成

得益于基于流匹配的解码器,GLM-TTS 原生支持流式推理;在 RTX 4090 上,系统的运行速度约为实时速度的 3 到 5 倍——足以用于实时助手、游戏角色对话和流式解说等场景,因为这些用途无法接受等待整段音频生成完毕。

GLM-TTS 入门

  1. 先检查硬件。 GLM-TTS 面向 Python 3.10–3.12 构建,需要至少配备 8GB VRAM 的 NVIDIA GPU 和可用的 CUDA 工具包;模型权重还需预留约 9GB 磁盘空间。CPU 也能推理,但速度会慢得多——单次生成预计需要 5 到 15 分钟,而 GPU 只需几秒。
  2. 下载模型权重。 使用 huggingface-cli download zai-org/GLM-TTS --local-dir ckpt,如果 ModelScope 在你所在地区下载更快,也可以运行 modelscope download --model ZhipuAI/GLM-TTS --local-dir ckpt 从中获取。
  3. 安装依赖项。 建立 Python 3.10–3.12 环境,并在运行任何推理脚本前通过项目的 requirements.txt 安装依赖。
  4. 运行基础生成。 python glmtts_inference.py --data=example_zh --exp_name=_test --use_cache 会使用项目提供的示例数据完成文档中的示例流程。
  5. 添加 --phoneme 标志以精准控制发音。 当你需要锁定多音字或生僻词的特定读法时,使用该标志启用音素能力,即可进入音素与文本混合输入路径,而不必依赖模型默认的纯文本推理。
  6. 使用 Gradio 应用快速测试。 上传参考音频、输入文本、调整 temperature 和 top_p 等生成参数,然后直接试听结果,无需为每次测试都编写脚本。

获得更好结果的技巧

  • 使用真正干净的 3–10 秒参考音频。 由于 CAMPPlus 说话人 embedding 承担了零样本克隆的主要工作,参考音频中的背景噪声或较差录音对音色复现的损害会比在某些其他架构中更明显。
  • 只针对多音字和生僻词使用 Phoneme-in,而不是整篇脚本。 它被设计为有针对性的纠正工具——只在发音确实存在歧义的地方混入音标,比没有必要地将整句话音素化更能简化工作流程。
  • 当零样本结果不够稳定时使用 LoRA 定制。 如果某个特定声音需要在大量内容中保持可靠,而不只是生成单个片段,采用 LoRA 会比反复期待零样本克隆每次都恰好成功更务实。
  • 根据延迟需求匹配 GPU。 文档所述的 3–5 倍实时速度专指 RTX 4090——如果你部署在性能较低的硬件上,应先测试实际吞吐量,再承诺实时或流式使用场景。
  • 任何对时效敏感的任务都不要依赖 CPU 推理。 鉴于 CPU 与 GPU 之间存在单次生成 5 到 15 分钟的性能差距,CPU 推理实际上只适合离线、非交互式用途,而不适合任何实时应用。

GLM-TTS 与其他强大的中文开源模型对比

GLM-TTSCosyVoice3GPT-SoVITS
背后组织智谱 AI + 清华大学阿里巴巴(FunAudioLLM)RVC-Boss(独立)
零样本克隆支持,约 3–10 秒参考音频支持,约 3–10 秒参考音频支持,5 秒
训练方法GRPO 多奖励 RL(共同优化发音 + 相似度 + 韵律)监督训练监督训练 + 可选微调
情感控制RL 驱动(快乐/悲伤/愤怒、笑声、呼吸声)基于指令并非专门功能
发音纠正Phoneme-in 混合输入发音修补手动标注
流式生成支持,原生支持不支持
许可证Apache 2.0(代码)/ MIT(权重)开源,提供托管 APIMIT

GLM-TTS 的具体贡献,是把发音、说话人相似度和情感韵律视为需要共同优化的目标,而不是依次处理——这种训练方法上的差异不像醒目的功能那样直观,却正是将真正可用于生产的系统与优秀研究演示区分开来的工程选择。

常见问题

GLM-TTS 由谁开发?

GLM-TTS 由智谱 AI 与清华大学合作开发,于 2025 年 12 月作为开源项目发布。

GLM-TTS 进行声音克隆需要多少参考音频?

大约 3 到 10 秒。CAMPPlus 模型提取说话人 embedding,从而实现无需针对每位说话人微调的零样本克隆。

GLM-TTS 中的 GRPO 是什么?

它是 Group Relative Policy Optimization(组相对策略优化),一种强化学习框架。GLM-TTS 在训练期间用它共同优化发音准确度、说话人相似度和富有表现力的韵律,而不是把这些目标视为彼此分离、依次处理的任务。

GLM-TTS 可以免费商用吗?

可以。GLM-TTS 的代码采用 Apache 2.0 许可证,模型权重采用 MIT 许可证,两者都允许商业使用。

运行 GLM-TTS 需要什么硬件?

至少配备 8GB VRAM 的 NVIDIA GPU、已安装的 CUDA 工具包、Python 3.10–3.12,以及约 9GB 用于模型权重的磁盘空间。CPU 推理可以运行,但速度明显更慢。

使用参考音频生成相似音色语音

如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。

开始克隆声音 →