EchoraEchora
返回模型列表

XTTS-v2:开发公司关闭后依然屹立的声音克隆标杆

2026年8月30日
•
8 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

许多开源模型在与其他任何模型比较之前,都会先拿来和 XTTS-v2 对比。考虑到打造它的 Coqui AI 已于 2024 年初彻底关闭,一个模型还能占据这样的地位,着实不同寻常。然而,XTTS-v2 依然守住了这份声誉——这套多语言零样本声音克隆系统足够出色,以至于开发公司的消失几乎没有削弱它的影响力。

什么是 XTTS-v2?

XTTS-v2 是 Coqui AI 开发的开源多语言文字转语音及声音克隆模型,于 2023 年发布,是对原始 XTTS 架构的改进。它只需短至 6 秒的参考音频,就能克隆说话人的声音,并支持 17 种语言:阿拉伯语、巴西葡萄牙语、普通话、捷克语、荷兰语、英语、法语、德语、意大利语、波兰语、俄语、西班牙语、土耳其语、日语、韩语、匈牙利语和印地语。

从架构上看,XTTS-v2 基于 GPT,而不是扩散模型——这让它与同领域较新的流匹配模型形成了有意义的区别。VQ-VAE 首先把真实音频转换成离散声学编码,并将其作为训练目标。随后,一个 GPT-2 风格的语言模型根据输入文字和说话人潜在表征来预测这些音频 token;这一表征由基于 Perceiver 的编码器计算得出,该编码器把参考梅尔频谱处理成一个捕捉说话人身份的紧凑向量。最后,HiFi-GAN 声码器将 token 序列转换成 24kHz 音频波形。

相比原始 XTTS 有哪些改进

第 2 版的变化恰好集中在那些能让克隆在实际使用中可靠、而不只是在演示里显得可行的方面:更好的说话人条件控制,支持多个参考片段并在说话人之间插值,整体韵律与音质有所提升,以及与初始版本相比明显更好的推理稳定性。它还继承了原版的跨语言克隆能力——用一种语言录制参考片段,再以另一种语言生成自然语音,同时保留说话人的声音身份——以及通过参考编码器自动完成的情绪和风格迁移,无需另外设置手工调校的独立控制项。

独立测试报告显示,在纯零样本条件下,说话人相似度得分(SECS)约为 0.59;若加入约十分钟的额外微调数据,得分可提高至约 0.72。如果你正在判断仅靠零样本克隆能否满足项目需求,或是否值得针对特定声音再进行微调,这组数据是一个实用的参考基准。

Coqui 关闭对你到底意味着什么

在基于 XTTS-v2 构建任何项目之前,这件事值得了解清楚。Coqui AI 是一家由前 Mozilla DeepSpeech 工程师创立、总部位于柏林的初创公司,于 2024 年 1 月关闭,并彻底停止了托管式 Coqui Studio 和 Coqui API 产品。公司在没有被收购的情况下结束运营,原始 GitHub 仓库也不再由创始团队正式开发。

在实际使用中,这带来的变化比你想象的要少。代码和模型权重仍完全公开并可下载,活跃的社区分支(idiap/coqui-ai-TTS)持续让项目兼容当前的 Python 和 PyTorch 版本,也修复了原维护者未能处理的问题。如果你安装原始 TTS 包后在现代 Python 版本上遇到失败,改装社区分支的软件包通常可以解决大多数问题。实际的不利之处是官方支持渠道已经不复存在;而真正发生显著变化的一点是许可证:Coqui 以前会为 XTTS-v2 的非商业模型权重出售商业许可证,但随着公司不复存在,这个付费商业授权选项实际上也已经消失。

XTTS-v2 入门

  1. 如果使用较新的 Python 版本,请安装社区维护的软件包。 在 Python 3.10–3.12 和较新 PyTorch 环境下,pip install coqui-tts(活跃维护的分支)通常比原始的 pip install TTS 包更可靠。
  2. 无论选择哪个软件包,都通过同一套 API 加载模型。 先执行 from TTS.api import TTS,再运行 TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True);无论安装的是哪个软件包,用法都完全相同。
  3. 留意 PyTorch 2.6 的安全限制。 较新的 PyTorch 版本会在默认 weights_only=True 设置下阻止 XTTS-v2 的自定义 XttsConfig 类——加载模型前需要通过 torch.serialization.add_safe_globals 明确放行,否则生成会在加载阶段失败。
  4. 生成一段克隆音频。 tts.tts_to_file(text="your text", speaker_wav="reference.wav", language="en", file_path="output.wav") 用几行代码就能完成基本的零样本克隆流程。
  5. 部署前检查显存。 基础推理至少需要约 3GB GPU 显存;若要在生产环境中实现稳定、快于实时的生成,8GB 或更多显存可以避免较长合成任务中的内存问题。
  6. 如果零样本质量还不够,就进行微调。 由于原 Coqui 团队已不再正式维护,社区分支保留了微调所需的训练脚本——预计其配置过程会比获得完整支持的商业产品更需要亲自动手。

获得更好效果的技巧

  • 使用干净、录制良好且不少于 6 秒的参考片段。 克隆质量会直接受到录音条件影响——与一些较新的架构相比,参考音频中的背景噪声或失真会让保真度下降得更加明显。
  • 尝试多个参考片段,让声音身份更加稳定。 XTTS-v2 支持多个说话人参考并在它们之间插值,因此与只依靠一段短片相比,它可以生成更加一致的声音;对于很难通过一次录音清晰捕捉的声音,这一点尤其明显。
  • 根据具体声音来设定对跨语言质量的预期。 训练数据中代表性较低的声音,其说话人相似度可能低于常见声音类型——在确定生产管线之前,请测试你的具体目标声音和语言组合。
  • 发布付费产品前确认商业授权路径。 由于 Coqui 原来的商业许可证已不再出售,请仔细审阅当前的 Coqui Public Model License 条款;如果目标是商业部署,也可以考虑使用 Apache 2.0 或 MIT 等更宽松许可证的模型。
  • 凡是不止随手试验的项目,都优先使用社区分支。 鉴于原始仓库的维护已经减少,对于任何需要长期运行的项目,持续获得补丁的分支都是更可靠的基础。

XTTS-v2 与其他零样本克隆模型对比

XTTS-v2F5-TTSChatterbox Multilingual
架构GPT-2 风格自回归 + VQ-VAEDiffusion Transformer + 流匹配基于扩散模型
参考片段长度约 6 秒约 5–15 秒约 5–10 秒
语言17主要面向英语23
多个参考片段 / 插值支持不是核心功能不是核心功能
官方是否仍在维护否(只有社区分支)是是
权重许可证Coqui Public Model License(非商业)CC-BY-NCMIT

XTTS-v2 能长久保持影响力,是因为它在开源替代方案屈指可数的年代,早早为多语言零样本克隆交出了一份真正扎实的答案——而它的架构和语言覆盖经受住了时间考验,即便开发它的公司已经消失多年,它仍是人们进行比较时的标准参照。

常见问题

Coqui AI 还在开发 XTTS-v2 吗?

没有。Coqui AI 已于 2024 年 1 月关闭。代码和模型权重仍然公开,一个活跃维护的社区分支让项目可以继续在当前软件上运行,但如今已经没有 Coqui 官方支持或开发。

我还能将 XTTS-v2 用于商业用途吗?

这需要谨慎处理。底层 TTS 库代码采用对商业使用友好的 Mozilla Public License 2.0,但 XTTS-v2 模型权重本身依据非商业的 Coqui Public Model License 发布。Coqui 以前会单独出售权重的商业许可证,但由于公司已经不复存在,这个付费选项也无法再获得——任何商业使用之前,都应直接审阅当前许可证条款。

XTTS-v2 需要多少参考音频才能克隆声音?

最短只需 6 秒;不过独立测试表明,加入额外微调数据后,说话人相似度还会提高,例如为特定声音提供约十分钟音频。

为什么在较新的 Python 或 PyTorch 版本上有时会安装失败?

原始 TTS 包在较新的环境中可能遇到兼容性问题;安装由社区维护的 coqui-tts 分支可以解决其中大多数问题,而 PyTorch 2.6+ 还要求显式调用 torch.serialization.add_safe_globals,才能加载 XTTS-v2 的自定义配置类。

XTTS-v2 与 F5-TTS 或 CosyVoice3 等较新模型相比如何?

XTTS-v2 仍提供有竞争力的多语言覆盖和可靠的克隆质量,但它缺少持续的官方开发,而且一些较新模型的延迟更低,或采用更宽松的许可证。它的优势仍在于广泛的语言支持和经过社区验证的稳定性,而不是最前沿的速度。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →