EchoraEchora
返回模型

Chatterbox TTS:盲测胜过 ElevenLabs 的开源声音克隆模型

2026年8月19日
阅读约 8 分钟

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

大多数“ElevenLabs 开源替代方案”的说法,经不起真正的并排比较,但 Chatterbox 经受住了考验。在 Podonos 进行的一项盲测中,听众会听到 Chatterbox 与 ElevenLabs 使用相同素材生成的成对样本,却看不到标签、背景信息,也不知道每段音频来自哪个模型。最终,Chatterbox 的输出在 63.75% 的比较中更受青睐。再加上支持商业使用的宽松 MIT 许可证,Chatterbox 因而成为本年度讨论度最高的开放权重 TTS 模型之一。

什么是 Chatterbox?

Chatterbox 是 Resemble AI 推出的开源文本转语音模型系列,由一个三人团队开发,并以 MIT 许可证发布。它尤其擅长两项能力:通过短参考音频完成零样本声音克隆,以及控制情绪夸张程度。后一项参数可以让声音从平淡克制逐渐变得富有戏剧表现力,Resemble AI 将其称为开源 TTS 领域的首创功能。

Chatterbox 系列已经从最初的英语模型扩展为三个版本,每个版本对应不同的优先目标:

  • Chatterbox(原版)——基础英语模型,重点优化声音质量和情绪表现范围。
  • Chatterbox Multilingual(V3)——一款 5 亿参数模型,支持 20 多种语言。它的目标是在同一克隆声音切换语言时,继续保持音色、口音和节奏,而不是逐渐变成缺乏辨识度的通用口音。
  • Chatterbox Turbo——针对速度优化的 3.5 亿参数版本,延迟约为 75 毫秒,生成速度约为实时速度的 6 倍,适合语音助手等响应速度比极致表现力更重要的应用。

工作原理:声音克隆、情绪控制与水印

零样本声音克隆。 Chatterbox 只需 5–10 秒参考音频,就能复现目标声音,无需微调或单独训练。提供一段音频后,模型即可用这个声音朗读新的文本。

两个可调参数。 输出主要由两个设置控制:exaggeration 用于调节情绪强度,cfg_weight 用于平衡对参考声音与输入文本的遵循程度。两者的默认值都是 0.5,在许多场景下可以直接使用;提高 exaggeration 则能产生 Chatterbox 最具代表性的戏剧化表达。

副语言标签。 Chatterbox Turbo 引入了用于叹气、倒吸气、咳嗽等反应的文本标签。模型会直接使用克隆后的声音,并以匹配的情绪语气演绎这些反应,无需事后拼接单独录制的音效。

内置水印。 Chatterbox 会在生成每段音频时嵌入 Resemble AI 的 PerTh(Perceptual Threshold,感知阈值)水印。听众无法察觉这一水印,但它被设计为可以承受压缩和基础编辑,从而帮助追溯生成音频的来源。对于需要验证音频出处的声音克隆产品,这是一项重要的可信机制。

如何开始使用 Chatterbox

  1. 配置运行环境。 通过 pip 安装 Chatterbox。项目基于 Python 3.11 开发和测试,官方建议使用 conda 环境,以保持依赖版本一致。
  2. 获取代码或模型。 从 GitHub 克隆 resemble-ai/chatterbox,如果不需要本地仓库,也可以直接从 Hugging Face 加载检查点。
  3. 选择合适的版本。 富有表现力的英语旁白可使用原版 Chatterbox;需要让克隆声音跨语言保持一致时选择 Chatterbox Multilingual;延迟优先时则选择 Chatterbox Turbo。
  4. 集成前先试用。 Resemble AI 在 Hugging Face Spaces 上提供官方 Gradio 演示,可以先在浏览器中测试声音克隆和 exaggeration 参数,再编写集成代码。
  5. 按需扩展部署方式。 如果本地推理无法满足规模需求,Resemble AI 还提供基于同一模型系列的托管 TTS 服务,适合需要托管式扩容而不想自行运维 GPU 的团队。

提升 Chatterbox 输出效果的技巧

  • 让参考音频与目标语言匹配。 使用 Chatterbox Multilingual 时,应确保参考音频的语言标签与目标生成语言一致;否则输出可能继承参考音频的口音,而不是采用目标语言的自然发音。如果无法获得完全匹配的参考音频,将 cfg_weight 设为 0 可以缓解这一问题。
  • 从默认的情绪强度开始。 默认值 0.5 已针对多种提示词进行调校。更高的值应当作为追求戏剧化表达时的主动创作选择,而不是每次都直接提高。
  • 交互式应用优先使用 Turbo。 如果用户需要等待响应,例如语音智能体、助手或实时演示,Turbo 约 75 毫秒的延迟往往比更大模型带来的少量质量提升更重要。
  • 在合规规划中考虑水印。 每段输出默认都带有 PerTh 水印,因此应在涉及 AI 生成音频披露要求的产品文档和政策中说明这一点。
  • 提供干净的 7–20 秒参考音频。 Resemble AI 在基准测试中使用了这一时长范围。尽管模型可以处理更短的样本,但 7–20 秒通常能更稳定地发挥零样本克隆效果。

Chatterbox、ElevenLabs 与其他开放模型对比

ChatterboxElevenLabs其他开放 TTS(DiaDia2
许可证MIT(宽松许可证)闭源商业 APIApache 2.0
声音克隆零样本,5–10 秒参考音频支持,受订阅方案限制各不相同,通常使用音频条件控制
情绪控制明确的 exaggeration 参数有限的风格控制不是核心功能
水印默认内置 PerTh 水印并非标准功能并非标准功能
自托管支持,可完整本地部署不支持支持
与 ElevenLabs 的盲测偏好Podonos 研究中 63.75% 的比较选择 Chatterbox未进行直接基准测试

Chatterbox 的真正差异不只是感知质量能够与闭源商业领先者竞争,还在于它同时提供 MIT 许可证、内置水印和完整自托管能力,而 ElevenLabs API 并没有同时提供这些条件。

常见问题

Chatterbox 可以免费用于商业项目吗?

可以。Chatterbox 采用 MIT 许可证,这是最宽松的开源许可证之一。只要遵守保留许可证和版权声明等条件,即可用于商业项目、修改和分发。

Chatterbox 与 ElevenLabs 的实际质量相比如何?

在 Podonos 进行的盲测中,评测者面对使用相同文本和参考音频生成的样本,且看不到模型标签。最终,Chatterbox 的输出在与 ElevenLabs 的比较中有 63.75% 更受听众青睐。

Chatterbox、Chatterbox Multilingual 和 Chatterbox Turbo 有什么区别?

原版 Chatterbox 是情绪表现范围较强的基础英语模型;Chatterbox Multilingual 将声音克隆扩展到 20 多种语言,同时尽量保持说话人身份;Chatterbox Turbo 则优先提升速度,延迟约为 75 毫秒,适用于实时场景。

Chatterbox 会为输出音频添加水印吗?

会。每次生成都会自动加入 Resemble AI 的 PerTh 水印。听众无法察觉,但可以通过检测来验证音频出处和真实性。

Chatterbox 克隆声音需要多长的参考音频?

最短只需 5–10 秒参考音频,而且零样本克隆不需要额外训练或微调。实际使用中,干净的 7–20 秒音频通常能带来更稳定的效果。

体验类似的声音克隆功能

Chatterbox 本身需要通过 Resemble AI 的开源实现或官方演示使用。如果你想在浏览器中体验声音克隆,可以尝试声音克隆这一类似功能。它不是 Chatterbox,也不运行 Chatterbox 模型,但可以让你先体验相近的声音克隆流程,再决定如何部署 Chatterbox。

请只克隆你拥有或已获得明确授权的声音。

探索声音克隆 →