Zonos:开放权重,直指闭源商业级品质
Zyphra 并没有把 Zonos 定位为“不错的开源替代方案”——团队自己的说法是,它在表现力和质量上可与领先的商业 TTS 提供商持平,甚至更胜一筹,同时还以完全宽松的许可证发布了实际模型权重。这是一项具体且可以检验的主张,而不是模糊的质量描述;支撑它的是一次真正大规模的训练:超过 20 万小时的多样化语音,并且有意把中性叙述与高度富有表现力的素材混合在一起,而非主要围绕单一语域进行训练。
什么是 Zonos?
Zonos 是帕洛阿尔托 AI 初创公司 Zyphra 于 2025 年 2 月发布测试版的开放权重文本转语音模型。它提供两种骨干网络版本——标准 transformer 和 SSM 混合架构——两者均有 16 亿参数,并且都采用 Apache 2.0 许可证发布。这意味着可以免费商用的是模型权重本身,而不只是代码,也无需另行签署协议。
底层原理:eSpeak、DAC Token 与两种骨干网络
Zonos 采用一条相对直观的处理管线:先通过 eSpeak 对文本进行规范化并转换为音素,再用得到的序列驱动 Descript Audio Codec(DAC)表示上的 token 预测;具体由 transformer 还是 SSM 混合骨干网络完成生成,取决于你加载的 checkpoint。两者在实际使用中的差别并非表面上的不同——混合版本在标准 attention 之外还加入了 state-space model 组件。与纯 transformer 相比,这类架构选择通常会在速度和序列长度处理上形成不同取舍,因此值得针对你的具体工作负载同时测试两者,而不是假定其中一个就是另一个的全面升级。
声音克隆:说话人嵌入与音频前缀
Zonos 支持使用 5 到 30 秒的参考片段进行零样本声音克隆,但有必要理解它用声音来约束生成的两种不同方式。说话人嵌入会从参考片段中提取整体声音身份。音频前缀则是直接在前面拼接一段参考音频,而不是先把它压缩成嵌入;它还能引出耳语等仅凭说话人嵌入确实很难复现的特定表现。如果你的项目需要某种特定表达方式,而普通参考片段没有捕捉到它,那么音频前缀是更直接的调节手段。
如果你根本没有参考声音,Zonos 也提供预设声音选项——包括美式和英式的男声与女声,以及随机声音设置——因此,要获得可用输出并不一定非得进行零样本克隆。
精细的情绪与表达控制
除了声音身份,Zonos 还可以直接控制语速、音高变化、最高频率、整体音频质量和具体情绪——明确支持快乐、愤怒、悲伤和恐惧。它能以如此细的粒度独立调节表达方式和情绪语气,这正是“富有表现力”定位的重要基础,而不是只对整个输出套用一个粗略的风格参数。
多语言支持与原生 44kHz 输出
Zonos-v0.1 支持英文、日文、中文、法文和德文;与这一领域许多输出为 24kHz 的模型相比,它尤其值得注意的一点是能以原生 44kHz 生成音频。这个明显更高的保真上限很有意义,尤其是当输出要进入会严格审视音质的制作流程,而不只是做到能听懂时。
速度
在 RTX 4090 上,Zonos 的实时因子约为 2x——每 1 秒计算时间大约生成 2 秒音频——在性能足够的消费级硬件上,足以舒适地用于近实时应用;不过,它并不是针对专用实时模型所追求的 200ms 以下流式延迟而设计的。
Zonos 入门
- 先安装 eSpeak 依赖。 Zonos 依赖 eSpeak 完成文本规范化和音素转换,因此在尝试运行推理之前要确保系统已经安装它——跳过这一步是首次运行时常见的失败原因。
- 克隆仓库并选择骨干网络。 从 GitHub
git cloneZyphra/Zonos项目,然后根据你想测试的架构,加载Zyphra/Zonos-v0.1-transformer或Zyphra/Zonos-v0.1-hybrid。 - 从参考片段构建说话人嵌入。 只需几行 Python:加载模型,对参考音频调用
make_speaker_embedding(),再用目标文本和语言调用make_cond_dict(),即可完成基本的零样本克隆流程。 - 使用 Gradio 界面进行反复测试。 运行
python gradio_interface.py可以避免每次生成都重新加载模型的开销,而最精简的 Python 示例默认会这样做——当你开始迭代而不只是生成一个样本时,这一点确实很实用。 - 在投入本地配置前先试用托管 playground。 Zyphra 在
playground.zyphra.com/audio提供托管版本,方便你在投入时间进行本地安装之前,快速评估输出质量和可用控制项。 - 专门针对难以克隆的表现使用音频前缀。 如果仅靠说话人嵌入无法生成你需要的耳语、气声或其他特定表达方式,就改用音频前缀条件控制方法。
获得更好效果的技巧
- 在实际用例中测试两种骨干网络。 transformer 与 SSM 混合模型并非简单的“旧版与新版”关系——它们代表真实的架构取舍,因此,针对你的具体内容类型对两者进行基准测试,比假定某一个在所有场景中都更好要可靠。
- 使用真正干净、时长在 5–30 秒内的参考片段。 零样本克隆正是围绕这个时长范围调优的,因此,处在该范围内且录制良好的样本,会比短得多或被无谓填长的片段表现更好。
- 有意识地组合情绪与表达控制,而不是一次只调一项。 语速、音高和情绪可以独立调节,因此,经过思考后将它们叠加使用(例如更快的节奏搭配一种特定情绪),才能真正体现 Zonos 所主张的表现力,而不是孤立地只调整一个参数。
- 不特别需要克隆时使用预设声音。 如果目标并不是复现某个具体真人的声音,内置的美式/英式男声和女声预设可以省去寻找并准备参考片段的步骤。
- 如果需要更广的语言覆盖或更低延迟,请留意 Zyphra 更新的 ZONOS2。 Zyphra 此后已经发布后续模型,它使用规模大得多的数据集训练,扩展了语言支持,并采用旨在降低延迟的混合专家架构——如果你的具体需求超出了 v0.1 的覆盖范围,值得进一步了解。
Zonos 与其他表现力声音克隆模型对比
| Zonos | Chatterbox | F5-TTS | |
|---|---|---|---|
| 背后机构 | Zyphra | Resemble AI | 独立研究(SJTU/Cambridge/Geely) |
| 参数量 | 1.6B(两种骨干网络版本) | ~0.5B | 并不主要以参数量定位 |
| 克隆所需参考片段 | 5–30 秒 | 5–10 秒 | ~5–15 秒 |
| 情绪控制 | 明确支持:快乐、愤怒、悲伤、恐惧 | Exaggeration 参数 | 不是专门功能 |
| 原生输出采样率 | 44kHz | 未以这一保真度明确说明 | 标准 TTS 采样率 |
| 语言 | 英文、日文、中文、法文、德文 | 英文(Multilingual:23 种) | 主要面向英文 |
| 许可证 | Apache 2.0 | MIT | CC-BY-NC(非商业) |
Zonos 的独特优势,是把真正大规模、兼顾两类语域的训练语料,与完全开放、允许商用的模型权重和原生 44kHz 保真度结合在一起——即使它的五语言覆盖范围比一些专注多语言的竞品更窄,这样的组合在其他产品中仍然更难找到。
常见问题
Zonos 真的可以免费商用吗?
可以。transformer 和 SSM 混合模型的权重都采用 Apache 2.0 许可证发布,无需另行签署协议即可商用。
Zonos 的 transformer 模型与混合模型有什么区别?
混合模型在标准 transformer attention 之外加入了 state-space model 组件,体现的是不同的架构取舍,而不是直接升级;在你的具体用例中同时测试两者,是做出选择的可靠方式。
Zonos 进行声音克隆需要多少参考音频?
大约 5 到 30 秒,可以使用说话人嵌入(用于整体声音身份)或音频前缀(更适合耳语等特定表现)。
Zonos 支持哪些语言?
v0.1 版本支持英文、日文、中文、法文和德文。
不安装任何东西,有托管方式可以试用 Zonos 吗?
有。Zyphra 在 playground.zyphra.com/audio 提供托管 playground,你可以直接测试该模型的声音克隆和表现力控制。
使用参考音频生成相似音色语音
如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。