VALL-E X:输入一句话,输出任意语言
VALL-E 已经证明,只需一段 3 秒音频,就足以在同一种语言中克隆声音。接下来一个显而易见、却更难回答的问题是:这同一段短音频,能否让一个人说出自己从未真正说过的语言?微软推出的跨语言后续模型 VALL-E X 给出了肯定的答案——只需提供单语说话人的一句话,它就能用同一个声音生成自然流利的另一种语言语音,完全不需要这个人实际说目标语言的录音。
什么是 VALL-E X?
VALL-E X 是一种跨语言神经音频编解码语言模型,由微软研究人员提出,是原始 VALL-E 架构的直接扩展。它继承了 VALL-E 的核心上下文学习能力——无需额外训练,就能从一段简短提示中捕捉声音——并将这项能力专门扩展到跨语言生成。模型使用覆盖多个领域的大规模多语言、多说话人语音数据进行训练。
实际效果是:提供说话人用母语说出的一句话,VALL-E X 就能用同一个声音生成目标语言语音,同时保留说话人的声音身份、情绪语气,甚至原始片段中的声学背景。它不需要同一个说话人分别用两种语言录制配对音频——模型完全不必听过这个特定的人说目标语言。
跨语言迁移究竟如何实现
其机制是 VALL-E 音素与声学 token 方法的自然延伸,并针对跨语言场景做了调整。VALL-E X 接收由源文本和目标文本生成的音素序列,以及源说话人的声学 token(通过神经音频编解码器从参考片段中提取),再把这些信息共同作为提示,生成目标语言的声学 token。随后,这些输出 token 会按照 VALL-E 原始架构相同的方式,解码回真实的语音波形。
训练不要求来自同一批说话人的跨语言配对数据。模型转而从多语言数据集中学习:将不同语言的音素序列和声学 token 序列拼接在一起,并加入语言 ID 信号,告诉模型当前应生成哪种语言。这个语言 ID 机制还赋予 VALL-E X 第二项更具趣味性的能力:有意控制口音。例如,它不仅能以完全接近母语的效果为目标,也能生成带有明显英语口音的中文语音,反之亦然。
保留的不只是声音
与原始 VALL-E 一样,VALL-E X 使用真实声学 token,而不是抽象化的说话人嵌入,因此跨语言切换时保留下来的不只有声音身份——源片段的情绪语气和声学环境通常也会延续到目标语言输出中。对于配音或内容本地化等用途,这是一项很有实际意义的细节:如果切换语言时丢掉说话人的情绪表达,那么使用其真实声音的意义也会大打折扣。
VALL-E X 是如何评估的
微软在评估中使用了 LibriSpeech、EMIME 和 AISHELL-3 数据集,对英中两个方向的跨语言生成进行了测试——既包括以中文说话人的语音为提示生成英语,也包括以英语说话人的语音为提示生成中文。报告结果显示,它实现了高质量的零样本跨语言合成,显著减少了早期跨语言 TTS 方法长期存在的不自然外语口音痕迹;同时,研究还表明,同一套底层架构可以进一步扩展到语音到语音翻译任务。
如今如何开始使用 VALL-E X
与原始 VALL-E 一样,微软发表了相关研究,却从未发布官方代码或预训练模型权重。不过,与第一代模型不同,这次社区给出了一个更容易直接使用的成果:
- 使用 Plachtaa/VALL-E-X 社区复现版本。 这套开源实现从零训练了自己的模型,而且值得注意的是,它确实公开发布了训练所得的预训练权重。与需要从零训练的 VALL-E 复现版本相比,这是更实用的入门选择。
- 它覆盖三种语言。 社区模型支持英语、中文和日语,能在三种语言中进行自然、有表现力的合成,也能在它们之间进行跨语言生成。
- 用 3–10 秒参考音频克隆声音。 这是该复现版本针对零样本声音克隆所采用的实际范围,完成克隆后再进行跨语言生成。
- 注意社区实现已升级解码器。 社区实现用 Vocos 解码器取代了 EnCodec 解码器,专门用于改善音质,同时加入批量 AR 解码,让生成结果更加稳定——这些并非对原论文的机械复现,而是实质性改进。
- 不要期待内置语音到语音翻译。 微软原始研究描述过一个 S2ST 扩展,但社区复现版本并未包含该模块,因为它需要单独训练;文档给出的替代方案是搭配标准翻译 API(如 Google Translate),先将源文本翻译成目标语言,再进行生成。
- 直接试验口音控制。 除了常规的跨语言克隆,还可以有意让语言 ID 信号与目标输出语言不匹配,亲自体验口音控制的效果——用一种语言说话,却带着另一种语言的口音。与大多数克隆模型相比,这是一项真正独特的能力。
获得更好效果的技巧
- 提供干净、只有一句话的参考片段。 整个跨语言迁移都取决于这段源语言提示,因此它的录音质量会显著影响目标语言输出的保真度。
- 针对具体语言组合测试两个方向。 跨语言质量不一定对称——让使用语言 A 的说话人生成语言 B,与反方向生成的效果可能不同,因此需要验证项目实际使用的具体方向。
- 如果口音属于创作目标,就有意识地使用语言 ID。 这不只是需要容忍的副作用。对于确实需要风格化口音的内容(例如带有特定说话习惯的角色),语言 ID 机制是一项真正的创作工具,而不只是准确度设置。
- 如果需要完整的语音到语音翻译,请单独规划翻译步骤。 社区复现版本没有内置 S2ST,因此应在管线中为外部翻译步骤留出空间,而不要指望模型自行完成源文本到目标文本的转换。
- 检查所用社区复现版本的许可证。 与任何研究模型的非官方复现一样,在商业使用前,请审阅你所采用实现的训练数据来源和许可证条款。
VALL-E X、VALL-E 与其他多语言克隆模型对比
| VALL-E X | VALL-E(原版) | XTTS-v2 | |
|---|---|---|---|
| 核心能力 | 跨语言声音迁移 | 同语言零样本克隆 | 多语言克隆,支持 17 种语言 |
| 跨语言、同一说话人 | 是,核心设计目标 | 不支持 | 是 |
| 口音控制 | 是,通过语言 ID | 不适用 | 并非专门功能 |
| 参考片段长度 | 约 3–10 秒 | 约 3 秒 | 约 6 秒 |
| 官方公开权重 | 否 | 否 | 是 |
| 可用的社区复现版本 | 有,并已发布预训练权重 | 需要自行训练 | 不适用,已有官方发布版本 |
| 情绪/环境延续 | 是,可跨语言延续 | 是,在同一种语言内延续 | 通过参考编码器自动实现 |
VALL-E X 的具体贡献,在于证明跨语言声音迁移不需要同一个说话人在两种语言中的配对训练数据——这是一个确实比同语言克隆更难的问题,而它使用让原始 VALL-E 广受关注的同一种上下文学习方法解决了这个问题。
常见问题
我可以从微软下载 VALL-E X 官方权重吗?
不可以。与原始 VALL-E 一样,微软发表了描述 VALL-E X 的研究,却从未发布官方代码或预训练模型。如今实际使用这套架构的途径是社区复现版本 Plachtaa/VALL-E-X,它提供了可直接使用的预训练权重。
VALL-E X 支持哪些语言?
微软原始研究的评估重点是英语和中文之间的跨语言生成。流行的社区复现版本把覆盖范围扩展到了英语、中文和日语。
VALL-E X 是否需要同一个说话人分别用两种语言录音?
不需要——这正是它要解决的核心问题。它只使用说话人的源语言参考片段,就能以这个人的声音生成目标语言语音,不要求为该说话人准备配对的跨语言训练数据。
VALL-E X 能否有意控制口音?
可以。它通过语言 ID 机制实现这项功能:既可以尽量减少外国口音,生成自然、接近母语的语音,也可以有意营造特定的口音效果,例如用英语口音说中文。
VALL-E X 是否包含语音到语音翻译?
微软原始研究描述过向这项能力扩展的方法,但流行的社区复现版本并未开箱即用地提供它——文档给出的替代方案是搭配一个单独的翻译步骤。
在浏览器中把文字转换为语音
如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。