EchoraEchora
返回模型列表

Voicebox:为编辑语音而生,而不只是从头生成语音

2026年9月7日
•
阅读约 5 分钟

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

自回归 TTS 模型只能从音频停止的位置继续向后生成——如果不重新生成后面的全部内容,它就无法回过头修正中间的某个词。Meta 旗下 FAIR 的研究模型 Voicebox 围绕一个完全不同的任务打造:给定前后音频上下文和目标文本,在音频中的任意位置补上缺失片段,就像用图像修复来编辑图片中间的区域,而不是只能从边缘继续向外绘制。

Voicebox 是什么?

Voicebox 是一种非自回归流匹配模型,使用超过 50,000 小时未经筛选、未经增强的语音进行训练——这些语音取自英语、法语、德语、西班牙语、波兰语和葡萄牙语的公版有声书。Meta 并没有直接针对 TTS 系统通常各自专攻的许多独立任务来训练它,而是采用了一个更通用的单一目标:文本引导的语音补全。事实证明,仅这一项任务就涵盖了人们实际希望语音模型完成的大部分工作,其原理与让 GPT 能够完成从未专门训练过的任务的上下文学习相同。

为什么语音补全改变了模型的能力边界

Voicebox 接受的训练是利用周围语音和目标文本重建被遮盖的一段音频,因此它能修改给定样本的任何部分——而不只是像自回归模型受结构限制的那样,仅能修改音频末尾。正是这种灵活性,让一个只针对单项任务训练的模型能够泛化出多种实际用途不同的能力:仅凭短至 2 秒的参考音频完成零样本文本转语音合成;进行跨语言风格迁移(在保留参考说话人风格的同时,用其支持的六种语言中的另一种朗读段落);以及降噪、内容编辑和对给定语句进行多样化重采样——这些都是同一底层补全任务的不同实例,而不是后来附加上去的独立专用模式。

背后的技术:条件流匹配

Voicebox 的非自回归核心建立在条件流匹配(Conditional Flow Matching,CFM)之上——这种方法以逐帧语言信息和被遮盖的音频上下文为条件,通过连续时间变量把一个简单的初始分布(高斯噪声)转换成目标语音分布。它与扩散模型的典型形式存在实质差异;Meta 当时自己的对比显示,它在零样本 TTS 的可懂度和音频相似度上优于 VALL-E,同时生成语音的速度约为同期领先自回归模型的 20 倍。

流匹配技术并没有停留在 Voicebox 上——E2 TTS 和 F5-TTS 后来使用的方法以相同的核心思想为基础;两者都沿用了 Voicebox 帮助确立的“填充或遮盖,然后生成”理念。它在概念上也与 CosyVoice2 和 CosyVoice3 等模型使用的流匹配解码器关系密切。如果你用过其中任何一个模型,你用到的就是 Voicebox 大规模展示的这一方法的直接后继。

Voicebox 与其开源架构后继者的比较

VoiceboxE2 TTSF5-TTS
核心技术条件流匹配流匹配、扁平 U-Net Transformer条件流匹配 + Diffusion Transformer
训练任务设定通用的文本引导语音补全文本-音频补全(无时长模型/对齐器)相同的核心方法,针对对齐稳健性进行改进
零样本提示长度约 2 秒相近约 5–15 秒
任务通用性一个模型完成 TTS、降噪、编辑和重采样主要专注于 TTS主要专注于 TTS
公开发布否(仅有研究论文)否(通过 F5-TTS 仓库提供社区复现)是,已在 GitHub 和 Hugging Face 发布
语言6 种以英语为主以英语为主

Voicebox 的持久意义更多在于它证明了:一个以真正大规模数据训练的通用补全目标,可以同时在多项不同的语音任务上达到或超过专用系统。此后,该领域有相当一部分工作一直在延续这一范式。

常见问题

“语音补全”是什么意思?

它是指利用周围上下文和目标文本生成音频中缺失或被遮盖的部分,让模型能够编辑样本中的任何位置,而不像自回归模型那样只能从音频末尾继续生成。

Voicebox 与 E2 TTS 和 F5-TTS 等模型有什么关系?

二者都是基于 Voicebox 所展示的同一种条件流匹配方法构建的架构后继者——E2 TTS 直接沿用了它的补全理念,F5-TTS 则在同一技术脉络上进一步提升了训练稳定性和对齐效果。

Voicebox 支持多少种语言?

根据其训练数据,它支持六种语言:英语、法语、德语、西班牙语、波兰语和葡萄牙语。

Meta 是否处理了 Voicebox 的滥用风险?

是。除了生成模型之外,Meta 的研究还明确介绍了一个能够区分真实语音和 Voicebox 生成语音的分类器,作为防范模型潜在滥用的已记录保障措施。

使用参考音频生成相似音色语音

如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。

开始克隆声音 →