VoiceCraft:编辑后的语音比真实录音更受听众青睐
在 VoiceCraft 自己开展的并列自然度对比中,有 48% 的时候,人类听众更偏爱其编辑后的语音,而非真正的原始录音——这几乎就像在一段真实音频与另一段由模型替换并重新生成了一个词的音频之间抛硬币做选择。这项结果最清楚地证明了 VoiceCraft 真正为何而生:它不只是从头生成语音,还能令人信服地编辑已有音频,让接缝消失于无形。
什么是 VoiceCraft?
VoiceCraft 是一种神经编解码器语言模型,通过 token 补全工作,由得克萨斯大学奥斯汀分校和 Rembrand 的研究人员开发,并以完全开源的方式发布——数据、代码和模型权重均可在 GitHub 与 Hugging Face 上公开获取。它基于 Transformer 解码器构建,发布时在语音编辑和零样本文本转语音两项任务上都达到了当时最先进的水平;评估专门采用真实环境音频,包括有声书、YouTube 视频和 Spotify 播客,而非干净的录音室录音。无论是克隆从未见过的声音,还是编辑已有录音,都只需要几秒参考音频。
技术关键:因果遮罩与延迟堆叠
这项技术值得理解,因为正是它让编辑——而不仅仅是从头生成——真正成为可能。标准自回归模型严格从左向右生成,因此若不重新生成编辑点之后的全部内容,就很难在已有序列中间插入新内容。VoiceCraft 用两步 token 重排流程解决了这个问题:其一是借鉴文本与图像联合建模成功技术的因果遮罩,其二是高效处理神经语音编解码器多码本结构的延迟堆叠。二者结合,使 VoiceCraft 可以在同时利用前后文的条件下执行补全生成,底层仍然采用自回归生成流程,而不必使用补全模型通常依赖的全非自回归方法。
一个模型,两种能力
得益于这种架构,VoiceCraft 通过同一套底层机制处理两项真正不同的任务。语音编辑让你能够对已有录音进行插入、删除、替换或多片段修改——无需重新录制,就能纠正一个词、替换一个短语或调整一句话;模型只重新生成受影响的片段,而非整段音频。零样本声音克隆则反向利用同一种补全能力:给定几秒从未见过的说话人声音,便能用该声音生成全新的语音。大多数 TTS 模型只为其中一项任务而构建;VoiceCraft 则把二者视为同一个底层问题,并用同一模型解决。
REALEDIT 基准
为了专门评估语音编辑,VoiceCraft 团队构建了 REALEDIT,并将其称为首个同类真实基准:它包含 310 个来自有声书、YouTube 视频和 Spotify 播客的真实示例,时长为 5 到 12 秒,涵盖插入、删除、替换,以及涉及 1 到 16 个词的多片段编辑。前述 48% 的偏好结果——在并列对比中,编辑后的语音胜过真正的原始录音——就直接来自这项基准测试;这也是为什么该数字颇具可信度,而不是从演示片段中精挑细选出来的结果。
VoiceCraft 入门
尝试 VoiceCraft 最直接的方式,是使用项目基于 Docker 的安装方案,由它替你处理环境配置;环境启动后,文档指定从 inference_tts.ipynb notebook 开始测试零样本 TTS 生成。如果你打算用自己的数据进行微调或训练,项目提供了单独的安装与训练文档,并特别建议微调时使用 AdamW,以获得比从头训练更好的稳定性。模型权重自 2024 年 3 月起已在 Hugging Face 上公开,因此对大多数使用场景而言,下载预训练 checkpoint 而非从零开始训练,才是切实可行的起点。
获得更好结果的技巧
- 把编辑用于精准修补,而非全面重写。 VoiceCraft 的编辑优势在于对短语或短片段进行有针对性的插入、删除和替换;若要大幅改动内容,标准的从头零样本生成模式更合适。
- 为克隆准备干净的参考片段。 由于只需要几秒音频,一段时长相当、清晰且录制良好的样本,会胜过噪声更多的样本。
- 先用你的实际音频类型测试,再假定基准性能能够直接迁移。 REALEDIT 专门采用播客和 YouTube 视频等真实环境来源,而非干净的录音室音频,因此测试环境确实更贴近现实;但你自己的内容具有特定的噪声特征和录制质量,仍值得直接验证。
- 除非有明确理由手动管理依赖,否则请使用 Docker。 编解码器、音素处理和 Transformer 解码器等众多组件都必须正确配合,Docker 方案可以避开相当一部分常见的环境配置问题。
- 如果需要英语以外的语言,请了解 VoiceCraft-X。 这个后续模型把相同的核心编辑与克隆方法扩展到 11 种语言,使用大语言模型处理跨语言文本,无需音标发音词典;如果项目的语言需求已经超出原版以英语为主的范围,值得进一步查看。
VoiceCraft 与仅生成式克隆模型对比
| VoiceCraft | F5-TTS | E2 TTS | |
|---|---|---|---|
| 语音编辑(在已有音频中插入/删除/替换) | 支持,核心能力 | 不支持,仅生成 | 不支持,仅生成 |
| 零样本声音克隆 | 支持,需几秒参考音频 | 支持,约 5–15 秒 | 支持,情况类似 |
| 核心机制 | 采用因果遮罩与延迟堆叠的自回归架构,可利用双向上下文 | 非自回归流匹配 | 非自回归流匹配 |
| 公开发布 | 是,数据、代码和权重全部开源 | 是,代码和权重开源 | 否,仅有研究论文 |
| 基准重点 | 真实环境音频(有声书、YouTube、播客) | 标准 TTS 基准 | 标准 TTS 基准 |
VoiceCraft 的独特定位,在于它是少数把编辑已有录音和生成全新语音视作同一个底层问题的开源模型之一——本站大多数模型完全为生成而构建,并没有处理既有音频的机制。
常见问题
VoiceCraft 能否在不重新生成整段音频的情况下编辑录音?
可以——这正是其核心设计目标。通过因果遮罩与延迟堆叠,VoiceCraft 只重新生成目标片段(插入、删除或替换的词语或短语),不必重建整段音频。
VoiceCraft 需要多少参考音频?
只需要几秒,无论是对从未见过的说话人进行零样本声音克隆,还是编辑已有录音,都是如此。
什么是 REALEDIT 基准?
这是 VoiceCraft 团队专门为语音编辑构建的真实评估数据集,包含 310 个来自有声书、YouTube 视频和播客的真实示例,涵盖插入、删除、替换和多片段编辑。
VoiceCraft 是否免费且开源?
是。数据、代码和预训练模型权重均可在 GitHub 与 Hugging Face 上公开获取,除项目声明的伦理使用要求外没有其他限制;这些要求明确禁止未经授权生成语音,或在未获同意的情况下操纵他人的声音。
VoiceCraft 是否有多语言版本?
有。后续模型 VoiceCraft-X 把同一种统一的编辑与克隆方法扩展到 11 种语言,使用大语言模型处理跨语言文本,而无需为每种语言分别准备音标词典。
使用参考音频生成相似音色语音
如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。