EchoraEchora
返回模型列表

GPT-SoVITS:完整的声音克隆工作室,而不只是一个模型

2026年9月2日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

许多开源克隆模型只给你一个 checkpoint 和一段 Python 脚本,就算大功告成。GPT-SoVITS 给你的却是完整流程——人声分离、自动转录、数据集切分、训练和推理,全都集中在一个基于浏览器的界面中——而这一切建立在极低的数据需求之上:5 秒音频就能得到可用的声音克隆,只需 1 分钟就能完成更充分的微调。

什么是 GPT-SoVITS?

GPT-SoVITS 是由开发者 RVC-Boss 创建的开源声音克隆与文本转语音项目,采用 MIT 许可证。它把基于 GPT 的语义文本建模与 SoVITS——一种基于 VITS 的声学和声音转换系统——组合成一条完整管线。GPT 组件负责把文本转换为语义 token;SoVITS 组件再以参考声音为引导,将这些 token 转换成最终波形。正是这种分工,让项目能够用同一套底层架构同时支持即时零样本生成和更深入的少样本微调。

它支持中文、英文、日文、韩文和粤语之间的跨语言生成,在中文和日文输出质量方面尤其享有很强的口碑。

两档克隆方式:5 秒与 1 分钟

这是它最受关注的能力,因此有必要准确说明每一档到底能带来什么。零样本模式接收一段 5 秒的参考音频,无需训练便能立即用该声音生成语音——开发者测试称,这一档与目标声音的相似度约为 80-95%,足以用于快速测试或要求不高的内容。少样本微调会更进一步:使用大约 1 分钟的目标声音数据对模型进行微调,可以在零样本基线之上明显提升相似度和自然度,缩小与参考说话人真实声音之间的大部分剩余差距。

版本历史:从 v1 到 v4

GPT-SoVITS 自首次发布以来经历了几个架构差异明显的世代。弄清哪个版本适合自己的情况,比直接选择“最新版本”更重要:

  • v1 和 v2 采用相同的基础架构——通过 VQ-VAE 解码器直接生成波形,没有独立的声码器阶段。v2 在此基础上扩展了语言支持并增加了预训练数据。
  • v2Pro / v2ProPlus 在保持 v2 硬件占用和推理速度的同时,进一步改善了稳定性和兼容性;按照项目自身的比较,它在某些方面甚至优于 v4,同时运行成本更低。
  • v3 用快捷条件流匹配扩散 Transformer(shortcut Conditional Flow Matching Diffusion Transformer,shortcut-CFM-DiT)替换了核心声学架构,带来了明显更接近参考音频的音色、更少的 GPT 侧重复或遗漏错误,以及更丰富的情感表现——其训练使用了经过扩充和质量筛选的约 7,000 小时数据集。由于这个版本的生成并非完全端到端,它依赖开源 BigVGAN v2 声码器把梅尔频谱图输出转换成 24kHz 音频,而非整数倍上采样可能会引入金属感伪影。
  • v4 修复了这一特定的金属声问题,并原生输出 48kHz 音频,而非 24kHz,从而避免将 24kHz 信号上采样后可能产生的轻微发闷音质。项目作者本人将 v4 描述为 v3 的实用直接替代版本。

实际选择的关键在于:v1、v2 和 v2Pro 往往更适合质量较低或带噪声的训练数据,因为它们的架构更容易受到整个训练集平均情况的影响。v3 和 v4 则尤其适合干净、高质量的参考音频,它们更偏向忠实复现这段特定参考音频,而不是在整个数据集中取平均——但如果源录音本身不够干净,它们的表现反而可能不如 v1/v2。

WebUI:为不想手动搭建训练管线的人而设计

GPT-SoVITS 的界面打包了整套数据集准备流程,而不只是推理。它包括用于从背景音乐或噪声中分离人声的 UVR5、用于转录的自动语音识别(中文 ASR 使用专用模型,英文和日文使用 Faster Whisper Large V3),以及把较长录音拆成可用训练片段的自动音频切分。对于 5-10 分钟左右的小型数据集,一个“一键三连”按钮会自动串联其中几项预处理步骤——如果你不熟悉从零开始编写数据管线,这是一项很有意义的易用性优势。

GPT-SoVITS 入门

  1. 如果你使用 Windows,就用 Windows 整合包。 预构建软件包可以直接下载——双击 go-webui.bat,无需手动配置环境即可启动完整 WebUI。
  2. 在 Linux/Mac 上手动配置,或者在你需要更多控制时这样做。 创建 Python 3.10 虚拟环境(使用 uv 或 conda),克隆仓库,然后通过 pip install -r requirements.txt 安装依赖。
  3. 下载与你目标版本匹配的预训练模型。 每个版本(v2、v2Pro、v3、v4)都有各自托管在 Hugging Face 上的特定 checkpoint 文件——务必确保预训练模型版本与 WebUI 中选择的训练版本一致,否则生成会失败或质量下降。
  4. 用内置工具准备参考音频。 如果源音频带有背景噪声或音乐,先运行 UVR5,然后使用自动切分和 ASR 标注工具,而不是自己手动转录和切割片段。
  5. 根据源音频质量选择版本。 对噪声较多或质量一般的录音使用 v1/v2/v2Pro;只有当参考音频达到干净的录音室品质,而且你希望最大程度忠实还原这段特定声音时,才使用 v3 或 v4。
  6. 留意 16 系列 GPU 问题。 较老的 NVIDIA 16 系列显卡没有 Tensor Core,训练时可能抛出 CUDA 配置错误;项目的 config.py 会自动检测这一情况,并强制使用 FP32 精度作为变通方案。

获得更好效果的技巧

  • 先尝试零样本,再决定是否投入微调。 快速进行一次 5 秒测试,就能判断基础模型的零样本相似度是否已经满足你的使用场景,之后再决定是否值得花时间收集并准备完整 1 分钟的训练音频。
  • 根据数据质量诚实选择版本,而不是只看新旧。 如果源录音有噪声,仅仅因为 v4 最新就默认选择它,反而可能损害输出质量——对于不够纯净的音频,v2Pro 往往是更实用的选择。
  • 训练前清理数据集,而不是训练后补救。 先用 UVR5 去除背景噪声和音乐;v3 和 v4 尤其依赖输入材料的保真度。
  • 有意识地发挥它在中文和日文上的优势。 如果项目的主要语言是中文或日文,GPT-SoVITS 是专门针对这些语言表现更强的开源选项之一;对于纯英文内容,其他模型可能更有优势。
  • 除非有明确理由,否则优先选择 v4 而非 v3。 v4 修复了 v3 已知的金属感伪影问题,同时输出原生采样率更高的音频;除非你正在专门排查基于 v3 的配置,否则遵循作者建议、把它视为直接替代版本是合理的默认选择。

GPT-SoVITS 与其他少样本克隆模型对比

GPT-SoVITSXTTS-v2Fish Speech
获得可用克隆所需的最少数据5 秒(零样本)约 6 秒约 10–30 秒
是否支持微调支持,约 1 分钟数据支持,通过社区脚本支持,原生提供
最擅长的语言中文、日文广泛覆盖 17 种语言英文、中文、日文
内置数据准备工具有(人声分离、ASR、自动切分)无无
许可证MITCoqui Public Model License(非商业)研究用途/偏非商业

GPT-SoVITS 的独特定位,在于它把真正很低的数据需求与兼顾数据准备和训练的一体化 WebUI 结合起来——尤其对于中文和日文内容,很难在其他项目中找到以同样方式完整打包的组合。

常见问题

使用 GPT-SoVITS 克隆声音到底需要多少音频?

即时零样本克隆最少只需 5 秒;若要微调模型并获得明显更好的相似度和自然度,则需要大约 1 分钟参考音频。

我应该使用 v2、v3 还是 v4?

如果训练音频质量一般或有噪声,请使用 v2 或 v2Pro;如果参考录音干净、达到录音室品质,则使用 v3 或 v4,因为这些版本更侧重忠实匹配特定参考音频。具体比较 v3 和 v4,v4 修复了一个已知的金属感伪影问题,并能原生输出更高质量的音频,因此是更实用的默认选择。

GPT-SoVITS 适合中文以外的语言吗?

适合——除中文外,它还支持英文、日文、韩文和粤语——但中文和日文是它口碑最强的领域。

GPT-SoVITS 可以免费商用吗?

可以。它采用 MIT 许可证,这是开源声音克隆项目中更宽松的许可证之一。

我必须手动准备自己的训练数据集吗?

不一定。WebUI 包含人声分离、自动转录和音频切分工具,还为较小的数据集提供一键选项,能够自动串联多项预处理步骤。

使用参考音频生成相似音色语音

如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。

开始克隆声音 →