EchoraEchora
返回模型列表

Tortoise TTS:后来者都曾向这只慢乌龟学习

2026年8月30日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

在零样本克隆变得快速而随手可用之前,有一个模型做出了完全不同的选择:花多长时间都可以,但输出一定要真正令人信服。Tortoise TTS 的名字很诚实——开发者之所以特意选用这个名字,正是因为用他本人的话说,这个模型“慢得离谱”。这份耐心换来的是出色的语音质量:早在 2022 年,它就是最早证明开源神经 TTS 可以与商业系统正面较量的案例之一。它所验证的理念也被部分新模型继承,至今仍能从这些模型的架构中看到 Tortoise 的基因。

什么是 Tortoise TTS?

Tortoise TTS 是由开发者 James Betker 创建的开源多音色文字转语音系统,首次提交可以追溯到 2022 年 1 月。Betker 在论文《Better Speech Synthesis Through Scaling》中记录了它的设计:借用当时刚刚改变图像生成领域的技术——自回归 Transformer 和去噪扩散概率模型(DDPM)——并将其用于语音。

值得注意的是,Tortoise 完全由 Betker 使用自己的硬件独立构建,与任何雇主无关,并以完全宽松的 Apache 2.0 许可证发布。相比一些通过非商业研究许可证限制商业用途的新型克隆模型,这确实是一项对商业使用友好的选择。

架构:先用自回归 Transformer,再用扩散模型

Tortoise 的方法受到 DALL-E 启发,这套两阶段管线既造就了它的优势,也造成了它的缓慢。首先,一个架构与 GPT 相似的自回归 Transformer 根据输入文本和参考声音样本生成离散语音 token。Tortoise 并不会就此停止,而是把这些 token 交给扩散模型,通过反复迭代将其细化为最终的高保真音频波形。

几年前推动图像生成质量跃升的正是同样的两步逻辑:先完成一次初始生成,再通过细化过程以计算时间换取保真度。对 Tortoise 而言,这种取舍带来了真正出色的韵律和语调——自然的停顿、重音以及说话人特有的声音质感——代价则是生成速度明显慢于大多数现代替代方案。

更为审慎的多音色克隆方式

Tortoise 支持通过一组参考音频片段克隆声音,并且专门围绕妥善处理多种声音而设计,而不是针对单一默认说话人进行优化。你需要提供目标声音的数段参考片段,模型会结合这些片段捕捉该说话人的特征。与较新模型的单片段零样本克隆相比,这套配置稍显繁重,但从历史表现来看,它比后来那些更快的系统实现了更稳定、更自然的身份迁移。

Tortoise 对后续模型的影响

如果你正在比较 Tortoise 和更新的方案,这一点值得了解:它的架构思想并没有停留在单个项目中。XTTS 的 GPT 风格自回归设计和哔哩哔哩的 IndexTTS 都明确建立在 Tortoise 帮助奠定的基础之上——用自回归语言模型生成内容,再以独立细化阶段提升音频质量,这种组合成为开源 TTS 生态中相当一部分项目采用并持续迭代的模板。如果你用过把 Transformer 与独立声学细化阶段配对的新型克隆模型,其中一部分设计血统很可能可以追溯到这里。

Tortoise TTS 入门

  1. 设置专用 conda 环境。 运行 conda create --name tortoise python=3.9 numba inflect,然后激活环境,并安装与你的 CUDA 版本匹配的 PyTorch、torchvision 和 torchaudio。
  2. 准确锁定 transformers 版本。 Tortoise 明确要求 transformers==4.29.2——更新的版本很可能导致兼容性问题,因此配置时不要跳过版本锁定。
  3. 克隆仓库并安装。 运行 git clone https://github.com/neonbjb/tortoise-tts.git,再执行 cd tortoise-tts 和 python setup.py install(也可以通过 pip install git+https://github.com/neonbjb/tortoise-tts 直接安装最新开发版本)。
  4. 选择速度/质量预设。 生成支持 fast、standard 以及更高质量的设置——初次测试从 fast 开始,确定最终输出时再使用速度更慢、保真度更高的预设。
  5. 启用 kv_cache 和半精度以显著加快生成。 使用 TextToSpeech(kv_cache=True) 或 TextToSpeech(half=True) 初始化,与默认设置相比可以明显加快推理,同时不会带来巨大的质量损失。
  6. 决定本地配置前先试用托管演示。 你可以使用 Hugging Face Spaces 演示——请注意,它需要 GPU 支持的 Space,因为纯 CPU 实例无法运行 Tortoise 的推理管线。

获得更好效果的技巧

  • 为生成留出实打实的时间,尤其是在较高质量设置下。 Tortoise 这个名字并不是反话——即便启用了 kv_cache 和半精度,如果你需要近乎即时的结果,也不该选择这个模型;它面向的是有声书旁白这类质量优先的离线工作流,而不是实时交互。
  • 提供多段参考片段,而不只是一段。 Tortoise 的多音色克隆围绕同时使用目标声音的多个样本而构建——如果像使用较新的零样本模型那样只依赖一段很短的片段,往往无法充分发挥它的实际能力。
  • 把它留给质量比周转速度更重要的内容。 长篇旁白、有声书和优质内容最能体现 Tortoise 的韵律优势——如果用于实时智能体或快速迭代,较新的低延迟模型会更合适。
  • 规划部署前确认大约有 8GB VRAM。 这是通常所说的流畅运行 Tortoise 的基础配置;在认定更小的 GPU 足够之前,请结合具体预设和批处理设置进行核对。
  • 不要期待与活跃开发模型相同的安装体验。 Tortoise 自初期版本发布后开发节奏已经放缓,因此严格遵循文档列出的依赖版本,尤其是被锁定的 transformers 版本,会比假设所有最新版都能运行省下更多排障时间。

Tortoise TTS 与较新克隆模型对比

Tortoise TTSXTTS-v2F5-TTS
架构自回归 Transformer + 扩散模型自回归 Transformer(GPT-2 风格)+ VQ-VAEDiffusion Transformer + flow matching
生成速度慢,质量优先中等快(~0.15 RTF)
声音克隆多片段参考单段约 6 秒片段单段约 5–15 秒片段
多语言支持主要为英语17 种语言主要面向英语
许可证Apache 2.0(完全宽松)Coqui Public Model License(非商业)CC-BY-NC(非商业)
最适合有声书、优质旁白、质量优先的离线工作通用多语言克隆实时或高吞吐量生成

Tortoise 如今的特定定位,是服务于那些生成时间确实无关紧要、音频质量却至关重要的项目——它也仍然是少数可以凭宽松许可证直接用于商业用途,无需另行签署协议的知名克隆模型之一。

常见问题

为什么叫“Tortoise TTS”?

这个名字是对模型缓慢速度有意而诙谐的调侃——它的创作者曾形容,模型从设计上就“慢得离谱”,因为它优先考虑输出质量而非生成速度。

谁创建了 Tortoise TTS?

James Betker 使用自己的硬件独立创建了 Tortoise TTS,没有任何雇主参与——模型及其代码和权重均完全开源。

Tortoise TTS 可以免费用于商业用途吗?

可以。它以 Apache 2.0 许可证发布,这是开源 TTS 模型中较为宽松的选择之一,没有要求另行签署商业协议的限制。

Tortoise TTS 的架构与较新的扩散模型有什么不同?

Tortoise 将自回归 Transformer(生成离散语音 token,类似 GPT 生成文本 token 的方式)与扩散模型配对,由后者把这些 token 细化为最终音频。这是一种受到图像生成技术启发的两阶段设计,不同于一些较新模型采用的单一 flow-matching 或 Diffusion Transformer 管线。

Tortoise TTS 影响过其他 TTS 模型吗?

是的。它把自回归语言模型与独立音频质量细化阶段结合起来,这一架构被认为影响了包括 XTTS 和 IndexTTS 在内的后续模型。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →