EchoraEchora
返回模型列表

Parler-TTS:描述你想要的声音,而不是录下它

2026年9月4日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

每个克隆模型首先都会要求同一样东西:一段参考音频。由 Hugging Face 开发的 Parler-TTS 完全跳过了这项要求——你不必提供声音样本,只需用一句话描述想要的声音,模型就会生成符合该描述的语音。在这里,“一位音调略低的女性说话者,以较快的速度说话,录音清晰、近距离”就是一份完整的声音规格说明,不需要麦克风。

什么是 Parler-TTS?

Parler-TTS 是 Hugging Face 推出的开源文本转语音项目,旨在复现最初由 Stability AI 和爱丁堡大学开展的、以自然语言引导高保真 TTS 的研究。这个项目与该领域大多数开源发布版本的不同之处,在于它真正做到了彻底开放:数据集、预处理流水线、训练代码和模型权重全部以宽松许可证公开,而不是只发布最终检查点。与大多数 TTS 项目相比,这是一种意义重大的、更透明的发布方式;也正因如此,社区不仅可以在黑箱上运行推理,还能重新训练、微调或完整复现项目结果。

自然语言音色控制究竟如何工作

Parler-TTS 接收两个彼此独立的文本输入,而不是一个——你想要朗读的文本,以及一段关于它应当如何发声的自然语言描述。这段描述可以控制说话者性别、音高、语速,以及背景噪声或混响等录音特征;这一切都通过普通句子完成,无需数字滑块或参考音频。像“一位男性说话者在嘈杂录音中以很快的速度发表单调的讲话”这样的描述,会被解析并直接应用于生成结果。

要实现这一点,必须解决一个真实的数据难题:音频数据集并不会附带自然语言描述。Hugging Face 专门构建了配套项目 DataSpeech 来弥合这一缺口——它先用客观特征标签(噪声水平、语速、混响及类似属性)标注语音样本,再把这些标签输入大语言模型,由模型生成自然流畅的描述。这些由 LLM 生成的描述与对应音频配对后,就成为训练数据,用来教 Parler-TTS 将描述性语言与真实声学特征关联起来。

实际可以控制什么

基础模型支持通过描述来控制性别、音高、语速和声学环境(背景噪声、混响、录音清晰度)——这些属性基本适用于任何说话者。情绪表现力则是一项进一步依靠微调获得的能力:Hugging Face 发布了一个在 Expresso 数据集上微调的版本。Expresso 是一个包含四位说话者的高质量表现型语音语料库,该版本专门教模型遵循情绪和表演风格提示,将同一套自然语言控制机制扩展到了基础模型默认覆盖范围之外、更富表现力的领域。

模型家族

Parler-TTS 已发布了几种不同规模和训练体量的版本,每种版本都在数据或能力方面迈进一步:

  • Parler-TTS Mini v0.1——首个发布版本,使用约 10,500 小时音频训练,确立了以自然语言描述为核心的方法。
  • Parler-TTS Mini v1 / v1.1——使用规模更大的 45,000 小时数据集训练;v1.1 专门改进了提示词分词器(基于 Llama 2 分词器,词表更大,并支持字节回退处理),以简化未来的多语言训练,除此之外,底层模型和训练数据与 v1 完全相同。
  • Parler-TTS Large v1——一个拥有 22 亿参数的模型,同样使用 45,000 小时数据集训练,以相应更大的计算资源占用提供该家族中最高的质量档位。

Parler-TTS 入门

  1. 安装库。 pip install git+https://github.com/huggingface/parler-tts.git 可直接从源代码仓库获取推理包。
  2. 加载所选模型和分词器。 使用 ParlerTTSForConditionalGeneration.from_pretrained() 加载你想要的具体检查点(Mini v0.1、Mini v1.1 或 Large v1),并搭配相应的 AutoTokenizer。
  3. 编写两个独立的提示词。 一个变量保存你想要朗读的文本,第二个变量保存对声音和表达方式的自然语言描述——两者会分别进行分词,然后再传入生成过程。
  4. 如果使用 v1.1 或更高版本,请使用两个分词器。 与早期版本不同,Mini v1.1 和 Large v1 分别为描述文本与朗读文本使用独立的分词器——请确认你参考的是哪个版本的文档,因为把 v0.1 的单分词器方法与新检查点混用会引发问题。
  5. 如果需要特定能力,请在自己的标注数据集上微调。 DataSpeech 流水线专门用于帮助你生成微调 Parler-TTS 所需的自然语言描述,从而让模型适应新的音色风格、语言或表现能力;这与创建 Expresso 微调版本所采用的方法相同。

获得更好结果的技巧

  • 音色描述要具体,不要含糊。 “一位音调略低的女性说话者,在非常清晰、近距离且速度略快的录音中说话”比“一个普通声音”能给模型提供多得多的信息;在每个可控维度(性别、音高、语速、录音质量)上写得具体,往往能得到更一致的结果。
  • 避免在提示词中描述国籍。 社区微调工作发现,在训练数据或推理提示词中加入国籍,实际上可能会降低输出质量,而不是提升口音准确度——应省略国籍,改用其他描述词(口音、语调、节奏)承载这些信息。
  • 需要情绪或表演风格提示时,专门选用 Expresso 微调版本。 基础模型针对更普适的属性(性别、音高、语速、环境)进行了调优;如果项目需要特定的情绪表达,基于 Expresso 的检查点正是为此构建的,而不是通用基础模型。
  • 让模型大小匹配你的质量需求。 对大多数项目而言,Mini v1.1 是更实用的默认选择;只有当最高质量比推理速度和资源使用更重要时,才应选用拥有 2.2B 参数的 Large v1。
  • 对于非英语语言,可以考虑训练自己的微调版本。 由于 Parler-TTS 的基础模型主要面向英语,社区实践(已有一个法语微调版本的记录案例)已经证明,DataSpeech 加微调的方法可以把项目扩展到其他语言,不过开放数据集的质量和数量仍是主要的实际瓶颈。

Parler-TTS 与参考音频克隆模型对比

Parler-TTSXTTS-v2F5-TTS
音色控制方式自然语言文本描述参考音频片段(约 6 秒)参考音频片段(约 5–15 秒)
无需音频样本是否否
克隆特定真人的声音不是设计目标是,这是核心用途是,这是核心用途
完整流水线开放(数据 + 代码 + 权重)是仅代码和权重仅代码和权重
模型大小从 Mini(10.5K/45K 小时)到 Large(2.2B 参数)单一当前版本单一当前版本
许可证Apache 2.0Coqui Public Model License(非商业)CC-BY-NC(非商业)

Parler-TTS 的特定定位,是无需用真实录音进行克隆,就能按需生成一个可信、规格明确的声音——适合你想控制声音特征,而不是复现某个特定人物身份的场景;其完全开放的训练流水线,在这种规模的项目中也确实非常罕见。

常见问题

使用 Parler-TTS 需要参考音频片段吗?

不需要。与声音克隆模型不同,Parler-TTS 根据对目标声音和表达风格的自然语言文本描述来生成语音,无需任何音频样本。

我实际可以控制哪些声音特征?

基础模型支持性别、音高、语速,以及背景噪声和混响等声学环境因素,全部通过自然语言描述指定。情绪表现力则专门通过 Expresso 微调版本提供。

Parler-TTS 可以免费用于商业用途吗?

可以。它以 Apache 2.0 许可证发布,这是开源 TTS 模型中较为宽松的选择之一,同时覆盖代码、训练流水线和权重。

Mini v1 和 Mini v1.1 有什么区别?

两者使用相同配置和完全一致的数据进行训练;v1.1 唯一的变化是改进了提示词分词器,采用更大的词表并支持字节回退,目的是简化未来的多语言训练。

Parler-TTS 能克隆特定真人的声音吗?

这不是它的核心设计。Parler-TTS 的重点是生成符合文本描述的声音,而不是复现特定参考说话者的身份——要克隆真人声音,专用克隆模型更合适。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →