FireRedTTS:为两项截然不同的任务打造的基础模型
小红书 FireRed 团队并不是要打造一个功能狭窄的演示模型——他们构建的是一套基础框架,其中包含明确的数据流水线,并通过两个具体的下游应用来验证它:为配音克隆声音,以及为聊天机器人生成自然、口语化且富有人情味的语音。这两项任务确实截然不同(一项要求听起来像某个特定的人,另一项则要求听起来像一位自然的对话伙伴),而 FireRedTTS 正是为了证明同一套基础系统能够同时出色完成这两项任务而构建的。
FireRedTTS 是什么?
FireRedTTS 是小红书 FireRed 团队开发的一套开源、基于语言模型的文字转语音框架,于 2024 年 9 月的一篇论文中首次提出。它由三个彼此衔接的部分组成:一条将原始音频转换为大规模、带有丰富标注的 TTS 数据集的数据处理流水线;一个基于这些数据构建的基础 TTS 系统;以及用于证明该基础模型实际应用范围的下游应用。这种“数据、基础模型、应用”的三段式框架,比典型的单一用途研究成果更有规划,也更面向产业实践。
FireRedTTS 的功能优势
- 真正的基础系统,而不是功能狭窄的单任务模型。 同一套底层架构既支持零样本克隆,也支持经过指令微调的对话语音生成。
- 扎实的上下文学习能力。 模型可以稳定合成同时符合提示文本和提示音频风格的语音,这与大型语言模型能够处理未经过专门微调的任务所依赖的是同一种广义能力。
- 通过少样本微调达到录音棚级质量,只需一小时的目标说话人录音,就能获得富有表现力的专业级声音角色。
- 透明地建立在成熟的开放组件之上——包括源自 Fish Speech 的文本分词器方案、BigCodec 语音编解码器、Encodec 的因果卷积设计、SpeechBrain 的 ECAPA-TDNN,以及一个中文预训练 HuBERT 模型。
基础系统的工作原理
FireRedTTS 使用语义感知语音分词器将语音压缩为离散语义 Token,随后由语言模型直接根据提示文本和提示音频生成这些 Token——这种上下文学习机制让模型只凭参考音频就能捕捉目标声音的风格。接着,一个两阶段波形生成器会将这些语义 Token 解码为高保真音频波形。代码库实际上提供了两种可选的解码器配置:声学 LLM 解码器和流匹配解码器。你可以根据更符合具体使用场景的取舍(速度、稳定性或音质特征),在两种生成方案之间进行选择。
两项真实应用:配音与聊天机器人
FireRedTTS 的基础模型定位正是在这里体现出实际价值。在配音方面,模型支持适用于 UGC(用户生成内容)场景的零样本声音克隆——无需额外训练即可即时克隆目标声音;它还支持使用约一小时目标说话人录音进行少样本微调,以便在制作精细度要求更高的 PUGC(专业用户生成内容)场景中达到具有表现力的录音棚级声音质量。在聊天机器人方面,FireRedTTS 通过指令微调生成可控、自然且口语化的语音,其中包括副语言行为和情感色彩;它专门针对语音对话智能体所需的表达风格进行了调优,而不是采用配音工作通常要求的更正式表达。
FireRedTTS 系列
最初于 2024 年发布的版本随后不断发展,形成了更广泛的模型谱系。FireRedTTS-1S(2025)将系统升级为真正的流式生成,并提供两种选择:延迟更低的多流语言模型方案,以及实时率更低的流匹配方案,具体取决于部署时更看重哪项指标。FireRedTTS-2(2025)将架构专门扩展到面向播客和聊天机器人场景的长文本、多说话人对话生成,新增 12.5Hz 流式分词器,并报告其表现领先业内可比的对话合成系统。FireRedTTS3(2026)进一步推进统一生成与编辑,加入指令控制的声音设计,以及对现有语音中特定片段进行精确编辑的能力。如果你的项目明确需要流式、多说话人播客式对话或语音编辑,这些后续版本中的某一个很可能比最初的基础模型更适合作为直接起点。
FireRedTTS 入门
- 创建独立的 conda 环境。
conda create --name redtts python=3.10会先设置所需的 Python 版本,再安装其他内容。 - 安装与你的 CUDA 版本匹配的 PyTorch。 项目针对 CUDA 11.8 和 CUDA 12.1 提供了具体安装命令——版本选错是常见的运行时错误来源,因此请与实际驱动配置保持一致。
- 从源代码安装 FireRedTTS。 运行
cd fireredtts && pip install -e .,再运行pip install -r requirements.txt,即可完成核心安装。 - 从项目的 Model_Lists 下载模型文件,并放入
pretrained_models。 - 在代码中选择解码器。 先使用
from fireredtts.fireredtts import FireRedTTS,然后以config_path="configs/config_24k.json"初始化声学 LLM 解码器,或以config_path="configs/config_24k_flow.json"初始化流匹配解码器——请根据你更重视生成稳定性,还是流匹配输出的特定音质特征来选择。
获得更好效果的技巧
- 快速制作 UGC 风格配音时使用零样本克隆,面向录音棚的内容则使用少样本微调。 项目明确说明,使用大约一小时数据进行微调的路径可以达到富有表现力的专业级声音质量——对于高品质内容,不要指望单靠零样本方式就能达到同等精细度。
- 要生成聊天机器人风格的语音,就充分利用指令微调。 如果目标是对话智能体的声音,而不是旁白或配音,那么自然口语表达和对副语言行为的感知能力,正是 FireRedTTS 针对这一场景专门调优的功能。
- 有意识地选择解码器,不要直接采用默认项。 请在实际内容上同时测试声学 LLM 解码器和流匹配解码器,因为项目同时提供二者,正是由于它们代表不同的取舍,而不是其中一个严格优于另一个。
FireRedTTS 与其他中国团队的基础 TTS 系统对比
| FireRedTTS | IndexTTS | CosyVoice | |
|---|---|---|---|
| 支持机构 | Xiaohongshu(FireRed Team) | Bilibili | Alibaba(FunAudioLLM) |
| 核心架构 | 语义分词器 + LM + 两阶段波形解码器 | 基于 XTTS/Tortoise,采用 GPT 风格 | 监督式语义 Token + 流匹配 |
| 已演示的应用 | 配音(零样本 + 少样本)与聊天机器人语音 | 通用零样本克隆、中文发音准确度 | 零样本多语言克隆 |
| 面向录音棚质量的微调 | 支持,约 1 小时数据 | 并非主要重点 | 并非主要重点 |
| 许可证/使用限制 | 明确说明仅限学术研究用途 | 商用权重需要授权 | 开放,提供托管 API |
FireRedTTS 的独特定位,在于它明确用同一套基础系统验证了两个真正不同的下游任务——多数由中国团队推出的同类 TTS 系统会主打单一核心用例,而 FireRedTTS 自身的论文则把配音和聊天机器人语音视为同等核心的验证场景。
常见问题
FireRedTTS 与 FireRedTTS-2 等后续版本有什么区别?
最初的 FireRedTTS 是一套基础系统,展示了配音和聊天机器人语音两类应用。FireRedTTS-2 专门面向播客的长文本、多说话人对话生成,而 FireRedTTS3 增加了统一生成和语音编辑能力——在从最初版本入手之前,请先确认哪个版本更符合你的实际使用场景。
FireRedTTS 能否在不进行额外训练的情况下克隆声音?
可以。它通过零样本克隆来满足快速 UGC 风格配音场景。对于表现力更强、达到录音棚级别的质量,项目还提供了使用约一小时目标说话人录音进行少样本微调的方案。
FireRedTTS 可以免费商用吗?
它的零样本声音克隆功能仅用于学术研究,并明确禁止非法使用——在进行任何商业部署之前,请直接查阅当前的许可证和使用条款。
我应该使用声学 LLM 解码器还是流匹配解码器?
两者同时提供,是因为它们代表不同的取舍,并非其中一个严格更好——请用自己的具体内容测试两者,判断哪一种更符合你在生成稳定性和输出音质特征方面的优先级。
在浏览器中把文字转换为语音
如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。