EchoraEchora
返回模型列表

Llasa:语音合成只是 LLaMA 学会的又一件事

2026年9月6日
•
7 分钟阅读

由香港科技大学 Audio Lab 开发的 Llasa,认真验证了一个明确的设想:如果像对文本进行 token 化一样把语音转换成 token,现有大语言模型无需专门架构也能生成语音——它只需要学会一套新的词表。Llasa 直接扩展三种不同规模的 LLaMA 模型,将语音视为其研究所称的“一种特殊语言”,而不是需要自成体系的独立模态。

什么是 Llasa?

Llasa 是一个文本转语音系统。它在基于文本的 LLaMA 语言模型上加入 XCodec2 码本中的语音 token,将模型扩展为 1B、3B 和 8B 三种参数规模;该码本包含 65,536 个不同的 token。模型使用 250,000 小时的中英语音数据训练,其中约 160,000 小时来自开源语料库(LibriHeavy、Emilia 和 WenetSpeech4TTS),另有 90,000 小时内部数据。这套方法可以与标准 LLaMA 框架无缝兼容——音频会被转换成单码本 token,并被当作语言模型能够学习预测的又一种序列。因此,现有的 LLM 压缩、加速和微调技术可以直接应用于 Llasa,无需从头构建 TTS 专用工具。

如何在 1B、3B 和 8B 之间选择

同一种底层方法提供三种规模,带来了真正实用的优势:你可以根据实际硬件和质量需求匹配模型规模,而不必受限于单一的固定体量:

  • Llasa-1B 是最轻量的选项。当资源限制比追求最高质量更重要时,它最为实用,也是进一步针对新语言或方言进行微调时最常用的基础版本。
  • Llasa-3B 居于中间,也是社区演示和对比中最常被提及的版本——如果你不确定哪种规模适合自己的用例,它是一个合理的默认选择。
  • Llasa-8B 是规模最大、能力最强的版本,在复杂文本理解和细腻语音生成方面更进一步,但相应的计算成本也更高。

扩展语音生成的测试时计算

这是 Llasa 最独特的研究贡献,它直接借鉴了近期推动文本 LLM 进步的一种趋势:Llasa 的研究不只通过训练更大的模型或使用更多数据来提升质量,还探索了在推理时扩展计算——这与推理模型通过“思考更久”给出更好答案的总体思路相同,只是这里将其用于语音生成,而非文本推理。因此,Llasa 的贡献既关乎如何通过推理时策略从固定模型中挖掘更多能力,也关乎模型架构本身。

强大的文本理解能力

Llasa 直接建立在真正的语言模型基础之上,而不是把文本转音素流水线接到声学模型上,因此它处理结构复杂文本时展现出的理解能力,会让许多专用 TTS 系统相形见绌——项目自身的示例特别展示了编号列表、嵌套标点,以及包含引述对话的多分句句子;Llasa-8B 能够正确处理这些文本,而不会在其中磕绊。

通过语音提示进行声音克隆

Llasa 既可以完全根据输入文本,使用自身的通用声音特征生成语音,也可以通过语音提示进行条件控制来克隆声音——据称只需 15 秒参考音频,就能捕捉目标说话人的音色和情感特征。这种双模式设计意味着,如果你不需要克隆特定声音,就不必这样做;普通文本转语音是一项核心模式,而非附带功能。

一个值得了解的实际细节

如果你使用的是 Llasa-3B,需要注意模型要求输入音频为 16kHz——使用其他采样率的音频是有文档记录的效果下降原因。因此,在运行推理前将参考片段重采样到匹配的采样率,值得作为标准预处理步骤来做,而不是等生成结果不理想后才发现采样率不匹配。

Llasa 入门

  1. 先安装 XCodec2。 Llasa 的语音 token 化直接依赖它,因此在尝试任何推理或训练之前,先确保这个依赖可以正常工作。
  2. 从 Hugging Face 选择模型规模。 HKUSTAudio/Llasa-1B、HKUSTAudio/Llasa-3B 和 HKUSTAudio/Llasa-8B 均可单独下载——请根据硬件预算和质量需求选择,而不是默认使用最大的版本。
  3. 使用专用推理仓库进行测试。 GitHub 项目 zhenye234/LLaSA_inference 专门用于运行和试验测试时计算扩展,与训练代码库彼此独立。
  4. 如需微调或从头训练,请使用训练仓库。 zhenye234/LLaSA_training 提供复现或扩展基础训练过程所需的脚本,以及已有文档说明的开源 token 化数据集(LibriHeavy、Emilia 和 WenetSpeech4TTS 合计约 160,000 小时)。
  5. 让参考音频的采样率符合模型要求。 尤其是 Llasa-3B 有明确记录的 16kHz 要求,请在生成前重采样语音提示音频,不要假设不同采样率可以互换使用。
  6. 对于基础训练未覆盖的语言或方言,可以考虑微调 Llasa-1B。 较小的模型更常被用作微调起点,而且已有社区工作将其扩展到粤语等其他语言。如果目标语言在中英文基础训练中覆盖不足,这是一条切实可行的路径。

获得更好效果的技巧

  • 如果不确定先测试哪种规模,可以从 Llasa-3B 开始。 它是社区使用和演示中最常被提及的版本,因此相比讨论较少的 1B 或 8B 检查点,更容易找到对比基准和故障排查帮助。
  • 输入真正复杂的文本,才能看到它的实际优势。 强文本理解是明确强调的能力,只用简单、规整的句子测试,无法体现 Llasa 与更基础 TTS 流水线的真正区别。
  • 克隆时使用 15 秒或更长的干净参考片段。 这通常被视为可靠捕捉目标声音音色和情感特征的实际最低时长。
  • 不要期待它无需调整就能在中英文之外的语言上表现出色。 例如,独立粤语评测显示,基础 Llasa-1B 模型的表现明显不如专用粤语或多语言模型,直到它针对粤语数据进行了专门微调——如果目标语言不是中文或英文,应把微调步骤纳入计划。
  • 利用共享 LLaMA 架构带来的 LLM 技术。 Llasa 确实建立在 LLaMA 框架上,因此量化、LoRA 微调等成熟的 LLM 优化方法,相比迁移到架构完全不同的 TTS 系统,更有可能顺利应用。

Llasa 与其他基于 LLM 的 TTS 方法对比

LlasaOuteTTSCosyVoice3
基础架构LLaMA(1B/3B/8B)+ XCodec2 tokenLLaMA/Qwen + DAC token监督式语义 token + 流匹配
模型规模选项1B、3B、8B350M–1B0.5B
语言中文、英文23 种(v1.0)9 种语言 + 18 种中文方言
声音克隆支持,约 15 秒语音提示支持,约 10 秒参考音频支持,约 3–10 秒参考音频
通过 llama.cpp / GGUF 运行不是主要部署路径支持,原生运行不支持
开箱即用的方言表现中文和英文以外需要微调以英文为主原生中文方言支持强

Llasa 的特定定位,是在“将 TTS 作为纯语言建模”的方法中提供真正灵活的模型规模(从 1B 到 8B),同时把研究重点放在扩展推理时计算上。虽然三者属于相似的架构家族,但这一侧重点不同于 OuteTTS 优先采用 llama.cpp 的部署方案,也不同于 CosyVoice3 对方言广度的重视。

常见问题

Llasa 1B、3B 和 8B 有什么区别?

它们采用相同的底层方法,只是规模逐级增大——1B 最轻量,也是最常用的微调起点;3B 是社区演示中使用最频繁的版本;8B 规模最大,以更高的计算成本提供最强的文本理解和生成质量。

Llasa 进行声音克隆需要多少参考音频?

通常认为,约 15 秒的干净参考音频足以捕捉目标说话人的音色和情感特征。

Llasa 在中文和英文以外的语言上表现好吗?

开箱即用时并不好。例如,独立粤语测试显示,基础模型的表现不如专用粤语或多语言系统,直到它针对该语言的数据进行了专门微调。

对 Llasa 来说,“扩展测试时计算”是什么意思?

它指的是在推理时使用额外计算来提升输出质量,而不是只依赖训练阶段的规模——其概念类似于面向推理的语言模型使用额外推理计算生成更好答案,只是这里将它应用于语音生成。

为什么 Llasa-3B 特别要求输入 16kHz 音频?

这是该检查点有文档记录的要求——输入其他采样率的音频是已知的效果下降原因,因此预先将参考片段重采样为 16kHz,值得作为标准做法。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →