EchoraEchora
返回模型列表

Sesame CSM 1B:让语音扎根于对话,而不只是文本

2026年9月6日
•
7 分钟阅读

大多数 TTS 模型接收一个句子,然后把它读出来。Sesame 的 CSM 1B 会接收截至当前的完整对话——也就是实际说过的话的音频,而不只是转录文本——再以这段上下文为依据生成下一句话,匹配对话已经形成的节奏、音高和情感基调。这一区别正是 CSM 整个理念的核心,也是 Sesame 所说的“声音临场感”(voice presence)——目标是让语音交互显得真实、让人感到被理解,而不是仅仅像有人在朗读。

什么是 CSM 1B?

CSM(Conversational Speech Model,对话语音模型)是 Sesame AI 推出的一款开放权重语音生成模型。Sesame AI 是一家位于旧金山的初创公司,由 Oculus 前 CEO Brendan Iribe 等人共同创立。CSM 于 2025 年 3 月以 10 亿参数检查点的形式发布,采用完全宽松的 Apache 2.0 许可证。它并非只从文本生成语音,而是直接根据交错的文本和音频历史进行生成,所用架构由两个 Transformer 构成,并以 LLaMA 为骨干。

底层原理:两个 Transformer 与 Mimi 编解码器

CSM 的架构把生成工作分配给两个 LLaMA 风格的自回归解码器。较大的骨干解码器负责处理交错的文本和音频上下文,并预测下一段语音的第一个码本 token。较小的深度解码器随后接收骨干解码器的隐藏状态,生成重建完全可懂语音所需的其余声学码本 token。

两个解码器处理的都是来自 Mimi 的 token。Mimi 是由 Kyutai 开发的分离式残差向量量化(RVQ)音频编解码器。Mimi 以 12.5Hz 的帧率把语音压缩到约 1.1kbps,同时保持较高的音频保真度。这种表示足够高效,让 CSM 无需承担更复杂声学流水线所需的沉重计算负担即可运行。

真正的差异所在:让语音扎根于实际对话

这一点值得仔细体会,因为它很容易被轻描淡写成一个次要的架构细节。骨干解码器可以同时访问过去的音频和文本,因此 CSM 能让下一句语音扎根于截至当前的真实对话声学风格——包括说话人的音高轮廓、语速和情绪状态——而不是仅仅根据文字所暗示的声音来生成回应。这正是 CSM 能够在用户显得疲惫时匹配其精力状态、在用户兴奋时表现得更有活力,并在对话节奏放慢时更自然地停顿的具体机制。此前大多数生产级语音系统只根据文本表示生成语音,并不会以刚刚发生在交流中的真实声音为声学依据。

坦诚说明:开放检查点与爆红演示并不相同

有必要准确说明你实际得到的是什么。CSM 的一个微调变体为 Maya 和 Miles 提供支持;它们是 Sesame 托管的语音伙伴,其演示于 2025 年 2 月爆红,因为听起来比此前的商业 TTS 系统更接近真实的对话伙伴。公开发布的 CSM 1B 检查点是支撑该体验的开源基础模型,并不是爆红演示背后那个经过微调的确切版本。因此应当相应调整预期:这个基础模型的确具备不俗的能力,但令演示登上新闻的那种精细完成度还涉及额外微调,而 Sesame 尚未以开放权重形式发布这些微调成果。

CSM 做不到什么

围绕它构建产品之前,有几项限制值得了解。CSM 专门被训练为音频生成模型,并非通用多模态 LLM——它无法生成文本,所以你需要先用另一个语言模型生成实际的回应内容,再由 CSM 将其转成语音。它也主要是一个英语模型;由于训练数据污染,它偶然具备一些处理其他语言的能力,但在任何严肃的非英语用例中都不应依赖这种能力。

Sesame 也明确规定了可接受用途:项目指南禁止在未经本人明确同意的情况下生成冒充真实个人的语音,禁止制作虚假新闻或诈骗电话等欺骗性或误导性内容,也禁止将该技术用于任何非法或有害用途。

CSM 1B 入门

  1. 克隆代码仓库。 运行 git clone [email protected]:SesameAILabs/csm.git,然后创建 Python 3.10 虚拟环境,并通过 pip install -r requirements.txt 安装依赖项。
  2. 获取 Hugging Face 上两个门控模型的访问权限。 你需要获准访问 sesame/CSM 1B 和 meta-llama/Llama-3.2-1B,因为 CSM 的骨干依赖 Llama 检查点——在尝试下载任一模型前,请先通过 huggingface-cli login 登录。
  3. 禁用 Mimi 的延迟编译。 设置环境变量 NO_TORCH_COMPILE=1 是文档中列出的操作,用于避免 Mimi 编解码器组件特有的编译问题。
  4. 在 Windows 上使用 triton-windows,而不是标准版 triton。 标准 triton 包无法安装在 Windows 上,项目文档明确指出应使用这一替代包。
  5. 将它与单独的 LLM 配合,组成完整的对话流水线。 由于 CSM 只能生成音频,你应在流水线上游安排一个文本生成模型,由它产出实际对话内容,再交给 CSM 配音。
  6. 考虑使用社区分支,以获得更完整的开箱即用界面。 akashjss/sesame-csm 等项目在基础模型之上增加了 Gradio UI 和兼容 OpenAI 的 API,并支持 CUDA、MLX 和 CPU 设备;与直接基于基础仓库自行开发相比,这是更快获得可用界面的途径。

改善效果的技巧

  • 向模型提供真实的对话历史,而不只是你想让它说的那一句话。 只有当你提供交错的文本和音频上下文作为依据时,CSM 的核心优势才会显现;如果没有这些历史,而只是把它当作单句 TTS 模型使用,就低估了它真正的设计目标。
  • 不要期待基础检查点能达到爆红的 Maya/Miles 演示完全相同的质量。 那项体验运行的是 Sesame 尚未开源的微调变体;应把公开的 CSM 1B 看作可供开发和微调的强大基础,而不是爆红体验的精确复刻。
  • 围绕 CSM 只能生成音频这一点来规划流水线。 为单独的文本生成模型预留资源,让它向 CSM 提供内容,而不要期待 CSM 一步完成对话生成和配音。
  • 任何生产关键型任务都应坚持使用英语。 鉴于其非英语能力源于偶然且并不可靠,应把英语视为该模型真正面向并经过测试的唯一语言。
  • 遵守关于同意和冒充行为的明确使用指南。 正因为 CSM 的输出可以呈现如此令人信服的上下文感知能力,更应认真对待项目自身对未经同意冒充他人声音的限制,而不要把它当作例行套话。

CSM 1B 与其他 Llama 骨干语音模型对比

CSM 1BOrpheus TTS典型的参考音频克隆模型
核心输入交错的文本 + 音频对话历史文本(可选择提供声音参考)文本 + 单个静态参考片段
骨干双 Transformer LLaMA 架构Llama-3B各不相同(扩散、流匹配等)
编解码器Mimi(Kyutai),12.5Hz,1.1kbpsSNAC各不相同
能否生成文本否,只能生成音频否,只能生成音频否
上下文感知核心设计目标并非主要重点并非主要重点
许可证Apache 2.0Apache 2.0各不相同

CSM 1B 的特定定位是真正以对话为依据——匹配正在进行的交流在声学上的真实情况,而不是把每一句话都当作孤立的生成任务。这一设计目标与专注于旁白的模型或基于参考片段的声音克隆都有实质区别。

常见问题

CSM 代表什么?

Conversational Speech Model(对话语音模型)——体现了它的核心设计目标:在对话过程中保持上下文感知,而不是生成孤立、脱离上下文的话语。

CSM 1B 能自行生成文本回应吗?

不能。CSM 专门被训练为音频生成模型,无法生成文本——请先用单独的语言模型产出对话内容,再由 CSM 将其转换成语音。

开源的 CSM 1B 就是 Sesame 爆红语音演示背后的同一个模型吗?

不完全是。CSM 的一个微调变体为 Maya 和 Miles 提供支持,它们是 Sesame 爆红演示中的托管语音伙伴。公开发布的 CSM 1B 是支撑该系统的开源基础模型,并不是那个具体的微调版本。

什么是 Mimi 编解码器?

Mimi 是由 Kyutai 开发的分离式残差向量量化音频编解码器。CSM 用它将语音编码成离散 token,并以约 1.1kbps 的码率将 token 解码回高保真音频。

CSM 1B 可以免费商用吗?

就许可证而言,可以——它采用 Apache 2.0 许可证。不过,Sesame 的使用指南明确禁止未经同意冒充他人声音和欺骗性用途;无论代码许可证多么宽松,这些规定都适用。

把多角色脚本转换为对话音频

如果你已经写好多角色脚本,可以使用 Echora 的文本转对话。最多添加 12 个对话区块、总计 5,000 个字符,为每个区块选择音色,按需添加支持的表达标签,并调整稳定度或说话人增强,然后试听并下载完整对话。

开始生成对话 →