EchoraEchora
返回模型列表

Step-Audio:一个模型,不再让三个模型相互交接

2026年9月6日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

大多数语音助手实际上是套着同一个界面的三个独立系统:语音识别模型转录你说的话,语言模型判断该如何回应,再由单独的 TTS 模型把回复转换成音频。这三个系统之间的每次交接都会增加延迟并造成信息损失。阶跃星辰发布的 Step-Audio 正是为了把整条链路整合进一个统一模型,让它同时处理识别、理解和生成——其开发团队称,这是业内首个采用这种方式构建、达到生产级水平的开源实时语音交互系统。

什么是 Step-Audio?

Step-Audio 是阶跃星辰于 2025 年 2 月发布的开源语音交互系统,围绕一个核心理念而设计:语音理解与语音生成不应是由两个独立模型解决的两个独立问题。一个系统同时处理自动语音识别、语义理解、对话管理、声音克隆和语音生成,专门用于消除传统 ASR 加 TTS 级联架构在组件每次交接时引入的延迟瓶颈。

底层原理:四个组成部分

双码本分词框架。 传统语音分词器通常只擅长捕捉适合理解任务或生成任务的信息,很少能同时兼顾两者。Step-Audio 改用两个并行分词器:语言分词器(16.7Hz、1024 项码本)和语义分词器(25Hz、4096 项码本),并以 2:3 的时间交错方式组合。正是这种双重结构,让一个下游模型能够基于同一套分词表示同时处理理解与生成,而不必为两者分别设置流水线。

以 1300 亿参数 LLM 为基础。 该组件基于阶跃星辰自己的 Step-1 语言模型构建,并通过音频情境化持续预训练和特定任务后训练进一步增强。正是它赋予 Step-Audio 真正的跨模态理解能力——像强大的语言模型推理文本一样推理音频内容,而不是把音频当成附加在纯文本模型上的独立模态。

混合语音合成器。 该组件将流匹配与神经声码器相结合,专门针对实时波形生成进行优化——它就是流水线中真正把模型内部表示还原为可听语音的部分。

语音活动检测模块。 该模块从音频流中提取人声片段,处理判断用户何时真正开口说话这一实际的前端任务。对于真正的实时流式交互,而非完整音频片段的批处理,这一点至关重要。

统一为什么确实重要

这一点值得直接说明,因为人们很容易把“统一模型”看成营销话术,而不是真正的架构差异。级联流水线——独立的 ASR、独立的 LLM、独立的 TTS——必须依次穿过三个模型边界,每一步都会损失信息:ASR 转录会在 LLM 看到内容之前抹去语气和重音,而 LLM 的文本回复又会在 TTS 看到它之前抹去应当如何表达的感觉。Step-Audio 的双码本方案专门用于让更丰富的信息一次贯穿整条流水线,这也是它能够带着方言和情绪细节作出回应的部分原因;由三个系统拼接而成的流水线在结构上很难同样完整地保留这些信息。

细粒度声音控制

Step-Audio 支持通过指令精确控制生成语音的实际听感:多种情绪(愤怒、喜悦、悲伤)、地域方言(粤语、四川话等),以及说唱和无伴奏哼唱等不同声音风格。这种控制通过同一套统一架构实现,而不是外接一个风格参数;同时还支持中文、英语和日语的多语言对话。

相比级联系统的量化提升

在团队自己的评测中,Step-Audio 的双码本对齐带来了可量化的结果:与 CosyVoice 相比,说话人相似度(SS)提高了 12%。团队将这一提升明确归因于语言分词器与语义分词器的协同方式,而不只是原始模型规模。

超越语音的智能体能力

Step-Audio 建立在真正的 1300 亿参数 LLM 基础之上,而不是较小的声学模型,因此它超越纯语音生成,延伸至更广泛的智能体行为——支持用于执行复杂任务的工具调用机制,并增强了角色扮演能力,使其定位更接近完整的语音智能体框架,而非独立的 TTS 引擎。

Step-Audio 入门

  1. 克隆仓库。 从 GitHub 克隆 stepfun-ai/Step-Audio 项目(git clone),获取代码、文档和模型访问说明。
  2. 为相当可观的硬件需求做好准备。 鉴于系统底层采用 1300 亿参数 LLM,其资源需求预计会大幅超过较小的专用 TTS 模型——这是生产规模的系统,而不是轻量级本地部署方案。
  3. 判断你需要完整统一系统,还是只需要生成。 如果你的用例只是文本转语音,不需要理解和对话管理组件,请评估对这一较窄任务而言,使用专用 TTS 模型是否会比部署 Step-Audio 的完整架构更简单。
  4. 使用基于指令的情绪、方言和风格控制。 Step-Audio 的细粒度控制系统并非只依靠参考声音,而是通过明确的指令来指定表达特征。
  5. 如果你构建的是智能体,而不只是语音界面,请探索 ToolCall 集成。 Step-Audio 的 LLM 基础支持工具调用和角色扮演,因此值得用它评估真正具有智能体能力的语音应用,而不只是把它当作即插即用的 TTS 替代品。

获得更好效果的技巧

  • 让模型与实际项目范围匹配。 对于构建完整的语音交互系统,Step-Audio 的统一架构确实是一项优势;如果你只需要文本转语音生成,部署和运行较小的专用模型很可能更实用。
  • 明确给出方言和情绪指令,而不是期待模型自行推断。 这些能力由指令控制系统引导,因此明确说明想要哪种方言或情绪,比含糊或隐晦的要求更容易得到稳定结果。
  • 如果端到端延迟是首要关注点,可以考虑 Step-Audio 2。 阶跃星辰的后续工作进一步走向真正的端到端处理,消除了更多传统流水线结构,并加入音频推理能力——如果项目需求已经超出原版 Step-Audio 的覆盖范围,值得进一步了解。
  • 如果用例超越简单 TTS,请评估其智能体能力。 鉴于 Step-Audio 支持 ToolCall 和角色扮演,它尤其值得用于处理复杂多步骤任务的语音驱动智能体,而不仅仅是生成旁白。

Step-Audio 与级联系统及纯生成系统对比

Step-Audio传统级联流水线CosyVoice3(纯生成)
核心范围统一理解 + 生成独立的 ASR + LLM + TTS 模型仅语音生成
延迟更低,单次贯通架构更高,串行经过 3 个系统专门针对生成优化
方言/情绪控制支持,基于指令取决于所用 TTS 组件支持,侧重方言
智能体能力(工具调用、角色扮演)支持需要单独编排不适用
模型规模以 1300 亿参数 LLM 为基础不一,各组件通常较小5 亿

Step-Audio 真正的区别在于架构范围,而不只是生成质量——它解决的问题(统一语音交互)比大多数专门为语音生成而设计的模型更广泛。

常见问题

Step-Audio 与典型 TTS 模型有何不同?

大多数 TTS 模型只处理语音生成。Step-Audio 在一个模型中统一语音识别、语义理解、对话管理和生成,专门用于消除独立 ASR、LLM 和 TTS 系统相互交接时产生的延迟和信息损失。

谁开发了 Step-Audio?

Step-Audio 由中国 AI 公司阶跃星辰开发,并于 2025 年 2 月以开源形式发布。

Step-Audio 的双码本分词器如何工作?

它将两个并行分词器——语言分词器和语义分词器——结合起来,以不同帧率运行,并按 2:3 的比例交错,专门让一个下游模型能够基于同一套分词语音表示同时处理理解和生成。

Step-Audio 支持方言和情绪吗?

支持。它通过基于指令的控制覆盖多种情绪(愤怒、喜悦、悲伤)、地域方言(粤语、四川话等),以及说唱和无伴奏哼唱等声音风格。

Step-Audio 有更新版本吗?

有。阶跃星辰已发布后续版本 Step-Audio 2,进一步推动真正的端到端处理并加入音频推理能力,此后还发布了同一系列的其他研究成果。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →