EchoraEchora
返回模型列表

Voxtral TTS:向封闭 API 语音市场发起挑战的开放权重模型

2026年9月10日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

商业语音 AI 的每一家主要厂商——包括 ElevenLabs——经营的都是专有、API 优先的业务:你租用声音,却不拥有背后的模型。Mistral AI 进入这一领域,直接打破了这种模式。Voxtral TTS 提供完整的开放权重,这意味着企业可以下载模型,完全在自己的基础设施上运行,而且不必向第三方发送任何一帧音频——这与租用他人的封闭模型,是截然不同的选择。

什么是 Voxtral TTS?

Voxtral TTS 是 Mistral AI 于 2026 年 3 月 26 日发布的一款 40 亿参数开放权重文字转语音模型,以 mistralai/Voxtral-4B-TTS-2603 的形式分发,提供 BF16 权重和一组开箱即用的参考声音。它是 Mistral 更广泛的 Voxtral 家族中补齐语音生成的一环。这个家族始于 2025 年 7 月,最初是一条语音理解模型产品线(可对音频进行转录、语音到文本翻译、摘要和问答),之后又通过专门的 Voxtral Transcribe 2 ASR 模型得到扩展。加入 TTS 后,Voxtral 如今覆盖了完整闭环——语音输入、语言理解和语音输出——形成一个相互衔接的模型家族,而不是彼此无关的独立产品。

Voxtral TTS 的功能优势

  • 真正开放的权重,让你能够在自己的基础设施上自托管,而不必像使用大多数质量相当的商业语音模型那样依赖封闭 API。
  • 仅用 2 到 3 秒参考音频即可进行零样本声音克隆,单凭这段短样本就能捕捉情绪、说话风格和口音。
  • “声音即指令”(Voice-as-instruction)生成,直接遵循参考音频的语调、节奏和情感特征,无需手动添加韵律或情绪标签。
  • 覆盖九种语言——英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语——并支持跨语言声音克隆和混合语言文本。
  • 低延迟流式生成,模型处理延迟约为 90ms,实时因子约为 9.7x,也就是说,它合成音频的速度接近最终语音播放速度的十倍。
  • 与 ElevenLabs 直接进行基准测试,Mistral 自己的评估报告显示,在零样本声音克隆测试中,Voxtral 相比 ElevenLabs Flash v2.5 获得了 68.4% 的偏好胜率;在说话人相似度上,则与 ElevenLabs v3 持平或更好。

“声音即指令”究竟如何工作

这是 Voxtral TTS 最具辨识度的设计选择,与其他几种富表现力模型采用的方括号标签系统有着实质区别。Voxtral TTS 通过分解式表征,将语音的语义内容(说了什么)与声学质感(听起来如何)分离。借助这种分离,模型可以把参考声音的音色、语气和音高应用到任意生成文本上,同时针对文本所使用的语言,独立维持正确的语言韵律;参考音频提示本身也可以承载情绪和风格指令,而不需要你用单独的风格标记注释文本。在实际使用中,这意味着你提供的参考音频不只是一段音色样本——它本身就是模型会直接遵循的表演指令。

更大语音技术栈的一部分

Voxtral TTS 并不是孤立存在的——它是整个家族的最新组成部分。该家族还包括最初专注于转录和音频理解的语音理解模型 Voxtral Mini,以及同时加入批量和实时自动语音识别的 Voxtral Transcribe 2。如果你的项目需要的是相反方向(输入音频,输出文本或理解结果),而不是 TTS,那么更值得关注的是这些较早发布的 Voxtral 模型——Mistral 所表述的目标,是打造一套由企业自主拥有的完整语音工作流,不必再为输入、理解和输出分别拼接不同供应商。

Voxtral TTS 入门

  1. 从 Hugging Face 下载模型卡。 mistralai/Voxtral-4B-TTS-2603 托管了 BF16 权重和随附的参考声音——任何自托管部署都从这里开始。
  2. 安装 vLLM 和 vLLM-Omni,以进行生产级服务部署。 Mistral 与 vLLM-Omni 团队直接合作,为该模型提供支持;你需要 vllm >= 0.18.0 和 vllm-omni >= 0.18.0,可通过 uv pip install vllm-omni --upgrade 安装。
  3. 如果不想手动配置环境,可以使用已准备好的 Docker 镜像。 Docker Hub 提供了预构建镜像,可更快启动并运行部署。
  4. 如果自托管不是首要需求,可以使用托管 API 或 Mistral Studio。 Voxtral TTS 也可直接通过 Mistral API 和 Studio 界面使用,价格为每 1,000 个字符 0.016 美元——在投入本地基础设施之前,这是一条评估质量时阻力更小的起点。
  5. 商业使用前,检查随附参考声音的许可条款。 它们采用 CC BY-NC 4.0 分发,整个模型也继承了同一许可证——如果你的部署计划用于商业场景,而非内部使用或评估,请仔细审阅这些条款。

获得更好效果的技巧

  • 把参考音频当作表演指令,而不只是一段音色样本。 由于模型会直接从提示中读取语调和情感特征,已经带有目标表达方式的参考音频,比一段平淡、中性的样本加上“希望文本本身能表达正确语气”的做法,更接近你想要的输出。
  • 正式采用前,针对你的具体语言组合测试跨语言克隆。 这项能力真实存在且有文档说明,但和大多数跨语言系统一样,质量会因具体的源语言与目标语言组合而异——请验证项目真正需要的那一组语言。
  • 任何对话式应用都应使用流式路径。 凭借低延迟和较高的实时因子,该模型尤其适合实时语音智能体和实时翻译场景,而不只是批量内容生成。
  • 如果你在开发商业产品,请仔细阅读 CC BY-NC 4.0 条款。 尽管该模型面向企业语音工作流,但随附的参考声音以及模型继承的许可证都限制商业使用——请确认你的具体用例真正需要满足哪些条件,不要想当然地把“开放权重”等同于“不受限制的商业使用”。
  • 用你的实际内容进行基准测试,不要只依赖 Mistral 发布的对比结果。 包括 ElevenLabs 对比在内的厂商基准测试是有用的信号,但会随语言和指标而变化——在最终选型前,请用自己的脚本进行测试。

Voxtral TTS 与 ElevenLabs、Chatterbox 对比

Voxtral TTSElevenLabsChatterbox
部署方式开放权重,可自托管封闭,仅提供 API开放权重,可自托管
克隆所需参考音频2–3 秒不固定5–10 秒
风格/情绪控制声音即指令(无需标签)有限的风格控制Exaggeration 参数
语言9 种多语言(数量更多)英语(多语言版:23 种)
许可证CC BY-NC 4.0(非商业)专有商业 APIMIT

Voxtral TTS 的独特定位,是把真正达到企业级、可与 ElevenLabs 竞争的质量,带入开放权重、可自托管的模型中——这种组合目前仍然相对少见,尽管它的非商业许可证意味着,“开放”并不自动等同于“可不受限制地用于商业部署”。

常见问题

Voxtral TTS 可以免费用于商业用途吗?

未经审查不能直接使用。该模型及其随附的参考声音均采用 CC BY-NC 4.0 这一非商业许可证发布——尽管它面向企业用例,但商业部署仍需要直接向 Mistral 核实当前许可条款,不能因为权重开放就假定可以不受限制地使用。

Voxtral TTS 与 ElevenLabs 相比如何?

在 Mistral 自己发布的评估中,Voxtral TTS 在零样本声音克隆测试中,相比 ElevenLabs Flash v2.5 获得了 68.4% 的偏好胜率;在说话人相似度上,则与 ElevenLabs v3 持平或更好。不过,这两个系统的结果会因语言和具体指标而异。

Voxtral TTS 与其他 Voxtral 模型有什么区别?

Voxtral TTS 专门负责语音生成。Voxtral Mini 和 Voxtral Transcribe 2 负责相反方向——语音理解、转录和翻译——共同构成同一个更广泛的 Voxtral 语音模型家族。

Voxtral TTS 克隆声音需要多少参考音频?

最少只需 2 到 3 秒,就能从这段短样本中捕捉情绪、说话风格和口音。

Voxtral TTS 有多快?

模型处理延迟约为 90ms,实时因子约为 9.7x,适合实时语音智能体和实时翻译等低延迟流式应用。

使用参考音频生成相似音色语音

如果你希望完成相近的“参考音频 + 新文本 → 相似音色语音”流程,可以使用 Echora 的声音克隆。上传你自己的声音或已获明确授权使用的参考音频,输入最多 5,000 个字符的新文本,即可生成与参考音色相近的新语音。

开始克隆声音 →