EchoraEchora
返回模型列表

WhisperSpeech:让转录模型反向运行

2026年9月8日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

OpenAI 的 Whisper 是目前最受信赖的语音识别模型之一——它使用海量多语言音频进行训练,能将语音转换为准确的文字。WhisperSpeech 背后的 Collabora 团队审视了这个模型,并提出了一个非常巧妙的问题:既然 Whisper 如此擅长理解语音表达的含义,那么把它反向运行会怎样?WhisperSpeech 就是答案——它没有从零设计 TTS 流程,而是通过反转 Whisper 自身的架构,构建出一个文字转语音系统。

什么是 WhisperSpeech?

WhisperSpeech 是 Collabora 推出的开源 TTS 系统,此前以 spear-tts-pytorch 之名开发,后来才采用现在的名称。项目明确提出了一个目标:在语音领域成为图像领域的 Stable Diffusion——功能强大、易于改造,并且可以安全地用于构建商业产品。最后一点是项目有意为之的明确选择:WhisperSpeech 的全部代码都以 Apache-2.0/MIT 许可证发布,其模型也完全使用获得适当许可的语音数据训练(当前版本采用英语 LibreLight 数据集),而不是来源模糊、从各处抓取的数据;这类不清晰的数据来源会给许多开源 TTS 研究的商业可用性蒙上阴影。

反转 Whisper 究竟如何工作

Whisper 自身的架构分为两部分:编码器将音频转换为连续的嵌入表示流,并在过程中捕捉上下文含义和韵律;解码器则使用交叉注意力,将这些嵌入表示转换为实际词语,也就是转录文本。WhisperSpeech 让同一结构沿相反方向运行:从文字出发,生成对应的嵌入表示,再将这些嵌入表示转换为声音,而不是从声音中提取它们。

真正巧妙之处在于它复用了什么。Whisper 的编码器基于海量多语言音频训练,能为语音内容生成异常强大的语义表示。Google 的 SPEAR-TTS 和 VALL-E 等架构在内部也依赖类似的语义 Token 提取,但它们所使用的特定语义编码器从未公开发布。通过将 Whisper 自身的编码器重新用于这一角色,WhisperSpeech 为同类系统一直保持闭源的组件提供了可直接替换的开源等效方案——这也是该项目把自己描述为填补了真实空白,而不只是换个品牌重新实现现有工作的部分原因。

两阶段流程

WhisperSpeech 采用了 AudioLM、SPEAR-TTS 和 Meta 的 MusicGen 所推广的同类两阶段 Token 流程——它没有用一个单体步骤完成语音合成,而是将其拆分为“阅读”和“说话”阶段。**文字到语义(T2S)**阶段使用源自 Whisper 的方法,将输入文字转换为语义 Token。随后,**语义到声学(S2A)**阶段把这些 Token 转换为实际音频:使用 Meta 的 EnCodec 进行声学建模,并通过 Charactr 的 Vocos 声码器渲染最终的高质量波形。项目并未从零构建每个组件,而是有意在每个阶段采用成熟的开源模块——由 Whisper 负责语义理解、EnCodec 负责声学表示、Vocos 担任声码器——将各自已经独立验证过的组件组合成新的系统。

速度与初现端倪的多语言能力

在加入 torch.compile 支持、KV 缓存和针对性的网络层调整后,WhisperSpeech 在消费级 RTX 4090 上达到了约 12 倍实时速度——这轮重要优化让它从研究级速度提升到能在易于获得的硬件上实现真正实用的推理速度。在多语言方面,团队开展了一项概念验证:使用英语、波兰语和法语混合数据集训练一个小型 S2A 模型,并成功使用仅接受过英语和波兰语训练的语义 Token 克隆出法语声音。这个结果释放出一个重要信号——它表明单个共享 Tokenizer 可能足以覆盖多种语言,而不必为每种语言单独训练一个;不过,这仍是早期探索性工作,并非已经完成的多语言版本。

WhisperSpeech 入门

听到 WhisperSpeech 效果最快的方式,是使用项目提供的 Google Colab notebook,无需在本地进行任何配置即可运行推理。如果你更愿意自行运行,Hugging Face 同时提供预训练模型及其对应的转换后训练数据集,你既可以在本地运行推理,也可以把它们作为训练自有变体的起点。项目的 Discord 社区设在 LAION 服务器的音频生成频道,是询问配置问题或关注多语言开发进展的活跃场所。

获得更好结果的技巧

  • 不要在确认当前语言覆盖范围前,就假定多语言支持已达到生产可用水平。 稳定版本仍以英语为主(通过 LibreLight);前景可期的法语声音克隆结果来自小型概念验证模型,而不是主版本——围绕更广泛的语言覆盖制定计划前,请先核实项目当前状态。
  • 先用 Colab notebook 验证你的内容质量。 在投入本地安装和配置之前,这是一种门槛更低的方式,可以直接听到模型对你的具体用例会产生怎样的实际输出。
  • 如果要规模化部署,请充分利用推理速度优化。 RTX 4090 上 12 倍实时速度的数据来自特定优化(torch.compile、KV 缓存)——请确保自己的部署也应用了这些优化,而不是运行未经优化的基准配置。
  • 如果关心商业部署,请充分考虑其许可优势。 该项目专门围绕获得适当许可的训练数据和宽松的代码许可证构建,因此相比训练数据来源不够透明的 TTS 项目,它确实是风险更低的起点——当供应商或模型选择需要接受法务审查时,这一点值得纳入考量。

WhisperSpeech 与其他完全开放的克隆模型对比

WhisperSpeechVoiceCraftF5-TTS
核心架构思路让 Whisper 的 ASR 流程反向运行使用 Token 补全进行编辑和克隆Diffusion Transformer + 流匹配
训练数据来源完全采用获得适当许可的数据(LibreLight)开放的真实环境来源Emilia 数据集(非商业许可证)
代码许可证Apache-2.0 / MIT开放代码开放,权重采用 CC-BY-NC
商业用途明确以可安全商用为设计目标开放,需核对伦理使用条款需要另行获得许可
推理速度约 12 倍实时速度(RTX 4090,已优化)并非主要重点约 0.15 实时因子
当前语言覆盖英语(多语言仍处于早期测试)以英语为主主要以英语为主

WhisperSpeech 的特定定位,在于它把一个优雅且节省资源的架构思路(复用 Whisper,而不是从零训练新的语义编码器)与真正有意为之的清晰数据许可相结合——对于既重视“效果好不好”,也同样重视“能否合法发布”的团队来说,这种组合尤为重要。

常见问题

“反转 Whisper”究竟如何产生语音?

Whisper 通常通过编码器—解码器结构,将音频转换为嵌入表示,再转换为文字。WhisperSpeech 将这一流程反转——从文字出发,生成对应的嵌入表示,然后将它们转换为音频,而不是从音频中提取这些表示。

WhisperSpeech 以前叫什么?

它最初以 spear-tts-pytorch 之名开发,这个名称体现了其架构受到 Google SPEAR-TTS 研究的启发,之后才更名为 WhisperSpeech。

WhisperSpeech 可以安全地用于商业产品吗?

这是项目明确的设计目标——代码以 Apache-2.0/MIT 许可证发布,模型只使用获得适当许可的语音数据训练,专门用于规避许多开源 TTS 项目因使用抓取数据或许可证不明的音频训练而面临的数据来源风险。

WhisperSpeech 支持英语以外的语言吗?

当前稳定版本使用英语 LibreLight 数据集训练。一款概念验证多语言模型(英语、波兰语、法语)已经展示出前景可期的跨语言声音克隆结果,但截至项目最近一次公开更新,更广泛的多语言支持仍在开发中。

WhisperSpeech 生成音频有多快?

在进行特定优化(torch.compile、KV 缓存和网络层调整)后,项目报告其在消费级 RTX 4090 GPU 上的生成速度约为实时速度的 12 倍。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →