EchoraEchora
返回模型列表

Edge TTS:通往企业级神经语音的免费后门

2026年9月13日
•
阅读约 7 分钟

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

Microsoft Edge 浏览器有一项名为“朗读”的无障碍功能,它在不引人注意的情况下使用了真正高质量的神经语音——其水准与 Microsoft 通过付费 Azure Speech 服务销售的语音相同。Edge TTS 是一款开源 Python 工具,可直接调用这项免费的浏览器服务,让你无需打开浏览器、安装 Windows,甚至完全无需注册 API 密钥,就能以脚本方式使用其中数百种神经语音。

Edge TTS 是什么?

Edge TTS 是由独立开发者 rany2 创建的 Python 模块和命令行工具,让你无需 Edge、Windows 或 API 密钥,即可从自己的代码或命令行使用 Microsoft Edge 的在线文本转语音服务。需要准确说明它究竟是什么:它不是 Microsoft 官方产品,也不是受支持的 API——它是一款社区工具,连接的是 Edge 浏览器内部为“朗读”无障碍功能所使用的同一个后端服务,从而免费从外部使用同一语音引擎。

Edge TTS 的功能优势

  • 真正免费,无需 API 密钥或注册账号——这与 Microsoft 自家的付费 Azure Speech Services 有着切实区别;后者在按量计费、需要凭证的 API 背后使用了同一种底层语音技术。
  • 数十种语言和地区 locale 中的数百种神经语音,包括阿拉伯语等语言的多个地区变体,而不是每种语言只提供一种通用声音。
  • 可独立于 Edge 浏览器或 Windows 工作,能够作为独立 Python 工具运行在任何可连接互联网的平台上。
  • 可直接通过命令行 flag 调整语速、音量和音高,无需完整标记语言即可实现基础韵律控制。
  • 内置字幕生成,可在输出音频的同时生成 SRT 或 VTT 字幕文件——对视频旁白、在线学习内容或无障碍工作流确实很实用。
  • 简单的 CLI 加异步 Python API,既支持快速执行一次性命令,也支持以脚本和批处理方式集成到更大的应用中。

关于其真实性质的重要说明

在基于它构建任何严肃项目之前,值得先清楚了解这一点。Edge TTS 的工作方式,是连接为 Microsoft Edge“朗读”功能提供支持的同一个在线端点——这是一项免费的浏览器无障碍功能,并不是有文档且有合同支持的公共 API。这个区别在实践中会带来两方面影响:第一,由于它并非官方工具,Microsoft 随时都可能在不作通知的情况下修改或限制该端点,这会让工具失效,直到社区完成适配;第二,项目已经明确移除了自定义 SSML 标记支持,因为 Microsoft 会阻止任何不是由其官方工具生成的 SSML,所以与真正有文档的语音 API 相比,你实际能进行的细粒度控制更有限。应把 Edge TTS 视为一款真正实用的免费工具,适合个人项目、原型和非关键内容——如果你考虑把它用于商业产品,请直接查阅 Microsoft 自己的条款,因为它并不像 Azure Speech Services 那样是获得许可的商业 API。

Edge TTS 入门

  1. 通过 pip 或 pipx 安装。 pip install edge-tts 适合一般用途;如果你只需要命令行工具本身,而不需要用于脚本开发的 Python 库,那么有文档说明的 pipx install edge-tts 是更干净的替代方案,可以避免污染系统 Python 环境。
  2. 选定声音前先列出可用声音。 edge-tts --list-voices 会打印完整的声音目录,包括性别、内容类别和个性标签——在确定具体声音名称前,这有助于找到合适的地区变体。
  3. 生成你的第一个音频文件。 edge-tts --voice en-US-AriaNeural --text "Hello, world!" --write-media hello.mp3 --write-subtitles hello.srt 会通过一条命令同时生成音频文件和匹配的字幕文件。
  4. 使用对应 flag 调整语速、音量或音高。 --rate=-50%、--volume=-50% 和 --pitch=-50Hz 是文档规定的语法——请注意,负值尤其需要使用 = 符号,否则命令行会错误解析该 flag。
  5. 如果想在非 Windows 系统上直接播放,请安装 mpv。 edge-playback 命令会立即播放生成的音频,而不是把它保存成文件,但在 Linux 和 macOS 上需要另行安装 mpv 命令行播放器(Windows 无需这一步)。
  6. 对于一次性 CLI 命令之外的任何工作,请使用异步 Python API。 将库直接导入 Python 代码,可以获得适合 Web 后端或批处理流水线的程序化控制,而无需反复通过 shell 调用 CLI。

获得更好结果的技巧

  • 浏览 --list-voices 的输出,寻找适合受众的地区变体。 许多语言都有多个方言选项;选择最接近的地区变体,会比默认采用按字母顺序排在最前面的声音明显更自然。
  • 将很长的文本分段,而不是一次发送一整个超大请求。 虽然没有严格记录的硬性限制,但把长篇内容拆成较小片段,是获得稳定输出更可靠的方法。
  • 不要依赖自定义 SSML 进行细粒度控制。 由于 Microsoft 会阻止并非由其自身工具生成的 SSML,应使用该库支持的语速、音量和音高 flag 来调整韵律,而不是尝试自己的标记。
  • 为生产用途准备备用方案。 鉴于这是一项对免费浏览器功能的非官方集成,而不是有合同支持的 API,如果底层访问方式发生变化,就需要备用计划;不要让关键业务流水线完全依赖它。
  • 专门为视频项目使用字幕输出。 用同一条命令在音频旁生成同步的 SRT/VTT 文件,可以省去独立的字幕制作步骤,而大多数其他免费 TTS 工具并未内置这项能力。

Edge TTS 与 Microsoft 官方语音服务及自托管替代方案的比较

Edge TTSAzure Speech Services(官方)Piper(自托管)
成本免费付费,按使用量计费免费,自托管
需要 API 密钥/账号否是否
官方、受支持的 API否——非官方社区工具是不适用,开源项目
语音质量高(同一种底层神经语音)高(同一种底层神经语音)扎实,更轻量
自定义 SSML 支持不支持(被 Microsoft 阻止)支持不是核心功能
可靠性保证无——端点可能在不通知的情况下发生变化有 SLA 支持完全取决于你自己的基础设施

Edge TTS 的特定定位,是让个人项目、原型和一般内容无需注册就能免费使用真正高质量的神经语音——对于任何商业关键场景或需要保证正常运行时间的用途,Microsoft 自家的付费 Azure Speech Services(使用同一种语音技术并获得官方许可)才是更合适的选择。

常见问题

Edge TTS 是 Microsoft 官方产品吗?

不是。它是一款独立的开源工具,连接的是为 Microsoft Edge“朗读”浏览器功能提供支持的同一个后端服务——它并不是 Microsoft 官方记录或支持的 API。

使用 Edge TTS 需要安装 Microsoft Edge 或 Windows 吗?

不需要。它可以作为独立 Python 工具运行在任何可连接互联网的平台上,不依赖 Edge 浏览器或 Windows 操作系统。

Edge TTS 真的免费吗?

是的,不需要 API 密钥、账号或付款——这与 Microsoft 自家的付费 Azure Speech Services 有着切实区别;后者在按量计费的 API 背后使用了类似的底层语音技术。

可以将 Edge TTS 用于商业产品吗?

请谨慎行事。由于它是一款调用免费浏览器无障碍功能的非官方工具,而不是获得许可的商业 API,对于任何关键业务用途,请直接查阅 Microsoft 的条款,并考虑改用 Azure Speech Services。

这与在 Windows 设置中下载 TTS 声音有什么不同?

它们是彼此独立的系统。Windows 内置的“讲述人”声音(可通过“设置”下载)是操作系统本身的一部分,而 Edge TTS 专门访问 Edge 浏览器基于云的神经语音;这些声音需要互联网连接,但通常听起来更加自然。

使用 Echora 在线生成语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。最多输入 5,000 个字符,即可生成单人语音、试听结果并下载完成的 MP3。

开始从文字生成语音 →