EchoraEchora
返回模型列表

EmotiVoice:写下情绪,语音便能表达

2026年9月9日
•
7 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

大多数“情感化”TTS 模型只提供一小组固定的情绪标签供你选择。由网易有道开源的 EmotiVoice 采用了更灵活的方式:像指导配音演员一样,在风格提示词中描述你想要的情绪,模型便会据此演绎。以提示词驱动、而非受限于一组固定开关,正是这个模型最鲜明的特点;它以中英双语能力为基础,并拥有真正庞大的音色库可供选择。

什么是 EmotiVoice?

EmotiVoice 是网易有道于 2023 年 11 月发布的开源文本转语音引擎,采用 Apache 2.0 许可证。它是一个基于 Transformer 的系统,直接受到 PromptTTS 研究方法的启发,并使用 LibriTTS 和 Hi-Fi TTS 数据集训练。该项目明确将自身定位为多音色、提示词可控的引擎——这两部分同等重要,共同构成了它的独特之处。

EmotiVoice 的功能优势

  • 超过 2,000 种预设音色,覆盖中英文,涵盖非常广泛的年龄、音调和声音特征,而非只有少数通用默认选项。
  • 由提示词控制情感表达——开心、兴奋、悲伤、愤怒等情绪通过风格提示词设定,而不是依赖严格固定的标签系统。
  • 情绪之外的其他风格因素,包括音高、速度和能量,可与情绪分别独立调整。
  • 使用自己的录音克隆声音,这一功能在首次发布后不久加入,让你能够用自定义声音扩展预设音色库。
  • 多种集成方式:交互式网页界面、用于批量生成的脚本接口,以及兼容 OpenAI 的 TTS API,只需极少改动即可接入现有工具。
  • 完全开放且可自行托管,部署后能够离线运行,所用许可证没有商业限制。

基于提示词的风格控制究竟如何工作

EmotiVoice 基于 PromptTTS 方法构建,当前实现使用四个风格因素塑造表达:音高、速度、能量和情绪——值得注意的是,其中不包括性别。项目自己的文档特别指出,当前风格控制因素有意排除了性别,不过也提到,如果有需求,加入这一因素并没有太大难度。实际使用时,这意味着声音的基本性别特征取决于你选择的预设音色,而提示词真正塑造的是这个声音如何说出一句话——包括情感色彩、节奏和强度。在开始编写提示词前,很有必要理解这种划分:先选择音色来确定声音身份,再通过提示词指导表演。

EmotiVoice 入门

尝试 EmotiVoice 最快捷的方式是使用它的 Docker 镜像,这需要一台配备 NVIDIA GPU 并已配置 NVIDIA Container Toolkit 的机器——运行官方提供的镜像会启动一个交互式网页演示,你可以直接在浏览器中使用。如果更愿意手动配置,项目文档也介绍了如何通过 conda 在 Python 3.8 环境中本地安装,让你能更细致地控制配置和依赖。对于编程调用,社区贡献的 OpenAI 兼容 API 服务器只需安装少量 Python 软件包,即可与核心引擎一同运行;任何已经适配 OpenAI TTS API 格式的客户端都能用极少的代码改动调用 EmotiVoice。

获得更好结果的技巧

  • 像指导一场表演那样编写风格提示词,而不只是标注一种情绪。 由于系统由提示词而非标签驱动,在核心情绪之外进一步描述强度和节奏,往往比单个词的标签带来更精确的结果。
  • 先选择预设音色,再编写情绪提示词。 性别和核心声音身份来自音色选择,而不是风格提示词,因此应先确定合适的音色,再迭代提示词以获得想要的表达。
  • 批量任务使用脚本接口。 如果要生成的不只是少量片段,脚本接口可以省去每次都手动操作网页界面的额外负担。
  • 只有在 2,000+ 种预设音色都不合适时,才专门考虑声音克隆。 现有音色库已经非常庞大,值得先浏览预设选项——克隆适用于确实需要某个特定真实声音的情况,不应成为默认起点。
  • 如果要替换商业 TTS 供应商,请使用兼容 OpenAI 的 API。 由于它复用了该 API 的请求格式,迁移现有集成代码通常比适配完全自定义的接口改动更小。

EmotiVoice 与其他富有表现力的双语模型对比

EmotiVoiceChatTTSChatterbox
支持机构网易有道2noiseResemble AI
语言英语、中文中文、英语英语(多语言:23 种)
情绪控制方式自由文本风格提示词生成时由模型自行预测明确的夸张度参数
预设音色数量2,000+通过高斯采样实现多说话人以零样本克隆为重点
声音克隆支持,使用个人录音不是主要工作流支持,零样本
许可证Apache 2.0AGPLv3+(代码)/ CC BY-NC 4.0(权重)MIT

EmotiVoice 的独特定位在于,将提示词带来的灵活性与庞大的预设音色规模结合在一起——ChatTTS 将对话韵律直接融入生成过程,Chatterbox 提供单一的夸张度调节,而 EmotiVoice 则让你在真正丰富的音色目录中,用自己的语言描述表达方式。

常见问题

如何在 EmotiVoice 中控制情绪?

通过用日常语言编写风格提示词,而不是从固定的情绪标签中选择——模型会解释提示词来塑造表达,同时音高、速度和能量还可以分别调整。

EmotiVoice 能通过提示词控制声音的性别吗?

目前不能。性别来自你选择的预设音色,而不是风格提示词,因为项目当前的风格控制实现有意排除了性别因素,不过文档也指出,未来可以加入这一因素。

EmotiVoice 支持声音克隆吗?

支持。除了超过 2,000 种预设音色外,它还可以使用你自己的录音克隆声音。

EmotiVoice 支持哪些语言?

英语和中文;项目路线图还列出了包括日语和韩语在内的更多语言支持。

EmotiVoice 可以免费用于商业用途吗?

可以。它采用 Apache 2.0 许可证,允许商业使用,无需支付版税或签订单独的许可协议。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →