Amazon Polly:AWS 云端文字转语音,四种引擎
Amazon Polly 是 AWS 的云端 TTS 服务,提供四种不同的语音引擎,从价格低廉的 Standard 语音到高端 Long-Form 旁白,并与 AWS 紧密集成。
解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。
Amazon Polly 是 AWS 的云端 TTS 服务,提供四种不同的语音引擎,从价格低廉的 Standard 语音到高端 Long-Form 旁白,并与 AWS 紧密集成。
Azure AI Speech 是微软官方云端 TTS 服务,提供数百种神经语音、自定义声音训练,以及可在实际规模下使用的完整 SSML 控制。
Edge TTS 是一款免费开源工具,可调用 Microsoft Edge“朗读”功能背后的同款在线声音,无需 API 密钥或账号。
SeamlessM4T 是 Meta 推出的开源模型,将语音识别、翻译和语音合成统一到一个系统中,覆盖多达 100 种语言。
MaskGCT 是 Amphion 的一款非自回归 TTS 模型,完全跳过对齐和时长预测,只需 5 秒音频即可克隆声音。
FireRedTTS 是小红书推出的基础 TTS 框架,既为配音提供零样本声音克隆,也为 AI 聊天机器人提供经过指令微调的自然口语生成。
Spark-TTS 使用基于 Qwen2.5 构建的单流语音编解码器 BiCodec,在一个开放模型中同时实现零样本声音克隆和完全合成的声音生成。
NeuTTS Air 是 Neuphonic 推出的端侧 TTS 模型,参数不足 10 亿,只需 3 秒音频即可克隆声音,并可在手机和树莓派上运行。
Kyutai Pocket TTS 是一款 100M 参数、采用 MIT 许可证的模型,仅凭 CPU 即可进行实时语音合成和零样本声音克隆,无需 GPU。
KaniTTS 将紧凑的 LFM2 语言模型与高效的神经音频编解码器相结合,只需总计 3GB 的 GPU 显存即可运行实时语音合成。
VoxCPM 是 OpenBMB 推出的无分词器中英双语 TTS 模型,在消费级 GPU 上可达到 0.17 的实时因子,并能根据上下文自动生成韵律。
Voxtral TTS 是 Mistral AI 推出的 4B 开放权重模型,只需 2–3 秒音频即可克隆声音,并在质量上与 ElevenLabs 进行了直接基准测试。