Amazon Polly:四档价格,只为实际需要的质量付费
大多数 TTS API 只提供一种语音质量档位和一个价格点,无论你要生成的是简短的 IVR 提示,还是完整的有声书章节。AWS 的文字转语音服务 Amazon Polly 刻意采用了不同方法:四种独立的语音引擎,各自面向不同的质量与成本取舍。这样,高流量通知系统无需为用不到的表现力支付高价,而以旁白为主的项目也不必为了省钱而被迫接受听起来机械的输出。
什么是 Amazon Polly?
Amazon Polly 是 AWS 的云端文字转语音服务,利用深度学习将书面文字转换成涵盖数十种语言的自然语音。它从一开始就是 AWS 的核心服务,这意味着它可以原生集成 AWS 生态系统的其他部分——用 S3 存储音频、用 CloudWatch 监控、用 IAM 控制访问——而不是后来附加到 AWS 上的独立产品。
Amazon Polly 的功能优势
- 四种不同的语音引擎,对应四个价格点,让你可以有意识地让成本匹配具体内容真正需要的质量,而不必为所有内容统一支付高端价格。
- 广泛的语言覆盖范围,涵盖数十种语言和地区语音变体。
- 深度原生集成 AWS,可直接与 S3、CloudWatch、IAM 和 Lambda 配合,适合已经基于 AWS 基础设施进行开发的团队。
- 真正慷慨的 12 个月免费套餐,四种引擎都有可观的字符额度,而不是只有最便宜的引擎可以免费使用。
- 明确的隐私承诺:Amazon Polly 不会保留你提交的文本内容。
- 全面支持 SSML,可在所有引擎档位中直接控制发音、语速和重音。
四种引擎:为内容选择合适的档位
这种分层结构是 Polly 最具代表性的特点,正确选择比直接采用最贵的选项更重要。Standard 语音是最早推出、价格最低的档位——适合基本通知、IVR 提示以及其他高流量、低细腻度的用例;在这些场景中,清晰度比自然的表现力更重要。基于深度学习构建的 Neural 语音是最常被建议用于生产环境的档位——语调更流畅、节奏更自然,对复杂句子的处理也明显更好;相比 Standard 确实更贵,但溢价有合理依据。Generative 语音于 2024 年加入,并在 2026 年 3 月大幅扩展,它使用一个拥有十亿参数的 Transformer 模型,进一步提升富有表现力且细腻的表达——当内容确实能从比 Neural 更自然的演绎中获益时,就适合选择这个档位。Long-Form 语音则专门解决完全不同的问题:长时间聆听。它并非针对单句或单段进行优化,而是专门调校,以减轻听众在有声书或完整文章等真正长篇内容中的疲劳感——这是价格最高的档位,应留给这种特定长时间聆听优化确实能产生回报的内容。
Polly 不提供哪些功能
在围绕 Polly 构建系统前,有一点值得坦诚了解:与一些已经加入受限克隆功能的云服务商不同,Amazon Polly 并不把声音克隆作为核心能力。独立评测还指出,如果不采用更高级且单独计费的定制选项,就很难创建辨识度很高的品牌声音;对于真正富有戏剧性和强烈情绪的表达,专门的表现力 TTS 竞争产品仍可能胜过 Polly 最具表现力的档位。如果项目的核心要求是复现某个真实声音,或最大限度拓展原始情绪范围,就值得在决定采用前,把 Polly 的 Generative 档位与这些替代方案直接比较,而不是假定最新引擎已经补齐了所有差距。
Amazon Polly 入门
- 设置 AWS 账户和 IAM 凭证。 Polly 使用标准 AWS 身份验证,因此在进行任何 API 调用前,你需要一个访问密钥和秘密访问密钥,并为 IAM 用户或角色附加适当的 Polly 权限。
- 安装对应编程语言的 AWS SDK。 对 Python 而言,
boto3是标准客户端库——运行pip install boto3即可开始使用;JavaScript、Java 和其他受支持语言也提供对应的 SDK。 - 使用文本和所选引擎调用
synthesize_speech。 一个基本的 Python 调用如下:polly_client.synthesize_speech(Text="your text", OutputFormat="mp3", VoiceId="Joanna", Engine="neural")——通过Engine参数具体选择 Standard、Neural、Generative 或 Long-Form。 - 在假定完全兼容前,检查哪些声音支持哪些引擎。 并非每种声音都能用于全部四种引擎——在围绕某种组合构建流程前,请确认所选的
VoiceId确实支持你需要的引擎档位。 - 直接在文本输入中使用 SSML 标签,以获得更精细的控制。 用 SSML 标记包裹输入,即可在四种引擎中的任何一种上控制发音、语速和重音。
- 通过 CloudWatch 监控用量,并为 AWS 相关成本编制预算。 除引擎按字符计费外,如果要保存生成的音频文件,还需考虑数据传输费用和 S3 存储成本,因为这些费用与 Polly 的核心用量分开计费。
获得更好结果的技巧
- 大多数生产内容默认选择 Neural,而不是 Standard。 Neural 只需比 Standard 适度增加成本,就能带来明显更自然的声音;对于任何面向客户的内容,它都是更合理的默认选择,不应把 Standard 当作稳妥起点。
- 把 Generative 和 Long-Form 留给确实能从中受益的内容。 Generative 的表现力和 Long-Form 减轻疲劳的调校都是真实优势,但每字符成本也明显更高——应让档位匹配确实需要这种特定质量的内容,而不是所有场景都默认选择最高档。
- 决定采用前,测试具体的声音与引擎组合。 并非所有声音都支持全部四种引擎,因此应尽早验证目标语言和声音是否可用,不要等到围绕该组合构建完流程后才发现不匹配。
- 进行大规模预算前,直接查看当前价格。 Amazon 会随时间调整 Polly 的引擎价格,不同来源引用的每字符费率也可能不同——请在 AWS 自己的价格页面确认当前数字,不要依赖可能已经过时的引用数据。
- 如果声音克隆是核心要求,就选择其他方案。 Polly 并未将其作为内置能力,因此,专门支持声音克隆并具备适当同意机制和安全保障的服务商,更直接适合这项具体需求。
Amazon Polly、Azure AI Speech 与 Edge TTS 对比
| Amazon Polly | Azure AI Speech | Edge TTS | |
|---|---|---|---|
| 价格结构 | 四个档位(每 100 万字符 $4–$100+) | 两个主要档位(Neural、Neural HD) | 免费 |
| 声音克隆 | 非核心功能 | 支持,通过受限的 Personal Voice | 不适用 |
| 生态系统集成 | 深度集成 AWS(S3、CloudWatch、IAM) | 深度集成 Azure/Foundry | 无——独立工具 |
| 免费套餐 | 支持,12 个月,额度慷慨 | 支持,每月额度 | 本身免费,不限量 |
| 官方授权 API | 是 | 是 | 否——非官方社区工具 |
| 最适合 | 已经使用 AWS、需要分层控制成本的团队 | 需要深度 SSML 和自定义声音训练的团队 | 原型开发和个人项目 |
Amazon Polly 的独特定位,是把有意设计的成本分层与深度 AWS 原生集成结合起来——对于已经基于 AWS 基础设施进行开发、希望显式控制价格与质量取舍,而不是让每个用例都采用同一固定费率的团队,它是合适的默认选择。
常见问题
Polly 的四种语音引擎有什么区别?
Standard 价格最低,最适合基本通知和 IVR。Neural 以适度溢价提供明显更自然的语调和节奏,推荐用于大多数生产内容。Generative 使用拥有十亿参数的 Transformer 模型,实现更富表现力且细腻的表达。Long-Form 专门经过调校,用于减轻有声书等长篇内容在长时间聆听中的疲劳感。
Amazon Polly 支持声音克隆吗?
它并不将声音克隆作为普遍可用的核心功能。如果克隆某个特定声音是核心要求,直接提供这项能力并配有适当同意保障的服务商会更合适。
Amazon Polly 可以免费使用吗?
它为 AWS 新客户提供 12 个月免费套餐,各引擎的字符额度不同——Standard 的额度远高于 Generative 或 Long-Form。超过免费套餐后,它按使用量、按字符计费。
Amazon Polly 会保留我提交的文本吗?
不会——Amazon 明确表示,Polly 不会保留提交文本的内容。
面向客户的应用应该使用哪种引擎?
Neural 通常是面向客户内容的推荐起点,能够平衡自然语音质量与成本;只有在 Generative 增加的表现力值得更高价格时,才专门选择它。
使用 Echora 在线生成语音
若需要目标相近的浏览器工作流,可以使用 Echora 的文字转语音。将最多 5,000 个字符转换成单人语音,试听结果并下载最终 MP3。