EchoraEchora
返回模型列表

Amazon Polly:四档价格,只为实际需要的质量付费

2026年9月14日
•
阅读约 7 分钟

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

大多数 TTS API 只提供一种语音质量档位和一个价格点,无论你要生成的是简短的 IVR 提示,还是完整的有声书章节。AWS 的文字转语音服务 Amazon Polly 刻意采用了不同方法:四种独立的语音引擎,各自面向不同的质量与成本取舍。这样,高流量通知系统无需为用不到的表现力支付高价,而以旁白为主的项目也不必为了省钱而被迫接受听起来机械的输出。

什么是 Amazon Polly?

Amazon Polly 是 AWS 的云端文字转语音服务,利用深度学习将书面文字转换成涵盖数十种语言的自然语音。它从一开始就是 AWS 的核心服务,这意味着它可以原生集成 AWS 生态系统的其他部分——用 S3 存储音频、用 CloudWatch 监控、用 IAM 控制访问——而不是后来附加到 AWS 上的独立产品。

Amazon Polly 的功能优势

  • 四种不同的语音引擎,对应四个价格点,让你可以有意识地让成本匹配具体内容真正需要的质量,而不必为所有内容统一支付高端价格。
  • 广泛的语言覆盖范围,涵盖数十种语言和地区语音变体。
  • 深度原生集成 AWS,可直接与 S3、CloudWatch、IAM 和 Lambda 配合,适合已经基于 AWS 基础设施进行开发的团队。
  • 真正慷慨的 12 个月免费套餐,四种引擎都有可观的字符额度,而不是只有最便宜的引擎可以免费使用。
  • 明确的隐私承诺:Amazon Polly 不会保留你提交的文本内容。
  • 全面支持 SSML,可在所有引擎档位中直接控制发音、语速和重音。

四种引擎:为内容选择合适的档位

这种分层结构是 Polly 最具代表性的特点,正确选择比直接采用最贵的选项更重要。Standard 语音是最早推出、价格最低的档位——适合基本通知、IVR 提示以及其他高流量、低细腻度的用例;在这些场景中,清晰度比自然的表现力更重要。基于深度学习构建的 Neural 语音是最常被建议用于生产环境的档位——语调更流畅、节奏更自然,对复杂句子的处理也明显更好;相比 Standard 确实更贵,但溢价有合理依据。Generative 语音于 2024 年加入,并在 2026 年 3 月大幅扩展,它使用一个拥有十亿参数的 Transformer 模型,进一步提升富有表现力且细腻的表达——当内容确实能从比 Neural 更自然的演绎中获益时,就适合选择这个档位。Long-Form 语音则专门解决完全不同的问题:长时间聆听。它并非针对单句或单段进行优化,而是专门调校,以减轻听众在有声书或完整文章等真正长篇内容中的疲劳感——这是价格最高的档位,应留给这种特定长时间聆听优化确实能产生回报的内容。

Polly 不提供哪些功能

在围绕 Polly 构建系统前,有一点值得坦诚了解:与一些已经加入受限克隆功能的云服务商不同,Amazon Polly 并不把声音克隆作为核心能力。独立评测还指出,如果不采用更高级且单独计费的定制选项,就很难创建辨识度很高的品牌声音;对于真正富有戏剧性和强烈情绪的表达,专门的表现力 TTS 竞争产品仍可能胜过 Polly 最具表现力的档位。如果项目的核心要求是复现某个真实声音,或最大限度拓展原始情绪范围,就值得在决定采用前,把 Polly 的 Generative 档位与这些替代方案直接比较,而不是假定最新引擎已经补齐了所有差距。

Amazon Polly 入门

  1. 设置 AWS 账户和 IAM 凭证。 Polly 使用标准 AWS 身份验证,因此在进行任何 API 调用前,你需要一个访问密钥和秘密访问密钥,并为 IAM 用户或角色附加适当的 Polly 权限。
  2. 安装对应编程语言的 AWS SDK。 对 Python 而言,boto3 是标准客户端库——运行 pip install boto3 即可开始使用;JavaScript、Java 和其他受支持语言也提供对应的 SDK。
  3. 使用文本和所选引擎调用 synthesize_speech。 一个基本的 Python 调用如下:polly_client.synthesize_speech(Text="your text", OutputFormat="mp3", VoiceId="Joanna", Engine="neural")——通过 Engine 参数具体选择 Standard、Neural、Generative 或 Long-Form。
  4. 在假定完全兼容前,检查哪些声音支持哪些引擎。 并非每种声音都能用于全部四种引擎——在围绕某种组合构建流程前,请确认所选的 VoiceId 确实支持你需要的引擎档位。
  5. 直接在文本输入中使用 SSML 标签,以获得更精细的控制。 用 SSML 标记包裹输入,即可在四种引擎中的任何一种上控制发音、语速和重音。
  6. 通过 CloudWatch 监控用量,并为 AWS 相关成本编制预算。 除引擎按字符计费外,如果要保存生成的音频文件,还需考虑数据传输费用和 S3 存储成本,因为这些费用与 Polly 的核心用量分开计费。

获得更好结果的技巧

  • 大多数生产内容默认选择 Neural,而不是 Standard。 Neural 只需比 Standard 适度增加成本,就能带来明显更自然的声音;对于任何面向客户的内容,它都是更合理的默认选择,不应把 Standard 当作稳妥起点。
  • 把 Generative 和 Long-Form 留给确实能从中受益的内容。 Generative 的表现力和 Long-Form 减轻疲劳的调校都是真实优势,但每字符成本也明显更高——应让档位匹配确实需要这种特定质量的内容,而不是所有场景都默认选择最高档。
  • 决定采用前,测试具体的声音与引擎组合。 并非所有声音都支持全部四种引擎,因此应尽早验证目标语言和声音是否可用,不要等到围绕该组合构建完流程后才发现不匹配。
  • 进行大规模预算前,直接查看当前价格。 Amazon 会随时间调整 Polly 的引擎价格,不同来源引用的每字符费率也可能不同——请在 AWS 自己的价格页面确认当前数字,不要依赖可能已经过时的引用数据。
  • 如果声音克隆是核心要求,就选择其他方案。 Polly 并未将其作为内置能力,因此,专门支持声音克隆并具备适当同意机制和安全保障的服务商,更直接适合这项具体需求。

Amazon Polly、Azure AI Speech 与 Edge TTS 对比

Amazon PollyAzure AI SpeechEdge TTS
价格结构四个档位(每 100 万字符 $4–$100+)两个主要档位(Neural、Neural HD)免费
声音克隆非核心功能支持,通过受限的 Personal Voice不适用
生态系统集成深度集成 AWS(S3、CloudWatch、IAM)深度集成 Azure/Foundry无——独立工具
免费套餐支持,12 个月,额度慷慨支持,每月额度本身免费,不限量
官方授权 API是是否——非官方社区工具
最适合已经使用 AWS、需要分层控制成本的团队需要深度 SSML 和自定义声音训练的团队原型开发和个人项目

Amazon Polly 的独特定位,是把有意设计的成本分层与深度 AWS 原生集成结合起来——对于已经基于 AWS 基础设施进行开发、希望显式控制价格与质量取舍,而不是让每个用例都采用同一固定费率的团队,它是合适的默认选择。

常见问题

Polly 的四种语音引擎有什么区别?

Standard 价格最低,最适合基本通知和 IVR。Neural 以适度溢价提供明显更自然的语调和节奏,推荐用于大多数生产内容。Generative 使用拥有十亿参数的 Transformer 模型,实现更富表现力且细腻的表达。Long-Form 专门经过调校,用于减轻有声书等长篇内容在长时间聆听中的疲劳感。

Amazon Polly 支持声音克隆吗?

它并不将声音克隆作为普遍可用的核心功能。如果克隆某个特定声音是核心要求,直接提供这项能力并配有适当同意保障的服务商会更合适。

Amazon Polly 可以免费使用吗?

它为 AWS 新客户提供 12 个月免费套餐,各引擎的字符额度不同——Standard 的额度远高于 Generative 或 Long-Form。超过免费套餐后,它按使用量、按字符计费。

Amazon Polly 会保留我提交的文本吗?

不会——Amazon 明确表示,Polly 不会保留提交文本的内容。

面向客户的应用应该使用哪种引擎?

Neural 通常是面向客户内容的推荐起点,能够平衡自然语音质量与成本;只有在 Generative 增加的表现力值得更高价格时,才专门选择它。

使用 Echora 在线生成语音

若需要目标相近的浏览器工作流,可以使用 Echora 的文字转语音。将最多 5,000 个字符转换成单人语音,试听结果并下载最终 MP3。

将文字转换成语音 →