Amazon Polly:4段階の料金で、本当に必要な品質にだけ支払う
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
多くのTTS APIは、短いIVRプロンプトを生成する場合でも、オーディオブックの1章全体を生成する場合でも、音声品質の段階と価格が1つしかありません。AWSのテキスト読み上げサービスであるAmazon Pollyは、意図して異なるアプローチを採用しています。品質とコストの異なるバランスを狙った4種類の独立した音声エンジンを用意することで、大量の通知を扱うシステムが不要な表現力のためにプレミアム料金を支払うことも、ナレーション中心のプロジェクトが節約のために機械的な出力を受け入れることも避けられます。
Amazon Pollyとは?
Amazon PollyはAWSのクラウドベースのテキスト読み上げサービスで、ディープラーニングを使って書かれたテキストを数十の言語で自然な音声に変換します。AWSの中核サービスとして構築されているため、後からAWSに付け足された単独製品として動作するのではなく、音声保存用のS3、監視用のCloudWatch、アクセス制御用のIAMなど、AWSエコシステムの他の部分とネイティブに統合されます。
Amazon Pollyの機能上の利点
- 価格の異なる4種類の音声エンジンにより、すべてに一律のプレミアム料金を支払うのではなく、コンテンツが本当に必要とする品質にコストを意図的に合わせられます。
- 幅広い言語対応により、数十の言語と地域別の音声バリエーションをカバーします。
- AWSとの深いネイティブ統合により、すでにAWSインフラストラクチャ上で開発しているチームは、S3、CloudWatch、IAM、Lambdaと直接連携できます。
- 本当に充実した12か月間の無料枠があり、最も安いエンジンだけでなく、4種類すべてで実用的な文字数枠を利用できます。
- 明示されたプライバシー方針として、Amazon Pollyは送信されたテキストの内容を保持しません。
- 包括的なSSML対応により、すべてのエンジン段階で発音、ペース、強調を直接制御できます。
4種類のエンジン:コンテンツに適した段階の選び方
この段階別の構成はPollyを特徴づける要素であり、最も高価な選択肢を既定にするより、正しく選ぶことのほうが重要です。Standard音声は当初からある最も手頃な段階で、基本的な通知、IVRプロンプト、その他の大量かつ微妙なニュアンスを必要としない用途に適しています。こうした用途では、自然な表現力より明瞭さが重要です。ディープラーニングで構築されたNeural音声は、本番利用で最も一般的に推奨される段階です。より滑らかなイントネーション、より自然なペース、複雑な文の明らかに優れた処理を提供し、Standardより実際に高価ですが、その差額には妥当な理由があります。2024年に追加され、2026年3月に大幅に拡充されたGenerative音声は、10億パラメータのTransformerモデルを使用し、さらに表現豊かで繊細な話し方を追求します。Neuralより自然な演技によってコンテンツが本当に良くなる場合に選ぶ段階です。Long-Form音声は、まったく別の課題である長時間のリスニングのために作られています。1つの文や段落を最適化するのではなく、オーディオブックや記事全文のような本当に長いコンテンツで聴き手の疲労を軽減するよう特別に調整されています。最も高価な段階であり、この長時間リスニング向けの最適化が実際に見合うコンテンツに限って利用するものです。
Pollyにできないこと
Pollyを中心に構築する前に、率直に知っておく価値がある点があります。制限付きのクローン機能を追加した競合クラウド事業者とは異なり、Amazon Pollyは音声クローンを中核機能として提供していません。独立したレビューでは、より高度で別料金のカスタマイズ機能を使わずに、非常に個性的なブランド音声を作ることには実質的な隔たりがあること、そして本当にドラマチックで感情の強い話し方では、表現力に特化したTTSの競合製品がPollyの最も表現豊かな段階をなお上回る可能性があることも指摘されています。特定の実在する声を再現すること、または生の感情表現の幅を最大化することがプロジェクトの中核要件なら、最新エンジンがすべての差を埋めたと仮定するのではなく、採用前にPollyのGenerative段階をそれらの代替手段と直接比較する価値があります。
Amazon Pollyの使い始め方
- AWSアカウントとIAM認証情報を設定します。 Pollyには標準のAWS認証を通じてアクセスするため、APIを呼び出す前に、IAMユーザーまたはロールに適切なPolly権限を設定し、アクセスキーとシークレットキーを用意する必要があります。
- 使用言語向けのAWS SDKをインストールします。 Pythonでは
boto3が標準クライアントライブラリです。pip install boto3で開始でき、JavaScript、Java、その他の対応言語にも同等のSDKがあります。 - テキストと選択したエンジンを指定して
synthesize_speechを呼び出します。 基本的なPython呼び出しはpolly_client.synthesize_speech(Text="your text", OutputFormat="mp3", VoiceId="Joanna", Engine="neural")のようになります。Standard、Neural、Generative、Long-Formのいずれかを具体的に選択する場所がEngineパラメータです。 - 完全な互換性を想定する前に、どの音声がどのエンジンに対応するか確認します。 すべての音声を4種類のエンジンすべてで利用できるわけではありません。その組み合わせを中心にパイプラインを構築する前に、選択した
VoiceIdが目的のエンジン段階に実際に対応していることを確認してください。 - より細かく制御するには、テキスト入力内でSSMLタグを直接使います。 入力をSSMLマークアップで囲むと、4種類のどのエンジンでも発音、ペース、強調を制御できます。
- CloudWatchで利用状況を監視し、AWS関連の費用も予算に含めます。 エンジンの文字単位料金に加え、生成した音声ファイルを保存する場合は、データ転送料とS3ストレージ費用も考慮してください。これらはPolly本体の利用料とは別に請求されます。
より良い結果を得るためのヒント
- ほとんどの本番コンテンツでは、StandardではなくNeuralを既定にします。 Standardから適度な費用増加でNeuralの音声は明らかに自然になるため、Standardを無難な出発点と考えるより、顧客向けコンテンツではNeuralのほうが合理的な既定値です。
- GenerativeとLong-Formは、それぞれの利点を特に活かせるコンテンツに取っておきます。 Generativeの表現力とLong-Formの疲労軽減調整はいずれも実際の利点ですが、文字単位の費用も大幅に高くなります。すべてで最上位段階を既定にせず、その特定の品質を本当に必要とするコンテンツに段階を合わせてください。
- 採用を決める前に、具体的な音声とエンジンの組み合わせをテストします。 すべての音声が4種類すべてのエンジンに対応するわけではないため、その組み合わせを中心にパイプラインを構築した後で不一致に気づくのではなく、対象言語と音声で利用できるか早い段階で確認してください。
- 大規模な予算を組む前に、現在の料金を直接確認します。 Amazonは時間とともにPollyのエンジン料金を変更しており、引用される文字単位料金は情報源によって異なる場合があります。古い可能性のある引用値に頼らず、AWS自身の料金ページで現在の数値を確認してください。
- 音声クローンが中核要件なら、別の選択肢を探します。 Pollyはこれを組み込み機能として提供していないため、適切な同意と安全対策を備えて音声クローンを明示的に提供する事業者のほうが、その具体的な要件には直接合います。
Amazon Polly、Azure AI Speech、Edge TTSの比較
| Amazon Polly | Azure AI Speech | Edge TTS | |
|---|---|---|---|
| 料金体系 | 4段階(100万文字あたり$4〜$100超) | 主に2段階(Neural、Neural HD) | 無料 |
| 音声クローン | 中核機能ではない | 制限付きのPersonal Voiceで対応 | 該当なし |
| エコシステム統合 | AWSと深く統合(S3、CloudWatch、IAM) | Azure/Foundryと深く統合 | なし——単独ツール |
| 無料枠 | あり、12か月、充実した利用枠 | あり、月間利用枠 | 本質的に無料で無制限 |
| 公式ライセンス付きAPI | あり | あり | なし——非公式コミュニティツール |
| 最適な用途 | すでにAWSを使い、段階別にコストを制御したいチーム | 高度なSSMLとカスタム音声学習が必要なチーム | プロトタイピングと個人プロジェクト |
Amazon Polly独自の立ち位置は、意図的なコストの段階分けと深いAWSネイティブ統合を組み合わせている点です。用途ごとに1つの固定料金を受け入れるのではなく、価格と品質のトレードオフを明示的に制御したい、すでにAWSインフラストラクチャ上で開発しているチームにとって適切な既定の選択肢です。
よくある質問
Pollyの4種類の音声エンジンは何が違いますか?
Standardは最も手頃で、基本的な通知やIVRに最適です。Neuralは適度な追加料金で明らかに自然なイントネーションとペースを提供し、ほとんどの本番コンテンツに推奨されます。Generativeは10億パラメータのTransformerモデルを使い、より表現豊かで繊細な話し方を実現します。Long-Formはオーディオブックのような長いコンテンツで聴き手の疲労を軽減するよう特別に調整されています。
Amazon Pollyは音声クローンに対応していますか?
一般に利用できる中核機能としては対応していません。特定の声をクローンすることが中心的な要件なら、適切な同意に関する安全対策とともに、この機能を直接提供する事業者のほうが適しています。
Amazon Pollyは無料で使えますか?
AWSの新規顧客向けに12か月間の無料枠があり、文字数枠はエンジンによって異なります。Standardの利用枠はGenerativeやLong-Formより大幅に多くなっています。無料枠の終了後は、文字単位で請求される従量課金サービスです。
Amazon Pollyは送信したテキストを保持しますか?
いいえ。AmazonはPollyが送信されたテキストの内容を保持しないと明記しています。
顧客向けアプリケーションにはどのエンジンを使うべきですか?
Neuralは、自然な音声品質とコストのバランスが取れており、通常は顧客向けコンテンツで推奨される出発点です。Generativeは、追加される表現力が高い料金に見合うコンテンツに限って使ってください。
Echoraでオンライン音声を作成
同様の目的を持つブラウザベースのワークフローには、Echoraのテキスト読み上げを利用できます。最大5,000文字を単一話者の音声に変換し、結果を試聴して完成したMP3をダウンロードできます。