Google Cloud TTS WaveNet:クラウド規模で使える成熟したニューラル音声
テキストと録音を、聴ける作品に
ナレーション、ステム分離、カバー、効果音を、ブラウザだけで。
- テキスト読み上げも、ボイスクローンも
- ステムを分離、またはカバーを生成
- 登録して試聴。聴いてから決められる
現在の生成型音声モデルが登場するずっと前から、WaveNetはニューラルテキスト読み上げの標準を確立するうえで重要な役割を果たしました。現在のGoogle Cloud TTSでは、以前とは異なりますが今も有用な位置を占めています。Googleの最新対話モデルに料金を払わずに、自然なニューラル音声、完全なSSML制御、予測可能なAPIの動作、非常に低い利用コストを求める開発者向けの、成熟した本番対応の音声ティアです。
Googleは現在、WaveNetを汎用で一般提供されている音声タイプに分類しています。Googleの最新世代の音声技術ではなくなり、現在の料金体系では従来型TTSモデルに含まれていますが、その成熟度には実用的な利点があります。月間400万文字の無料枠を超えた後も、WaveNetは100万文字あたりわずか$4です。大手クラウド事業者を通じて確立されたニューラル音声を利用する方法として、最も低価格な選択肢の1つです。
Google WaveNet TTSとは?
WaveNetは、生の音声から発話を生成するニューラル手法として生まれました。従来のパラメトリック合成とボコーダーだけに依存するのではなく、人間の発話録音で学習したため、より自然な強調、抑揚、音素、単語間のつながりを再現できます。
Google Cloud TTSにおけるWaveNetは、ダウンロードできる単独モデルではありません。GoogleのText-to-Speech APIを通じて提供される、管理されたクラウド音声のファミリーです。開発者はテキストまたはSSMLを送信し、en-US-Wavenet-DのようなWaveNet音声と出力形式を選ぶと、Googleのインフラストラクチャから合成音声を受け取ります。
したがって、元のWaveNetアーキテクチャは基盤となる音声技術であり、Google Cloud Text-to-SpeechはアプリケーションにWaveNet音声を導入するための管理された商用サービスです。
Google Cloud TTS WaveNetの機能上の利点
- 低コストのニューラル音声——月間無料枠の終了後も、WaveNetは100万文字あたり$4であり、大量の本番ワークロードでも実用的です。
- 完全なSSML対応——プレーンテキスト合成を超えて、発音、間、ペース、数字、日付、略語、その他の話し方の細部を制御できます。
- 複数の構築済み音声——モデルを学習またはホスティングすることなく、異なる言語や地域ロケールで対応しているWaveNet音声から選択できます。
- 柔軟な音声出力——Web、モバイル、電話、バックエンドのメディアワークフロー向けに、MP3、Linear16、OGG Opusなどの形式を生成できます。
- Google Cloudとのネイティブ統合——他のGoogle Cloudサービスと同じIAM、請求、割り当て、監視インフラストラクチャを利用できます。
WaveNet音声の選択と発話制御
WaveNetは、カスタム音声クローンではなく、Googleが事前定義した音声を中心に構築されています。各音声には固有の言語コード、ロケール、音声名、自然サンプルレートがあるため、本番アプリケーションは対象者に合う音声を明示的に選び、生成ごとに一貫性を保てます。
音声の選択に加えて、Google Cloud TTSは発話速度、ピッチ、音量ゲイン、音声エンコード、サンプルレートの制御を公開しています。SSMLは発音と話し方にもう1層の制御を加え、開発者が間を指定し、略語や構造化データを処理し、特定のフレーズの読み方に影響を与えられるようにします。
このためWaveNetは、出力を一貫して予測可能に保つ必要があるアプリケーションで特に効果的です。新しい生成型音声システムほど自由な表現力はありませんが、繰り返される本番出力に対して、はるかに多くの決定論的な制御を提供します。
Google Cloud TTS WaveNetの使い始め方
WaveNet音声の利用は標準のGoogle Cloud Text-to-Speechワークフローに従い、自分でモデルを学習または導入する必要はありません。
- Google Cloudプロジェクトを作成または選択し、Cloud Text-to-Speechを有効にします。 利用量が月間無料枠内に収まる場合でも、請求を有効にする必要があります。
- 認証を設定します。 Cloud TTSは標準のGoogle Cloud認証とIAM権限を使用するため、既存のGoogle Cloud環境に組み込めます。
- WaveNet音声を選びます。 Googleの現在の音声カタログから、必要な言語、ロケール、個別のWaveNet音声を選択します。
- テキストまたはSSMLを指定します。 基本的な合成にはプレーンテキストで十分ですが、SSMLを使うと発音、間、ペース、構造化された内容をさらに制御できます。
- 音声出力を選びます。 アプリケーションに必要なエンコードと再生設定を選択し、Cloud Text-to-Speechを通じて音声を生成します。
- 割り当てと利用状況を監視します。 本番環境では、Google Cloudを通じて文字数の消費、リクエスト上限、音声の可用性、現在の請求ルールを追跡する必要があります。
WaveNetでより良い結果を得るためのヒント
- 言語と性別だけに頼らず、正確な音声を選びます。 一貫性が重要なら、特定のWaveNet音声を指定することで、生成間の予期しない変化を防げます。
- 略語、数字、日付、意図的な間にはSSMLを使います。 書かれたテキストだけでは意図した読み上げ結果にならないことが多い代表的なケースです。
- ピッチや速度を調整する前に、最も近い自然な音声を選びます。 極端なパラメータ変更は、本来なら自然な音声を人工的に聞こえさせる可能性があります。
- 長いスクリプトを論理的な区切りに分割します。 小さなセグメントは、本番ワークフローで再試行、管理、結合しやすくなります。
- 遅延に敏感な対話体験をWaveNet中心に構築しないでください。 Googleの新しい音声モデルのほうが、対話型音声エージェントやストリーミング用途に適しています。
- ロケールの採用を決める前に、現在の音声カタログを確認します。 個々のWaveNet音声は、特定の言語と地域バリエーションでのみ利用できます。
現在のGoogle Cloud TTSにおけるWaveNetの位置
現在のWaveNetは、Googleの主力モデルではなく、より広範なGoogle Cloud TTS製品群の1段階として見ると最も理解しやすくなります。
| WaveNet | Neural2 | Chirp 3: HD | |
|---|---|---|---|
| 位置づけ | 成熟した汎用ニューラルTTS | より新しい汎用ニューラルTTS | 対話型/高度な音声 |
| 提供状況 | GA | GA | GA |
| SSML | 対応 | 対応 | 異なる制御モデル |
| リアルタイム対話への重点 | なし | なし | あり |
| 月間無料利用量 | 400万文字 | 100万文字 | 100万文字 |
| 無料利用後の料金 | 100万文字あたり$4 | 100万文字あたり$16 | 100万文字あたり$30 |
| 最適な用途 | コスト重視の本番TTS、ナレーション、プロンプト | より新しい音声ティアが必要な汎用ワークロード | 音声エージェントと対話型音声 |
Googleは現在、WaveNetを成熟した、または従来型のTTS製品群に位置づける一方、Chirp 3: HDのような新しいモデルは次世代の対話型音声を対象としています。
これはWaveNetが時代遅れになったという意味ではなく、役割がより明確になっただけです。対話型でストリーミング対応の会話音声が必要なら、新しいモデルのほうが適しています。確立されたニューラル音声とSSMLを備えた、低価格で予測可能なGoogle Cloud TTSが必要なら、WaveNetは今も価格と機能の優れた比率を提供します。
Google Cloud TTS WaveNetを使うべき人
WaveNetは、高度な音声作成ではなく、拡張可能で予測可能な音声生成を必要とするチームに特に適しています。
一般的な用途には次のものがあります。
- 音声メニュー、アカウント情報、サービスプロンプト向けのIVRと通話自動化
- アプリケーションやWebサイトの内容を読み上げるアクセシビリティ機能
- レッスン、演習、指導用音声を生成する教育製品
- 音声を明瞭かつ一貫して保つ必要がある通知とアラート
- 記事、製品コンテンツ、情報メディア向けのナレーションワークフロー
- すでにGoogle IAM、請求、インフラストラクチャを使用しているGoogle Cloudアプリケーション
- 文字単位の費用が重要な大量合成
音声クローン、非常に表現豊かなキャラクター演技、リアルタイムの会話ターンが主な要件の場合、WaveNetはあまり適していません。
よくある質問
Google WaveNetはGoogle Cloud TTSでまだ利用できますか?
はい。WaveNet音声は引き続きGoogle Cloud Text-to-Speechで利用できます。現在は最新世代の音声モデルではなく、Googleの成熟した、または従来型のTTS製品群に含まれています。
Google Cloud TTS WaveNetの料金はいくらですか?
WaveNetには現在、月間最大400万文字の無料利用枠があり、その後は100万文字あたり$4です。Google Cloudプロジェクトで請求を有効にする必要があります。
WaveNetはSSMLに対応していますか?
はい。WaveNetはSSMLに対応し、開発者は発音、間、ペース、日付、数字、略語などの構造化された内容の読み方を制御できます。
Google WaveNetは音声をクローンできますか?
いいえ。WaveNetは参照音声から話者をクローンするのではなく、Googleが事前定義した音声カタログを使用します。カスタム音声またはクローン音声が必要なアプリケーションには、別の音声ソリューションが必要です。
WaveNetはGoogleのStandard音声より優れていますか?
WaveNetは、特にイントネーション、リズム、音の間のつながりにおいて、従来の合成手法より自然な発話特性を生成するよう設計されています。現在はWaveNet音声とStandard音声が同様の低コスト段階にあるため、適切な音声を利用できる場合、一般にはWaveNetのほうが有力な選択肢です。
WaveNetは複数の言語に対応していますか?
はい。WaveNet音声は複数の言語と地域ロケールで利用できますが、対応範囲は市場によって異なります。本番用の音声を選ぶ前に、現在のGoogle Cloud音声カタログを確認してください。
WaveNetはリアルタイムAI音声エージェントに適していますか?
エージェント向けの合成出力を提供することはできますが、WaveNetはGoogleのリアルタイム対話音声向けの主要モデルではありません。ストリーミングと低遅延の対話が中核要件となるアプリケーションには、Googleの新しいTTSモデルのほうが適しています。
WaveNetとGoogle Cloud TTSの違いは何ですか?
WaveNetはニューラル音声技術と音声ファミリーです。Google Cloud Text-to-Speechは、アプリケーションがWaveNetやGoogleの他のTTS音声タイプにアクセスするための管理されたクラウドサービスです。
Echoraでオンライン音声を作成
同様の目的を持つブラウザベースのワークフローには、Echoraのテキスト読み上げを利用できます。最大5,000文字を単一話者の音声に変換し、結果を試聴して完成したMP3をダウンロードできます。