Amazon Polly:AWSクラウドTTS、4種類のエンジン
Amazon PollyはAWSのクラウドTTSサービスで、低価格のStandard音声から高品質なLong-Formナレーションまで4種類の音声エンジンを提供し、AWSと緊密に連携します。
オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。
Amazon PollyはAWSのクラウドTTSサービスで、低価格のStandard音声から高品質なLong-Formナレーションまで4種類の音声エンジンを提供し、AWSと緊密に連携します。
Azure AI SpeechはMicrosoft公式のクラウドTTSサービスで、数百種類のニューラル音声、カスタム音声のトレーニング、実運用規模での完全なSSML制御を提供します。
Edge TTSは、Microsoft Edgeの「音声で読み上げる」機能を支えるものと同じオンライン音声を、APIキーやアカウントなしで利用できる無料のオープンソースツールです。
SeamlessM4T は、音声認識・翻訳・音声合成を最大 100 言語対応の単一システムに統合した、Meta のオープンソースモデルです。
MaskGCTは、アラインメントと継続時間予測を完全に省き、わずか5秒の音声から声をクローンするAmphionの非自己回帰型TTSモデルです。
FireRedTTS は Xiaohongshu の基盤 TTS フレームワークです。吹き替え向けのゼロショット音声クローンと、AI チャットボット向けに指示チューニングされたカジュアルな音声を提供します。
Spark-TTS は、Qwen2.5 を基盤とする単一ストリーム音声コーデック BiCodec を使い、1つのオープンモデルでゼロショット音声クローンと完全な合成音声の作成を実現します。
NeuTTS Air は、10億未満のパラメータで構成された Neuphonic のオンデバイス TTS モデルです。わずか3秒の音声から声をクローンし、スマートフォンや Raspberry Pi で動作します。
Kyutai Pocket TTSは、1億パラメータ、MITライセンスのモデルです。GPUを必要とせず、CPUだけでリアルタイム音声合成とゼロショット音声クローンを実行します。
KaniTTSは、コンパクトなLFM2言語モデルと効率的なニューラル音声コーデックを組み合わせ、合計わずか3GBのGPU VRAMでリアルタイム音声合成を実行します。
VoxCPMはOpenBMBによる中国語・英語対応のトークナイザー不要TTSモデルで、一般向けGPU上でリアルタイム係数0.17を達成し、文脈に応じた韻律を自動生成します。
Voxtral TTS は Mistral AI の 4B オープンウェイトモデルです。2~3 秒の音声から声をクローンし、品質を ElevenLabs と直接ベンチマークしています。