Step-Audio:StepFunによる統合音声理解+TTS
Step-Audioは、音声認識、対話、音声生成を1つのシステムに統合し、ASRからTTSへの受け渡しを省く、StepFunのオープンソースモデルです。
オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。
Step-Audioは、音声認識、対話、音声生成を1つのシステムに統合し、ASRからTTSへの受け渡しを省く、StepFunのオープンソースモデルです。
Zonos は、20万時間を超える音声で学習した Zyphra のオープンウェイト TTS モデルです。数秒で音声をクローンし、感情、ピッチ、話速を細かく制御できます。
Orpheus TTSは、Llama-3Bを基盤とし、200msのストリーミング遅延、感情タグ、ゼロショットクローンに対応するCanopy Labsの音声LLMで、FastAPIサーバーを通じて導入できます。
OuteTTSは音声を純粋な言語モデリングとして扱うため、GGUF経由でllama.cpp上にネイティブ動作し、10秒の音声から声をクローンして合計23言語に対応します。
GLM-TTS は LLM と Flow Matching を組み合わせた Zhipu AI のオープンソース TTS で、3秒の音声から声をクローンし、RL で感情と発音を向上させます。
Parler-TTSは、音声を用意せず、自然言語の記述によって声、ピッチ、話し方を制御するHugging FaceのオープンソースTTSモデルです。
ChatTTS は 2noise が開発した TTS モデルで、中国語と英語のチャットボットやアシスタントの対話向けに最適化され、自然な笑い声、間、間投詞を生成します。
MeloTTSはMyShellによるオープンソースの多言語TTSで、CPUでのリアルタイム推論と、ひとつの発話内での中国語・英語のネイティブなコードスイッチングに対応します。
Piper TTSは、CPUだけでリアルタイム動作する1500万パラメーターのニューラル音声モデルです。GPUを必要とせず、Raspberry Piなどのエッジデバイス向けに構築されています。
NaturalSpeech 3 は音声を内容、韻律、声色、ディテールの個別の部分空間に分け、Microsoft の TTS モデルがそれぞれを独立して制御できるようにします。
NaturalSpeech 2 は連続音声コードに潜在拡散を用い、Microsoft の TTS モデルが話し声のプロンプトだけからゼロショットで歌声を生成できるようにします。
NaturalSpeech は Microsoft の VAE ベース TTS モデルです。人間レベルの品質を正式に定義し、LJSpeech データセットで自ら定めた統計検定を通過しました。