CosyVoice2:ストリーミング対応・低レイテンシの多言語 TTS モデル
CosyVoice2 は 150ms の初回パケット遅延で音声をストリーミングし、CosyVoice 比で発音エラーを 30〜50% 削減。指示による感情・アクセント制御も追加します。
オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。
CosyVoice2 は 150ms の初回パケット遅延で音声をストリーミングし、CosyVoice 比で発音エラーを 30〜50% 削減。指示による感情・アクセント制御も追加します。
CosyVoice は、教師ありセマンティックトークンを用い、わずか 3 億パラメータで 5 言語にわたるゼロショット音声クローンを実現する、Alibaba FunAudioLLM のオープンソース TTS です。
Kokoro-82Mは、8言語・54種類の音声を備え、GPUなしでCPU上でも高速に動作するApache-2.0ライセンスのTTSモデルです。無料、オープンソースで、セルフホストも容易です。
Chatterbox Multilingual は5〜10秒の音声から声をクローンし、アクセントと声色を保ったまま23言語で発話します。オープンソースで MIT ライセンスです。
Chatterbox Turbo は TTS 生成を10ステップから1ステップへ蒸留し、リアルタイム音声エージェントのレイテンシを150ミリ秒未満に短縮します。高速、オープンソース、MIT ライセンスです。
Chatterbox は、ゼロショット音声クローン、感情表現の調整、透かしを備えた Resemble AI のオープンソース TTS モデルです。ElevenLabs との比較を解説します。
Dia2 は、Nari Labs が開発した Dia TTS のストリーミング対応版です。テキストを受け取りながら、話者ごとの声を一貫して保つ複数話者の対話をリアルタイムで生成します。その仕組みを解説します。
Nari Labs の Dia 1.6B は、リアルな感情、笑い声、ため息を含む複数話者の対話を一度に生成するオープンソース音声モデルです。無料でオンライン体験できます。