Qwen3-TTS:Alibaba のオープンソース音声クローンモデル
Qwen3-TTS(Qwen-TTS)は、97ms の遅延、3秒の音声によるクローン、テキストからの音声設計を備えた Alibaba のオープンソース TTS です。10言語に対応し、無料で試せます。
オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。
Qwen3-TTS(Qwen-TTS)は、97ms の遅延、3秒の音声によるクローン、テキストからの音声設計を備えた Alibaba のオープンソース TTS です。10言語に対応し、無料で試せます。
IndexTTS 2は、ミリ秒単位の長さ制御と感情・音色の分離を実現した初の自己回帰型TTSで、映像吹き替えの同期に特化して設計されています。
IndexTTSは、Pinyinによる発音修正と句読点によるポーズ制御に対応するBilibiliのオープンソースTTSで、精度ではXTTSとF5-TTSを上回ります。
CosyVoice3 は9言語と18を超える中国語方言に対応し、発音修正機能を追加。音声クローン精度のベンチマークでは F5-TTS などの大規模モデルを上回ります。
CosyVoice2 は 150ms の初回パケット遅延で音声をストリーミングし、CosyVoice 比で発音エラーを 30〜50% 削減。指示による感情・アクセント制御も追加します。
CosyVoice は、教師ありセマンティックトークンを用い、わずか 3 億パラメータで 5 言語にわたるゼロショット音声クローンを実現する、Alibaba FunAudioLLM のオープンソース TTS です。
Kokoro-82Mは、8言語・54種類の音声を備え、GPUなしでCPU上でも高速に動作するApache-2.0ライセンスのTTSモデルです。無料、オープンソースで、セルフホストも容易です。
Chatterbox Multilingual は5〜10秒の音声から声をクローンし、アクセントと声色を保ったまま23言語で発話します。オープンソースで MIT ライセンスです。
Chatterbox Turbo は TTS 生成を10ステップから1ステップへ蒸留し、リアルタイム音声エージェントのレイテンシを150ミリ秒未満に短縮します。高速、オープンソース、MIT ライセンスです。
Chatterbox は、ゼロショット音声クローン、感情表現の調整、透かしを備えた Resemble AI のオープンソース TTS モデルです。ElevenLabs との比較を解説します。
Dia2 は、Nari Labs が開発した Dia TTS のストリーミング対応版です。テキストを受け取りながら、話者ごとの声を一貫して保つ複数話者の対話をリアルタイムで生成します。その仕組みを解説します。
Nari Labs の Dia 1.6B は、リアルな感情、笑い声、ため息を含む複数話者の対話を一度に生成するオープンソース音声モデルです。無料でオンライン体験できます。