EchoraEchora

AI モデル

オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。

8分で読めます

VITS:古典的なエンドツーエンド TTS アーキテクチャを解説

VITS は、単一段階の生成が二段階システムに匹敵し得ることを証明し、数え切れないほどの派生モデルを生み出した、2021 年の条件付き VAE・フローベース TTS モデルです。

VITSテキスト読み上げエンドツーエンド TTS条件付き VAE正規化フローオープンソース
続きを読む
読了目安:7分

MockingBird:5秒でリアルタイム中国語音声クローン

MockingBird は、わずか5秒の音声から声をクローンして標準中国語の音声をリアルタイム合成でき、今も最も人気のある中国語 TTS リポジトリの1つです。

MockingBird音声クローン中国語 TTSリアルタイム TTSSV2TTSオープンソース
続きを読む
7分で読めます

EmotiVoice:NetEase Youdaoのプロンプト制御型感情TTS

EmotiVoiceはNetEase Youdaoが公開したオープンソースのTTSエンジンで、英語と中国語の2,000以上の音声を備え、シンプルなテキストプロンプトで感情を指定できます。

EmotiVoiceテキスト読み上げ感情TTSプロンプト制御NetEase Youdaoオープンソース
続きを読む
読了目安:7分

WhisperSpeech:Whisperを逆転させて作られたテキスト読み上げ

WhisperSpeechは、OpenAIの音声認識モデルWhisperのアーキテクチャを逆転させ、適切にライセンスされた商用利用に安全なデータだけを使って、テキストから音声を生成します。

WhisperSpeechテキスト読み上げWhisperライセンス済みデータオープンソース音声合成
続きを読む
読了目安:7分

MetaVoice:感情表現に優れた英語音声クローン

MetaVoice は、感情豊かな英語音声のために作られた Apache 2.0 ライセンスの TTS モデルで、わずか30秒の参照音声から米国英語と英国英語の声をクローンできます。

MetaVoice音声クローン感情表現 TTS英語 TTSゼロショット音声クローンオープンソース
続きを読む
約7分で読めます

VibeVoice:Microsoft の長時間マルチスピーカー TTS モデル

VibeVoice は Microsoft のオープンソース TTS で、4人の話者によるポッドキャスト音声を90分生成できます。関連モデル VibeVoice-ASR と 4-bit 量子化版も提供されています。

VibeVoiceマルチスピーカー TTS長時間音声AIポッドキャストオープンソース
続きを読む
7分で読めます

Sesame CSM 1B:文脈を認識する会話音声モデル

Sesame CSM 1B は、交互に並ぶテキストと音声の履歴から音声を生成し、平板に文章を読み上げるのではなく、会話の実際のテンポや感情に合わせます。

Sesame CSM会話音声文脈認識 TTSオープンウェイト音声生成
続きを読む