Silero TTS:軽量な事前学習済みテキスト読み上げモデル
Silero TTSは、PyTorch Hubから1行で読み込めるMITライセンスの軽量な事前学習済みモデルで、ロシア語、CIS諸語、インド諸語を手厚くカバーしています。
オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。
Silero TTSは、PyTorch Hubから1行で読み込めるMITライセンスの軽量な事前学習済みモデルで、ロシア語、CIS諸語、インド諸語を手厚くカバーしています。
VITS は、単一段階の生成が二段階システムに匹敵し得ることを証明し、数え切れないほどの派生モデルを生み出した、2021 年の条件付き VAE・フローベース TTS モデルです。
MockingBird は、わずか5秒の音声から声をクローンして標準中国語の音声をリアルタイム合成でき、今も最も人気のある中国語 TTS リポジトリの1つです。
EmotiVoiceはNetEase Youdaoが公開したオープンソースのTTSエンジンで、英語と中国語の2,000以上の音声を備え、シンプルなテキストプロンプトで感情を指定できます。
YourTTSはVITSをベースにしたCoquiの研究モデルで、ゼロショット音声変換も行える初の多言語ゼロショット・マルチスピーカーTTSシステムです。
WhisperSpeechは、OpenAIの音声認識モデルWhisperのアーキテクチャを逆転させ、適切にライセンスされた商用利用に安全なデータだけを使って、テキストから音声を生成します。
VoiceCraftは既存の音声を編集し、数秒の音声から声をクローンします。編集後のクリップは48%の割合で元の録音より好まれました。
Voiceboxは、テキストと音声の文脈から音声を補完し、フローマッチングによってゼロショットTTS、編集、ノイズ除去を実現するMeta AIの研究モデルです。
MetaVoice は、感情豊かな英語音声のために作られた Apache 2.0 ライセンスの TTS モデルで、わずか30秒の参照音声から米国英語と英国英語の声をクローンできます。
VibeVoice は Microsoft のオープンソース TTS で、4人の話者によるポッドキャスト音声を90分生成できます。関連モデル VibeVoice-ASR と 4-bit 量子化版も提供されています。
Sesame CSM 1B は、交互に並ぶテキストと音声の履歴から音声を生成し、平板に文章を読み上げるのではなく、会話の実際のテンポや感情に合わせます。
Llasaは、LLaMAの1B、3B、8BモデルをXCodec2音声トークンで拡張し、25万時間の中国語・英語音声で学習した音声クローンおよびテキスト読み上げモデルです。