EchoraEchora

AI モデル

オープンソースや人気の AI 音声モデルを解説し、Echora で近い機能を試す方法もご紹介します。

7分で読めます

Step-Audio:StepFunによる統合音声理解+TTS

Step-Audioは、音声認識、対話、音声生成を1つのシステムに統合し、ASRからTTSへの受け渡しを省く、StepFunのオープンソースモデルです。

Step-Audio音声インタラクション音声理解テキスト読み上げ音声エージェントオープンソース
続きを読む
7分で読めます

Orpheus TTS:Llama-3Bベースの低遅延ストリーミング音声LLM

Orpheus TTSは、Llama-3Bを基盤とし、200msのストリーミング遅延、感情タグ、ゼロショットクローンに対応するCanopy Labsの音声LLMで、FastAPIサーバーを通じて導入できます。

Orpheus TTSテキスト読み上げ音声LLM低遅延ストリーミング表現力の高い音声オープンソース
続きを読む
7分で読めます

OuteTTS:llama.cppで動作する音声モデル

OuteTTSは音声を純粋な言語モデリングとして扱うため、GGUF経由でllama.cpp上にネイティブ動作し、10秒の音声から声をクローンして合計23言語に対応します。

OuteTTSllama.cppGGUFテキスト読み上げ音声クローン多言語TTS
続きを読む
7分で読めます

ChatTTS:会話に特化した中英バイリンガル TTS

ChatTTS は 2noise が開発した TTS モデルで、中国語と英語のチャットボットやアシスタントの対話向けに最適化され、自然な笑い声、間、間投詞を生成します。

ChatTTSTTS会話音声バイリンガル音声オープンソース2noise
続きを読む
約7分で読めます

MeloTTS:CPUで動くMyShellの多言語TTS

MeloTTSはMyShellによるオープンソースの多言語TTSで、CPUでのリアルタイム推論と、ひとつの発話内での中国語・英語のネイティブなコードスイッチングに対応します。

MeloTTS多言語TTSCPU TTSコードスイッチング音声合成オープンソース
続きを読む
読了約7分

Piper TTS:Raspberry Pi向けの超軽量音声合成

Piper TTSは、CPUだけでリアルタイム動作する1500万パラメーターのニューラル音声モデルです。GPUを必要とせず、Raspberry Piなどのエッジデバイス向けに構築されています。

Piper TTSテキスト読み上げRaspberry PiエッジAICPU TTS
続きを読む