EchoraEchora

AI 模型

解读开源与热门 AI 语音模型,并了解如何在 Echora 上体验对应能力。

阅读约 7 分钟

Silero TTS:轻量级预训练文本转语音模型

Silero TTS 是一款轻量级、采用 MIT 许可证的预训练模型,只需一行代码即可通过 PyTorch Hub 加载,并对俄语、独联体国家语言和印度语言提供强大支持。

Silero TTS文本转语音轻量级 TTS多语言 TTSPyTorch
阅读更多
8 分钟阅读

VITS:经典端到端 TTS 架构详解

VITS 是 2021 年推出的条件 VAE 与基于流的 TTS 模型,它证明了单阶段生成可以媲美两阶段系统,并由此催生了无数衍生项目。

VITS文本转语音端到端 TTS条件 VAE归一化流开源
阅读更多
7 分钟阅读

MockingBird:5 秒实时中文声音克隆

MockingBird 只需 5 秒音频即可克隆声音并实时合成普通话语音,至今仍是最受欢迎的中文 TTS 仓库之一。

MockingBird声音克隆普通话 TTS实时 TTSSV2TTS开源
阅读更多
7 分钟阅读

VoiceCraft:零样本语音编辑与声音克隆

VoiceCraft 能编辑已有语音,并用几秒音频克隆声音;在对比中,编辑后的片段有 48% 的时候比原始录音更受听众偏爱。

VoiceCraft语音编辑声音克隆零样本 TTS语音补全开源
阅读更多
阅读约 5 分钟

Voicebox:Meta 的非自回归流匹配语音 AI

Voicebox 是 Meta AI 的研究模型,它根据文本和音频上下文补全语音,并利用流匹配实现零样本文本转语音、编辑与降噪。

VoiceboxMeta AI语音补全流匹配零样本 TTS声音克隆
阅读更多
7 分钟阅读

MetaVoice:富有情感表现力的英语声音克隆

MetaVoice 是一款采用 Apache 2.0 许可证的 TTS 模型,专为富有情感的英语语音而打造,只需 30 秒参考音频即可克隆美式和英式英语声音。

MetaVoice声音克隆情感 TTS英语 TTS零样本声音克隆开源
阅读更多
阅读约 7 分钟

VibeVoice:微软长篇多说话人 TTS 模型

VibeVoice 是微软的开源 TTS,可生成长达 90 分钟、包含 4 位说话人的播客音频,并提供配套的 VibeVoice-ASR 模型和 4-bit 量化版本。

VibeVoice多说话人 TTS长篇语音AI 播客开源模型
阅读更多