EchoraEchora

Modelos de IA

Guias sobre modelos de voz com IA de código aberto e populares, e como testar capacidades comparáveis na Echora.

7 min de leitura

GPT-SoVITS: clonagem de voz com 1 minuto e destaque em chinês

O GPT-SoVITS clona uma voz com apenas 1 minuto de áudio, ou com 5 segundos em modo zero-shot, tem desempenho especialmente forte em chinês e japonês e inclui um conjunto completo de ferramentas WebUI.

TTSclonagem de vozajuste fino few-shotTTS multilíngueGPT-SoVITS
Ler mais
7 min de leitura

VALL-E X: modelo da Microsoft para clonagem de voz entre idiomas

O VALL-E X é a extensão interlinguística do VALL-E desenvolvida pela Microsoft: clona uma voz em um idioma para falar fluentemente em outro e inclui controle de sotaque.

VALL-E Xclonagem de voz entre idiomasTTS multilínguemodelo de linguagem com codec neuralcontrole de sotaque
Ler mais
7 min de leitura

VALL-E: Modelo de linguagem com codec neural da Microsoft para TTS

O VALL-E é o modelo de linguagem com codec neural da Microsoft que trata a fala como tokens discretos, assim como o GPT trata o texto, e clona uma voz a partir de um prompt de áudio de 3 segundos.

TTSmodelo de linguagem com codec neuralclonagem de voz zero-shotMicrosoft ResearchVALL-E
Ler mais
7 min de leitura

Tortoise TTS: O modelo multivoz original de alta qualidade

O Tortoise TTS é um modelo multivoz open source sob a licença Apache 2.0 que combina um Transformer autorregressivo com diffusion para oferecer qualidade de áudio excepcional, ainda que lentamente.

TTSTTS open sourceclonagem de vozTTS multivozTortoise TTS
Ler mais
8 min de leitura

XTTS-v2: Clonagem de voz zero-shot multilíngue da Coqui

O XTTS-v2 é o modelo de clonagem de voz zero-shot da Coqui que cobre 17 idiomas com apenas um clipe de 6 segundos e segue como referência apesar do fechamento da Coqui em 2024.

TTSTTS open sourceclonagem de voz zero-shotTTS multilíngueXTTS-v2
Ler mais
7 min de leitura

E2 TTS: o modelo zero-shot com flow matching por trás do F5-TTS

O E2 TTS é o sistema TTS zero-shot «Embarrassingly Easy» da Microsoft, tão simples que chega a ser constrangedor. Ele usa flow matching sem modelo de duração nem alinhador e é o antecessor direto do F5-TTS na pesquisa.

TTSflow matchingTTS zero-shotclonagem de vozE2 TTS
Ler mais