EchoraEchora

Modelos de IA

Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.

7 min de lectura

VALL-E X: modelo de Microsoft para clonación de voz entre idiomas

VALL-E X es la extensión interlingüística de VALL-E desarrollada por Microsoft: clona una voz en un idioma para que hable con fluidez en otro e incorpora control del acento.

VALL-E Xclonación de voz entre idiomasTTS multilingüemodelo de lenguaje con códec neuronalcontrol del acento
Leer más
7 min de lectura

VALL-E: Modelo de lenguaje con códec neuronal de Microsoft para TTS

VALL-E es el modelo de lenguaje con códec neuronal de Microsoft que trata el habla como tokens discretos, igual que GPT trata el texto, y clona una voz a partir de una muestra de audio de 3 segundos.

TTSmodelo de lenguaje con códec neuronalclonación de voz zero-shotMicrosoft ResearchVALL-E
Leer más
7 min de lectura

StyleTTS: síntesis de voz no autorregresiva basada en estilo

StyleTTS separa el estilo del habla del contenido mediante AdaIN y un codificador de estilo específico, lo que aporta prosodia y forma de expresión controlables a la TTS no autorregresiva.

StyleTTSTTS basada en estiloTTS no autorregresivasíntesis de vozAdaIN
Leer más
7 min de lectura

Tortoise TTS: El modelo multivoz original de alta calidad

Tortoise TTS es un modelo multivoz open source con licencia Apache 2.0 que combina un Transformer autorregresivo con diffusion para lograr una calidad de audio excepcional, aunque lentamente.

TTSTTS open sourceclonación de vozTTS multivozTortoise TTS
Leer más
8 min de lectura

XTTS-v2: Clonación de voz multilingüe zero-shot de Coqui

XTTS-v2 es el modelo de Coqui para clonación de voz zero-shot que abarca 17 idiomas con solo un clip de 6 segundos y sigue siendo un referente pese al cierre de Coqui en 2024.

TTSTTS open sourceclonación de voz zero-shotTTS multilingüeXTTS-v2
Leer más
7 min de lectura

E2 TTS: el modelo zero-shot con flow matching detrás de F5-TTS

E2 TTS es el sistema TTS zero-shot «Embarrassingly Easy» de Microsoft, tan sencillo que resulta embarazoso. Usa flow matching sin modelo de duración ni alineador y es el antecesor directo de F5-TTS en investigación.

TTSflow matchingTTS zero-shotclonación de vozE2 TTS
Leer más
7 min de lectura

Fish Speech: TTS open source expresivo con ajuste fino

Fish Speech es el TTS open source expresivo de Fish Audio, con clonación zero-shot, ajuste fino mediante LoRA y etiquetas de emoción integradas como [whisper] y [angry].

TTSTTS open sourceclonación de vozajuste finoFish Speech
Leer más