EchoraEchora

Modelos de IA

Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.

7 min de lectura

SeamlessM4T: modelo integral de traducción de voz de Meta

SeamlessM4T es un modelo de código abierto de Meta que unifica reconocimiento de voz, traducción y síntesis de voz en un solo sistema para hasta 100 idiomas.

traducción de vozvoz multilingüetraducción de voz a vozreconocimiento automático del hablaSeamlessM4T
Leer más
7 min de lectura

Spark-TTS: clonación de voz zero-shot con un único códec

Spark-TTS utiliza BiCodec, un códec de voz de flujo único basado en Qwen2.5, para la clonación de voz zero-shot y la creación de voces totalmente sintéticas en un único modelo abierto.

TTSclonación de vozclonación de voz zero-shotBiCodecSpark-TTS
Leer más
7 min de lectura

NeuTTS Air: modelo ligero de clonación de voz en el dispositivo

NeuTTS Air es un modelo TTS de Neuphonic para ejecutarse en el dispositivo, con menos de 1.000 millones de parámetros, que clona una voz con solo 3 segundos de audio y funciona en teléfonos y Raspberry Pi.

NeuTTS AirTTS en el dispositivoclonación de vozTTS ligeroGGUFRaspberry PiNeuphonic
Leer más
7 min de lectura

VoxCPM: modelo TTS bilingüe, de baja latencia y sin tokenizador

VoxCPM es un modelo TTS de OpenBMB sin tokenizador para chino e inglés que alcanza un factor de tiempo real de 0,17 en una GPU de consumo y genera prosodia automática según el contexto.

VoxCPMTTSsíntesis de voz sin tokenizadorTTS bilingüestreaming de baja latenciaOpenBMB
Leer más