Step-Audio: comprensión unificada del habla + TTS de StepFun
Step-Audio es un modelo de código abierto de StepFun que unifica reconocimiento de voz, diálogo y generación de voz en un solo sistema, evitando el traspaso de ASR a TTS.
Guías sobre modelos de voz con IA de código abierto y populares, y cómo probar capacidades comparables en Echora.
Step-Audio es un modelo de código abierto de StepFun que unifica reconocimiento de voz, diálogo y generación de voz en un solo sistema, evitando el traspaso de ASR a TTS.
Zonos es un modelo TTS de pesos abiertos de Zyphra, entrenado con más de 200 000 horas de voz, que clona una voz en segundos y permite controlar con precisión la emoción, el tono y la velocidad del habla.
Orpheus TTS es un LLM de voz de Canopy Labs basado en Llama-3B, con 200ms de latencia en streaming, etiquetas de emoción y clonación zero-shot, que puede desplegarse mediante un servidor FastAPI.
OuteTTS trata el habla como modelado puro del lenguaje, por lo que se ejecuta de forma nativa en llama.cpp mediante GGUF y clona una voz con 10 segundos de audio en un total de 23 idiomas.
GLM-TTS es el TTS open source de Zhipu AI que combina un LLM con flow matching, clona una voz a partir de 3 segundos y usa RL para mejorar la emoción y la pronunciación.
Parler-TTS es un modelo TTS de código abierto de Hugging Face que controla la voz, el tono y el estilo del habla mediante una descripción en lenguaje natural, sin necesidad de audio.
ChatTTS es un modelo TTS de 2noise optimizado para diálogos de chatbots y asistentes en chino e inglés, capaz de generar risas, pausas e interjecciones naturales.
MeloTTS es el TTS multilingüe de código abierto de MyShell, con inferencia en tiempo real en CPU y cambio nativo entre chino e inglés dentro de una misma frase hablada.
Piper TTS es un modelo neuronal de voz de 15 millones de parámetros que funciona en tiempo real solo con CPU, creado para Raspberry Pi y otros dispositivos de borde sin necesidad de GPU.
NaturalSpeech 3 separa el habla en subespacios de contenido, prosodia, timbre y detalle, lo que permite al modelo TTS de Microsoft controlar cada uno de forma independiente.
NaturalSpeech 2 aplica difusión latente a códigos de audio continuos, lo que permite al modelo TTS de Microsoft generar canto zero-shot a partir de una simple muestra de voz hablada.
NaturalSpeech es el modelo TTS de Microsoft basado en VAE que definió formalmente la calidad de nivel humano y después superó su propia prueba estadística en el conjunto de datos LJSpeech.