VibeVoice: creado para un pódcast completo, no solo para una frase
- ¿Qué es VibeVoice?
- Ventajas funcionales de VibeVoice
- Cómo funciona por dentro
- VibeVoice-ASR: la mitad de la familia que escucha
- Consejos para obtener mejores resultados
- VibeVoice frente a otros modelos de larga duración y con múltiples hablantes
- Preguntas frecuentes
- Convierte un guion con varios hablantes en audio
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Casi todos los modelos TTS se centran en una sola intervención: genera esta frase, con esta voz, y detente. VibeVoice, el framework de voz de código abierto de Microsoft, se concibió en torno a una unidad de contenido completamente distinta: un episodio entero. Genera hasta 90 minutos de audio conversacional continuo con múltiples hablantes en una sola pasada, con hasta cuatro hablantes diferentes que mantienen una identidad coherente y alternan sus turnos con naturalidad de principio a fin: la diferencia entre un modelo creado para una frase y otro creado para un pódcast.
¿Qué es VibeVoice?
VibeVoice es un framework de código abierto de Microsoft con licencia MIT para generar audio conversacional expresivo, de larga duración y con múltiples hablantes; se creó explícitamente para situaciones como pódcasts, ficciones sonoras y entrevistas. Se publica en dos tamaños: VibeVoice-1.5B, basado en un modelo de lenguaje Qwen2.5-1.5B, y VibeVoice-Large, basado en el modelo Qwen2.5-7B de mayor tamaño para ofrecer más fidelidad a cambio de un coste computacional igualmente mayor. Ambos se alojan de forma abierta (microsoft/VibeVoice-1.5B y la variante Large), junto con el código del proyecto en GitHub.
Ventajas funcionales de VibeVoice
- 90 minutos de generación continua. Una sola pasada puede producir hasta 90 minutos de audio coherente y mantener durante todo ese tiempo tanto la identidad de los hablantes como la coherencia narrativa, muy por encima de los clips breves para los que se diseñan la mayoría de los modelos TTS.
- Hasta cuatro hablantes distintos de forma natural. El diálogo con múltiples hablantes es una capacidad de primer nivel, no una solución improvisada que une generaciones separadas de una sola voz: los turnos y la identidad de cada hablante se mantienen coherentes durante toda una sesión larga.
- Compresión de audio extremadamente eficiente. Una tasa de tokenización de 7.5Hz consigue reducir aproximadamente 3.200 veces la resolución del audio original sin perder fidelidad, lo que hace computacionalmente viable generar 90 minutos de audio.
- Transferencia entre idiomas y canto como capacidades emergentes. Ninguna de estas dos capacidades se entrenó de forma específica, pero ambas aparecen como comportamientos emergentes: el modelo puede trasladar el acento de una voz entre idiomas e incluso intentar cantar, aunque la calidad varía en ambos casos.
- Medidas de IA responsable integradas de forma predeterminada. Cada resultado incluye un aviso audible y una marca de agua imperceptible, aplicados automáticamente en lugar de ofrecerse como una opción que haya que activar.
- Disponible en varios tamaños, incluidas variantes cuantizadas. Además de los checkpoints básicos 1.5B y Large, las versiones cuantizadas de 4 y 8 bits creadas por la comunidad reducen de forma considerable los requisitos de VRAM en hardware limitado.
- Un modelo complementario para la dirección inversa. VibeVoice-ASR amplía la misma familia a la conversión de voz a texto, por lo que el proyecto no se limita únicamente a la generación.
Cómo funciona por dentro
El pipeline de VibeVoice se divide en tres partes que cooperan entre sí. Los tokenizadores acústicos y semánticos continuos, que funcionan a esa frecuencia ultrabaja de 7.5Hz, comprimen el audio original en una representación lo bastante eficiente como para procesar secuencias realmente largas sin que el coste computacional se dispare. A continuación, un modelo de lenguaje Qwen2.5 preentrenado (de 1.5B o 7B, según el checkpoint que utilices) modela el propio diálogo —la semántica, el flujo y la estructura de los turnos— para condicionar qué debe decirse y quién debe hacerlo. Por último, una cabeza de difusión ligera de cuatro capas combinada con un decodificador VAE completa los detalles acústicos de alta fidelidad sobre la estructura definida por el LLM y utiliza guía sin clasificador durante la inferencia para controlar hasta qué punto el resultado se ajusta al timbre de una voz de referencia (el valor de cfg_scale que suele recomendarse ronda 1.3).
El entrenamiento se realiza deliberadamente por etapas: los propios tokenizadores se congelan y solo se entrenan el LLM y la cabeza de difusión mediante aprendizaje curricular, que empieza con secuencias más cortas y se amplía progresivamente hasta 65.000 tokens. Esto es precisamente lo que permite al modelo mantener la coherencia durante una generación realmente larga en vez de desviarse o perder la consistencia de los hablantes a mitad del proceso.
VibeVoice-ASR: la mitad de la familia que escucha
Publicado en enero de 2026, VibeVoice-ASR amplía la misma familia en la dirección opuesta: es un modelo unificado de voz a texto, no de texto a voz. Procesa hasta 60 minutos de audio de larga duración en una sola pasada y produce transcripciones estructuradas que recogen quién habló (mediante diarización de hablantes), cuándo lo hizo (con marcas de tiempo precisas) y qué dijo; también admite contexto personalizado por el usuario y palabras clave específicas de un dominio. Desde entonces se ha integrado directamente en la biblioteca Hugging Face Transformers y en Azure AI Foundry Labs de Microsoft, lo que facilita su adopción sin tener que crear una configuración de inferencia específica.
Para el despliegue en el edge, VibeVoice-ASR-BitNet comprime específicamente el modelo de 4.62GB a 1.58GB mediante cuantización heterogénea (I8_S para el codificador de audio e I2_S para el modelo de lenguaje), sustituye el modelo base Qwen2.5-7B por una versión Qwen2.5-1.5B más ligera y solo aumenta entre un 1 y un 4% el valor absoluto de la tasa de error de palabras. Junto con el runtime específico VibeASR.cpp, creado sobre kernels SIMD personalizados y fusión de operadores dentro del framework ggml, ofrece transcripción en tiempo real (RTF inferior a 1) con apenas 3 hilos de CPU, sin necesidad de GPU, y funciona entre 1.6 y 2.3 veces más rápido que Whisper.cpp con un tamaño de modelo comparable.
Consejos para obtener mejores resultados
- Escribe el guion en el formato que el modelo realmente espera. Estructura la entrada como turnos etiquetados (
Speaker 1: ... Speaker 2: ...) dentro de una transcripción de texto simple, no como un párrafo sin estructura; así VibeVoice puede asignar correctamente los turnos y mantener la coherencia de cada hablante. - Empieza con el modelo 1.5B antes de dar por hecho que necesitas Large. Dado el salto considerable en requisitos de computación y VRAM, comprueba que el modelo pequeño no sea ya suficiente para tu contenido antes de comprometerte con el checkpoint de 7B.
- Usa un checkpoint precuantizado en hardware limitado en lugar de cuantizar sobre la marcha. Los modelos precuantizados de 4 u 8 bits se cargan más rápido y evitan el coste de cuantizar durante cada ejecución.
- No dependas del canto emergente ni de los resultados entre idiomas para contenido de producción. Como ninguna de estas capacidades se entrenó ni optimizó de forma específica, considera los buenos resultados como una ventaja adicional y no como una función fiable; si buscas expresamente uno de estos efectos, reserva margen para repetir el muestreo.
- Ten en cuenta el aviso audible y la marca de agua para tu caso de uso. Como ambos se incorporan automáticamente a cada resultado, inclúyelos en cualquier documentación del producto relacionada con la divulgación de audio generado por IA.
VibeVoice frente a otros modelos de larga duración y con múltiples hablantes
| VibeVoice | CosyVoice3 | TTS típico de un solo hablante | |
|---|---|---|---|
| Máximo de hablantes por sesión | 4 | Zero-shot por clip, no basado en sesiones | 1 |
| Duración continua máxima | ~90 minutos | No es un objetivo específico | Clips breves |
| Arquitectura principal | LLM Qwen2.5 + cabeza de difusión + tokenizadores de 7.5Hz | Tokens semánticos supervisados + flow matching | Varía |
| Modelo ASR complementario | Sí (VibeVoice-ASR) | No | No |
| Variantes cuantizadas disponibles | Sí (4/8 bits de la comunidad + BitNet oficial para ASR) | No | Varía |
| Licencia | MIT | Abierto, con API alojada disponible | Varía |
El nicho específico de VibeVoice es la escala del resultado, no la expresividad de cada frase: si tu proyecto genera una sola línea de diálogo, la mayoría de los demás modelos de este sitio te servirán bien; si vas a generar un episodio completo de pódcast con varios presentadores, VibeVoice se creó específicamente para esa unidad de contenido.
Preguntas frecuentes
¿Cuál es la diferencia entre VibeVoice-1.5B y VibeVoice-Large?
1.5B se basa en Qwen2.5-1.5B y es la opción más ligera y rápida; Large utiliza Qwen2.5-7B para ofrecer más fidelidad a costa de mayores requisitos de computación y VRAM.
¿Qué duración puede tener realmente un clip de audio generado por VibeVoice?
Hasta 90 minutos de audio continuo y coherente en una sola pasada, manteniendo la identidad de los hablantes durante todo el proceso.
¿Qué es VibeVoice-ASR? ¿Es lo mismo que VibeVoice TTS?
No. VibeVoice-ASR es un modelo complementario e independiente de la misma familia que se ocupa de convertir voz a texto, no texto a voz, y procesa hasta 60 minutos de audio con diarización de hablantes y marcas de tiempo.
¿Puedo ejecutar VibeVoice-Large en una GPU de consumo?
Sí, con cuantización: los checkpoints precuantizados de 4 bits reducen los requisitos de VRAM a unos 10GB, aunque la velocidad de generación se resiente en comparación con la precisión completa.
¿VibeVoice es gratuito para uso comercial?
Sí. Se publica bajo la licencia MIT, una de las opciones más permisivas entre los modelos TTS de código abierto.
Convierte un guion con varios hablantes en audio
Si ya tienes un guion terminado con varios hablantes, utiliza Texto a diálogo de Echora. Añade hasta 12 bloques de diálogo y 5.000 caracteres en total, asigna una voz a cada bloque, incorpora etiquetas de interpretación compatibles y ajusta la estabilidad o el refuerzo del hablante. Después podrás escuchar y descargar la conversación completa.