Dia TTS: el modelo de código abierto que genera diálogos reales, no solo frases
Convierte texto y grabaciones en obras que se escuchan
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
La mayoría de los motores de texto a voz están diseñados para leer una frase en voz alta. Dia TTS intenta algo más difícil: generar una conversación completa—dos hablantes, emociones que se entrelazan y una risa en el momento adecuado—en una sola pasada a partir de un guion sencillo. Si estás creando un pódcast, un audiolibro, un personaje de videojuego o un agente de IA que debe sonar como personas conversando y no como un narrador leyendo, este es un modelo creado específicamente para esa tarea.
¿Qué es Dia TTS (Dia 1.6B)?
Dia, también conocido como Dia-1.6B o Dia 1.6B, es un modelo de texto a voz de 1.600 millones de parámetros desarrollado por Nari Labs, un pequeño equipo surcoreano fundado por dos desarrolladores universitarios. Publicado bajo la licencia Apache 2.0, Dia tiene todos sus pesos abiertos: los checkpoints están alojados en Hugging Face y el código de inferencia es público en GitHub.
Lo que distingue a Dia de las arquitecturas TTS convencionales no es solo el número de parámetros, sino el objetivo de entrenamiento. En lugar de optimizar la narración limpia de frases aisladas, Dia está diseñado de extremo a extremo para la síntesis de diálogos: varios hablantes, turnos naturales y la textura no verbal que realmente tienen las conversaciones. Las primeras comparaciones de la comunidad lo sitúan como una alternativa de código abierto seria frente a sistemas comerciales cerrados como ElevenLabs y Sesame CSM-1B, especialmente en casos con mucho diálogo, donde esos modelos todavía suenan claramente más “leídos” que “hablados”.
Dia sigue siendo uno de los pocos sistemas con pesos abiertos creados específicamente alrededor de la conversación, en lugar de adaptarse a partir de la narración de un solo hablante.
¿Cómo funciona Dia?
Dia toma una transcripción en texto plano y la convierte directamente en una forma de onda de audio terminada: no hace falta un proceso separado de clonación de voz ni unir manualmente clips de cada hablante. Tres mecanismos impulsan el resultado:
Etiquetas de hablante. Envolver las líneas de diálogo con las etiquetas [S1] y [S2] indica al modelo qué voz debe decir cada línea. Dia mantiene constante el timbre de cada hablante etiquetado durante todo el guion, de modo que un intercambio no pierde la identidad vocal como suele ocurrir con clips de un solo hablante pegados entre sí.
Generación no verbal. Esta es la capacidad más distintiva de Dia. Indicaciones dentro de la línea, como (laughs), se convierten en risas, tos o carraspeos reales; no son un sonido de “jaja” sintetizado y añadido al audio después. Ese detalle hace que una conversación generada suene como dos personas hablando y no como dos guiones leídos.
Acondicionamiento de audio. Si proporcionas un breve clip de referencia junto con el texto, puedes orientar el tono emocional, el ritmo y la forma de hablar de la salida, o clonar una voz concreta para usarla de manera consistente en un proyecto. Sin un clip de referencia, Dia genera voces variadas al azar en cada ejecución; fijar una semilla aleatoria o proporcionar un prompt de audio produce un hablante repetible y consistente.
¿Cómo usar Dia TTS?
Hay tres pasos prácticos, según quieras evaluar primero la idea o construir con el modelo:
- Explora en línea una función de diálogo comparable. Text to Dialogue te permite probar la idea general de usar varias voces en una misma escena antes de comprometerte con una instalación local de Dia. Es una alternativa con capacidades comparables, no Dia, y no ejecuta la sintaxis
[S1]/[S2]de Dia. - Ejecuta Dia localmente para producción. Clona el repositorio
nari-labs/diadesde GitHub, crea un entorno virtual de Python e instala las dependencias indicadas. Los pesos del modelo se descargan automáticamente desde Hugging Face en la primera ejecución, o puedes cargar Dia directamente mediante la biblioteca Transformers de Hugging Face. - Comprueba primero tu hardware. Dia funciona cómodamente en una sola GPU con aproximadamente 8–10 GB de VRAM; una tarjeta de consumo o una instancia en la nube como una Colab T4 bastan para ejecutar inferencias sin trucos de cuantización.
Consejos para obtener mejores resultados
- Mantén constantes las etiquetas de hablante. Usa el mismo esquema
[S1]/[S2]en todo el guion; mezclar convenciones a mitad del texto confunde la asignación de turnos. - Coloca las indicaciones no verbales donde ocurrirían de forma natural.
(laughs)justo después de un remate funciona distinto que en mitad de una frase. Trata estas etiquetas como indicaciones de dirección, no como decoración. - Fija una semilla para repetir las voces. Si necesitas la misma voz de personaje en varias generaciones (por ejemplo, un NPC recurrente de un juego), fija la semilla aleatoria o reutiliza el mismo prompt de audio en vez de empezar de cero cada vez.
- Ten presente la limitación de solo inglés. Por ahora, Dia solo genera inglés. Planifica los proyectos multilingües teniendo en cuenta esta restricción, en lugar de descubrirla después de generar el contenido.
- Usa un clip de referencia breve y limpio para clonar. La calidad del acondicionamiento de audio depende mucho de que la muestra de referencia sea clara y no tenga ruido de fondo.
Dia frente a otros modelos TTS
| Dia 1.6B | ElevenLabs | Sesame CSM-1B | |
|---|---|---|---|
| Licencia | Pesos abiertos (Apache 2.0) | API comercial cerrada | Pesos abiertos |
| Diálogo multi-hablante en una pasada | Sí, de forma nativa | Requiere asignar una voz a cada línea | Limitado |
| Sonidos no verbales (risas, tos) | Se generan de forma nativa con etiquetas de texto | Normalmente requiere editar el audio manualmente | No es una función principal |
| Clonación de voz | Sí, mediante acondicionamiento de audio | Sí | Sí |
| Autoalojamiento | Sí, despliegue local completo | No | Sí |
| Idiomas compatibles | Solo inglés | Multilingüe | Enfocado en inglés |
La ventaja de Dia se concentra justo donde importa el diálogo: los turnos y el realismo no verbal. Si tu caso de uso es la narración de un solo hablante en varios idiomas, una API comercial multilingüe puede ser más adecuada; pero para audio en inglés con varios personajes, el enfoque de código abierto de Dia en el diálogo es difícil de igualar con este tamaño de modelo.
Preguntas frecuentes
¿Dia TTS es gratis?
Sí. Dia se publica bajo la licencia Apache 2.0, por lo que sus pesos y su código se pueden usar, modificar y autoalojar gratis, incluso en proyectos comerciales, siempre que se cumplan los términos de la licencia.
¿Dia 1.6B admite idiomas distintos del inglés?
Todavía no. Dia solo genera voz en inglés; los guiones en otros idiomas no son compatibles oficialmente.
¿Qué hardware necesito para ejecutar Dia 1.6B localmente?
Una GPU con aproximadamente 8–10 GB de VRAM es suficiente para la inferencia. Tanto una GPU de consumo como una instancia T4 en la nube funcionan sin optimización adicional.
¿Dónde está el repositorio de Dia 1.6B en GitHub?
El código oficial y las instrucciones de instalación se mantienen en nari-labs/dia en GitHub, mientras que los pesos del modelo están alojados por separado en Hugging Face.
¿Puede Dia clonar una voz concreta?
Sí. Si proporcionas un clip de referencia como prompt de acondicionamiento de audio, Dia puede imitar una voz y un tono emocional determinados, además de generar voces aleatorias de forma predeterminada.
Prueba una función de diálogo comparable
Si quieres escuchar audio con varios hablantes en el navegador, prueba Text to Dialogue como alternativa comparable. No es Dia TTS, pero te permite crear prototipos de escenas con dos hablantes antes de configurar Dia localmente.