EchoraEchora
Volver a Modelos

Dia2 TTS: la evolución con streaming que vuelve casi instantánea la generación de diálogos

18 de agosto de 2026
8 min de lectura

Convierte texto y grabaciones en obras que se escuchan

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

El modelo Dia original demostró que un sistema TTS con pesos abiertos podía generar conversaciones completas con varios hablantes en una sola pasada, pero tenía que esperar a recibir todo el guion antes de producir el primer sonido. Dia2 elimina esa espera. Es el modelo de diálogo de nueva generación de Nari Labs, reconstruido desde cero para el streaming: el audio comienza a reproducirse mientras el texto todavía se está escribiendo. Esto lo convierte en la primera opción realmente viable para aplicaciones de voz conversacionales en directo, y no solo para clips renderizados de antemano.

Por qué Dia2 es una mejora real y no un simple cambio de versión

Dia2 conserva todo lo que hacía útil al Dia original—diálogos con etiquetas de hablante, turnos naturales e interpretación expresiva—y reconstruye el flujo de generación alrededor de un cambio esencial: ya no necesita tener la transcripción completa antes de empezar a hablar. En cuanto llegan las primeras palabras, Dia2 comienza a generar audio. Esa es la diferencia entre un modelo adecuado para narración y otro preparado para conversaciones en directo.

Hay checkpoints de dos tamaños disponibles, Dia2-1B y Dia2-2B, que permiten elegir entre un streaming más rápido y ligero o una salida de mayor fidelidad, según priorices la latencia o la calidad de voz. Ambos tienen pesos abiertos bajo Apache 2.0, con checkpoints en Hugging Face y código de inferencia en GitHub.

Cómo funciona la generación de diálogos en streaming

Los sistemas TTS tradicionales, incluida la primera generación de Dia, funcionan básicamente por lotes: entra el texto y sale una forma de onda completa. Dia2 reorganiza este proceso como un flujo incremental basado en varios mecanismos clave:

  • Streaming de audio token a token. En lugar de esperar una señal de fin de secuencia, Dia2 emite audio a medida que avanza la generación, de modo que la reproducción puede comenzar una fracción de segundo después de enviar las primeras palabras.
  • Acondicionamiento de hablante basado en prefijos. En lugar de usar un único clip de referencia como el Dia original, Dia2 asigna un prefijo de voz independiente a cada hablante. Así puedes definir voces diferentes y estables para [S1] y [S2] sin que se mezclen durante un intercambio largo.
  • Una ventana de generación de unos dos minutos. Cada sesión de streaming admite actualmente hasta dos minutos de diálogo continuo en inglés. Es suficiente para un intercambio natural, una respuesta de un agente de voz o una escena corta, aunque no para un capítulo completo de audiolibro en una sola llamada.

Esta arquitectura convierte a Dia2 en una base para proyectos realmente interactivos—agentes de voz en tiempo real, juegos narrados en directo y flujos de voz a voz—en los que la generación de una sola pasada del Dia original no era lo bastante rápida.

¿Cómo ejecutar Dia2 localmente?

  1. Instala los requisitos previos. Dia2 se distribuye mediante uv y la inferencia requiere CUDA 12.8 o una versión posterior. Comprueba la versión del controlador antes de instalar para evitar el fallo más habitual.
  2. Descarga el modelo. Clona nari-labs/dia2 desde GitHub o carga directamente un checkpoint por el nombre del repositorio: nari-labs/Dia2-2B para mayor fidelidad, o la variante 1B para menor latencia.
  3. Escribe un guion con etiquetas. Organiza la entrada con las etiquetas de hablante [S1]/[S2], igual que en el Dia original. Dia2 utiliza la misma convención, por lo que los guiones existentes necesitan muy pocos cambios.
  4. Ajusta los parámetros de generación. La escala CFG y la temperatura controlan hasta qué punto la salida sigue el guion o introduce variaciones naturales. Utiliza una temperatura baja para resultados predecibles y listos para producción, y una alta para obtener resultados más expresivos y experimentales.
  5. En producción, considera un servidor alojado. Como la salida no está vinculada de forma predeterminada a un único hablante, proyectos de la comunidad como Dia-TTS-Server permiten cambiar en caliente entre Dia 1.6B, Dia2-1B y Dia2-2B, además de ofrecer un endpoint compatible con OpenAI. Es una vía de integración más rápida que crear desde cero una capa de inferencia.

Cómo obtener el máximo partido de Dia2

  • Fija una vez el prefijo de voz y reutilízalo en todas partes. Como Dia2 no está ajustado para una única voz, el resultado cambia entre ejecuciones si no fijas un prefijo o una semilla. Configúralo una vez por proyecto y guárdalo, en lugar de generar una voz nueva en cada sesión.
  • Diseña teniendo en cuenta el límite de dos minutos. Para contenido más largo, divide los guiones en varias llamadas de streaming consecutivas en lugar de forzar una única solicitud demasiado grande. Esto también mantiene baja la latencia en usos interactivos.
  • No omitas la comprobación de la versión de CUDA. La causa más común de errores de instalación de Dia2 es la incompatibilidad del controlador. Confirma que tienes CUDA 12.8 o posterior antes de investigar cualquier otro problema.
  • Adapta el tamaño del modelo al caso de uso. Elige Dia2-1B cuando la capacidad de respuesta importe más que la calidad final, como en agentes en directo o voz para chat en tiempo real. Elige Dia2-2B cuando la calidad sea prioritaria y puedas aceptar una latencia algo mayor.
  • Respeta la política de uso. La licencia de Nari Labs prohíbe expresamente generar audio que suplante a personas reales sin su permiso. Incorpora controles de consentimiento en cualquier producto que acepte prompts de voz proporcionados por usuarios.

Dia2 frente al Dia 1.6B original

Dia2Dia 1.6B (original)
Modo de generaciónStreaming; comienza antes de recibir todo el textoPor lotes; requiere primero la transcripción completa
Tamaños del modeloCheckpoints de 1B y 2B1.6B, un único checkpoint
Acondicionamiento de vozPrefijo independiente por hablanteUn único audio de referencia compartido
Uso idealAgentes en directo, conversación en tiempo real, voz a vozDiálogos prerenderizados, pódcasts, audiolibros
Salida continua máximaUnos dos minutos por sesiónSin el mismo tipo de límite temporal
LicenciaApache 2.0Apache 2.0

Si tu proyecto genera el audio con antelación—un episodio de pódcast o diálogos ya preparados para un juego—el Dia 1.6B original sigue siendo una opción plenamente competente y algo más sencilla. Dia2 resulta especialmente útil cuando el audio debe responder a algo que está ocurriendo ahora mismo.

Preguntas frecuentes

¿Dia2 es gratuito y de código abierto?

Sí. Dia2 se publica bajo la licencia Apache 2.0, y tanto los checkpoints 1B y 2B como el código de inferencia están disponibles públicamente en GitHub y Hugging Face.

¿Cuál es la diferencia práctica entre Dia2-1B y Dia2-2B?

Dia2-1B es la opción más ligera y de menor latencia, adecuada para interacción en tiempo real. Dia2-2B sacrifica algo de velocidad para lograr mayor fidelidad de audio. Elige según tenga más importancia la capacidad de respuesta o la calidad de salida.

¿Puede Dia2 generar más de dos minutos de audio en una sola llamada?

No en una única sesión de streaming. El límite actual es de aproximadamente dos minutos de voz continua en inglés. El contenido más largo debe dividirse en llamadas consecutivas.

¿Dia2 sustituye al Dia 1.6B original?

No por completo. Dia2 es la mejor opción para aplicaciones interactivas y en tiempo real, pero el Dia 1.6B original sigue siendo una alternativa sólida y más sencilla para proyectos que generan los diálogos sin conexión y con antelación.

¿Qué requisitos de hardware tiene Dia2?

Dia2 requiere un entorno de GPU compatible con CUDA 12.8 o posterior. La VRAM necesaria varía entre los checkpoints 1B y 2B; el modelo pequeño es la opción más ligera para hardware con recursos limitados.

Prueba una función de diálogo similar

Dia2 se ejecuta mediante su implementación de código abierto. Si quieres crear un prototipo de audio con varios hablantes en el navegador, prueba Texto a diálogo como una función similar. No es Dia2 ni ofrece su motor de streaming en tiempo real, pero permite explorar una escena con varias voces antes de instalar el modelo localmente.

Explorar Texto a diálogo →