EchoraEchora
Volver a los modelos

IndexTTS2: el primer modelo TTS capaz de ajustarse al movimiento de los labios

28 de agosto de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Al doblar un vídeo con la mayoría de los modelos TTS, tarde o temprano aparece el mismo obstáculo: la frase generada dura medio segundo de más y el audio deja de estar sincronizado con la boca del personaje en pantalla. Los modelos TTS autorregresivos —los que generan el habla token a token y suelen sonar más naturales— han sido históricamente los que más sufren este problema, porque su longitud de generación no se puede fijar de antemano. IndexTTS2, del equipo Index de Bilibili, es el primer modelo TTS autorregresivo creado para resolver ese problema concreto: controlar con precisión de milisegundos cuánto dura realmente una frase de voz generada.

Novedades de IndexTTS2

IndexTTS 2 es el sucesor del IndexTTS original de Bilibili, y más que una actualización gradual, es una reconstrucción orientada directamente a los flujos profesionales de doblaje y localización de contenidos. Mientras que el modelo original reconocía de forma explícita como problemas pendientes su rango emocional limitado y la ausencia de generación mediante instrucciones, IndexTTS2 aborda ambos de manera directa y añade una capacidad que el original nunca tuvo: controlar exactamente cuánto dura una frase generada.

Entrenado con unas 55.000 horas de datos de voz multilingües en chino, inglés y japonés, sus autores describen IndexTTS2 como un modelo que logra simultáneamente resultados de vanguardia frente a los sistemas TTS zero-shot existentes en tasa de error de palabras, similitud del hablante y fidelidad emocional, tres métricas que en otros modelos suelen mejorar a costa unas de otras.

Control preciso de la duración: la función principal

Esta es la aportación central de IndexTTS2 y aborda directamente una limitación estructural del TTS autorregresivo. Como estos modelos generan voz token a token sin una longitud objetivo fija, ajustar una duración específica —por ejemplo, exactamente 3,2 segundos para encajar una frase doblada en un clip de vídeo existente— ha exigido tradicionalmente prueba y error, volver a generar o aplicar en posproducción un estiramiento temporal que degrada la calidad del audio.

IndexTTS2 introduce un sistema de adaptación de duración con dos modos de generación distintos:

  • Modo de duración especificada. Permite definir explícitamente el número de tokens generados para alcanzar una longitud objetivo precisa. Es el modo creado para el doblaje audiovisual, donde una frase debe caer dentro de una ventana temporal exacta para coincidir con el movimiento de los labios o el ritmo de la escena.
  • Modo de duración libre. Deja que el modelo genere de forma natural, sin una restricción en el número de tokens, al tiempo que reproduce fielmente las características prosódicas del prompt de entrada. Es la mejor opción cuando un ritmo natural importa más que alcanzar una duración exacta.

Cabe destacar que los autores diseñaron este método general para que pudiera aplicarse a otras arquitecturas TTS autorregresivas más allá del propio IndexTTS2; no es un recurso limitado exclusivamente a este modelo.

Separación entre emoción y timbre

La segunda gran incorporación consiste en separar a quién se parece una voz de cómo se siente. En la mayoría de los modelos de clonación, el clip de referencia determina tanto la identidad del hablante como, de forma implícita, su tono emocional: no resulta fácil clonar la voz de una persona que habla con calma y hacer que pronuncie una frase enfadada de manera convincente. IndexTTS2 separa estas dos dimensiones y permite especificar de forma independiente una fuente de timbre y otra de emoción, incluso a partir de dos clips de referencia completamente diferentes.

La entrada emocional admite cuatro métodos distintos: solo audio de referencia, un prompt de audio emocional separado y asociado a otro texto objetivo, una descripción emocional en lenguaje natural (por ejemplo, «que suene ansioso y apresurado») o un vector emocional directo. La vía de descripción en lenguaje natural utiliza un modelo Qwen3 ajustado que actúa como una capa de instrucciones suaves, diseñada específicamente para reducir la barrera del control emocional sin exigir que los usuarios entiendan parámetros basados en vectores. Para mantener el habla clara durante una interpretación emocional intensa —un punto de fallo habitual en el que una emoción fuerte reduce la inteligibilidad—, el modelo incorpora representaciones latentes GPT destinadas a conservar la estabilidad bajo tensión emocional.

Primeros pasos con IndexTTS2

  1. Clona el repositorio. Ejecuta git clone https://github.com/index-tts/index-tts.git y asegúrate de tener instalados tanto git como git-lfs antes de continuar.
  2. Instala las dependencias con uv. El proyecto recomienda el gestor de paquetes uv en lugar de una configuración manual con pip/conda: uv sync --all-extras descarga el conjunto completo de dependencias.
  3. Descarga el checkpoint de IndexTTS2. hf download IndexTeam/IndexTTS-2 --local-dir=checkpoints obtiene específicamente los pesos del modelo. No reutilices un directorio de checkpoint de IndexTTS-1.5, ya que ambos no son intercambiables.
  4. Usa la clase de inferencia v2. En Python, importa desde indextts.infer_v2 en lugar del módulo infer original y después llama a .infer() con un prompt de audio del hablante y el texto objetivo para generar un clip básico.
  5. Añade control de duración o emoción para tareas de doblaje. Cuando la generación básica funcione, incorpora una duración objetivo o un prompt de audio emocional a la llamada de inferencia. Es aquí donde aparecen realmente las ventajas de IndexTTS2 específicas para el doblaje, no en la generación predeterminada de una sola pasada.

Consejos para aprovechar IndexTTS2 al máximo

  • Usa el modo de duración especificada para cualquier contenido con una restricción temporal visual. El modo de duración libre funciona bien para una narración independiente, pero cualquier proyecto que sincronice audio con un vídeo existente —doblaje, redoblaje o anuncios localizados— debería usar desde el principio el modo con un número explícito de tokens en vez de corregir los tiempos en posproducción.
  • Separa deliberadamente las fuentes de timbre y emoción. Si necesitas que la voz clonada de una persona concreta pronuncie una frase con un tono emocional que no aparece de forma natural en el clip de referencia, proporciona un prompt de audio emocional aparte en lugar de intentar extraer emoción de un único clip de referencia plano.
  • Si no eres especialista en audio, prueba primero la entrada emocional mediante descripción textual. La vía de instrucciones en lenguaje natural basada en Qwen3 está creada para ser más accesible que los vectores emocionales; empieza por ahí antes de asumir que debes ajustar manualmente parámetros numéricos.
  • Vigila la claridad durante la generación con emociones intensas. Aunque las representaciones latentes GPT de IndexTTS2 están diseñadas para preservar la inteligibilidad durante una interpretación emocional fuerte, conviene comprobar la claridad en tu contenido concreto en vez de dar por hecho que será uniforme en todas las combinaciones de emociones e idiomas.
  • Confirma los términos de la licencia antes de realizar trabajos de doblaje comercial. Como ocurre con el IndexTTS original, los pesos del modelo se rigen por la licencia de uso de modelos de Bilibili, que exige autorización para usos comerciales. Verifica que cubra tu proyecto antes de lanzar un producto de localización o doblaje de pago basado en él.

IndexTTS2 frente a IndexTTS (original)

IndexTTS2IndexTTS (1.0 / 1.5)
Control de duraciónPreciso, a nivel de milisegundos (dos modos)No disponible
Control emocionalSeparado del timbre, 4 métodos de entradaLimitado, debilidad reconocida
Generación mediante instruccionesSí, a través de una descripción en lenguaje naturalNo disponible
Datos de entrenamiento~55.000 horas, chino/inglés/japonés~10.000+ horas, chino/inglés
Uso más adecuadoDoblaje de vídeo, localización, narración emocionalClonación zero-shot general, precisión de pronunciación en chino
LanzamientoSeptiembre de 2025Marzo de 2025 (1.0) / mayo de 2025 (1.5)

Si tu proyecto consiste en una clonación de voz de uso general sin requisitos estrictos de tiempo, el IndexTTS original sigue siendo una opción capaz y más sencilla. Si estás doblando contenido de vídeo en el que una frase debe encajar dentro de una ventana temporal específica —o necesitas que una voz clonada exprese de manera convincente una emoción que no estaba en el clip de referencia—, IndexTTS2 es la versión creada específicamente para ese trabajo.

Preguntas frecuentes

En la práctica, ¿qué significa «control de duración» en IndexTTS2?

Significa que puedes especificar exactamente cuántos tokens —y, por tanto, aproximadamente cuánto tiempo— debe ocupar una frase generada. Esto es esencial para el doblaje, donde el diálogo debe ajustarse a los tiempos de un vídeo existente en lugar de durar lo que el modelo genere de forma espontánea.

¿Puede IndexTTS2 hacer que una voz clonada exprese una emoción diferente a la del clip de referencia?

Sí. Esta es la función de separación entre emoción y timbre. Puedes proporcionar una fuente emocional aparte —audio, descripción textual o vector emocional— independiente de la referencia de timbre, de modo que una voz de referencia calmada pueda pronunciar una frase ansiosa o entusiasta.

¿IndexTTS2 es lo mismo que «IndexTTS 2»?

Sí, ambos nombres se refieren al mismo modelo. IndexTTS2, que a veces se escribe IndexTTS 2, es la segunda generación publicada por Bilibili y es distinta del IndexTTS original (1.0/1.5).

¿Qué idiomas admite IndexTTS2?

Sus datos de entrenamiento abarcan chino, inglés y japonés, extraídos de unas 55.000 horas de voz multilingüe.

¿IndexTTS2 es gratuito para uso comercial?

El código es open source, pero los pesos del modelo se rigen por el acuerdo de licencia de uso de modelos de Bilibili, que exige autorización previa para el uso comercial. Comprueba los términos actuales de la licencia antes de implementarlo en un producto de pago.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →