EchoraEchora
Volver a los modelos

IndexTTS: El modelo de voz creado dentro de la mayor plataforma china de vídeos de anime y videojuegos

28 de agosto de 2026
•
8 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Bilibili, la plataforma de vídeo que alberga millones de horas de anime, videojuegos y contenido de creadores en China, tiene una razón práctica y evidente para interesarse por la conversión de texto a voz: doblaje, avatares digitales y locuciones a escala de plataforma. IndexTTS es el resultado de hacer pública esa necesidad interna. Desarrollado por el Departamento de Plataforma de IA de Bilibili y publicado como open source, es un modelo de clonación de voz zero-shot diseñado específicamente en torno a un problema que los sistemas TTS multilingües genéricos suelen resolver mal: pronunciar correctamente textos en chino con todos sus caracteres polifónicos y su vocabulario de larga cola.

¿Qué es IndexTTS?

IndexTTS es un modelo autorregresivo de texto a voz con estilo GPT, desarrollado por el equipo Index de Bilibili y construido principalmente sobre las arquitecturas XTTS y Tortoise, a las que añade una serie de mejoras específicas. Admite clonación de voz zero-shot —reproducir la voz de un hablante a partir de un clip de referencia— tanto en chino como en inglés, y se entrenó con más de diez mil horas de datos de voz.

Lo que diferencia a IndexTTS de las bases XTTS y Tortoise sobre las que se construye no es una única función destacada, sino una serie de decisiones de ingeniería deliberadas, cada una dirigida a un punto débil concreto de los primeros TTS open source: precisión de la pronunciación en chino, control de los tiempos y estabilidad de la clonación.

La ingeniería detrás de IndexTTS

Modelado híbrido de caracteres y pinyin. Esta es la principal aportación de IndexTTS. La síntesis de texto en chino tiene un problema persistente: los modelos entrenados únicamente con secuencias de caracteres pronuncian mal con frecuencia los caracteres polifónicos —un mismo carácter se lee de forma distinta según el contexto— y el vocabulario de larga cola. IndexTTS lo aborda mezclando directamente caracteres y pinyin durante el entrenamiento: en el preprocesamiento, una parte de los caracteres no polifónicos se sustituye de forma aleatoria por sus equivalentes en pinyin, lo que enseña al modelo a utilizar el pinyin como señal de desambiguación que también puede aceptar durante la inferencia para forzar una pronunciación concreta.

Control de pausas mediante puntuación. IndexTTS interpreta los signos de puntuación como señales temporales, lo que permite controlar dónde se producen las pausas en la voz generada simplemente mediante la puntuación del texto de entrada, sin necesidad de marcas temporales independientes.

Un pipeline de condicionamiento y decodificación reconstruido. IndexTTS introduce un codificador condicional de voz basado en Conformer para mejorar la forma en que el modelo capta las características del hablante a partir de un clip de referencia, y sustituye el decodificador original de códigos de voz por BigVGAN2. El equipo atribuye a este cambio una mayor estabilidad del entrenamiento, similitud del timbre y calidad general del audio.

FSQ en lugar de VQ para el tokenizer de voz. El equipo realizó una comparación directa entre la cuantización vectorial estándar (Vector Quantization) y la cuantización escalar finita (Finite-Scalar Quantization) para codificar tokens acústicos de voz, abordando el problema del colapso del codebook que puede degradar los sistemas basados en VQ. Esta decisión técnica también influyó posteriormente en el diseño del tokenizer de CosyVoice2.

Rendimiento en benchmarks

En la evaluación publicada por el equipo —que midió la tasa de error de palabras, la similitud del hablante y la puntuación media de opinión en conjuntos de prueba en inglés y chino—, IndexTTS se comparó directamente con XTTS, CosyVoice2 (sin streaming), Fish-Speech, FireRedTTS y F5-TTS. Los resultados publicados muestran que IndexTTS supera a todos ellos en la tasa de error de palabras, al tiempo que sigue siendo competitivo específicamente con CosyVoice2 y F5-TTS en similitud del hablante, los dos modelos que los autores consideran sus rivales más cercanos en fidelidad de clonación.

También conviene señalar con franqueza que el artículo original de IndexTTS reconoce directamente sus propias limitaciones: en el momento del lanzamiento, el modelo no admitía generación de voz mediante instrucciones, solo cubría chino e inglés y tenía una capacidad limitada para expresar emociones complejas. La actualización IndexTTS-1.5 del equipo, publicada en mayo de 2025, se centró específicamente en mejorar la estabilidad y el rendimiento en inglés respecto a la versión inicial 1.0.

Primeros pasos con IndexTTS

  1. Configura un entorno con Python 3.10. Crea un entorno conda dedicado e instala ffmpeg, ya sea mediante el gestor de paquetes del sistema o con conda install -c conda-forge ffmpeg.
  2. Gestiona por separado la dependencia pynini en Windows si es necesario. Si pip install no consigue compilar un wheel para pynini en Windows, instálalo con conda install -c conda-forge pynini==2.1.6 y después ejecuta pip install WeTextProcessing --no-deps; es una solución conocida que el proyecto documenta directamente.
  3. Descarga los pesos del modelo. Usa huggingface-cli download para obtener IndexTeam/IndexTTS (1.0) o IndexTeam/IndexTTS-1.5, según la versión que necesites. El checkpoint 1.5 es la mejor opción predeterminada para la mayoría de los proyectos nuevos por sus mejoras de estabilidad.
  4. Ejecuta la inferencia mediante CLI o Python. La herramienta de línea de comandos indextts recibe directamente el texto y un archivo de voz de referencia; también puedes llamar a la clase IndexTTS desde Python para tener más control dentro de un pipeline mayor.
  5. Usa la WebUI para probar antes de integrar. Ejecuta pip install -e ".[webui]" --no-build-isolation y después python webui.py para abrir en localhost:7860 una interfaz en el navegador con la que puedes probar la clonación y el control de pronunciación sin escribir código.

Consejos para obtener mejores resultados

  • Utiliza de forma deliberada sustituciones por pinyin para los caracteres polifónicos. Cuando un carácter tiene varias pronunciaciones válidas según el contexto, proporcionar directamente el pinyin correcto resulta más fiable que esperar que el modelo deduzca la lectura adecuada a partir del texto circundante.
  • Puntúa el texto según las pausas que realmente quieras. Como IndexTTS interpreta la puntuación como información temporal, utiliza la posición de las comas y los puntos como una herramienta de ritmo, no solo de corrección gramatical. Es una forma de controlar el ritmo que requiere menos esfuerzo que las opciones ofrecidas por la mayoría de los modelos.
  • Utiliza IndexTTS-1.5 de forma predeterminada salvo que tengas un motivo concreto para no hacerlo. La versión 1.5 existe específicamente para corregir problemas de estabilidad y mejorar la salida en inglés del modelo 1.0 original; hay pocos motivos para iniciar un proyecto nuevo con el checkpoint anterior.
  • Mantén expectativas realistas sobre el rango emocional. La propia documentación del modelo reconoce una expresividad emocional limitada frente a lanzamientos más recientes centrados en las emociones. Si la interpretación dramática es fundamental para tu proyecto, esta generación de IndexTTS no está optimizada para ello.
  • Comprueba la licencia del modelo antes de un despliegue comercial. El código de IndexTTS se publica bajo Apache 2.0, pero los pesos preentrenados utilizan una licencia de modelo de Bilibili independiente que exige autorización previa por escrito para el uso comercial. Confirma que tu caso de uso está cubierto antes de lanzar un producto comercial basado en él.

IndexTTS frente a sus competidores más cercanos

IndexTTSXTTSCosyVoice2F5-TTS
Base arquitectónicaXTTS + Tortoise, estilo GPTReferenciaTokens semánticos supervisadosFlow matching
Control de pronunciación en chinoModelado híbrido de caracteres y pinyinNo es una prioridadNo tiene una función específicaNo tiene una función específica
Control de pausasMediante puntuaciónLimitadoMediante instruccionesLimitado
Tasa de error de palabras (evaluación publicada)La mejor entre los modelos comparadosReferenciaSegundo más cercanoSegundo más cercano
Similitud del hablanteCompetitiva con los mejores modelosInferiorComparableComparable
Uso comercialLos pesos requieren autorizaciónVaríaApache 2.0Varía según la versión

La ventaja específica de IndexTTS frente a sus competidores más cercanos es la precisión de la pronunciación en chino y la sencillez de la inferencia. El equipo describe su proceso de entrenamiento como relativamente directo y su uso como más controlable que el de varios modelos open source similares, lo que supone una ventaja práctica importante para los equipos que crean pipelines de producción en lugar de demostraciones de investigación.

Preguntas frecuentes

¿Quién desarrolló IndexTTS?

IndexTTS fue desarrollado por el Departamento de Plataforma de IA de Bilibili (B站), la gran plataforma china de vídeos de anime, videojuegos y creadores, y se publicó como open source en GitHub y Hugging Face.

¿Cuál es la diferencia entre IndexTTS-1.0 e IndexTTS-1.5?

IndexTTS-1.5, publicado en mayo de 2025, es una actualización centrada en mejorar la estabilidad del modelo y la calidad de la síntesis en inglés respecto a la versión 1.0 original. La mayoría de los proyectos nuevos deberían usar 1.5 de forma predeterminada.

¿Cómo gestiona IndexTTS los problemas de pronunciación en chino?

Mediante el modelado híbrido de caracteres y pinyin: el modelo se entrena con una mezcla de caracteres chinos y sus equivalentes en pinyin, lo que permite proporcionar directamente el pinyin correcto para corregir un carácter polifónico o poco común mal pronunciado.

¿IndexTTS es gratuito para uso comercial?

El código se publica bajo la licencia Apache 2.0, pero los pesos preentrenados utilizan una licencia de Bilibili independiente que exige autorización previa por escrito para el uso comercial. Comprueba las condiciones vigentes de la licencia antes de realizar un despliegue comercial.

¿Cómo se compara IndexTTS con CosyVoice2 y F5-TTS?

En los benchmarks publicados por el equipo, IndexTTS logró una tasa de error de palabras inferior a la de ambos y, al mismo tiempo, siguió siendo competitivo específicamente en similitud del hablante, la métrica que mide hasta qué punto la salida clonada coincide con la voz de referencia.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →