EchoraEchora
Volver a los modelos

XTTS-v2: El referente de clonación de voz que sobrevivió a su propia empresa

30 de agosto de 2026
•
8 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Muchos modelos open source se comparan con XTTS-v2 antes de compararse con cualquier otra cosa. Es una posición extraña para un modelo, teniendo en cuenta que Coqui AI, la empresa que lo creó, cerró por completo a principios de 2024. Aun así, XTTS-v2 es el modelo que consiguió afianzar esa reputación: un sistema multilingüe de clonación de voz zero-shot tan bueno que la desaparición de su propio creador apenas afectó a su relevancia.

¿Qué es XTTS-v2?

XTTS-v2 es un modelo open source multilingüe de texto a voz y clonación de voz desarrollado por Coqui AI y publicado en 2023 como una mejora de la arquitectura XTTS original. Clona la voz de un hablante a partir de tan solo 6 segundos de audio de referencia en 17 idiomas: árabe, portugués de Brasil, chino mandarín, checo, neerlandés, inglés, francés, alemán, italiano, polaco, ruso, español, turco, japonés, coreano, húngaro e hindi.

En cuanto a su arquitectura, XTTS-v2 se basa en GPT y no en difusión, una diferencia importante respecto a los modelos más recientes de flow matching en este ámbito. Primero, un VQ-VAE convierte el audio real en códigos acústicos discretos que sirven como objetivos de entrenamiento. Después, un modelo de lenguaje al estilo GPT-2 predice esos tokens de audio condicionado por el texto de entrada y una representación latente del hablante. Esta representación la calcula un codificador basado en Perceiver que procesa el espectrograma mel de referencia hasta convertirlo en un vector compacto que captura la identidad del hablante. Por último, un vocoder HiFi-GAN convierte la secuencia de tokens en una forma de onda de audio de 24kHz.

Qué mejoró respecto al XTTS original

Los cambios de la versión 2 se concentran precisamente en los aspectos que hacen que la clonación sea fiable en la práctica, en lugar de limitarse a parecer viable en una demostración: mejor condicionamiento del hablante, compatibilidad con varios clips de referencia e interpolación entre hablantes, mejoras generales de la prosodia y la calidad del audio, y una estabilidad de inferencia considerablemente superior a la de la versión original. También conserva la clonación entre idiomas de la versión original —grabar un clip de referencia en un idioma y generar habla natural en otro, manteniendo la identidad vocal del hablante—, además de una transferencia de emoción y estilo que se produce automáticamente mediante el codificador de referencia, en vez de depender de controles separados ajustados a mano.

Pruebas independientes han registrado puntuaciones de similitud del hablante (SECS) de alrededor de 0,59 en condiciones puramente zero-shot, que aumentan hasta aproximadamente 0,72 con unos diez minutos de datos adicionales para fine-tuning. Es una referencia útil para decidir si la clonación zero-shot será suficiente para tu proyecto o si merece la pena dar el paso adicional de ajustar el modelo con una voz concreta.

El cierre de Coqui y lo que realmente significa para ti

Conviene entenderlo bien antes de crear nada basado en XTTS-v2. Coqui AI, la startup berlinesa fundada por antiguos ingenieros de Mozilla DeepSpeech, cerró en enero de 2024 y puso fin por completo a sus productos alojados Coqui Studio y Coqui API. La empresa cesó su actividad sin ser adquirida, y su repositorio original de GitHub ya no recibe desarrollo oficial por parte del equipo fundador.

En la práctica, esto cambia menos de lo que cabría esperar. El código y los pesos del modelo siguen siendo totalmente públicos y descargables, y un fork activo de la comunidad (idiap/coqui-ai-TTS) ha mantenido el proyecto compatible con las versiones actuales de Python y PyTorch, corrigiendo problemas que los responsables originales no llegaron a resolver. Si instalas el paquete TTS original y encuentras fallos en una versión moderna de Python, instalar en su lugar el paquete del fork comunitario soluciona la mayoría. La desventaja práctica es que ya no existe un canal de soporte oficial, y lo único que sí cambió de forma significativa es la licencia: Coqui vendía antes una licencia comercial para los pesos no comerciales de XTTS-v2 y, como la empresa ya no existe, esa opción de licencia comercial de pago ha desaparecido en la práctica.

Primeros pasos con XTTS-v2

  1. Instala el paquete mantenido por la comunidad si utilizas una versión reciente de Python. pip install coqui-tts (el fork con mantenimiento activo) suele ser más fiable que el paquete original pip install TTS en Python 3.10–3.12 con versiones recientes de PyTorch.
  2. Carga el modelo mediante la misma API en ambos casos. from TTS.api import TTS seguido de TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True) funciona exactamente igual con independencia del paquete que hayas instalado.
  3. Ten en cuenta la restricción de seguridad de PyTorch 2.6. Las versiones más recientes de PyTorch bloquean la clase personalizada XttsConfig de XTTS-v2 con la configuración predeterminada weights_only=True; tendrás que permitirla explícitamente mediante torch.serialization.add_safe_globals antes de cargar el modelo o la generación fallará durante la carga.
  4. Genera un clip clonado. tts.tts_to_file(text="your text", speaker_wav="reference.wav", language="en", file_path="output.wav") cubre en unas pocas líneas el flujo básico de clonación zero-shot.
  5. Comprueba la VRAM antes de desplegarlo. La inferencia básica necesita un mínimo aproximado de 3GB de VRAM de GPU; para una generación estable y más rápida que el tiempo real en producción, disponer de 8GB o más evita problemas de memoria durante las síntesis más largas.
  6. Haz fine-tuning si la calidad zero-shot no es suficiente. Los forks de la comunidad mantienen los scripts de entrenamiento necesarios para el fine-tuning, ya que el equipo original de Coqui ha dejado de mantenerlos oficialmente. Prepárate para un proceso de configuración más manual que el de un producto comercial con soporte completo.

Consejos para obtener mejores resultados

  • Utiliza un clip de referencia limpio, bien grabado y de 6 segundos o más. La calidad de la clonación depende directamente de las condiciones de grabación: el ruido de fondo o la distorsión del audio de referencia reducen la fidelidad de forma notablemente mayor que con algunas arquitecturas más recientes.
  • Prueba varios clips de referencia para lograr una identidad más estable. La compatibilidad de XTTS-v2 con varias referencias de hablante y la interpolación entre ellas puede generar una voz más uniforme que un único clip corto, especialmente en voces difíciles de capturar con claridad en una sola grabación.
  • Ajusta las expectativas de calidad entre idiomas a cada voz. La similitud del hablante puede ser menor en voces con menos representación en los datos de entrenamiento que en perfiles de voz habituales. Prueba tu voz objetivo y el par de idiomas concretos antes de comprometerte con una canalización de producción.
  • Confirma la vía de licencia comercial antes de lanzar un producto de pago. Como la licencia comercial original de Coqui ya no está a la venta, revisa detenidamente las condiciones actuales de la Coqui Public Model License o considera un modelo con una licencia más permisiva, como Apache 2.0 o MIT, si tu objetivo es el despliegue comercial.
  • Da preferencia al fork comunitario para cualquier uso que vaya más allá de una prueba informal. Dado el menor mantenimiento del repositorio original, el fork que recibe correcciones activamente es una base más fiable para un proyecto que deba perdurar.

XTTS-v2 frente a otros modelos de clonación zero-shot

XTTS-v2F5-TTSChatterbox Multilingual
ArquitecturaAutorregresiva al estilo GPT-2 + VQ-VAEDiffusion Transformer + flow matchingBasada en difusión
Duración del clip de referencia~6 segundos~5–15 segundos~5–10 segundos
Idiomas17Centrado principalmente en inglés23
Varios clips de referencia / interpolaciónSíNo es una función principalNo es una función principal
Mantenimiento oficial activoNo (solo fork comunitario)SíSí
Licencia de los pesosCoqui Public Model License (no comercial)CC-BY-NCMIT

La vigencia de XTTS-v2 se debe a que fue una respuesta temprana y realmente sólida a la clonación multilingüe zero-shot en una época con pocas alternativas abiertas. Su arquitectura y cobertura lingüística han resistido lo bastante bien como para que siga siendo un punto de comparación habitual incluso años después de la desaparición de su propio creador.

Preguntas frecuentes

¿Coqui AI sigue desarrollando XTTS-v2?

No. Coqui AI cerró como empresa en enero de 2024. El código y los pesos del modelo siguen siendo públicos, y un fork comunitario con mantenimiento activo mantiene el proyecto operativo con software actual, pero ya no existe soporte ni desarrollo oficial de Coqui.

¿Puedo seguir utilizando XTTS-v2 con fines comerciales?

Requiere cautela. El código de la biblioteca TTS subyacente utiliza la Mozilla Public License 2.0, compatible con usos comerciales, pero los pesos del modelo XTTS-v2 se publican bajo la Coqui Public Model License, que es no comercial. Coqui vendía antes una licencia comercial independiente para los pesos, pero como la empresa ya no existe, esa opción de pago ya no está disponible. Revisa directamente las condiciones vigentes de la licencia antes de cualquier uso comercial.

¿Cuánto audio de referencia necesita XTTS-v2 para clonar una voz?

Tan solo 6 segundos, aunque las pruebas independientes muestran que la similitud del hablante mejora aún más con datos adicionales para fine-tuning, como unos diez minutos de audio de una voz concreta.

¿Por qué falla a veces la instalación en versiones recientes de Python o PyTorch?

El paquete TTS original puede tener problemas de compatibilidad en entornos recientes; instalar el fork coqui-tts mantenido por la comunidad resuelve la mayoría. Además, PyTorch 2.6+ requiere una llamada explícita a torch.serialization.add_safe_globals para cargar la clase de configuración personalizada de XTTS-v2.

¿Cómo se compara XTTS-v2 con modelos más recientes como F5-TTS o CosyVoice3?

XTTS-v2 todavía ofrece una cobertura multilingüe competitiva y una calidad de clonación fiable, pero carece de desarrollo oficial continuo, y varios modelos más recientes ofrecen una latencia menor o licencias más permisivas. Sigue siendo una opción sólida por su amplia compatibilidad lingüística y su estabilidad probada por la comunidad, más que por ofrecer una velocidad de última generación.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →