EchoraEchora
Volver a los modelos

YourTTS: dos tareas distintas, un solo modelo

8 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Generar voz nueva con una voz nunca vista y convertir una grabación existente a la voz de otro hablante parecen problemas relacionados, pero la mayoría de los sistemas TTS están diseñados para hacer solo una de esas cosas. YourTTS, desarrollado por investigadores de Coqui, se creó para hacer ambas con el mismo modelo subyacente —texto a voz multihablante zero-shot y conversión de voz zero-shot— y, al hacerlo, se convirtió en el primer enfoque publicado que llevó un método verdaderamente multilingüe al TTS multihablante zero-shot.

¿Qué es YourTTS?

YourTTS es un modelo de investigación desarrollado por Edresson Casanova y sus colegas de Coqui, construido sobre la arquitectura VITS: un modelo de extremo a extremo que combina un autoencoder variacional, entrenamiento adversarial y flujos normalizantes para pasar directamente del texto a una forma de onda, sin etapas acústicas y de vocodificador separadas. YourTTS incorpora varias modificaciones específicas a esa base VITS, ajustadas expresamente para la generación zero-shot, multilingüe y multihablante.

Basado en VITS, con modificaciones reales

Dos decisiones de diseño destacan como verdaderas desviaciones de los trabajos anteriores, no como simples ajustes graduales. En primer lugar, YourTTS utiliza texto sin procesar como entrada en vez de fonemas. Los sistemas anteriores solían depender de la fonemización, que funciona bien en idiomas con herramientas maduras y de alta calidad para convertir grafemas en fonemas, pero ofrece resultados desiguales en los que carecen de ellas. Trabajar directamente con texto sin procesar evita esa dependencia, algo especialmente importante para extender el enfoque a idiomas con pocos recursos. En segundo lugar, un codificador de hablante específico extrae de cada intervención de entrenamiento un embedding de hablante para condicionar el modelo. Se entrena junto con una Speaker Consistency Loss que compara, mediante distancia coseno, los embeddings extraídos del audio generado con el embedding del hablante original. Así, se optimiza directamente que el modelo suene realmente como el hablante objetivo, no solo que produzca voz inteligible.

Dos capacidades distintas

El TTS multihablante zero-shot genera voz nueva con una voz en la que el modelo nunca se ha entrenado, usando solo un embedding de referencia calculado a partir de una muestra breve. La conversión de voz zero-shot es una tarea relacionada, pero realmente diferente: dada una grabación de audio existente, la transforma en la voz de un hablante objetivo mientras conserva el contenido original; se convierte lo que ya se dijo, no se genera texto nuevo. YourTTS obtuvo resultados de vanguardia en la primera tarea y resultados comparables al estado del arte en la segunda, ambos medidos en el benchmark VCTK. Eso lo convierte en un sistema verdaderamente polivalente, no en un modelo TTS al que se le añadió una función de conversión de voz.

Una aportación real a los idiomas con pocos recursos

YourTTS demostró algo especialmente útil más allá de sus cifras principales en benchmarks: resultados zero-shot prometedores en un idioma objetivo usando durante el entrenamiento datos de un solo hablante de ese idioma. La configuración de entrenamiento publicada lo refleja directamente: se usaron más de 1.000 hablantes de inglés, pero solo 5 de francés y uno de portugués, junto con un equilibrador de lotes por idioma que asignaba deliberadamente una mayor proporción de lotes de entrenamiento a los idiomas infrarrepresentados para compensarlo. Que de un conjunto de datos tan desequilibrado pudiera surgir un sistema multilingüe y multihablante utilizable constituye la prueba concreta que ofrece el modelo de que este enfoque podría llevar el TTS zero-shot y la conversión de voz a idiomas que no cuentan con conjuntos de datos tan amplios y diversos en hablantes como el inglés.

Ajuste fino para voces difíciles

Para hablantes cuya voz o cuyas características de grabación difieren notablemente de todo lo incluido en los datos de entrenamiento, YourTTS admite ajuste fino con menos de un minuto de voz adicional. Según lo publicado, incluso en estos casos más difíciles alcanza resultados de vanguardia en similitud de voz. Esto resulta importante en la práctica para material de origen con un acento poco habitual, grabado en condiciones inusuales o, en general, mal representado por la capacidad zero-shot del modelo base.

Primeros pasos con YourTTS

La vía más directa es la interfaz de línea de comandos de la biblioteca Coqui TTS, donde se especifican el modelo YourTTS, un archivo de referencia del hablante objetivo, un archivo de referencia de contenido opcional para la conversión de voz y un código de idioma; la biblioteca se encarga después de cargar el modelo y ejecutar la inferencia. Dado que los enlaces del repositorio de investigación original están rotos, obtener el modelo mediante Coqui TTS —o sus forks comunitarios con mantenimiento activo— en lugar de la página de GitHub del artículo original es hoy la opción más fiable para conseguir un checkpoint funcional.

Consejos para obtener mejores resultados

  • Ten claro qué tarea estás realizando. El TTS zero-shot (texto nuevo, voz nueva) y la conversión de voz (audio existente, voz nueva) usan YourTTS de formas distintas. Decide cuál necesita tu proyecto antes de configurar el pipeline, porque confundir ambos flujos de trabajo es una causa habitual de problemas.
  • Aplica ajuste fino cuando la voz objetivo sea poco habitual. Si el hablante de origen tiene un acento o unas características de grabación distintivos y poco representados en los datos de entrenamiento habituales, reserva tiempo para el paso documentado de ajuste fino con menos de un minuto, en vez de esperar que el modo zero-shot lo resuelva por sí solo.
  • Utiliza el fork de Coqui TTS mantenido por la comunidad, no el repositorio original. Tras el cierre de Coqui en 2024, los enlaces de la página original de Edresson en GitHub dejaron de funcionar; el fork de la biblioteca con mantenimiento activo es la fuente más fiable para obtener un modelo funcional.
  • Respeta el consentimiento al clonar o convertir la voz de una persona real. Dado que investigaciones documentadas muestran que la capacidad de clonación de YourTTS puede usarse para suplantar sistemas de autenticación por voz, cualquier implementación real que implique la voz de una persona concreta debe exigir su permiso explícito.

YourTTS frente a modelos relacionados de Coqui y transferencia de voz

YourTTSXTTS-v2VoiceCraft
TTS multihablante zero-shotSí, estado del arte en su lanzamientoSíSí
Conversión de voz zero-shotSí, comparable al estado del arte en su lanzamientoNo es su objetivo principalNo (se centra en la edición)
Arquitectura baseVITS + codificador de hablante + Speaker Consistency LossAutorregresivo al estilo GPT-2 + VQ-VAEAutorregresivo con enmascaramiento causal + apilamiento retardado
Enfoque multilingüeEl primero de su clase en este campo de investigación17 idiomasCentrado en el inglés
Entrada de textoTexto sin procesar (sin dependencia de fonemizador)Procesamiento de texto estándarProcesamiento de texto estándar
Mantenimiento actualMediante forks comunitarios de Coqui TTSMediante forks comunitarios de Coqui TTSMantenimiento activo por los autores originales

El lugar específico de YourTTS en esta evolución es el de una investigación anterior de Coqui que estableció el TTS multilingüe, multihablante y zero-shot como un enfoque viable. Los modelos XTTS posteriores ampliaron ese trabajo, mientras que YourTTS sigue distinguiéndose por tratar la conversión de voz como una capacidad de primer nivel y no como algo añadido a posteriori.

Preguntas frecuentes

¿Qué diferencia hay entre el modo TTS y el modo de conversión de voz de YourTTS?

El modo TTS genera voz nueva a partir de texto con una voz objetivo; la conversión de voz toma una grabación de audio existente y la transforma en la voz de un hablante objetivo mientras conserva el contenido hablado original. Son dos tareas relacionadas, pero distintas, gestionadas por el mismo modelo.

¿Todavía se puede utilizar YourTTS?

Sí, principalmente mediante la biblioteca Coqui TTS y sus forks comunitarios con mantenimiento activo. Los enlaces de descarga del modelo en el repositorio de investigación original están rotos tras el cierre de Coqui AI en 2024 y el borrado de su servidor de alojamiento original.

¿Cuántos datos necesita YourTTS para clonar una voz?

La clonación zero-shot funciona con una muestra de referencia breve y no requiere ajuste fino. Para voces que difieren notablemente de los datos de entrenamiento, está documentado que el ajuste fino con menos de un minuto de voz adicional consigue una similitud claramente mayor.

¿Quién desarrolló YourTTS?

YourTTS fue desarrollado por Edresson Casanova y colaboradores de Coqui, y se publicó en ICML 2022.

¿YourTTS se puede usar gratis?

Está disponible a través de la biblioteca Coqui TTS de código abierto. Comprueba las condiciones de licencia vigentes del paquete o fork concreto que utilices, ya que los detalles de licencia pueden variar entre los forks mantenidos por la comunidad que surgieron tras el cierre de Coqui AI.

Dale una voz nueva a una grabación

Para cambiar la voz de una grabación sin perder el contenido hablado ni la interpretación, utiliza el Cambiador de voz de Echora. Sube una grabación, elige una voz de destino integrada o una muestra de referencia autorizada y genera el audio transformado en el navegador.

Transformar una grabación →