EchoraEchora
Volver a los modelos

StyleTTS 2: cuando los oyentes consideraron la voz sintética más natural que la real

31 de agosto de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Afirmar que un modelo TTS suena «casi humano» es ya tan habitual que se ha convertido en ruido de fondo. StyleTTS 2, creado por el mismo equipo de la Universidad de Columbia responsable del StyleTTS original, formuló una afirmación más concreta y comprobable: en una evaluación auditiva con el conjunto de datos LJSpeech de un solo hablante, hablantes nativos de inglés calificaron su salida sintetizada como más natural que las grabaciones humanas reales con las que se había entrenado. En el conjunto VCTK de múltiples hablantes, igualó las grabaciones humanas en lugar de superarlas, un resultado más modesto pero aun así destacable en una tarea más difícil y variada.

Qué cambió respecto al StyleTTS original

StyleTTS 2 conserva la idea central de su predecesor —el estilo como componente explícitamente separado y controlable de la generación—, pero cambia la forma de obtener ese estilo y reconstruye el proceso de entrenamiento en torno a una nueva fuente de retroalimentación.

Estilo muestreado mediante difusión, no extraído de un clip de referencia. El StyleTTS original necesitaba un espectrograma mel de referencia para que su codificador de estilo extrajera un vector de estilo. StyleTTS 2 modela en cambio el estilo como una variable aleatoria latente generada mediante difusión, lo que permite producir un estilo apropiado y natural para cualquier texto sin necesidad de voz de referencia. Este es el mayor cambio práctico entre ambas versiones: StyleTTS 2 no exige tener a mano una muestra de voz para generar resultados expresivos y variados.

Grandes modelos de lenguaje de voz como discriminadores. En lugar de entrenarse únicamente con un discriminador convencional, StyleTTS 2 incorpora grandes modelos de lenguaje de voz preentrenados —entre ellos WavLM— para juzgar hasta qué punto la voz generada resulta convincentemente humana, junto con un nuevo método diferenciable de modelado de duración que permite entrenar todo el sistema de extremo a extremo y no en fases separadas.

Las cifras de ablación: qué fue lo que realmente importó

La investigación de StyleTTS 2 no se limitó a afirmar que estas decisiones de diseño eran útiles, sino que midió la aportación individual de cada una mediante pruebas de puntuación de opinión media comparativa (CMOS): se eliminó un componente cada vez y se volvió a medir la naturalidad percibida.

  • Eliminar la difusión de estilo —y utilizar en su lugar vectores de estilo de referencia aleatorios— produjo la mayor caída de calidad entre los componentes probados, la señal más clara de cuánto contribuye realmente la difusión de estilo dependiente del texto a un resultado de nivel humano.
  • Eliminar el aumentador diferenciable de duración y retirar el discriminador basado en WavLM provocaron por separado caídas sustanciales de calidad, lo que confirma que ambos elementos arquitectónicos nuevos —no solo uno— realizaban una aportación real.
  • Eliminar por completo el codificador de estilo prosódico también perjudicó de forma medible la naturalidad, reforzando la idea de que el concepto subyacente de vector de estilo del StyleTTS original seguía siendo una contribución auténtica y no algo que el nuevo enfoque de difusión hubiera sustituido sin más.
  • Excluir específicamente el texto fuera de distribución del entrenamiento adversario redujo la robustez del modelo ante entradas desconocidas, el efecto más pequeño de los componentes probados, pero aun así significativo.

Adaptación zero-shot de hablantes

Cuando se entrenó con LibriTTS, StyleTTS 2 superó a los modelos abiertos disponibles hasta entonces específicamente en adaptación zero-shot de hablantes: generaba voz convincente para una voz que el modelo nunca había encontrado antes a partir de un breve clip de referencia. En combinación con el muestreo de estilo basado en difusión, esto ofrece a StyleTTS 2 dos formas independientes de introducir variación: estilos de habla nuevos incluso sin audio de referencia e identidad de hablante clonada cuando se dispone de un clip de referencia.

Lo que conviene saber antes de empezar

Algunos detalles prácticos determinan cómo es realmente ejecutar StyleTTS 2:

La inferencia con calidad completa depende de un componente con licencia GPL. El repositorio principal no lo incluye directamente debido a la licencia; un fork comunitario con licencia GPL ofrece un script de inferencia importable —incluida una API experimental de streaming—, mientras que existe otro paquete completamente cubierto por la licencia MIT que utiliza en su lugar el fonemizador gruut. Sin embargo, esta sustitución reduce algo la calidad del resultado debido a una falta de correspondencia entre el fonemizador y gruut.

Las GPU antiguas pueden introducir artefactos audibles. Un problema conocido produce ruido agudo de fondo en tarjetas gráficas antiguas a causa de diferencias en la precisión de coma flotante; la solución documentada consiste en utilizar una GPU más moderna o recurrir a la inferencia por CPU.

La síntesis en otros idiomas necesita un modelo PL-BERT correspondiente. StyleTTS 2 se puede entrenar en otras lenguas, pero requiere un modelo PL-BERT preentrenado específico para cada idioma; para ello existe un PL-BERT multilingüe entrenado por la comunidad que cubre 14 idiomas.

La clonación de voz implica aquí una expectativa de consentimiento. Si utilizas los modelos preentrenados con un hablante de referencia que no pertenece a los conjuntos originales de entrenamiento de acceso abierto, las condiciones de uso del proyecto exigen que tengas permiso de esa persona o que indiques claramente que el audio resultante es sintético antes de hacerlo público.

Primeros pasos con StyleTTS 2

  1. Clona el repositorio. Ejecuta git clone sobre el proyecto oficial yl4579/StyleTTS2 y elige entre la vía de inferencia con licencia MIT y el fork con licencia GPL según tus necesidades de calidad y tus restricciones de licencia.
  2. Descarga el checkpoint preentrenado de LibriTTS. Está disponible en Hugging Face y es el punto de partida recomendado tanto para la adaptación zero-shot de hablantes como para la generación de propósito general.
  3. Configura los parámetros de muestreo por difusión. La inferencia expone parámetros como alpha, beta, diffusion_steps y embedding_scale. Como el muestreador es ancestral, un mayor número de pasos de difusión produce muestras más diversas a costa de una generación más lenta; ajústalo según importe más la variedad o la velocidad en tu caso de uso.
  4. Utiliza primero el notebook de demostración incluido para escuchar el modelo en funcionamiento. Los notebooks de inferencia del repositorio reproducen las muestras de demostración publicadas por el propio modelo y calculan directamente el factor de tiempo real, lo que proporciona una referencia concreta de velocidad en tu propio hardware.
  5. Ajusta la generación de tu GPU a la calidad de salida esperada. Si aparecen artefactos agudos inesperados, comprueba si utilizas una GPU antigua antes de asumir que se trata de un error de configuración.
  6. Configura primero PL-BERT si necesitas resultados en otros idiomas. Antes de empezar el entrenamiento, confirma que existe un modelo PL-BERT preentrenado para el idioma objetivo —o utiliza el PL-BERT multilingüe de la comunidad—, en vez de descubrir el requisito a mitad del proceso.

Consejos para obtener mejores resultados

  • Aumenta los pasos de difusión para ganar variedad, no solo calidad. Más pasos aportan más diversidad entre generaciones del mismo texto, algo útil cuando quieres varias interpretaciones distintas, pero no es un control que debas llevar al máximo por defecto si la velocidad importa.
  • Utiliza el fork con licencia GPL si la calidad del resultado es prioritaria y la licencia lo permite. La vía exclusivamente MIT existe específicamente para ofrecer flexibilidad de licencia y reconoce una contrapartida en calidad; elige de forma consciente según qué restricción sea más importante para tu proyecto.
  • Prueba la clonación zero-shot con tu voz objetivo concreta antes de comprometerte. Los resultados publicados describen una adaptación zero-shot sólida específicamente en el benchmark LibriTTS; valida la calidad con tu propio hablante de referencia en lugar de dar por hecho que será uniforme en todas las voces.
  • Interpreta la afirmación de que «supera las grabaciones humanas» en su contexto real. Refleja una evaluación auditiva específica con el conjunto LJSpeech de un solo hablante; en el conjunto VCTK de múltiples hablantes, el resultado igualó las grabaciones humanas, no las superó, algo más habitual —y aun así impresionante— en una tarea multihablante más difícil.
  • Respeta las expectativas de divulgación y consentimiento para voces clonadas. No se trata solo de un trámite legal: tomárselo en serio forma parte de un uso responsable de la tecnología, especialmente por lo convincente que puede resultar el audio.

StyleTTS 2 frente a StyleTTS y otros modelos de clonación

StyleTTS 2StyleTTS (original)XTTS-v2
Fuente del estiloMuestreado por difusión, sin referencia necesariaExtraído del audio de referencia mediante un codificador de estiloVariable latente de hablante basada en un clip de referencia
DiscriminadorGrandes modelos de lenguaje de voz (p. ej., WavLM)Discriminador adversario estándarN/A (arquitectura diferente)
Adaptación zero-shot de hablantesMejorada respecto al predecesorCompatibleCompatible, 17 idiomas
Naturalidad declaradaSupera grabaciones humanas en LJSpeech e iguala en VCTKSólida, anterior a esta afirmaciónSólida, sin comparación directa con grabaciones humanas
Método de entrenamientoDe extremo a extremo, modelado diferenciable de duraciónModular, adversarioAutorregresivo al estilo GPT
MultilingüeMediante modelos PL-BERT comunitariosCentrado en inglés17 idiomas de forma nativa

El avance central de StyleTTS 2 consiste en eliminar la dependencia del audio de referencia para crear un estilo expresivo y, al mismo tiempo, llevar la naturalidad lo bastante lejos como para igualar o superar las grabaciones humanas en al menos un benchmark estándar. Es una afirmación verdaderamente infrecuente, concreta y comprobable de manera independiente en un campo donde «casi humano» suele quedar en algo impreciso.

Preguntas frecuentes

¿StyleTTS 2 suena realmente mejor que las grabaciones humanas?

En una evaluación específica, hablantes nativos de inglés calificaron la salida de StyleTTS 2 como más natural que las grabaciones humanas reales en el conjunto LJSpeech de un solo hablante. En el conjunto VCTK, más difícil y con múltiples hablantes, las igualó en lugar de superarlas. Ambos resultados son destacables, pero conviene recordar el contexto concreto de la evaluación y no tratarlo como una afirmación universal.

¿Necesito un clip de audio de referencia para usar StyleTTS 2?

No para generar voz expresiva y natural en general: el estilo se puede muestrear mediante difusión sin audio de referencia. Un clip de referencia sigue siendo útil específicamente para la clonación zero-shot de la voz de un hablante concreto.

¿Por qué menciona el repositorio un problema de licencia GPL?

La inferencia con calidad completa depende de un componente con licencia GPL, por lo que no se incluye directamente en el repositorio principal de estilo MIT. Puedes utilizar un fork comunitario con licencia GPL para obtener la calidad completa o una alternativa enteramente cubierta por la licencia MIT que usa el fonemizador gruut, con una contrapartida moderada en calidad.

¿Puede StyleTTS 2 generar voz en idiomas distintos del inglés?

Sí, con un modelo PL-BERT preentrenado para el idioma objetivo. Un PL-BERT multilingüe entrenado por la comunidad ya cubre 14 idiomas, y para los demás puedes entrenar el tuyo propio.

¿Qué provoca el ruido agudo del que informan algunos usuarios?

Es un artefacto conocido vinculado a diferencias de precisión de coma flotante en GPU antiguas; utilizar una GPU más moderna o cambiar a inferencia por CPU lo resuelve.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →