EchoraEchora
Volver a los modelos

StyleTTS: tratar «cómo se dice algo» como una variable independiente y controlable

31 de agosto de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de los modelos de TTS agrupan dos preguntas muy distintas en una sola: qué se dice y cómo se expresa. StyleTTS, desarrollado en la Universidad de Columbia, las separa de forma deliberada. Toma prestada una técnica de la generación de imágenes —el mismo recurso de transferencia de estilo que permitió a las redes neuronales aplicar la textura de una imagen al contenido de otra— y la lleva al habla, tratando la prosodia, el ritmo y la forma de expresión como un «estilo» independiente y controlable, en lugar de algo integrado implícitamente en la identidad del hablante.

¿Qué es StyleTTS?

StyleTTS es un modelo de texto a voz no autorregresivo, lo que significa que genera un enunciado completo en paralelo en vez de hacerlo token a token; una elección estructural que lo hace considerablemente más rápido durante la inferencia que las alternativas autorregresivas. Su arquitectura se compone de ocho módulos distintos que trabajan juntos: un codificador de texto, un codificador de estilo, un discriminador, un alineador de texto, un extractor de tono, un decodificador de voz, un predictor de duración y un predictor de prosodia. Es un diseño más modular que el de muchos modelos integrales más recientes, y esa modularidad es deliberada: permite manipular el estilo como un componente independiente, en vez de dejarlo como un subproducto entrelazado con todo lo demás.

El vector de estilo: qué hace que esté realmente «basado en estilo»

Esta es la parte que merece la pena entender, porque constituye la razón de ser del nombre del modelo. El codificador de estilo de StyleTTS recibe un mel-espectrograma de referencia y extrae de él un vector de estilo, algo que funciona de forma parecida a un embedding de hablante, pero que capta más que simplemente «quién habla». Capta cómo habla esa persona: el ritmo, el énfasis, el matiz emocional y la textura acústica de su forma de expresarse.

Ese vector de estilo se inyecta después en el decodificador de voz mediante normalización de instancia adaptativa (Adaptive Instance Normalization, AdaIN), la misma técnica de normalización que emplean los modelos de transferencia neuronal de estilo para aplicar el estilo visual de una imagen al contenido de otra. Aquí hace algo análogo con el audio: la salida del decodificador se vuelve a normalizar repetidamente con respecto al vector de estilo en distintos puntos de la red, lo que permite que un único estilo de referencia influya en todo el enunciado generado, en lugar de reducirse a una entrada condicionante estática al principio.

Entrenamiento adversarial para lograr naturalidad

Además de su diseño basado en estilo, StyleTTS se entrena con un discriminador —la misma idea central de las redes generativas adversariales— que empuja al decodificador a producir una salida difícil de distinguir de grabaciones humanas reales, en lugar de optimizarla únicamente frente a una pérdida de reconstrucción. En combinación con predictores específicos de duración y prosodia que gestionan explícitamente la temporización y el contorno tonal, este conjunto es lo que aporta a la salida de StyleTTS su ritmo natural, en vez de la cadencia más plana y mecánica que pueden producir los modelos no autorregresivos más sencillos.

Transferencia de estilo y de hablante zero-shot

StyleTTS admite la adaptación zero-shot a hablantes no vistos, algo demostrado con hablantes de prueba reservados del corpus LibriTTS que no formaron parte del entrenamiento: basta con proporcionar un clip de referencia de un hablante nuevo para que el codificador de estilo extraiga de él un vector de estilo utilizable, sin ningún ajuste adicional. Como el estilo y el contenido están separados en la arquitectura, esto también abre la puerta a combinaciones más inusuales que las que ofrecen los modelos de clonación habituales: aplicar la forma de expresarse de un hablante a la identidad vocal de otro, en lugar de tratar la «voz» como una única propiedad indivisible.

Primeros pasos con StyleTTS

  1. Clona el repositorio. Haz git clone del proyecto oficial yl4579/StyleTTS desde GitHub para obtener el código y el notebook de inferencia.
  2. Instala phonemizer. El proceso de inferencia de StyleTTS depende de esta herramienta para convertir el texto en fonemas antes de la síntesis; instálala antes de intentar ejecutar el notebook incluido.
  3. Descarga los checkpoints preentrenados para tu caso de uso. Hay disponible un modelo entrenado con el corpus LJSpeech de un solo hablante para narraciones coherentes con una sola voz, y otro checkpoint entrenado con LibriTTS admite generación multihablante y zero-shot.
  4. Obtén el checkpoint correspondiente del vocoder HiFi-GAN. La salida de mel-espectrograma de StyleTTS debe combinarse con el modelo HiFi-GAN entrenado de forma correspondiente para producir la onda final; si los checkpoints del vocoder y del modelo acústico no coinciden, la calidad de salida empeorará.
  5. Usa inference.ipynb para hacer tu primera generación. El notebook incluido explica cómo cargar los modelos preentrenados y generar a partir de texto, y es la forma más rápida de escuchar por ti mismo el efecto de la transferencia de estilo antes de crear un proceso personalizado.
  6. Descarga la partición test-clean de LibriTTS si quieres probar la demo zero-shot. Se necesita específicamente para probar la generación con hablantes de referencia que el modelo nunca vio durante el entrenamiento.

Consejos para obtener mejores resultados

  • Elige el clip de referencia por el estilo, no solo por la identidad del hablante. Como el codificador de estilo capta tanto las características de la forma de expresarse como la identidad vocal, un clip de referencia con una prosodia clara y bien grabada se transferirá de manera más convincente que uno técnicamente limpio pero plano y monótono.
  • Ajusta el checkpoint a las necesidades de hablantes de tu proyecto. El modelo entrenado con LJSpeech es la opción adecuada para una narración coherente con una sola voz; recurre al checkpoint de LibriTTS específicamente cuando necesites capacidad multihablante o zero-shot.
  • Mantén el alineador de texto y el extractor de tono en consonancia con tus datos de entrenamiento. Si piensas ajustar o volver a entrenar el modelo con audio personalizado, el alineador y el extractor de tono preentrenados del proyecto se entrenaron con un preprocesamiento de mel-espectrogramas específico; apartarse de él exige volver a entrenar también esos componentes, no solo el modelo principal.
  • Informa adecuadamente de que se trata de voz sintética. Como ocurre con la mayoría de los modelos de voz publicados con fines de investigación, usar la semejanza de alguien o una voz creada a partir de grabaciones reales conlleva la responsabilidad de contar con el consentimiento del hablante de origen o dejar claro que la salida es sintética; aquí esto importa aún más por lo directamente reconocible que el «estilo» puede hacer que parezca una interpretación clonada.
  • Considera StyleTTS 2 si no tienes a mano un clip de referencia. El StyleTTS original necesita una muestra de audio de referencia para extraer su vector de estilo; su sucesor, StyleTTS 2, modificó más adelante este mecanismo para que el estilo pudiera muestrearse mediante difusión sin necesidad de voz de referencia, algo que conviene saber si tu flujo de trabajo no siempre dispone de un clip de referencia limpio.

StyleTTS frente a otros enfoques no autorregresivos y de clonación

StyleTTSTTS típica con embedding de hablanteModelos de clonación autorregresivos
Modo de generaciónNo autorregresivo (paralelo)VaríaAutorregresivo (secuencial)
Control del estiloExplícito, mediante un vector de estilo inyectado con AdaINImplícito, entrelazado con el embedding de hablanteImplícito, ligado al audio de referencia
Velocidad de inferenciaRápida (generación en paralelo)VaríaGeneralmente más lenta
Adaptación zero-shot de hablantesSíLimitada, depende de la arquitecturaSí, un objetivo de diseño habitual
Método de entrenamientoAdversarial (basado en discriminador)VaríaVaría
Modularidad de la arquitecturaAlta (8 módulos distintos)MenorSuele ser más integral

La contribución específica de StyleTTS es demostrar que el estilo del habla merece tratarse como una variable controlable independiente, en vez de como algo inseparable de la identidad del hablante; una distinción sobre la que después se apoyaron directamente modelos más orientados a la difusión, incluido su propio sucesor.

Preguntas frecuentes

¿Qué significa exactamente «estilo» en StyleTTS?

Se refiere a características de la forma de expresarse —prosodia, ritmo, énfasis y matiz emocional— extraídas de un clip de audio de referencia para formar un vector de estilo, distinto de la identidad vocal del hablante de referencia, aunque relacionado con ella.

¿StyleTTS es autorregresivo como los modelos de clonación basados en GPT?

No. StyleTTS es no autorregresivo y genera un enunciado completo en paralelo en vez de hacerlo token a token, lo que por lo general lo hace más rápido durante la inferencia que las alternativas autorregresivas.

¿StyleTTS necesita un clip de audio de referencia para funcionar?

Sí, en el caso del StyleTTS original: su codificador de estilo extrae un vector de estilo de un mel-espectrograma de referencia. Su sucesor, StyleTTS 2, eliminó después este requisito al modelar el estilo como una variable muestreada mediante difusión.

¿Puede StyleTTS clonar la voz de un hablante no visto?

Sí, admite la adaptación zero-shot a hablantes no vistos durante el entrenamiento, algo demostrado mediante hablantes reservados del conjunto de prueba de LibriTTS.

¿Qué vocoder utiliza StyleTTS?

HiFi-GAN, combinado con un checkpoint correspondiente entrenado junto al modelo acústico concreto (LJSpeech o LibriTTS) que estés utilizando.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →