EchoraEchora
Volver a los modelos

Parler-TTS: describe la voz que quieres en vez de grabarla

4 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Todos los modelos de clonación piden primero lo mismo: un clip de audio de referencia. Parler-TTS, desarrollado por Hugging Face, elimina por completo ese requisito: en vez de una muestra de voz, escribes una frase que describe la voz que quieres y el modelo genera un habla que coincide con esa descripción. «Una hablante con una voz ligeramente grave, que habla rápido en una grabación clara y cercana» es aquí una especificación de voz completa, sin necesidad de micrófono.

¿Qué es Parler-TTS?

Parler-TTS es un proyecto de texto a voz de código abierto de Hugging Face, creado como reproducción de una investigación sobre la guía mediante lenguaje natural para TTS de alta fidelidad, realizada originalmente por Stability AI y la Universidad de Edimburgo. Lo que distingue al proyecto de la mayoría de las publicaciones de código abierto en este ámbito es hasta qué punto está realmente abierto: los conjuntos de datos, el pipeline de preprocesamiento, el código de entrenamiento y los pesos del modelo se publican por completo bajo una licencia permisiva, en lugar de ofrecer solo el checkpoint final. Es una publicación considerablemente más transparente que la de la mayoría de los proyectos TTS, y eso es precisamente lo que permite a la comunidad volver a entrenar, ajustar o reproducir por completo los resultados del proyecto, en vez de limitarse a ejecutar inferencias sobre una caja negra.

Cómo funciona realmente el control de voz mediante lenguaje natural

Parler-TTS recibe dos entradas de texto separadas en lugar de una: el texto que quieres que se pronuncie y una descripción en lenguaje natural de cómo debería sonar. Esa descripción puede controlar el género del hablante, el tono, la velocidad del habla y características de la grabación como el ruido de fondo o la reverberación, todo mediante frases corrientes y no con controles deslizantes numéricos ni audio de referencia. Una descripción como «un hablante pronuncia un discurso monótono a gran velocidad en una grabación ruidosa» se interpreta y se aplica directamente al resultado generado.

Hacerlo posible exigió resolver un verdadero problema de datos: los conjuntos de datos de audio no incluyen descripciones en lenguaje natural. Hugging Face creó un proyecto complementario, DataSpeech, específicamente para salvar esa brecha: etiqueta muestras de voz con características objetivas (nivel de ruido, velocidad del habla, reverberación y atributos similares) y después pasa esas etiquetas a un gran modelo de lenguaje para que genere descripciones naturales a partir de ellas. Esa descripción generada por el LLM, emparejada con el audio correspondiente, se convierte en datos de entrenamiento que enseñan a Parler-TTS a relacionar el lenguaje descriptivo con características acústicas reales.

Qué puedes controlar realmente

Los modelos base permiten controlar mediante descripciones el género, el tono, la velocidad del habla y el entorno acústico (ruido de fondo, reverberación y claridad de la grabación), atributos en gran medida universales para cualquier hablante. La expresividad emocional es una capacidad adicional basada en el ajuste: Hugging Face publicó una versión ajustada con el conjunto de datos Expresso, un corpus de voz expresiva de alta calidad con cuatro hablantes, creado específicamente para enseñar al modelo a seguir indicaciones de emoción y estilo interpretativo. Así, el mismo mecanismo de control mediante lenguaje natural se extiende hacia un terreno más expresivo que el cubierto de forma predeterminada por los modelos base.

La familia de modelos

Parler-TTS se ha publicado en varios tamaños y escalas de entrenamiento distintos, cada uno de los cuales supone un avance en datos o capacidades:

  • Parler-TTS Mini v0.1: la primera versión, entrenada con aproximadamente 10.500 horas de audio, que estableció el enfoque central de descripción mediante lenguaje natural.
  • Parler-TTS Mini v1 / v1.1: entrenada con un conjunto de datos mayor, de 45.000 horas; v1.1 mejora específicamente el tokenizador de prompts (basado en el tokenizador de Llama 2, con un vocabulario más amplio y tratamiento de byte fallback) para simplificar el futuro entrenamiento multilingüe, aunque tanto el modelo subyacente como los datos de entrenamiento son por lo demás idénticos a los de v1.
  • Parler-TTS Large v1: un modelo de 2.200 millones de parámetros, también entrenado con el conjunto de datos de 45.000 horas, que ofrece el nivel de calidad más alto de la familia a costa de una carga computacional correspondientemente mayor.

Primeros pasos con Parler-TTS

  1. Instala la biblioteca. pip install git+https://github.com/huggingface/parler-tts.git obtiene el paquete de inferencia directamente del repositorio de código fuente.
  2. Carga el modelo y el tokenizador elegidos. Usa ParlerTTSForConditionalGeneration.from_pretrained() con el checkpoint específico que quieras (Mini v0.1, Mini v1.1 o Large v1), junto con el AutoTokenizer correspondiente.
  3. Escribe dos prompts separados. Una variable contiene el texto que quieres que se pronuncie y una segunda contiene tu descripción en lenguaje natural de la voz y la forma de hablar; ambos se tokenizan por separado antes de pasarlos a la generación.
  4. Usa dos tokenizadores si trabajas con v1.1 o una versión posterior. A diferencia de las versiones anteriores, Mini v1.1 y Large v1 utilizan tokenizadores separados para la descripción y el texto hablado, respectivamente. Comprueba la versión a la que corresponde la documentación que sigues, porque mezclar el método de un solo tokenizador de v0.1 con un checkpoint más reciente causará problemas.
  5. Ajusta el modelo con tu propio conjunto de datos anotado si necesitas una capacidad concreta. El pipeline de DataSpeech está diseñado específicamente para ayudarte a generar las descripciones en lenguaje natural necesarias para ajustar Parler-TTS hacia un nuevo estilo de voz, idioma o capacidad expresiva, siguiendo el mismo método utilizado para crear la versión ajustada con Expresso.

Consejos para obtener mejores resultados

  • Sé específico en lugar de impreciso al describir la voz. «Una hablante con una voz ligeramente grave pronuncia sus palabras en una grabación muy clara, cercana y un poco rápida» proporciona al modelo mucha más información que «una voz normal», y la especificidad en cada dimensión controlable (género, tono, velocidad y calidad de grabación) tiende a producir resultados más consistentes.
  • Evita describir la nacionalidad en tus prompts. Los trabajos de ajuste de la comunidad han descubierto que incluir la nacionalidad en los datos de entrenamiento o en los prompts de inferencia puede degradar la calidad del resultado en vez de mejorar la precisión del acento. Omítela y deja que otros términos descriptivos (acento, tono y ritmo) transmitan esa información.
  • Recurre específicamente al ajuste Expresso para prompts de emoción o estilo interpretativo. Los modelos base están ajustados para atributos más universales (género, tono, velocidad y entorno); si tu proyecto necesita una interpretación emocional concreta, el checkpoint basado en Expresso está creado para eso, a diferencia del modelo base de uso general.
  • Adapta el tamaño del modelo a tus necesidades de calidad. Mini v1.1 es la opción predeterminada más práctica para la mayoría de los proyectos; elige los 2.2B parámetros de Large v1 específicamente cuando la máxima calidad importe más que la velocidad de inferencia y el uso de recursos.
  • Considera entrenar tu propio ajuste para idiomas distintos del inglés. Como los modelos base de Parler-TTS se centran principalmente en el inglés, los esfuerzos de la comunidad (un ajuste para francés es un ejemplo documentado) han demostrado que el enfoque de DataSpeech más ajuste puede extender el proyecto a otros idiomas, aunque la calidad y la cantidad de datos abiertos siguen siendo el principal cuello de botella práctico.

Parler-TTS frente a modelos de clonación con audio de referencia

Parler-TTSXTTS-v2F5-TTS
Método de control de vozDescripción de texto en lenguaje naturalClip de audio de referencia (~6 segundos)Clip de audio de referencia (~5–15 segundos)
No necesita muestra de audioSíNoNo
Clona la voz de una persona real concretaNo es el objetivo del diseñoSí, ese es su propósito centralSí, ese es su propósito central
Apertura de todo el pipeline (datos + código + pesos)SíSolo código y pesosSolo código y pesos
Tamaños de modeloDe Mini (10.5K/45K h) a Large (2.2B parámetros)Una única versión actualUna única versión actual
LicenciaApache 2.0Coqui Public Model License (no comercial)CC-BY-NC (no comercial)

El nicho específico de Parler-TTS es generar bajo demanda una voz verosímil y bien definida sin necesitar una grabación real para clonarla. Resulta útil cuando quieres controlar las características de una voz en lugar de reproducir la identidad de una persona concreta, y su pipeline de entrenamiento completamente abierto es una auténtica rareza entre proyectos de esta escala.

Preguntas frecuentes

¿Necesito un clip de audio de referencia para usar Parler-TTS?

No. A diferencia de los modelos de clonación de voz, Parler-TTS genera habla a partir de una descripción de texto en lenguaje natural de la voz y el estilo de interpretación deseados, sin necesitar ninguna muestra de audio.

¿Qué características de la voz puedo controlar realmente?

Los modelos base admiten el género, el tono, la velocidad del habla y factores del entorno acústico como el ruido de fondo y la reverberación, todos especificados mediante descripciones en lenguaje natural. La expresividad emocional está disponible específicamente a través de la versión ajustada con Expresso.

¿Parler-TTS es gratuito para uso comercial?

Sí. Se publica bajo la licencia Apache 2.0, una de las opciones más permisivas entre los modelos TTS de código abierto, y abarca por igual el código, el pipeline de entrenamiento y los pesos.

¿Cuál es la diferencia entre Mini v1 y Mini v1.1?

Se entrenan con datos idénticos y la misma configuración; el único cambio de v1.1 es un tokenizador de prompts mejorado con un vocabulario más amplio y compatibilidad con byte fallback, pensado para simplificar el futuro entrenamiento multilingüe.

¿Puede Parler-TTS clonar la voz de una persona real concreta?

No como parte central de su diseño. Parler-TTS está concebido para generar una voz que coincida con una descripción de texto, no para reproducir la identidad de un hablante de referencia concreto; para clonar la voz de una persona real, un modelo dedicado a la clonación es más adecuado.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →