EchoraEchora
Volver a los modelos

Qwen3-TTS: Un modelo de voz que responde en menos de una décima de segundo

29 de agosto de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

La mayoría de las demostraciones de clonación de voz te hacen esperar un instante antes de que empiece el audio, suficiente para que nunca llegue a sentirse del todo como una conversación. Qwen3-TTS, el modelo de voz open source del equipo Qwen de Alibaba, se creó para cerrar esa brecha: una arquitectura de doble vía que genera voz de extremo a extremo con una latencia hasta el primer paquete de audio de tan solo 97 milisegundos, lo bastante rápida para funcionar detrás de un agente de voz en directo sin añadir por sí misma un retraso perceptible.

¿Qué es Qwen3-TTS?

Qwen3-TTS es un modelo open source de texto a voz entrenado con más de 5 millones de horas de datos de voz, publicado bajo la licencia Apache 2.0 y con pesos públicos en Hugging Face y GitHub. En su núcleo hay un tokenizer de voz personalizado, Qwen3-TTS-Tokenizer-12Hz, combinado con una arquitectura híbrida de streaming que genera el audio directamente, en lugar de pasar por una etapa independiente de diffusion o vocoder. Esta decisión de diseño explica tanto su baja latencia como su estabilidad con textos de entrada más largos o con más ruido.

El modelo cubre 10 idiomas principales —chino, inglés, japonés, coreano, alemán, francés, ruso, portugués, español e italiano— junto con varios perfiles de voz para dialectos chinos, y se distribuye en dos tamaños con pesos abiertos: una versión de 1.7B parámetros ajustada para ofrecer la máxima calidad y otra más ligera de 0.6B, creada para hardware limitado sin renunciar a demasiado a cambio.

Tres formas de generar una voz

Qwen3-TTS no te obliga a seguir un único método: está diseñado en torno a tres formas distintas de generar voz, según los recursos con los que cuentes.

Clona una voz con 3 segundos de audio. Proporciona un breve clip de referencia junto con su transcripción correspondiente y el modelo reproducirá la voz de esa persona con un texto nuevo; es uno de los requisitos de audio de referencia más cortos entre los modelos open source de clonación actuales.

Diseña una voz a partir de una descripción de texto. ¿No tienes ninguna grabación? Describe la voz con lenguaje natural —edad, género, tono y personalidad— y Qwen3-TTS generará una voz nueva que coincida, sin necesitar ninguna referencia de audio. Es una opción realmente útil cuando necesitas una voz de personaje diferenciada y no quieres buscar, licenciar ni grabar una primero.

Elige un preset ya preparado. Para los proyectos que solo necesitan una buena voz sin ninguna configuración, la API alojada ofrece 49 voces predefinidas de distintos personajes. Se basan en personas con nombre que abarcan distintas edades, géneros y personalidades, y puedes cambiarlas al instante sin configuración adicional.

En los tres modos, el modelo interpreta bien el contexto: ajusta el tono, el ritmo y la expresión emocional según la semántica del propio texto, y se comporta mejor ante entradas desordenadas o con un formato imperfecto que los modelos de voz anteriores de la misma familia.

Primeros pasos con Qwen3-TTS

  1. Elige entre el alojamiento propio y la API. Alojar por tu cuenta los pesos abiertos te da control total y elimina el coste por carácter; llamar a la API alojada —con modelos como qwen3-tts-flash para generar rápido y con baja latencia, o qwen3-tts-instruct-flash cuando necesitas control mediante instrucciones en lenguaje natural— es la opción más rápida si prefieres no gestionar infraestructura de GPU.
  2. Instala el paquete. pip install qwen-tts te proporciona la clase Qwen3TTSModel necesaria para cargar y ejecutar inferencias de forma local.
  3. Elige un checkpoint adecuado para tu hardware. Qwen/Qwen3-TTS-12Hz-1.7B-Base es el modelo de calidad completa y necesita unos 6–8GB de VRAM; la variante de 0.6B funciona con comodidad en 4–6GB, con una pérdida de calidad menor de lo que sugiere la diferencia de tamaño.
  4. Genera una voz clonada. Llama a generate_voice_clone() con el texto de destino, un código de idioma, un archivo de audio de referencia y su transcripción correspondiente.
  5. Almacena en caché los prompts de referencia para generaciones repetidas. Si vas a producir varios clips con la misma voz clonada, reutiliza las características del prompt ya calculadas en lugar de volver a calcularlas en cada llamada; así se acelera de forma perceptible la generación por lotes.
  6. Usa vLLM para aumentar el rendimiento en producción. El equipo de Qwen ofrece compatibilidad con vLLM para Qwen3-TTS desde el primer día, y merece la pena usarlo en lugar de un bucle de inferencia PyTorch convencional para cualquier trabajo que vaya más allá de pruebas a pequeña escala.

Pruébalo sin configurar nada

Tanto el Space oficial de Hugging Face como la demo de ModelScope permiten probar la clonación y el diseño de voces directamente en el navegador, sin instalar nada. Alibaba Cloud también ha ofrecido cuotas gratuitas de caracteres a los desarrolladores que prueban el modelo mediante su API de Model Studio, y plataformas de terceros como Replicate y DeepInfra alojan igualmente el modelo con pesos abiertos. Es una forma sencilla de evaluar la calidad antes de comprometerse con infraestructura local o con un plan de API de pago.

Consejos para obtener mejores resultados

  • Asegúrate de que la transcripción de referencia para la clonación sea exacta. La calidad de la clonación depende en gran medida de que el texto de referencia coincida con lo que realmente se dice en el audio; una transcripción incorrecta perjudica más los resultados que una grabación de calidad ligeramente inferior.
  • Usa el diseño de voces cuando no dispongas de un clip de referencia real. Describir la voz que quieres suele acercarte más al resultado deseado que buscar un clip de archivo «lo bastante parecido», y evita cualquier duda de licencia relacionada con una voz real grabada.
  • Empieza con el modelo de 0.6B si no tienes claro qué permite tu hardware. Con aproximadamente la mitad de la huella de la versión de 1.7B, ofrece buenos resultados para la mayoría de los casos de uso; sube de tamaño solo si necesitas específicamente esa fidelidad adicional.
  • Utiliza las variantes alojadas de baja latencia para aplicaciones en directo. Si estás creando algo más parecido a un agente de voz que a un sistema de generación de contenido por lotes, las opciones rápidas y de baja latencia de la API se diseñaron específicamente para ese caso, de modo que no tengas que optimizar por tu cuenta la inferencia autoalojada.

Qwen3-TTS frente a otros modelos open source de clonación

Qwen3-TTSCosyVoice3Chatterbox
Organización responsableAlibaba (equipo Qwen)Alibaba (FunAudioLLM)Resemble AI
Parámetros0.6B / 1.7B0.5B~0.5B
Clip de referencia para clonar~3 segundos~3–10 segundos5–10 segundos
Latencia hasta el primer paquete~97ms~150ms (alojado)No es un objetivo principal
Diseño de voces a partir de textoSíNoNo
Idiomas109 + 18 dialectos chinosInglés (variante multilingüe: 23)
LicenciaApache 2.0Abierto, con API alojada disponibleMIT

La ventaja concreta de Qwen3-TTS consiste en combinar una latencia realmente baja con tres vías de generación distintas —clonación, diseño de voces a partir de texto y presets ya preparados— en una única versión con pesos abiertos, un conjunto de funciones más amplio que el de la mayoría de los modelos de clonación para un solo propósito y de tamaño comparable.

Preguntas frecuentes

¿Qwen-TTS y Qwen3-TTS son el mismo modelo?

No exactamente. Qwen-TTS era el modelo de voz anterior de Alibaba, disponible únicamente mediante la API alojada de Qwen y sin pesos públicos. Qwen3-TTS pertenece a la nueva generación, es open source, ofrece pesos descargables y tiene un conjunto de funciones más amplio. Si quieres alojarlo o ajustarlo por tu cuenta, Qwen3-TTS es el modelo adecuado.

¿Qué significa qwen3-tts-flash?

Es el nombre de una versión alojada y gestionada de Qwen3-TTS disponible mediante la API de Alibaba Cloud, ajustada para generar rápido y con baja latencia sin necesidad de alojamiento propio. Ejecuta la misma familia de modelos subyacente que la versión con pesos abiertos, pero como servicio gestionado.

¿Se puede usar Qwen3-TTS gratis?

Los pesos abiertos pueden alojarse gratuitamente bajo la licencia Apache 2.0. La API alojada ha ofrecido cuotas gratuitas de caracteres para nuevos desarrolladores, con uso de pago una vez superadas; consulta los precios actuales de Alibaba Cloud para conocer los límites exactos.

¿Cuál es la diferencia práctica entre los modelos de 0.6B y 1.7B?

El modelo de 1.7B ofrece mayor calidad de salida y necesita más VRAM (aproximadamente 6–8GB); el de 0.6B es más ligero (4–6GB) y su pérdida de calidad es menor de lo que podría sugerir la diferencia de parámetros.

¿Puedo probar Qwen3-TTS antes de instalar nada?

Sí. Tanto el Space oficial de Hugging Face como la demo de ModelScope funcionan en el navegador, y plataformas de alojamiento como Replicate y DeepInfra ofrecen acceso mediante API sin configuración local.

Genera una voz similar desde un audio de referencia

Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.

Crear una voz clonada →