EchoraEchora
Volver a los modelos

Zonos: pesos abiertos con la mira puesta en la calidad comercial cerrada

5 de septiembre de 2026
•
7 min de lectura

Zyphra no presentó Zonos como «una buena alternativa open source»: el propio equipo afirma que ofrece una expresividad y una calidad a la altura, o incluso por encima, de los principales proveedores comerciales de TTS, al tiempo que publica los pesos reales con una licencia totalmente permisiva. Es una afirmación concreta y comprobable, no una vaga declaración de calidad, y está respaldada por un entrenamiento de dimensiones realmente grandes: más de 200 000 horas de voz variada, en las que se mezclaron deliberadamente narración neutra y material muy expresivo en lugar de entrenar principalmente con un solo registro.

¿Qué es Zonos?

Zonos es un modelo de texto a voz de pesos abiertos que Zyphra, una startup de IA con sede en Palo Alto, lanzó en fase beta en febrero de 2025. Se distribuye con dos variantes de backbone —un transformer estándar y una arquitectura híbrida SSM—, ambas con 1 600 millones de parámetros y publicadas bajo la licencia Apache 2.0. Esto significa que los propios pesos, y no solo el código, pueden utilizarse gratis con fines comerciales sin necesidad de un acuerdo por separado.

Por dentro: eSpeak, tokens DAC y dos backbones para elegir

Zonos sigue un pipeline relativamente sencillo: el texto se normaliza y se convierte en fonemas mediante eSpeak, y la secuencia resultante impulsa la predicción de tokens sobre representaciones de Descript Audio Codec (DAC), generadas con el backbone transformer o con el híbrido SSM según el checkpoint que cargues. La diferencia práctica entre ambos no es superficial: la variante híbrida incorpora componentes de state-space model junto con la atención estándar. Este tipo de decisión arquitectónica suele implicar compensaciones distintas en velocidad y manejo de la longitud de las secuencias frente a un transformer puro, por lo que conviene probar ambos con tu carga de trabajo concreta en lugar de suponer que uno es una actualización estrictamente superior al otro.

Clonación de voz: embeddings de hablante frente a prefijos de audio

Zonos admite clonación de voz zero-shot a partir de un clip de referencia de entre 5 y 30 segundos, pero vale la pena entender las dos formas distintas de condicionar la generación con una voz. Un embedding de hablante captura la identidad vocal general del clip de referencia. Un prefijo de audio —es decir, anteponer literalmente un fragmento del audio de referencia en vez de reducirlo primero a un embedding— también puede provocar comportamientos específicos, como susurrar, que son realmente difíciles de reproducir solo con un embedding de hablante. Si tu proyecto necesita un estilo de interpretación concreto que un clip de referencia normal no consigue transmitir, la vía del prefijo de audio es el control más directo.

Para los casos en los que no tienes ninguna voz de referencia, Zonos también incluye opciones de voces predefinidas —voces masculinas y femeninas estadounidenses y británicas, además de un ajuste de voz aleatoria—, por lo que la clonación zero-shot no es un requisito indispensable para obtener resultados útiles.

Control detallado de la emoción y la interpretación

Además de la identidad de la voz, Zonos permite controlar directamente la velocidad del habla, la variación del tono, la frecuencia máxima, la calidad general del audio y emociones concretas: admite explícitamente felicidad, ira, tristeza y miedo. Este grado de control granular e independiente sobre la mecánica de la interpretación y el tono emocional es una parte sustancial de aquello en lo que realmente se apoya su posicionamiento «expresivo», en vez de limitarse a aplicar un único parámetro de estilo genérico a toda la salida.

Compatibilidad multilingüe y salida nativa a 44kHz

Zonos-v0.1 abarca inglés, japonés, chino, francés y alemán y, a diferencia de muchos modelos de este ámbito que generan audio a 24kHz, produce audio de forma nativa a 44kHz. Ese techo de fidelidad notablemente más alto importa si la salida va a entrar en un proceso de producción en el que la calidad del audio se examina con atención, y no solo necesita resultar inteligible.

Velocidad

En una RTX 4090, Zonos funciona con un factor de tiempo real de aproximadamente 2x —genera alrededor de 2 segundos de audio por cada segundo de cómputo—, lo que lo sitúa cómodamente en un terreno útil para aplicaciones casi en tiempo real con hardware de consumo capaz, aunque no se ha diseñado específicamente para la latencia de streaming inferior a 200ms que persiguen los modelos dedicados al tiempo real.

Primeros pasos con Zonos

  1. Instala primero la dependencia eSpeak. Como Zonos depende de eSpeak para normalizar el texto y convertirlo en fonemas, asegúrate de tenerlo instalado en el sistema antes de intentar ejecutar la inferencia; omitirlo es una causa habitual de fallos en la primera ejecución.
  2. Clona el repositorio y elige el backbone. Haz git clone del proyecto Zyphra/Zonos desde GitHub y carga Zyphra/Zonos-v0.1-transformer o Zyphra/Zonos-v0.1-hybrid, según la arquitectura que quieras probar.
  3. Crea un embedding de hablante a partir de un clip de referencia. Unas pocas líneas de Python —cargar el modelo, llamar a make_speaker_embedding() con el audio de referencia y después a make_cond_dict() con el texto y el idioma de destino— cubren el flujo básico de clonación zero-shot.
  4. Usa la interfaz de Gradio para hacer pruebas repetidas. Ejecutar python gradio_interface.py evita la sobrecarga de volver a cargar el modelo en cada generación, algo que el ejemplo mínimo de Python hace de forma predeterminada; resulta realmente útil cuando ya estás iterando y no solo generando una muestra.
  5. Prueba el playground alojado antes de comprometerte con la configuración local. Zyphra mantiene una versión alojada en playground.zyphra.com/audio, una forma rápida de evaluar la calidad de salida y los controles disponibles antes de invertir tiempo en la instalación local.
  6. Recurre a un prefijo de audio para los comportamientos especialmente difíciles de clonar. Si un embedding de hablante por sí solo no produce los susurros, la voz aireada u otro estilo de interpretación concreto que necesitas, cambia al método de condicionamiento con prefijo de audio.

Consejos para obtener mejores resultados

  • Prueba ambas variantes de backbone con tu caso de uso real. Los modelos transformer e híbrido SSM no son simplemente «antiguo frente a nuevo»: representan una verdadera compensación arquitectónica, así que medir ambos con tu tipo específico de contenido es más fiable que suponer que uno es mejor en todos los casos.
  • Utiliza un clip de referencia realmente limpio y de entre 5 y 30 segundos. La clonación zero-shot está ajustada en torno a este intervalo, por lo que una muestra bien grabada con una duración dentro de ese rango superará tanto a un clip mucho más corto como a uno alargado innecesariamente.
  • Combina los controles de emoción e interpretación de forma deliberada, no solo de uno en uno. Como la velocidad del habla, el tono y la emoción se pueden ajustar por separado, superponerlos con criterio —por ejemplo, un ritmo más rápido junto con un tono emocional concreto— es donde realmente se manifiesta la expresividad que reivindica Zonos, en vez de modificar un único parámetro de forma aislada.
  • Usa voces predefinidas cuando no necesites específicamente una clonación. Si el objetivo no es reproducir una voz real concreta, los ajustes predefinidos de voces masculinas y femeninas estadounidenses y británicas ahorran el paso de buscar y preparar un clip de referencia.
  • Presta atención a la versión más reciente ZONOS2 de Zyphra si necesitas más idiomas o menor latencia. Desde entonces, Zyphra ha publicado un modelo sucesor entrenado con un conjunto de datos considerablemente mayor, con más idiomas y una arquitectura mixture-of-experts orientada a reducir la latencia; vale la pena examinarlo si tus requisitos concretos superan lo que cubre v0.1.

Zonos frente a otros modelos de clonación expresiva

ZonosChatterboxF5-TTS
Organización responsableZyphraResemble AIInvestigación independiente (SJTU/Cambridge/Geely)
Parámetros1.6B (dos variantes de backbone)~0.5BNo se presenta principalmente por su número de parámetros
Clip de referencia para la clonación5–30 segundos5–10 segundos~5–15 segundos
Control de emocionesExplícito: felicidad, ira, tristeza, miedoParámetro ExaggerationNo es una función específica
Frecuencia de muestreo nativa de salida44kHzNo se especifica con este nivel de fidelidadFrecuencias estándar de TTS
IdiomasInglés, japonés, chino, francés, alemánInglés (Multilingual: 23)Centrado principalmente en inglés
LicenciaApache 2.0MITCC-BY-NC (no comercial)

La ventaja concreta de Zonos consiste en combinar un corpus de entrenamiento realmente grande y de doble registro con pesos totalmente abiertos y permisivos para uso comercial, además de fidelidad nativa a 44kHz. Es una combinación más difícil de encontrar reunida en otros modelos, aunque su cobertura de cinco idiomas sea más estrecha que la de algunos competidores centrados en el multilingüismo.

Preguntas frecuentes

¿Zonos es realmente gratuito para uso comercial?

Sí. Los pesos de los modelos transformer e híbrido SSM se publican bajo la licencia Apache 2.0, que permite el uso comercial sin un acuerdo por separado.

¿Cuál es la diferencia entre los modelos transformer e híbrido de Zonos?

El modelo híbrido incorpora componentes de state-space model junto con la atención transformer estándar, lo que representa una compensación arquitectónica diferente y no una actualización directa. Probar ambos con tu caso de uso concreto es la forma fiable de elegir.

¿Cuánto audio de referencia necesita Zonos para clonar una voz?

Aproximadamente entre 5 y 30 segundos, utilizando un embedding de hablante —para la identidad vocal general— o un prefijo de audio —más adecuado para comportamientos específicos como los susurros—.

¿Qué idiomas admite Zonos?

Inglés, japonés, chino, francés y alemán en la versión v0.1.

¿Hay una forma alojada de probar Zonos sin instalar nada?

Sí. Zyphra mantiene un playground alojado en playground.zyphra.com/audio, donde puedes probar directamente la clonación de voz y los controles expresivos del modelo.

Genera una voz similar desde un audio de referencia

Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.

Crear una voz clonada →