CosyVoice3: Una versión creada para cada acento
- Novedades de CosyVoice3
- Cobertura de dialectos e idiomas sustancialmente ampliada
- Inpainting de pronunciación
- Clonación entre idiomas mejorada
- Resultados de los benchmarks
- Primeros pasos con CosyVoice3
- Consejos para obtener mejores resultados
- CosyVoice3 vs. CosyVoice2 vs. CosyVoice original
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
CosyVoice2 resolvió la latencia: la síntesis en streaming con 150ms de latencia hasta el primer paquete permitió usarlo en chats de voz en tiempo real. Lo que no resolvió por completo fue la amplitud de la cobertura: un producto de voz para usuarios de habla china no solo necesita mandarín, sino también cantonés, sichuanés, shanghainés y otra docena de acentos regionales para sonar auténtico en lugar de genérico. CosyVoice3 es la respuesta de Alibaba FunAudioLLM a esa carencia: la misma base de streaming, ampliada para cubrir más idiomas, muchos más dialectos chinos y una nueva forma de corregir la pronunciación sin necesidad de reentrenamiento.
Novedades de CosyVoice3
Construido en torno a la misma escala de 0.5B parámetros que CosyVoice2, CosyVoice3 (publicado como Fun-CosyVoice3-0.5B) es una versión mejorada, no una reconstrucción desde cero. Se centra en tres debilidades concretas que el equipo identificó en la generación anterior: la consistencia del contenido, la similitud del hablante y la naturalidad de la prosodia. El resultado, según los benchmarks publicados por Alibaba, es un modelo que supera a varios sistemas competidores más grandes pese a mantener la misma escala compacta de parámetros.
Cobertura de dialectos e idiomas sustancialmente ampliada
Este es el cambio principal y la razón por la que CosyVoice3 existe como una versión diferenciada en lugar de una actualización menor. CosyVoice3 admite nueve idiomas —chino, inglés, japonés, coreano, alemán, español, francés, italiano y ruso— junto con más de dieciocho dialectos y acentos regionales chinos, entre ellos cantonés, sichuanés, shanghainés, mandarín del noreste y variedades de Shaanxi, Shanxi, Tianjin, Shandong, Ningxia y Gansu. Pocos modelos TTS open source intentan alcanzar este nivel de granularidad dialectal en un solo checkpoint, y eso hace que CosyVoice3 sea especialmente adecuado para productos dirigidos al mercado chino, donde una voz genérica en mandarín no sustituye de forma convincente al acento regional real del oyente.
Inpainting de pronunciación
CosyVoice3 introduce una capacidad que las versiones anteriores no tenían: corregir una palabra específica mal pronunciada —normalmente un carácter chino polifónico o un término poco común— proporcionando directamente la secuencia correcta de Pinyin o fonemas, sin volver a entrenar ni ajustar el modelo. Para el uso en producción en ámbitos como el médico, jurídico o técnico, donde una sola lectura incorrecta puede arruinar un clip entero, esto convierte una limitación que antes no tenía solución en un problema que sí puede corregirse.
Clonación entre idiomas mejorada
Las versiones anteriores ya podían clonar una voz a partir de un clip de referencia en chino y generar inglés natural (o a la inversa), pero CosyVoice3 se centró expresamente en mejorar este escenario: el objetivo declarado por el equipo era conservar con mayor fidelidad la identidad de la voz cuando el idioma de referencia y el de generación no coinciden.
Resultados de los benchmarks
Las evaluaciones publicadas por Alibaba sitúan a CosyVoice3 favorablemente tanto frente a su predecesor como frente a modelos de terceros más grandes:
- Tasa de error de caracteres chinos del 0.81% en su variante ajustada con RL: inferior al 1.52% de F5-TTS y al 1.16% de VibeVoice-1.5B, pese a que CosyVoice3 funciona con aproximadamente un tercio de los parámetros de VibeVoice.
- Tasa de error de palabras en inglés del 1.68%, de nuevo por delante de F5-TTS (2.00%) y VibeVoice-1.5B (3.04%).
- Similitud del hablante del 78.0% en chino y del 71.8% en inglés; se informó que la cifra en chino superó el benchmark de similitud establecido por regrabaciones humanas reales en la misma evaluación.
La conclusión práctica: el número de parámetros no es el factor decisivo. La ventaja de CosyVoice3 procede de refinamientos arquitectónicos concretos —mejor representación de tokens, entrenamiento mejorado y datos dialectales específicos—, no de limitarse a aumentar la escala.
Primeros pasos con CosyVoice3
- Clona el repositorio con sus submódulos. CosyVoice3 comparte el mismo repositorio de GitHub que las versiones anteriores:
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git; la opción--recursivees obligatoria por la dependencia Matcha-TTS. - Descarga específicamente Fun-CosyVoice3-0.5B. Usa
snapshot_downloadde ModelScope o descárgalo desde Hugging Face; asegúrate de apuntar al checkpoint 3.0, no al directorio de un modelo CosyVoice2 anterior ni al CosyVoice original. - Selecciona explícitamente un dialecto o idioma cuando sea importante. Si tu caso de uso necesita un acento regional concreto, elige la voz o instrucción dialectal correspondiente en lugar de confiar en que el modelo chino general lo deduzca del contexto.
- Inicia la WebUI para probar antes de integrar.
python3 webui.py --port 50000 --model_dir pretrained_models/Fun-CosyVoice3-0.5Babre una interfaz de Gradio para probar directamente la clonación, la selección de dialectos y el inpainting de pronunciación. - Usa TensorRT-LLM si la velocidad de inferencia se convierte en un cuello de botella a escala. El proyecto informa de una aceleración de aproximadamente 4x en el componente del modelo de lenguaje frente a la inferencia estándar con Transformers, una configuración que merece la pena para despliegues en producción con un volumen elevado de solicitudes.
- Considera la API alojada si tu equipo no quiere alojar el modelo por su cuenta. Model Studio de Alibaba Cloud ofrece CosyVoice3 como API gestionada (
cosyvoice-v3-flash/cosyvoice-v3-plus), con una latencia anunciada hasta el primer paquete de tan solo 150ms, si ejecutar tu propia pila de inferencia no es una prioridad.
Consejos para obtener mejores resultados
- Recurre al inpainting de pronunciación antes de dar por imposible una palabra. Un carácter polifónico o un término técnico mal pronunciado suele requerir una corrección fonética de una sola línea, no volver a generar todo el clip ni abandonar el modelo para ese contenido.
- Indica el dialecto de forma explícita, no implícita. Con más de 18 dialectos disponibles, dejar que el modelo lo adivine por el contexto es menos fiable que especificar directamente el acento de destino, sobre todo en dialectos menos comunes como los de Ningxia o Gansu.
- Valida cada par de idiomas por separado. La mejora de la clonación entre idiomas es real, pero la calidad sigue variando según el par concreto: prueba exactamente la combinación de origen y destino que necesita tu producto en lugar de asumir resultados uniformes en los nueve idiomas.
- Usa clips de referencia limpios de 3–10 segundos. Este sigue siendo el intervalo para el que está ajustada la clonación zero-shot del modelo; un audio de referencia ruidoso o inusualmente largo degrada la similitud del hablante con independencia de la versión que ejecutes.
- No elijas por costumbre el modelo más grande disponible. Los resultados de CosyVoice3 en benchmarks, que superan a modelos más grandes como VibeVoice-1.5B, recuerdan que la arquitectura y los datos de entrenamiento importan más que el número bruto de parámetros: evalúa tu contenido real antes de dar por hecho que otro modelo más grande será mejor.
CosyVoice3 vs. CosyVoice2 vs. CosyVoice original
| CosyVoice3 | CosyVoice2 | CosyVoice (original) | |
|---|---|---|---|
| Parámetros | 0.5B | 0.5B | 300M |
| Idiomas | 9 | Multilingüe (menos dialectos) | 5 |
| Dialectos chinos | 18+ | Limitados | No eran una prioridad |
| Inpainting de pronunciación | Sí | No | No |
| Streaming | Sí | Sí, se introdujo aquí | No |
| Clonación entre idiomas | Mejorada | Compatible | Compatible |
| CER chino (mejor variante) | 0.81% | Superior | Referencia |
Cada versión resolvió una limitación diferente: la original demostró que los tokens supervisados superaban a los no supervisados, CosyVoice2 añadió la arquitectura de streaming necesaria para el uso en tiempo real y CosyVoice3 extiende esa misma base a muchos más idiomas y dialectos al tiempo que mejora la precisión de pronunciación. Si tu producto necesita específicamente acentos regionales chinos auténticos o una forma de corregir pronunciaciones erróneas sin reentrenamiento, CosyVoice3 es la versión creada para ello.
Preguntas frecuentes
¿Cuál es la principal mejora de CosyVoice3 frente a CosyVoice2?
Principalmente, la amplitud de dialectos e idiomas: CosyVoice3 cubre nueve idiomas y más de dieciocho dialectos regionales chinos, frente a la cobertura más limitada de CosyVoice2; además incorpora el nuevo inpainting de pronunciación y mejora la precisión de clonación entre idiomas.
¿Qué es el inpainting de pronunciación?
Es una función de CosyVoice3 que permite corregir una palabra específica mal pronunciada —normalmente un carácter chino polifónico o un término poco común— proporcionando directamente la secuencia correcta de Pinyin o fonemas, sin volver a entrenar el modelo.
¿CosyVoice3 sigue admitiendo generación en streaming y de baja latencia?
Sí. CosyVoice3 se basa en la arquitectura de streaming introducida en CosyVoice2, con opciones de API alojada que anuncian una latencia hasta el primer paquete de tan solo 150ms.
¿Cómo se compara CosyVoice3 con modelos más grandes como VibeVoice o F5-TTS?
En los benchmarks publicados por Alibaba, CosyVoice3 superó a ambos en tasas de error de chino e inglés y en similitud del hablante para clonación de voz, pese a funcionar específicamente con menos parámetros que VibeVoice-1.5B.
¿CosyVoice3 es gratuito y open source?
Sí. Los pesos del modelo y el código están disponibles en el repositorio FunAudioLLM/CosyVoice de GitHub y en ModelScope, junto con una API alojada independiente de Alibaba Cloud para los equipos que prefieran un servicio gestionado.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.