EchoraEchora
Volver a Modelos

CosyVoice2: síntesis de voz lo bastante rápida para una conversación real

27 de agosto de 2026
6 min de lectura

Convierte texto y grabaciones en obras que se escuchan

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

El CosyVoice original demostró que los tokens semánticos supervisados podían producir una clonación de voz zero-shot más precisa y consistente que los modelos anteriores basados en tokens no supervisados. Lo que no podía hacer era responderte en tiempo real: como la mayoría de los TTS basados en LLM de primera generación, necesitaba el texto completo antes de empezar a generar audio. CosyVoice2 se creó exactamente para cerrar esa brecha, reestructurando el mismo enfoque subyacente en una arquitectura de streaming con una latencia hasta el primer paquete lo bastante baja para el chat de voz en vivo.

Novedades de CosyVoice2

CosyVoice2, desarrollado por el equipo de voz Tongyi de Alibaba, conserva la base de tokens semánticos supervisados que hizo funcionar al modelo original, pero reconstruye el pipeline alrededor de tres cambios de ingeniería concretos:

Cuantización escalar finita. El tokenizador de voz del modelo original dejaba infrautilizada una parte de su libro de códigos. CosyVoice2 lo sustituye por cuantización escalar finita, mejora la utilización del libro de códigos y proporciona al modelo una representación del habla más eficiente y mejor aprovechada.

Un modelo de lenguaje texto-voz simplificado. Al simplificar la arquitectura del LM, CosyVoice2 puede usar modelos de lenguaje grandes preentrenados directamente como base, en lugar de requerir una arquitectura a medida: un cambio que simplifica el entrenamiento y hereda la comprensión general del lenguaje del LLM base.

Flow matching causal consciente de fragmentos. Esta es la parte que realmente habilita el streaming. En lugar de esperar toda la entrada antes de generar un espectrograma mel, CosyVoice2 procesa el habla en fragmentos ordenados causalmente y unifica la síntesis en streaming y sin streaming en un único marco, en vez de ofrecerlas como dos modelos independientes. Los resultados publicados por el equipo describen que este modo de streaming produce una salida casi indistinguible en calidad de la generación completa sin conexión, un resultado significativamente distinto de la compensación de calidad que normalmente ha exigido el TTS en streaming.

Las cifras que importan

  • 150ms de latencia hasta el primer paquete. CosyVoice2 puede empezar a producir audio aproximadamente 150 milisegundos después de recibir texto, lo bastante rápido como para que en un pipeline de chat de voz (junto con un LLM que genera el texto de respuesta) el retraso percibido siga siendo bajo aunque dos modelos trabajen en secuencia.
  • 30–50% menos errores de pronunciación frente al CosyVoice original, resultado directo del tokenizador mejorado y la arquitectura LM simplificada.
  • Puntuación MOS: de 5.4 a 5.53, que refleja la mejora en naturalidad valorada por personas junto con las mejoras de latencia: CosyVoice2 no intercambia calidad por velocidad, mejora ambas a la vez.
  • La tasa de error de caracteres más baja en el conjunto de pruebas Seed-TTS hard entre los modelos comparados en el momento de su lanzamiento, un benchmark diseñado específicamente para poner a prueba casos de pronunciación difíciles.

Detrás de estas cifras hay un detalle de entrenamiento importante: CosyVoice2 usa aprendizaje por refuerzo durante el fine-tuning, con la similitud del hablante y la tasa de error de palabras medida por ASR como señales de recompensa; así optimiza directamente que el modelo suene como el hablante objetivo y diga bien las palabras, en lugar de optimizar solo una pérdida de reconstrucción genérica.

Generación mediante instrucciones, unificada con la clonación

CosyVoice2 también reúne dos capacidades que estaban separadas en el lanzamiento original: clonación de voz zero-shot y control de estilo basado en instrucciones. En la familia CosyVoice de primera generación, había que elegir entre el modelo base de clonación y el checkpoint Instruct independiente. CosyVoice2 integra ambos en un solo modelo, de modo que puedes clonar una voz desde un clip de referencia y dirigir de forma independiente la emoción, el acento y la interpretación de rol mediante instrucciones, sin cambiar de checkpoint según la capacidad que necesites en esa sesión.

Cómo empezar con CosyVoice2

  1. Clona el repositorio con submódulos. Igual que con el CosyVoice original, usa git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git: CosyVoice2 comparte el mismo repositorio y la dependencia Matcha-TTS.
  2. Descarga el checkpoint CosyVoice2-0.5B. Está disponible mediante Hugging Face y ModelScope, separado de los checkpoints originales CosyVoice-300M; asegúrate de obtener específicamente los pesos 2.0 si necesitas streaming.
  3. Elige explícitamente el modo streaming o sin conexión. Como CosyVoice2 unifica ambos en un marco, tu llamada de inferencia decide qué ruta se ejecuta: streaming para casos interactivos y sin conexión para generación por lotes de máxima calidad cuando la latencia no importa.
  4. Prueba la generación mediante instrucciones junto con la clonación. Combina un clip de audio de referencia con una instrucción de estilo (emoción, acento o rol) en la misma llamada para ver la capacidad unificada en acción, en lugar de probar por separado la clonación y el control por instrucciones.
  5. Mide la latencia hasta el primer paquete en tu propio hardware. La cifra publicada de 150ms refleja el entorno de prueba del equipo; valida la latencia real en tu GPU de despliegue antes de comprometer decisiones de arquitectura en tiempo real.

Consejos para obtener mejores resultados

  • Usa el modo streaming específicamente para pipelines conversacionales. Si construyes un agente de voz donde la salida de texto de un LLM alimenta directamente al TTS, el modo streaming es lo que mantiene bajo el tiempo de respuesta de extremo a extremo; el modo sin conexión reintroduce la espera de la frase completa que CosyVoice2 se creó para eliminar.
  • No supongas que streaming implica menor calidad. El flow matching consciente de fragmentos de CosyVoice2 se diseñó específicamente para mantener la salida en streaming cerca de la calidad sin conexión; prueba ambos modos con tu contenido real en vez de elegir sin conexión por cautela.
  • Apóyate en el control mediante instrucciones para el tono en vez de volver a grabar clips de referencia. Si necesitas una interpretación emocional diferente de la misma voz clonada, cambiar una instrucción es más rápido de iterar que buscar un nuevo clip de referencia que ya tenga ese tono emocional.
  • Valida la pronunciación en tu vocabulario de dominio específico. La reducción de errores del 30–50% se mide frente a benchmarks generales; la terminología técnica o específica de un dominio debe revisarse puntualmente antes de producción.
  • Combínalo con un LLM rápido al crear chat de voz. Como la baja latencia de CosyVoice2 está diseñada para pipelines de estilo chat, el tiempo total de respuesta sigue dependiendo de la rapidez con que el LLM que lo precede produce texto; un generador de texto lento reduce el beneficio de una fase TTS rápida.

CosyVoice2 frente a CosyVoice (original)

CosyVoice2CosyVoice (2024)
Parámetros0.5B300M
StreamingSí, unificado con el modo sin conexiónNo
Latencia hasta el primer paquete~150msNo optimizado para esta métrica
Clonación zero-shot + estilo controlado mediante instruccionesUnificados en un modeloCheckpoints separados (base vs. Instruct)
Precisión de pronunciación30–50% menos erroresReferencia
Puntuación MOS5.535.4
Método de entrenamientoFine-tuning con RL (recompensa de similitud del hablante + WER)Entrenamiento supervisado

La ruta de actualización de CosyVoice2 es específica: si tu proyecto necesita generación en tiempo real o casi en tiempo real —agentes de voz, chat en vivo, aplicaciones interactivas—, esta es la versión creada para ello. Si generas audio sin conexión sin restricciones de latencia, la diferencia importa menos, aunque las mejoras de precisión y calidad siguen aplicándose.

Preguntas frecuentes

¿Cuál es la principal diferencia entre CosyVoice y CosyVoice2?

CosyVoice2 añade síntesis en streaming con una latencia hasta el primer paquete de unos 150ms, unifica la clonación zero-shot con el control de estilo mediante instrucciones en un solo modelo y mejora la precisión de pronunciación un 30–50% frente al original, todo ello mientras aumenta la calidad (MOS de 5.4 a 5.53) en lugar de intercambiarla por velocidad.

¿CosyVoice2 es lo bastante rápido para el chat de voz en tiempo real?

Sí, ese es su objetivo de diseño principal. Una latencia hasta el primer paquete de 150ms permite combinarlo con un LLM en un pipeline de chat de voz sin que la fase TTS añada por sí sola un retraso perceptible.

¿CosyVoice2 sacrifica calidad de audio por velocidad de streaming?

No. El diseño de flow matching causal consciente de fragmentos se creó específicamente para mantener la salida en streaming cerca de la calidad de la generación sin conexión, y las puntuaciones MOS publicadas incluso mejoraron respecto al original sin streaming.

¿CosyVoice2 todavía puede hacer clonación de voz zero-shot?

Sí, y está mejorada: la clonación y el control de estilo basado en instrucciones (emoción, acento y estilo de rol) están ahora integrados en un solo modelo, en lugar de requerir checkpoints separados como en el CosyVoice original.

¿CosyVoice2 es open source?

Sí. Los pesos del modelo y el código de inferencia están disponibles públicamente mediante el mismo repositorio de GitHub FunAudioLLM/CosyVoice, junto con alojamiento en Hugging Face y ModelScope.

Prueba una función similar de clonación de voz

CosyVoice2 está disponible mediante la implementación open source FunAudioLLM/CosyVoice y sus plataformas de modelos. Si quieres explorar la clonación de voz en el navegador, prueba la Clonación de voz como una función similar. No es CosyVoice2 ni ejecuta el modelo CosyVoice2, pero permite probar un flujo de clonación de voz parecido sin configurar el modelo localmente.

Clona únicamente voces que te pertenezcan o para las que tengas permiso explícito.

Explorar Clonación de voz →