CosyVoice2: modelo TTS multilingüe en streaming y de baja latencia
CosyVoice2 transmite voz con 150ms de latencia hasta el primer paquete, reduce los errores de pronunciación un 30–50% frente a CosyVoice y añade control de emoción y acento mediante instrucciones.