CosyVoice2: modelo TTS multilíngue com streaming e baixa latência
CosyVoice2 transmite fala com 150ms de latência até o primeiro pacote, reduz erros de pronúncia em 30–50% em relação ao CosyVoice e adiciona controle de emoção e sotaque por instruções.