CosyVoice3: Uma versão criada para cada sotaque
- O que há de novo no CosyVoice3
- Cobertura de dialetos e idiomas substancialmente ampliada
- Inpainting de pronúncia
- Clonagem entre idiomas aprimorada
- Resultados dos benchmarks
- Primeiros passos com o CosyVoice3
- Dicas para obter resultados melhores
- CosyVoice3 vs. CosyVoice2 vs. CosyVoice original
- Perguntas frequentes
- Transforme texto em voz com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
O CosyVoice2 resolveu a latência: a síntese por streaming com 150ms de atraso até o primeiro pacote tornou o modelo viável para chat de voz em tempo real. O que ele não resolveu completamente foi o alcance: um produto de voz voltado a falantes de chinês não precisa apenas de mandarim, mas também de cantonês, sichuanês, xangainês e mais uma dúzia de sotaques regionais para soar autêntico, em vez de genérico. O CosyVoice3 é a resposta da Alibaba FunAudioLLM para essa lacuna: a mesma base de streaming, ampliada para cobrir mais idiomas, muito mais dialetos chineses e uma nova forma de corrigir a pronúncia sem precisar retreinar o modelo.
O que há de novo no CosyVoice3
Construído na mesma escala de 0.5B parâmetros do CosyVoice2, o CosyVoice3 (lançado como Fun-CosyVoice3-0.5B) é uma versão aprimorada, não uma reconstrução do zero. Ele se concentra em três fraquezas específicas que a equipe identificou na geração anterior: consistência de conteúdo, similaridade do falante e naturalidade da prosódia. Segundo os benchmarks publicados pela Alibaba, o resultado é um modelo que supera vários sistemas concorrentes maiores, mesmo mantendo a mesma quantidade enxuta de parâmetros.
Cobertura de dialetos e idiomas substancialmente ampliada
Essa é a principal mudança e o motivo pelo qual o CosyVoice3 existe como um lançamento distinto, e não como uma pequena atualização de versão. O CosyVoice3 oferece suporte a nove idiomas — chinês, inglês, japonês, coreano, alemão, espanhol, francês, italiano e russo — além de mais de dezoito dialetos e sotaques regionais chineses, incluindo cantonês, sichuanês, xangainês, mandarim do nordeste e variedades de Shaanxi, Shanxi, Tianjin, Shandong, Ningxia e Gansu. Poucos modelos TTS open source tentam atingir esse nível de detalhamento dialetal em um único checkpoint, e é isso que torna o CosyVoice3 especialmente adequado para produtos voltados ao mercado chinês, onde uma única voz em mandarim não substitui de forma convincente o sotaque regional real do ouvinte.
Inpainting de pronúncia
O CosyVoice3 apresenta uma capacidade que as versões anteriores não tinham: corrigir uma palavra específica pronunciada incorretamente — geralmente um caractere chinês polifônico ou um termo incomum — fornecendo diretamente a sequência correta de Pinyin ou fonemas, sem retreinar nem fazer ajuste fino do modelo. Para uso em produção em áreas como medicina, direito ou conteúdo técnico, nas quais uma única leitura incorreta pode comprometer um clipe inteiro, isso transforma uma limitação que antes não tinha solução em um problema que pode ser corrigido.
Clonagem entre idiomas aprimorada
Clonar uma voz a partir de um clipe de referência em chinês e gerar inglês natural (ou o inverso) já era possível nas versões anteriores, mas o CosyVoice3 direcionou melhorias especificamente para esse cenário. O objetivo declarado pela equipe era preservar melhor a identidade da voz quando o idioma de referência e o idioma de geração não coincidem.
Resultados dos benchmarks
As avaliações publicadas pela Alibaba posicionam o CosyVoice3 de forma favorável tanto em relação ao próprio antecessor quanto a modelos maiores de terceiros:
- Taxa de erro de caracteres chineses de 0.81% na variante ajustada com RL: menor que os 1.52% do F5-TTS e os 1.16% do VibeVoice-1.5B, apesar de o CosyVoice3 operar com aproximadamente um terço da contagem de parâmetros do VibeVoice.
- Taxa de erro de palavras em inglês de 1.68%, novamente à frente do F5-TTS (2.00%) e do VibeVoice-1.5B (3.04%).
- Similaridade de falante de 78.0% em chinês e 71.8% em inglês; foi relatado que o valor em chinês superou o benchmark de similaridade estabelecido por regravações humanas reais na mesma avaliação.
A conclusão prática: a contagem de parâmetros não é o fator decisivo aqui. A vantagem do CosyVoice3 vem de refinamentos arquitetônicos específicos — melhor representação de tokens, treinamento aprimorado e dados direcionados de dialetos —, não de simplesmente aumentar a escala.
Primeiros passos com o CosyVoice3
- Clone o repositório com os submódulos. O CosyVoice3 compartilha o mesmo repositório do GitHub das versões anteriores:
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git; a opção--recursiveé obrigatória para a dependência Matcha-TTS. - Baixe especificamente o Fun-CosyVoice3-0.5B. Use o
snapshot_downloaddo ModelScope ou baixe pelo Hugging Face. Verifique se o destino é o checkpoint 3.0, e não um diretório de modelo CosyVoice2 anterior ou do CosyVoice original. - Selecione explicitamente um dialeto ou idioma quando isso for importante. Se o caso de uso exige um sotaque regional específico, escolha a voz ou instrução do dialeto correspondente, em vez de depender do modelo geral de chinês para inferi-lo pelo contexto.
- Inicie a WebUI para testar antes de integrar.
python3 webui.py --port 50000 --model_dir pretrained_models/Fun-CosyVoice3-0.5Babre uma interface Gradio para testar diretamente clonagem, seleção de dialetos e inpainting de pronúncia. - Use TensorRT-LLM se a velocidade de inferência se tornar um gargalo em escala. O projeto relata aceleração de aproximadamente 4x no componente de modelo de linguagem em comparação com a inferência padrão do Transformers, o que compensa o esforço de configuração em implantações de produção com grande volume de solicitações.
- Considere a API hospedada para equipes que não querem hospedar o modelo por conta própria. O Model Studio da Alibaba Cloud oferece o CosyVoice3 como API gerenciada (
cosyvoice-v3-flash/cosyvoice-v3-plus), com latência anunciada até o primeiro pacote de apenas 150ms, se executar sua própria stack de inferência não for prioridade.
Dicas para obter resultados melhores
- Use o inpainting de pronúncia antes de concluir que não há como corrigir uma palavra. Um caractere polifônico ou termo técnico pronunciado incorretamente costuma exigir uma correção de fonema em uma única linha, não a regeneração do clipe inteiro nem o abandono do modelo para aquele conteúdo.
- Seja explícito sobre o dialeto, não implícito. Com mais de 18 dialetos disponíveis, deixar o modelo adivinhar pelo contexto é menos confiável do que especificar diretamente o sotaque desejado, principalmente em dialetos menos comuns, como os de Ningxia ou Gansu.
- Valide cada par entre idiomas individualmente. A melhoria na clonagem entre idiomas é real, mas a qualidade ainda varia conforme o par específico. Teste exatamente a combinação de origem e destino necessária para o produto, em vez de presumir resultados uniformes entre todos os nove idiomas.
- Use clipes de referência limpos de 3–10 segundos. Esse continua sendo o intervalo para o qual a clonagem zero-shot do modelo é ajustada; áudio de referência ruidoso ou incomumente longo reduz a similaridade do falante, independentemente da versão executada.
- Não escolha por hábito o maior modelo disponível. Os resultados do CosyVoice3 em benchmarks, superando modelos maiores como o VibeVoice-1.5B, lembram que a arquitetura e os dados de treinamento importam mais do que a contagem bruta de parâmetros. Avalie o conteúdo real antes de presumir que um modelo maior em outro lugar seria melhor.
CosyVoice3 vs. CosyVoice2 vs. CosyVoice original
| CosyVoice3 | CosyVoice2 | CosyVoice (original) | |
|---|---|---|---|
| Parâmetros | 0.5B | 0.5B | 300M |
| Idiomas | 9 | Multilíngue (menos dialetos) | 5 |
| Dialetos chineses | 18+ | Limitados | Não eram o foco |
| Inpainting de pronúncia | Sim | Não | Não |
| Streaming | Sim | Sim, introduzido aqui | Não |
| Clonagem entre idiomas | Aprimorada | Compatível | Compatível |
| CER chinês (melhor variante) | 0.81% | Maior | Referência |
Cada versão resolveu uma restrição diferente: a original provou que tokens supervisionados superavam os não supervisionados, o CosyVoice2 adicionou a arquitetura de streaming necessária para uso em tempo real e o CosyVoice3 estende essa mesma base a muito mais idiomas e dialetos, ao mesmo tempo que melhora a precisão da pronúncia. Se o produto precisa especificamente de sotaques regionais chineses autênticos ou de uma forma de corrigir pronúncias sem retreinamento, o CosyVoice3 é a versão criada para isso.
Perguntas frequentes
Qual é a principal melhoria do CosyVoice3 em relação ao CosyVoice2?
Principalmente a abrangência de dialetos e idiomas: o CosyVoice3 cobre nove idiomas e mais de dezoito dialetos regionais chineses, em comparação com a cobertura mais limitada do CosyVoice2. Além disso, inclui o novo recurso de inpainting de pronúncia e maior precisão na clonagem entre idiomas.
O que é inpainting de pronúncia?
É um recurso do CosyVoice3 que permite corrigir uma palavra específica pronunciada incorretamente — geralmente um caractere chinês polifônico ou um termo incomum — fornecendo diretamente a sequência correta de Pinyin ou fonemas, sem retreinar o modelo.
O CosyVoice3 ainda oferece geração por streaming e de baixa latência?
Sim. O CosyVoice3 se baseia na arquitetura de streaming introduzida no CosyVoice2, com opções de API hospedada que anunciam latência até o primeiro pacote de apenas 150ms.
Como o CosyVoice3 se compara a modelos maiores como VibeVoice ou F5-TTS?
Nos benchmarks publicados pela Alibaba, o CosyVoice3 superou ambos nas taxas de erro em chinês e inglês e na similaridade do falante para clonagem de voz, apesar de operar especificamente com menos parâmetros do que o VibeVoice-1.5B.
O CosyVoice3 é gratuito e open source?
Sim. Os pesos do modelo e o código estão disponíveis no repositório FunAudioLLM/CosyVoice do GitHub e no ModelScope, além de uma API hospedada separada pela Alibaba Cloud para equipes que preferem um serviço gerenciado.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.