EchoraEchora
Voltar aos modelos

VoxCPM: deixando de lado a etapa de tokenização da qual a maioria dos modelos TTS depende

10 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Quase todas as arquiteturas TTS modernas — dos tokens de codec do VALL-E aos tokens semânticos do CosyVoice e aos codebooks discretos do GPT-SoVITS — começam comprimindo a fala em unidades discretas antes que um modelo aprenda a prevê-las. O VoxCPM, da OpenBMB, segue um caminho completamente diferente: modela a fala diretamente em um espaço contínuo, deixando de lado por completo a tokenização discreta. Essa decisão arquitetônica é a base das duas capacidades de destaque do modelo — prosódia sensível ao contexto e clonagem de voz zero-shot realmente convincente — em um modelo bilíngue chinês-inglês rápido o bastante para fazer streaming em uma única GPU de consumo.

O que é o VoxCPM?

O VoxCPM é um sistema de texto para voz sem tokenizador criado pela OpenBMB sobre o backbone do modelo de linguagem MiniCPM-4 e lançado sob a licença Apache-2.0. Em vez de converter a fala em tokens discretos como faz a maioria dos sistemas comparáveis, ele usa uma arquitetura autorregressiva de difusão de ponta a ponta para gerar representações contínuas da fala diretamente a partir do texto, após ser treinado com mais de 1,8 milhão de horas de áudio bilíngue em chinês e inglês.

Vantagens funcionais do VoxCPM

  • Modelagem contínua sem tokenizador, evitando a perda de informações que a tokenização discreta pode introduzir e, ao mesmo tempo, preservando a estabilidade da geração por meio de um gargalo semidiscreto.
  • Geração de voz sensível ao contexto — o modelo infere a prosódia e o tom emocional adequados diretamente do significado do texto de entrada, sem exigir tags de estilo manuais.
  • Resultados de ponta entre os sistemas de código aberto, superando concorrentes fortes, como IndexTTS2 e CosyVoice2, no benchmark SEED-TTS-EVAL.
  • Latência realmente baixa, alcançando um fator de tempo real de apenas 0,17 em uma NVIDIA RTX 4090 de consumo — ou seja, gera áudio cerca de seis vezes mais rápido do que a fala resultante leva para ser reproduzida.
  • Clonagem de voz zero-shot fiel à realidade, com pontuações altas de similaridade de falante nos dois idiomas compatíveis.
  • Licença aberta e suporte a fine-tuning, lançado sob Apache-2.0 e com documentação tanto para fine-tuning supervisionado (SFT) quanto para adaptação LoRA, permitindo personalizar ainda mais o modelo.

Como a geração sem tokenizador realmente funciona

Esta é a decisão arquitetônica que diferencia o VoxCPM, e vale a pena entender por que ela importa. Sistemas TTS baseados em tokens discretos comprimem a fala em um vocabulário fixo de códigos — algo eficiente para a previsão ao estilo de modelos de linguagem, mas com perdas por construção, pois os detalhes acústicos contínuos são arredondados para um conjunto limitado de símbolos discretos. O VoxCPM combina modelagem hierárquica de linguagem, Quantização Escalar Finita (FSQ) e Diffusion Transformers locais para gerar diretamente representações contínuas da fala. Assim, contorna esse gargalo de informação e ainda mantém a geração estável o suficiente para um treinamento confiável.

O componente FSQ produz especificamente o que o projeto descreve como uma representação semidiscreta estruturada — um meio-termo que separa implicitamente o conteúdo semântico de alto nível dos detalhes acústicos refinados sem forçar nenhum deles a entrar em um código totalmente discreto. É essa separação implícita que possibilita a geração sensível ao contexto: como o significado semântico e a textura acústica não ficam entrelaçados em uma única representação, o modelo consegue inferir a prosódia e o tom emocional a partir do que o texto realmente significa, em vez de exigir que você especifique o estilo de interpretação como uma instrução separada.

Resultados em benchmarks

No benchmark SEED-TTS-EVAL, o VoxCPM-0.5B registrou taxa de erro de palavras de 1,85% em inglês e taxa de erro de caracteres de 0,93% em chinês — ambas à frente de concorrentes fortes, como IndexTTS2 e CosyVoice2 —, mantendo pontuações de similaridade de falante de 72,9% em inglês e 77,2% em chinês. Uma variante treinada no conjunto Emilia, menor e totalmente público (VoxCPM-Emilia), ainda obteve resultados competitivos (WER de 2,34% em inglês e CER de 1,11% em chinês), o que o projeto aponta como evidência da eficiência de dados da arquitetura, em vez de resultados dependentes apenas da escala do conjunto de treinamento. Em avaliações auditivas subjetivas, o VoxCPM liderou em similaridade de falante em inglês e teve bom desempenho em naturalidade; em chinês, ficou ligeiramente atrás do IndexTTS2 em naturalidade, mas um pouco à frente em similaridade de falante. Isso sugere que o ponto forte específico do VoxCPM é a consistência da clonagem, enquanto o IndexTTS2 mantém uma vantagem especificamente na naturalidade prosódica do chinês.

Primeiros passos com o VoxCPM

  1. Verifique primeiro os requisitos do ambiente. O VoxCPM precisa do Python 3.10 ou posterior (abaixo da versão 3.13), do PyTorch 2.5.0 ou posterior e do CUDA 12.0 ou posterior — confirme esses requisitos antes de tentar a instalação.
  2. Instale o pacote e baixe um checkpoint do Hugging Face. openbmb/VoxCPM-0.5B é a versão bilíngue original; openbmb/VoxCPM1.5 é a atualização de dezembro de 2025, com suporte a fine-tuning por SFT e LoRA e saída de áudio aprimorada em 44.1kHz, superior aos 16kHz do original.
  3. Carregue o modelo por meio do pacote Python voxcpm. Execute from voxcpm import VoxCPM e depois VoxCPM.from_pretrained("openbmb/VoxCPM-0.5B") para obter um objeto de modelo pronto para uso em poucas linhas.
  4. Gere áudio com model.generate(). Passe o texto desejado junto com parâmetros de geração, como cfg_value (intensidade da orientação sem classificador) e inference_timesteps, e depois grave a forma de onda retornada usando uma biblioteca como soundfile.
  5. Use o ModelScope como fonte alternativa para download se o acesso ao Hugging Face estiver lento para você. O projeto documenta essa opção como uma alternativa direta para baixar os mesmos pesos.
  6. Clone o repositório do GitHub (OpenBMB/VoxCPM) para consultar a documentação completa de início rápido, os scripts de demonstração e os detalhes da licença antes de criar algo que vá além dos testes iniciais.

Dicas para obter resultados melhores

  • Deixe a geração sensível ao contexto fazer o trabalho em vez de especificar demais o estilo. Como o modelo já infere a prosódia e a emoção a partir do significado do texto, escrever um texto de entrada naturalmente descritivo tende a produzir resultados melhores do que tentar forçar uma interpretação específica com soluções improvisadas que o modelo não foi criado para aceitar.
  • Use o VoxCPM1.5 em vez da versão 0.5B original em projetos novos. A saída de áudio aprimorada em 44.1kHz e o suporte adicional a fine-tuning fazem dele um ponto de partida mais prático, a menos que você tenha um motivo específico para usar a versão anterior.
  • Faça fine-tuning com LoRA para uma voz ou um domínio específico em vez de treinar o modelo inteiro novamente. Dado o suporte documentado a LoRA, esse é o caminho mais eficiente em recursos se você precisar adaptar o modelo a uma determinada voz ou estilo de conteúdo para além da clonagem zero-shot.
  • Trate-o como software para pesquisa, não ainda como um produto comercial pronto para produção. A própria ficha do modelo afirma explicitamente que ele é lançado para fins de pesquisa e desenvolvimento e desaconselha o uso comercial ou em produção sem antes realizar testes independentes rigorosos e uma avaliação de segurança.
  • Limite-se ao chinês e ao inglês para obter resultados confiáveis. O desempenho em outros idiomas não é garantido e pode gerar saídas imprevisíveis ou de baixa qualidade, pois os principais dados de treinamento do modelo são especificamente bilíngues, e não amplamente multilíngues.

VoxCPM versus outros modelos fortes de clonagem em chinês e inglês

VoxCPMIndexTTS2CosyVoice2
Representação centralSem tokenizador, contínua + semidiscreta com FSQTokens discretosTokens semânticos supervisionados
WER em inglês (SEED-TTS-EVAL)1,85%MaiorMaior
CER em chinês (SEED-TTS-EVAL)0,93%MaiorMaior
Naturalidade em chinês (subjetiva)Forte, ligeiramente atrás do IndexTTS2LíderForte
Similaridade de falanteLíder em inglês e chinêsCompetitivaCompetitiva
Controle de estilo/emoçãoAutomático, inferido pelo contextoControle de duração + separação entre emoção e timbreBaseado em instruções
LicençaApache-2.0Licença do modelo da Bilibili (uso comercial exige autorização)Aberta, com API hospedada disponível

A vantagem específica do VoxCPM é uma aposta arquitetônica realmente diferente — representação contínua em vez de tokenização discreta — que se reflete diretamente nos números dos benchmarks e no streaming de baixa latência. Isso faz dele uma escolha técnica forte especificamente para trabalhos bilíngues em chinês e inglês, embora a ausência de controle manual direto sobre o estilo seja uma contrapartida real em relação aos modelos criados em torno de interpretações explícitas baseadas em instruções.

Perguntas frequentes

O que significa “sem tokenizador” no VoxCPM?

Significa que o VoxCPM gera diretamente representações contínuas da fala, em vez de primeiro comprimir a fala em um vocabulário de tokens discretos como faz a maioria dos sistemas TTS comparáveis. Essa abordagem busca evitar a perda de informações que a tokenização discreta pode introduzir.

Posso controlar diretamente a emoção ou o estilo de fala no VoxCPM?

Não por meio de controles manuais explícitos na versão atual. Em vez disso, o modelo infere automaticamente a prosódia e a emoção adequadas a partir do significado do texto de entrada. A própria documentação do projeto aponta isso como uma limitação atual para quem precisa especificamente de controle direto sobre o estilo.

O VoxCPM está pronto para produção ou uso comercial?

A própria ficha do modelo desaconselha esse uso sem antes realizar testes independentes rigorosos e uma avaliação de segurança, descrevendo explicitamente a versão como destinada a fins de pesquisa e desenvolvimento.

O VoxCPM é compatível com outros idiomas além de chinês e inglês?

Não de forma confiável. Ele foi treinado especificamente como um modelo bilíngue chinês-inglês, e o desempenho em outros idiomas não é garantido. Uma versão posterior e separada chamada VoxCPM2 amplia o modelo para 2 bilhões de parâmetros e 30 idiomas, com recursos adicionais de criação de voz, caso você precise de uma cobertura linguística mais ampla.

Qual é a velocidade do VoxCPM?

Ele alcança um fator de tempo real de apenas 0,17 em uma RTX 4090 de consumo, o que significa que a geração é executada cerca de seis vezes mais rápido do que a própria duração de reprodução do áudio resultante.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →