VoxCPM: deixando de lado a etapa de tokenização da qual a maioria dos modelos TTS depende
- O que é o VoxCPM?
- Vantagens funcionais do VoxCPM
- Como a geração sem tokenizador realmente funciona
- Resultados em benchmarks
- Primeiros passos com o VoxCPM
- Dicas para obter resultados melhores
- VoxCPM versus outros modelos fortes de clonagem em chinês e inglês
- Perguntas frequentes
- Transforme texto em voz com a Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Quase todas as arquiteturas TTS modernas — dos tokens de codec do VALL-E aos tokens semânticos do CosyVoice e aos codebooks discretos do GPT-SoVITS — começam comprimindo a fala em unidades discretas antes que um modelo aprenda a prevê-las. O VoxCPM, da OpenBMB, segue um caminho completamente diferente: modela a fala diretamente em um espaço contínuo, deixando de lado por completo a tokenização discreta. Essa decisão arquitetônica é a base das duas capacidades de destaque do modelo — prosódia sensível ao contexto e clonagem de voz zero-shot realmente convincente — em um modelo bilíngue chinês-inglês rápido o bastante para fazer streaming em uma única GPU de consumo.
O que é o VoxCPM?
O VoxCPM é um sistema de texto para voz sem tokenizador criado pela OpenBMB sobre o backbone do modelo de linguagem MiniCPM-4 e lançado sob a licença Apache-2.0. Em vez de converter a fala em tokens discretos como faz a maioria dos sistemas comparáveis, ele usa uma arquitetura autorregressiva de difusão de ponta a ponta para gerar representações contínuas da fala diretamente a partir do texto, após ser treinado com mais de 1,8 milhão de horas de áudio bilíngue em chinês e inglês.
Vantagens funcionais do VoxCPM
- Modelagem contínua sem tokenizador, evitando a perda de informações que a tokenização discreta pode introduzir e, ao mesmo tempo, preservando a estabilidade da geração por meio de um gargalo semidiscreto.
- Geração de voz sensível ao contexto — o modelo infere a prosódia e o tom emocional adequados diretamente do significado do texto de entrada, sem exigir tags de estilo manuais.
- Resultados de ponta entre os sistemas de código aberto, superando concorrentes fortes, como IndexTTS2 e CosyVoice2, no benchmark SEED-TTS-EVAL.
- Latência realmente baixa, alcançando um fator de tempo real de apenas 0,17 em uma NVIDIA RTX 4090 de consumo — ou seja, gera áudio cerca de seis vezes mais rápido do que a fala resultante leva para ser reproduzida.
- Clonagem de voz zero-shot fiel à realidade, com pontuações altas de similaridade de falante nos dois idiomas compatíveis.
- Licença aberta e suporte a fine-tuning, lançado sob Apache-2.0 e com documentação tanto para fine-tuning supervisionado (SFT) quanto para adaptação LoRA, permitindo personalizar ainda mais o modelo.
Como a geração sem tokenizador realmente funciona
Esta é a decisão arquitetônica que diferencia o VoxCPM, e vale a pena entender por que ela importa. Sistemas TTS baseados em tokens discretos comprimem a fala em um vocabulário fixo de códigos — algo eficiente para a previsão ao estilo de modelos de linguagem, mas com perdas por construção, pois os detalhes acústicos contínuos são arredondados para um conjunto limitado de símbolos discretos. O VoxCPM combina modelagem hierárquica de linguagem, Quantização Escalar Finita (FSQ) e Diffusion Transformers locais para gerar diretamente representações contínuas da fala. Assim, contorna esse gargalo de informação e ainda mantém a geração estável o suficiente para um treinamento confiável.
O componente FSQ produz especificamente o que o projeto descreve como uma representação semidiscreta estruturada — um meio-termo que separa implicitamente o conteúdo semântico de alto nível dos detalhes acústicos refinados sem forçar nenhum deles a entrar em um código totalmente discreto. É essa separação implícita que possibilita a geração sensível ao contexto: como o significado semântico e a textura acústica não ficam entrelaçados em uma única representação, o modelo consegue inferir a prosódia e o tom emocional a partir do que o texto realmente significa, em vez de exigir que você especifique o estilo de interpretação como uma instrução separada.
Resultados em benchmarks
No benchmark SEED-TTS-EVAL, o VoxCPM-0.5B registrou taxa de erro de palavras de 1,85% em inglês e taxa de erro de caracteres de 0,93% em chinês — ambas à frente de concorrentes fortes, como IndexTTS2 e CosyVoice2 —, mantendo pontuações de similaridade de falante de 72,9% em inglês e 77,2% em chinês. Uma variante treinada no conjunto Emilia, menor e totalmente público (VoxCPM-Emilia), ainda obteve resultados competitivos (WER de 2,34% em inglês e CER de 1,11% em chinês), o que o projeto aponta como evidência da eficiência de dados da arquitetura, em vez de resultados dependentes apenas da escala do conjunto de treinamento. Em avaliações auditivas subjetivas, o VoxCPM liderou em similaridade de falante em inglês e teve bom desempenho em naturalidade; em chinês, ficou ligeiramente atrás do IndexTTS2 em naturalidade, mas um pouco à frente em similaridade de falante. Isso sugere que o ponto forte específico do VoxCPM é a consistência da clonagem, enquanto o IndexTTS2 mantém uma vantagem especificamente na naturalidade prosódica do chinês.
Primeiros passos com o VoxCPM
- Verifique primeiro os requisitos do ambiente. O VoxCPM precisa do Python 3.10 ou posterior (abaixo da versão 3.13), do PyTorch 2.5.0 ou posterior e do CUDA 12.0 ou posterior — confirme esses requisitos antes de tentar a instalação.
- Instale o pacote e baixe um checkpoint do Hugging Face.
openbmb/VoxCPM-0.5Bé a versão bilíngue original;openbmb/VoxCPM1.5é a atualização de dezembro de 2025, com suporte a fine-tuning por SFT e LoRA e saída de áudio aprimorada em 44.1kHz, superior aos 16kHz do original. - Carregue o modelo por meio do pacote Python
voxcpm. Executefrom voxcpm import VoxCPMe depoisVoxCPM.from_pretrained("openbmb/VoxCPM-0.5B")para obter um objeto de modelo pronto para uso em poucas linhas. - Gere áudio com
model.generate(). Passe o texto desejado junto com parâmetros de geração, comocfg_value(intensidade da orientação sem classificador) einference_timesteps, e depois grave a forma de onda retornada usando uma biblioteca comosoundfile. - Use o ModelScope como fonte alternativa para download se o acesso ao Hugging Face estiver lento para você. O projeto documenta essa opção como uma alternativa direta para baixar os mesmos pesos.
- Clone o repositório do GitHub (
OpenBMB/VoxCPM) para consultar a documentação completa de início rápido, os scripts de demonstração e os detalhes da licença antes de criar algo que vá além dos testes iniciais.
Dicas para obter resultados melhores
- Deixe a geração sensível ao contexto fazer o trabalho em vez de especificar demais o estilo. Como o modelo já infere a prosódia e a emoção a partir do significado do texto, escrever um texto de entrada naturalmente descritivo tende a produzir resultados melhores do que tentar forçar uma interpretação específica com soluções improvisadas que o modelo não foi criado para aceitar.
- Use o VoxCPM1.5 em vez da versão 0.5B original em projetos novos. A saída de áudio aprimorada em 44.1kHz e o suporte adicional a fine-tuning fazem dele um ponto de partida mais prático, a menos que você tenha um motivo específico para usar a versão anterior.
- Faça fine-tuning com LoRA para uma voz ou um domínio específico em vez de treinar o modelo inteiro novamente. Dado o suporte documentado a LoRA, esse é o caminho mais eficiente em recursos se você precisar adaptar o modelo a uma determinada voz ou estilo de conteúdo para além da clonagem zero-shot.
- Trate-o como software para pesquisa, não ainda como um produto comercial pronto para produção. A própria ficha do modelo afirma explicitamente que ele é lançado para fins de pesquisa e desenvolvimento e desaconselha o uso comercial ou em produção sem antes realizar testes independentes rigorosos e uma avaliação de segurança.
- Limite-se ao chinês e ao inglês para obter resultados confiáveis. O desempenho em outros idiomas não é garantido e pode gerar saídas imprevisíveis ou de baixa qualidade, pois os principais dados de treinamento do modelo são especificamente bilíngues, e não amplamente multilíngues.
VoxCPM versus outros modelos fortes de clonagem em chinês e inglês
| VoxCPM | IndexTTS2 | CosyVoice2 | |
|---|---|---|---|
| Representação central | Sem tokenizador, contínua + semidiscreta com FSQ | Tokens discretos | Tokens semânticos supervisionados |
| WER em inglês (SEED-TTS-EVAL) | 1,85% | Maior | Maior |
| CER em chinês (SEED-TTS-EVAL) | 0,93% | Maior | Maior |
| Naturalidade em chinês (subjetiva) | Forte, ligeiramente atrás do IndexTTS2 | Líder | Forte |
| Similaridade de falante | Líder em inglês e chinês | Competitiva | Competitiva |
| Controle de estilo/emoção | Automático, inferido pelo contexto | Controle de duração + separação entre emoção e timbre | Baseado em instruções |
| Licença | Apache-2.0 | Licença do modelo da Bilibili (uso comercial exige autorização) | Aberta, com API hospedada disponível |
A vantagem específica do VoxCPM é uma aposta arquitetônica realmente diferente — representação contínua em vez de tokenização discreta — que se reflete diretamente nos números dos benchmarks e no streaming de baixa latência. Isso faz dele uma escolha técnica forte especificamente para trabalhos bilíngues em chinês e inglês, embora a ausência de controle manual direto sobre o estilo seja uma contrapartida real em relação aos modelos criados em torno de interpretações explícitas baseadas em instruções.
Perguntas frequentes
O que significa “sem tokenizador” no VoxCPM?
Significa que o VoxCPM gera diretamente representações contínuas da fala, em vez de primeiro comprimir a fala em um vocabulário de tokens discretos como faz a maioria dos sistemas TTS comparáveis. Essa abordagem busca evitar a perda de informações que a tokenização discreta pode introduzir.
Posso controlar diretamente a emoção ou o estilo de fala no VoxCPM?
Não por meio de controles manuais explícitos na versão atual. Em vez disso, o modelo infere automaticamente a prosódia e a emoção adequadas a partir do significado do texto de entrada. A própria documentação do projeto aponta isso como uma limitação atual para quem precisa especificamente de controle direto sobre o estilo.
O VoxCPM está pronto para produção ou uso comercial?
A própria ficha do modelo desaconselha esse uso sem antes realizar testes independentes rigorosos e uma avaliação de segurança, descrevendo explicitamente a versão como destinada a fins de pesquisa e desenvolvimento.
O VoxCPM é compatível com outros idiomas além de chinês e inglês?
Não de forma confiável. Ele foi treinado especificamente como um modelo bilíngue chinês-inglês, e o desempenho em outros idiomas não é garantido. Uma versão posterior e separada chamada VoxCPM2 amplia o modelo para 2 bilhões de parâmetros e 30 idiomas, com recursos adicionais de criação de voz, caso você precise de uma cobertura linguística mais ampla.
Qual é a velocidade do VoxCPM?
Ele alcança um fator de tempo real de apenas 0,17 em uma RTX 4090 de consumo, o que significa que a geração é executada cerca de seis vezes mais rápido do que a própria duração de reprodução do áudio resultante.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.