VoxCPM: prescindir del paso de tokenización del que dependen la mayoría de modelos TTS
- ¿Qué es VoxCPM?
- Ventajas funcionales de VoxCPM
- Cómo funciona realmente la generación sin tokenizador
- Resultados en benchmarks
- Primeros pasos con VoxCPM
- Consejos para obtener mejores resultados
- VoxCPM frente a otros modelos potentes de clonación en chino e inglés
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Casi todas las arquitecturas TTS modernas —desde los tokens de códec de VALL-E hasta los tokens semánticos de CosyVoice y los libros de códigos discretos de GPT-SoVITS— empiezan comprimiendo el habla en unidades discretas antes de que un modelo aprenda a predecirlas. VoxCPM, de OpenBMB, sigue una vía completamente distinta: modela el habla directamente en un espacio continuo y prescinde por completo de la tokenización discreta. Esa decisión arquitectónica sustenta las dos capacidades emblemáticas del modelo —la prosodia que tiene en cuenta el contexto y una clonación de voz zero-shot realmente convincente— en un modelo bilingüe chino-inglés lo bastante rápido como para generar audio en streaming con una sola GPU de consumo.
¿Qué es VoxCPM?
VoxCPM es un sistema de texto a voz sin tokenizador creado por OpenBMB sobre la arquitectura base del modelo de lenguaje MiniCPM-4 y publicado bajo la licencia Apache-2.0. En lugar de convertir el habla en tokens discretos como hacen la mayoría de sistemas comparables, utiliza una arquitectura autorregresiva de difusión de extremo a extremo para generar representaciones continuas del habla directamente a partir de texto, tras entrenarse con más de 1,8 millones de horas de audio bilingüe chino-inglés.
Ventajas funcionales de VoxCPM
- Modelado continuo sin tokenizador, que evita la pérdida de información que puede introducir la tokenización discreta y, al mismo tiempo, conserva la estabilidad de generación mediante un cuello de botella semidiscreto.
- Generación de voz según el contexto: el modelo infiere la prosodia y el tono emocional adecuados directamente a partir del significado del texto de entrada, sin necesidad de etiquetas de estilo manuales.
- Resultados de vanguardia entre los sistemas de código abierto, por encima de competidores potentes como IndexTTS2 y CosyVoice2 en el benchmark SEED-TTS-EVAL.
- Latencia realmente baja, con un factor de tiempo real de tan solo 0,17 en una NVIDIA RTX 4090 de consumo; es decir, genera audio aproximadamente seis veces más rápido de lo que tarda en reproducirse la voz resultante.
- Clonación de voz zero-shot fiel a la realidad, con puntuaciones altas de similitud de hablante en los dos idiomas compatibles.
- Licencia abierta y compatibilidad con ajuste fino, publicado bajo Apache-2.0 y con documentación tanto para ajuste fino supervisado (SFT) como para adaptación LoRA a fin de personalizar aún más el modelo.
Cómo funciona realmente la generación sin tokenizador
Esta es la decisión arquitectónica que diferencia a VoxCPM, y merece la pena entender por qué importa. Los sistemas TTS de tokens discretos comprimen el habla en un vocabulario fijo de códigos, algo eficiente para la predicción al estilo de los modelos de lenguaje, pero con pérdidas por diseño, ya que el detalle acústico continuo se redondea a un conjunto limitado de símbolos discretos. VoxCPM combina en cambio modelado jerárquico del lenguaje, cuantización escalar finita (FSQ) y Transformers de difusión locales para generar directamente representaciones continuas del habla. Así evita ese cuello de botella de información, pero mantiene una generación lo bastante estable como para entrenar el modelo de forma fiable.
En concreto, el componente FSQ produce lo que el proyecto describe como una representación semidiscreta estructurada: un punto intermedio que separa implícitamente el contenido semántico de alto nivel del detalle acústico fino sin obligar a ninguno de los dos a entrar en un código totalmente discreto. Esa separación implícita es la que permite generar en función del contexto: como el significado semántico y la textura acústica no están entrelazados en una única representación, el modelo puede inferir la prosodia y el tono emocional a partir de lo que realmente significa el texto, en vez de exigir que se especifique el estilo de interpretación como una instrucción aparte.
Resultados en benchmarks
En el benchmark SEED-TTS-EVAL, VoxCPM-0.5B registró una tasa de error de palabras del 1,85 % en inglés y una tasa de error de caracteres del 0,93 % en chino —ambas por delante de competidores potentes como IndexTTS2 y CosyVoice2—, al tiempo que mantuvo puntuaciones de similitud de hablante del 72,9 % en inglés y del 77,2 % en chino. Una variante entrenada con el conjunto Emilia, más pequeño y completamente público (VoxCPM-Emilia), siguió obteniendo resultados competitivos (WER del 2,34 % en inglés y CER del 1,11 % en chino), algo que el proyecto presenta como prueba de la eficiencia de datos de la arquitectura y no como resultados dependientes únicamente de la escala del conjunto de entrenamiento. En evaluaciones auditivas subjetivas, VoxCPM lideró la similitud de hablante en inglés y logró buenos resultados de naturalidad; en chino quedó ligeramente por detrás de IndexTTS2 en naturalidad, pero lo superó por poco en similitud de hablante. Esto indica que el punto fuerte específico de VoxCPM es la consistencia de la clonación, mientras que IndexTTS2 conserva una ventaja concreta en la naturalidad prosódica del chino.
Primeros pasos con VoxCPM
- Comprueba primero los requisitos del entorno. VoxCPM necesita Python 3.10 o posterior (pero anterior a 3.13), PyTorch 2.5.0 o posterior y CUDA 12.0 o posterior; confírmalos antes de intentar la instalación.
- Instala el paquete y descarga un checkpoint desde Hugging Face.
openbmb/VoxCPM-0.5Bes la versión bilingüe original;openbmb/VoxCPM1.5es la actualización de diciembre de 2025, con compatibilidad para ajuste fino mediante SFT y LoRA y una salida de audio mejorada a 44.1kHz, frente a los 16kHz del original. - Carga el modelo mediante el paquete de Python
voxcpm. Ejecutafrom voxcpm import VoxCPMy despuésVoxCPM.from_pretrained("openbmb/VoxCPM-0.5B")para obtener en un par de líneas un objeto de modelo listo para usar. - Genera audio con
model.generate(). Pasa el texto de destino junto con parámetros de generación comocfg_value(intensidad de la guía sin clasificador) einference_timesteps, y después guarda la forma de onda devuelta con una biblioteca comosoundfile. - Utiliza ModelScope como fuente de descarga alternativa si el acceso a Hugging Face te resulta lento. El proyecto lo documenta como alternativa directa para descargar los mismos pesos.
- Clona el repositorio de GitHub (
OpenBMB/VoxCPM) para consultar la documentación completa de inicio rápido, los scripts de demostración y los detalles de la licencia antes de crear nada que vaya más allá de las pruebas iniciales.
Consejos para obtener mejores resultados
- Deja que la generación según el contexto haga su trabajo en vez de especificar demasiado el estilo. Como el modelo ya infiere la prosodia y la emoción a partir del significado del texto, redactar un texto de entrada descriptivo y natural suele dar mejores resultados que intentar forzar una interpretación concreta mediante soluciones provisionales para las que el modelo no se diseñó.
- Utiliza VoxCPM1.5 en lugar de la versión 0.5B original para proyectos nuevos. La salida de audio mejorada a 44.1kHz y la compatibilidad añadida con el ajuste fino hacen que sea un punto de partida más práctico, salvo que tengas un motivo concreto para usar la versión anterior.
- Haz un ajuste fino con LoRA para una voz o un dominio concretos en lugar de reentrenar todo el modelo. Dada la compatibilidad documentada con LoRA, es la vía más eficiente en recursos si necesitas adaptar el modelo a una voz o un estilo de contenido particular más allá de la clonación zero-shot.
- Trátalo como software para investigación, no todavía como un producto comercial listo para producción. La propia ficha del modelo indica explícitamente que se publica para fines de investigación y desarrollo, y desaconseja su uso comercial o en producción sin realizar antes pruebas independientes rigurosas y una evaluación de seguridad.
- Limítate al chino y al inglés para obtener resultados fiables. El rendimiento en otros idiomas no está garantizado y puede producir resultados impredecibles o de baja calidad, ya que los datos principales de entrenamiento del modelo son específicamente bilingües y no ampliamente multilingües.
VoxCPM frente a otros modelos potentes de clonación en chino e inglés
| VoxCPM | IndexTTS2 | CosyVoice2 | |
|---|---|---|---|
| Representación principal | Sin tokenizador, continua + semidiscreta con FSQ | Tokens discretos | Tokens semánticos supervisados |
| WER en inglés (SEED-TTS-EVAL) | 1,85 % | Mayor | Mayor |
| CER en chino (SEED-TTS-EVAL) | 0,93 % | Mayor | Mayor |
| Naturalidad en chino (subjetiva) | Sólida, ligeramente por detrás de IndexTTS2 | Líder | Sólida |
| Similitud de hablante | Líder en inglés y chino | Competitiva | Competitiva |
| Control de estilo/emoción | Automático, inferido por el contexto | Control de duración + separación entre emoción y timbre | Basado en instrucciones |
| Licencia | Apache-2.0 | Licencia del modelo de Bilibili (el uso comercial requiere autorización) | Abierta, con API alojada disponible |
La ventaja específica de VoxCPM es una apuesta arquitectónica realmente distinta —representación continua en vez de tokenización discreta— que se traduce directamente en las cifras de los benchmarks y en streaming de baja latencia. Esto lo convierte en una opción técnica potente específicamente para trabajos bilingües en chino e inglés, aunque la falta de control manual directo del estilo constituye una contrapartida real frente a los modelos creados en torno a una interpretación explícita basada en instrucciones.
Preguntas frecuentes
¿Qué significa «sin tokenizador» en VoxCPM?
Significa que VoxCPM genera directamente representaciones continuas del habla, en vez de comprimir primero el habla en un vocabulario de tokens discretos como hacen la mayoría de sistemas TTS comparables. Este enfoque busca evitar la pérdida de información que puede introducir la tokenización discreta.
¿Puedo controlar directamente la emoción o el estilo de habla en VoxCPM?
No mediante controles manuales explícitos en la versión actual. El modelo infiere automáticamente la prosodia y la emoción adecuadas a partir del significado del texto de entrada; la propia documentación del proyecto señala esto como una limitación actual para quien necesite específicamente controlar el estilo de forma directa.
¿Está VoxCPM preparado para producción o uso comercial?
La propia ficha del modelo desaconseja hacerlo sin realizar antes pruebas independientes rigurosas y una evaluación de seguridad, y describe explícitamente la versión como destinada a fines de investigación y desarrollo.
¿Admite VoxCPM otros idiomas además del chino y el inglés?
No de forma fiable. Se ha entrenado específicamente como modelo bilingüe chino-inglés y el rendimiento en otros idiomas no está garantizado. Una versión posterior e independiente llamada VoxCPM2 amplía el modelo a 2.000 millones de parámetros y 30 idiomas, además de añadir funciones de diseño de voz, si necesitas una cobertura lingüística más amplia.
¿Qué velocidad alcanza VoxCPM?
Logra un factor de tiempo real de tan solo 0,17 en una RTX 4090 de consumo, lo que significa que la generación se ejecuta aproximadamente seis veces más rápido que la propia duración de reproducción del audio resultante.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.