GPT-SoVITS: un estudio completo de clonación de voz, no solo un modelo
- ¿Qué es GPT-SoVITS?
- Dos niveles de clonación: 5 segundos y 1 minuto
- Historial de versiones: de v1 a v4
- La WebUI: pensada para quienes no quieren crear flujos de entrenamiento a mano
- Primeros pasos con GPT-SoVITS
- Consejos para obtener mejores resultados
- GPT-SoVITS frente a otros modelos de clonación few-shot
- Preguntas frecuentes
- Genera una voz similar desde un audio de referencia
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Muchos modelos open source de clonación te entregan un checkpoint y un script de Python y dan el trabajo por terminado. GPT-SoVITS, en cambio, te ofrece el flujo completo —separación vocal, transcripción automática, segmentación del conjunto de datos, entrenamiento e inferencia, todo dentro de una interfaz para el navegador—, construido en torno a un requisito de datos realmente bajo: un clon utilizable con 5 segundos de audio y uno correctamente ajustado con tan solo un minuto.
¿Qué es GPT-SoVITS?
GPT-SoVITS es un proyecto open source de clonación de voz y texto a voz, con licencia MIT, creado por el desarrollador RVC-Boss. Combina en un solo flujo el modelado semántico de texto basado en GPT con SoVITS, un sistema acústico y de conversión de voz basado en VITS. El componente GPT se encarga de convertir el texto en tokens semánticos; después, el componente SoVITS transforma esos tokens, guiado por la voz de referencia, en la forma de onda final. Esta división del trabajo es lo que permite al proyecto admitir tanto la generación zero-shot inmediata como un ajuste fino few-shot más profundo sobre la misma arquitectura subyacente.
Admite generación interlingüe entre chino, inglés, japonés, coreano y cantonés, y se ha ganado una reputación especialmente sólida por la calidad de sus resultados en chino y japonés.
Dos niveles de clonación: 5 segundos y 1 minuto
Esta es la capacidad principal, y conviene precisar qué ofrece realmente cada nivel. El modo zero-shot toma una muestra de referencia de 5 segundos y genera de inmediato una voz con ese timbre, sin necesidad de entrenamiento; las pruebas del desarrollador han descrito este nivel como capaz de producir aproximadamente un 80-95% de similitud con la voz objetivo, suficiente para pruebas rápidas o contenido de menor exigencia. El ajuste fino few-shot va más allá: con cerca de un minuto de datos de la voz objetivo, el modelo se puede ajustar para mejorar de forma perceptible la similitud y la naturalidad respecto al punto de partida zero-shot, cerrando gran parte de la distancia restante con la voz real del hablante de referencia.
Historial de versiones: de v1 a v4
GPT-SoVITS ha pasado por varias generaciones arquitectónicas claramente diferenciadas desde su lanzamiento inicial, y saber cuál encaja con tu situación importa más que elegir por defecto «la más nueva»:
- v1 y v2 comparten la misma arquitectura fundamental: generación directa de la forma de onda mediante un decodificador VQ-VAE, sin una fase separada de vocoder. v2 amplió esta base con más idiomas y más datos de preentrenamiento.
- v2Pro / v2ProPlus perfeccionaron aún más la estabilidad y la compatibilidad, manteniendo los requisitos de hardware y la velocidad de inferencia de v2. En las comparaciones del propio proyecto, incluso superan a v4 en algunos aspectos y siguen siendo más baratos de ejecutar.
- v3 sustituyó la arquitectura acústica central por un Transformer de difusión con Conditional Flow Matching abreviado (shortcut Conditional Flow Matching Diffusion Transformer, shortcut-CFM-DiT), lo que produjo una similitud tímbrica perceptiblemente mayor con el audio de referencia, menos errores de repetición u omisión en el lado GPT y una expresión emocional más rica. Se entrenó con un conjunto ampliado y filtrado por calidad de unas 7.000 horas. Como en esta versión la generación no es completamente de extremo a extremo, recurre al vocoder open source BigVGAN v2 para convertir la salida de espectrograma mel en audio de 24kHz, lo que puede introducir un artefacto metálico debido al sobremuestreo por un factor no entero.
- v4 corrige ese problema concreto de sonido metálico y produce audio de 48kHz de forma nativa en lugar de 24kHz, evitando la calidad ligeramente apagada que podía resultar de sobremuestrear una señal de 24kHz. El propio autor del proyecto describe v4 como un sustituto directo y práctico de v3.
El criterio práctico de decisión es este: v1, v2 y v2Pro suelen rendir mejor con datos de entrenamiento de baja calidad o con ruido, porque su arquitectura recibe una mayor influencia del promedio general del conjunto de entrenamiento. v3 y v4 rinden mejor específicamente con audio de referencia limpio y de alta calidad, ya que se inclinan más por reproducir fielmente esa referencia concreta que por promediar un conjunto de datos; sin embargo, pueden rendir peor que v1/v2 si las grabaciones originales no están limpias.
La WebUI: pensada para quienes no quieren crear flujos de entrenamiento a mano
La interfaz de GPT-SoVITS reúne todo el flujo de preparación del conjunto de datos, no solo la inferencia. Incluye UVR5 para separar las voces de la música de fondo o el ruido, reconocimiento automático del habla para la transcripción (ASR en chino mediante modelos específicos, e inglés y japonés mediante Faster Whisper Large V3) y segmentación automática del audio para dividir grabaciones largas en fragmentos útiles para el entrenamiento. En conjuntos de datos pequeños, de entre 5 y 10 minutos, un botón de «triple acción con un clic» encadena automáticamente varios de estos pasos de preprocesamiento, una ventaja importante de accesibilidad si no te resulta cómodo programar desde cero un flujo de datos.
Primeros pasos con GPT-SoVITS
- Utiliza el paquete integrado para Windows si trabajas en Windows. Hay un paquete precompilado disponible para descarga directa: haz doble clic en
go-webui.baty se iniciará la WebUI completa sin necesidad de configurar manualmente el entorno. - Configúralo manualmente en Linux/Mac, o si quieres más control. Crea un entorno virtual de Python 3.10 (mediante
uvo conda), clona el repositorio e instala las dependencias conpip install -r requirements.txt. - Descarga los modelos preentrenados que correspondan a tu versión objetivo. Cada versión (v2, v2Pro, v3, v4) tiene sus propios archivos de checkpoint alojados en Hugging Face. Asegúrate de que la versión del modelo preentrenado coincida con la versión de entrenamiento seleccionada en la WebUI; de lo contrario, la generación fallará o perderá calidad.
- Prepara el audio de referencia con las herramientas integradas. Ejecuta primero UVR5 si la fuente contiene ruido de fondo o música; después utiliza las herramientas de segmentación automática y anotación ASR en vez de transcribir y cortar manualmente los fragmentos.
- Elige la versión según la calidad del audio de origen. Utiliza v1/v2/v2Pro para grabaciones con más ruido o de calidad media; reserva v3 o v4 para audio de referencia limpio, con calidad de estudio, cuando busques la máxima fidelidad a esa voz concreta.
- Ten presente el problema de las GPU de la serie 16. Las tarjetas NVIDIA de la serie 16 más antiguas carecen de tensor cores y pueden provocar un error de configuración CUDA durante el entrenamiento; el archivo
config.pydel proyecto lo detecta automáticamente y fuerza la precisión FP32 como solución alternativa.
Consejos para obtener mejores resultados
- Empieza por zero-shot antes de comprometerte con el ajuste fino. Una prueba rápida de 5 segundos te indica si la similitud zero-shot del modelo base ya es suficiente para tu caso de uso antes de invertir tiempo en reunir y preparar un minuto completo de audio de entrenamiento.
- Ajusta la versión a la calidad de los datos, no a su fecha. Elegir v4 por defecto solo porque es la versión más nueva puede perjudicar la calidad de salida si las grabaciones de origen tienen ruido; v2Pro suele ser la opción más práctica para audio que no está impecable.
- Limpia el conjunto de datos antes del entrenamiento, no después. Usa primero UVR5 para eliminar el ruido de fondo y la música; v3 y v4, en particular, dependen mucho de la fidelidad del material que reciben.
- Aprovecha deliberadamente su fortaleza en chino y japonés. Si el idioma principal de tu proyecto es chino o japonés, GPT-SoVITS es una de las opciones open source más potentes específicamente para esos idiomas, más que para contenido solo en inglés, donde otros modelos pueden tener ventaja.
- Prefiere v4 a v3 salvo que tengas un motivo concreto para no hacerlo. Como v4 corrige el conocido problema de artefactos metálicos de v3 y genera audio con una frecuencia de muestreo nativa más alta, la recomendación del propio autor de tratarlo como sustituto directo es una opción predeterminada razonable, salvo que estés resolviendo un problema específico de una configuración basada en v3.
GPT-SoVITS frente a otros modelos de clonación few-shot
| GPT-SoVITS | XTTS-v2 | Fish Speech | |
|---|---|---|---|
| Datos mínimos para un clon utilizable | 5 segundos (zero-shot) | ~6 segundos | ~10–30 segundos |
| Compatibilidad con ajuste fino | Sí, ~1 minuto de datos | Sí, mediante scripts de la comunidad | Sí, nativa |
| Idiomas más fuertes | Chino, japonés | Amplia cobertura de 17 idiomas | Inglés, chino, japonés |
| Herramientas integradas de preparación de datos | Sí (separación vocal, ASR, segmentación automática) | No | No |
| Licencia | MIT | Coqui Public Model License (no comercial) | Orientada a investigación/uso no comercial |
El nicho específico de GPT-SoVITS es la combinación de un requisito de datos realmente bajo con una WebUI todo en uno que se ocupa tanto de la preparación de datos como del entrenamiento. Especialmente para contenido en chino y japonés, es difícil encontrar esta combinación reunida en otro proyecto.
Preguntas frecuentes
¿Cuánto audio necesito realmente para clonar una voz con GPT-SoVITS?
Bastan 5 segundos para un clon zero-shot inmediato, o alrededor de 1 minuto de audio de referencia para ajustar un modelo con una similitud y una naturalidad perceptiblemente mejores.
¿Qué versión debo usar, v2, v3 o v4?
Usa v2 o v2Pro si el audio de entrenamiento tiene una calidad media o contiene ruido; utiliza v3 o v4 si las grabaciones de referencia están limpias y tienen calidad de estudio, ya que esas versiones se centran más en reproducir fielmente la referencia concreta. Entre v3 y v4, v4 corrige un conocido problema de artefactos metálicos y produce audio nativo de mayor calidad, por lo que es la opción predeterminada más práctica.
¿GPT-SoVITS funciona bien con idiomas distintos del chino?
Sí. Además de chino, admite inglés, japonés, coreano y cantonés, pero es en chino y japonés donde se ha labrado la reputación más sólida.
¿GPT-SoVITS es gratuito para uso comercial?
Sí. Se publica bajo la licencia MIT, una de las opciones más permisivas entre los proyectos open source de clonación de voz.
¿Tengo que preparar manualmente mi propio conjunto de datos de entrenamiento?
No necesariamente. La WebUI incluye herramientas de separación vocal, transcripción automática y segmentación de audio, además de una opción de un solo clic para conjuntos de datos pequeños que encadena automáticamente varios pasos de preprocesamiento.
Genera una voz similar desde un audio de referencia
Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.