EchoraEchora
Volver a los modelos

VITS: la arquitectura que sustenta discretamente una gran parte del TTS de código abierto

9 de septiembre de 2026
•
8 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Muchos modelos de voz de código abierto muy conocidos comparten en realidad el mismo antepasado, aunque la mayoría de los usuarios nunca se dé cuenta: las voces ONNX de Piper, la base multilingüe de MeloTTS, la clonación condicionada por hablante de YourTTS y la mitad SoVITS de GPT-SoVITS están construidas directamente sobre la arquitectura que aborda esta página. VITS es el sistema TTS clásico de extremo a extremo que demostró que un modelo de generación paralela y de una sola etapa podía igualar de verdad la calidad de las antiguas cadenas de dos etapas; esa demostración explica por qué una parte tan grande del ecosistema TTS de código abierto aún se remonta a él.

¿Qué es VITS?

VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) fue presentado por Jaehyeon Kim, Jungil Kong y Juhee Son, de Kakao Enterprise, y publicado en ICML 2021. Es un modelo de síntesis de voz de extremo a extremo que predice una forma de onda directamente a partir de una secuencia de texto de entrada en una sola etapa, publicado bajo la licencia MIT. Antes de VITS ya existían modelos de extremo a extremo capaces de entrenarse en una sola etapa y realizar muestreo en paralelo, pero la calidad de sus resultados quedaba sistemáticamente por debajo de los sistemas de dos etapas: un modelo acústico entrenado por separado que alimentaba a un vocoder también entrenado por separado. VITS cerró esa brecha directamente y su evaluación oficial mostró que superaba, en puntuación media de opinión sobre el conjunto de datos LJSpeech, a los modelos de dos etapas más potentes disponibles públicamente.

Ventajas funcionales de VITS

  • Realmente de extremo a extremo. Entra texto y sale una forma de onda, sin una etapa de vocoder entrenada por separado que gestionar: una auténtica simplificación arquitectónica frente a las cadenas de dos etapas que se diseñó para superar.
  • Generación paralela y no autorregresiva. Como VITS no genera el audio token a token de forma secuencial, la inferencia es rápida en comparación con las alternativas autorregresivas.
  • Un predictor estocástico de duración. El mismo texto de entrada puede interpretarse con ritmos y cadencias diferentes pero válidos entre una generación y otra, en lugar de producir siempre un resultado idéntico y determinista.
  • Calidad competitiva frente a los sistemas de dos etapas, validada mediante evaluaciones de puntuación media de opinión tanto en benchmarks de un solo hablante (LJSpeech) como de varios hablantes (VCTK).
  • Compatibilidad nativa con varios hablantes mediante embeddings de hablante, sin requerir una arquitectura fundamentalmente distinta para ese escenario.
  • Una licencia MIT permisiva y una presencia en el campo lo bastante amplia como para convertirse en la base sobre la que muchos proyectos posteriores construyeron directamente, en vez de crear su propia arquitectura acústica desde cero.

Bajo el capó: la arquitectura VAE condicional

VITS está estructurado como un autoencoder variacional condicional compuesto por tres piezas que cooperan: un codificador posterior, un decodificador y una distribución previa condicional. En esta última, un codificador de texto basado en Transformer y una pila de capas de acoplamiento de flujos de normalización trabajan juntos para modelar, a partir del texto de entrada, características acústicas basadas en espectrogramas. Después, el decodificador reconstruye la forma de onda real mediante una pila de capas convolucionales transpuestas, siguiendo una filosofía de diseño similar a la del vocoder HiFi-GAN en vez de requerir HiFi-GAN como una etapa posterior verdaderamente separada.

Lo que hace que esta combinación funcione tan bien es el método de entrenamiento: la inferencia variacional ampliada con flujos de normalización se combina con un proceso de entrenamiento adversario tomado de los métodos de estilo GAN, y juntos mejoran la capacidad expresiva del modelo generativo subyacente más allá de lo que suele conseguir un VAE estándar por sí solo.

El predictor estocástico de duración

Esta es la elección de diseño más característica de VITS y responde a una limitación real de la mayoría de los sistemas TTS anteriores: cuando una persona real dice dos veces la misma frase, el timing y el ritmo no son idénticos en cada ocasión. VITS modela este fenómeno directamente mediante un predictor estocástico de duración, usando el modelado de incertidumbre sobre variables latentes para sintetizar el mismo texto de entrada con ritmos realmente diversos, en vez de imponer una única duración determinista a cada fonema sin tener en cuenta el contexto. Esto es lo que aporta a VITS una cualidad natural de uno a muchos: un texto, varias interpretaciones válidas con cadencias diferentes, en consonancia con el comportamiento real del lenguaje hablado.

Primeros pasos con VITS

  1. Descarga en Hugging Face un checkpoint preentrenado oficial de Kakao Enterprise. kakao-enterprise/vits-ljs es el modelo de un solo hablante entrenado con LJ Speech; kakao-enterprise/vits-vctk es el modelo multihablante entrenado con el conjunto de datos VCTK (109 hablantes con distintos acentos ingleses). Elige según necesites una voz uniforme o varios hablantes.
  2. Usa la integración de Hugging Face Transformers para obtener la configuración más sencilla. VITS es compatible directamente con las clases VitsModel y VitsTokenizer de la biblioteca transformers: con from transformers import VitsModel, VitsTokenizer y la carga por nombre de cualquiera de los checkpoints, puedes llegar a la inferencia en unas pocas líneas y sin configurar un vocoder independiente.
  3. Usa el repositorio original de GitHub jaywalnut310/vits si quieres entrenar o ajustar el modelo. Es la implementación oficial de referencia de los autores del artículo y el punto de partida que adoptaron la mayoría de los proyectos derivados (Piper, YourTTS y otros) al adaptar VITS a sus casos de uso concretos.
  4. Busca un checkpoint de la comunidad específico para tu idioma o conjunto de datos antes de entrenar uno propio. Dada la cantidad de idiomas y conjuntos de datos con los que la comunidad ha vuelto a entrenar VITS, buscar en Hugging Face un checkpoint existente para el idioma objetivo suele ser más rápido que entrenarlo desde cero.

El árbol genealógico de VITS: qué está construido realmente sobre él

Piper combina un modelo basado en VITS con exportación a ONNX y fonemización mediante espeak-ng para un despliegue ultraligero en el edge, exclusivamente con CPU. MeloTTS se basa específicamente en VITS y VITS2 e incorpora características lingüísticas basadas en BERT para mejorar la prosodia. YourTTS modifica la base de VITS con un codificador de hablante específico y Speaker Consistency Loss para añadir capacidades zero-shot multihablante y de conversión de voz. GPT-SoVITS utiliza un sistema basado en VITS (la parte “SoVITS” de su nombre) en el componente acústico y de conversión de voz de su cadena híbrida, combinado con un componente basado en GPT para el modelado semántico. Ninguno es una copia de VITS: cada proyecto tomó la misma arquitectura central y la modificó para un objetivo específico y distinto, justo el tipo de adaptabilidad que convierte una arquitectura en una base auténtica.

Consejos para obtener mejores resultados

  • Usa el checkpoint de LJSpeech para mantener una sola voz uniforme y VCTK cuando necesites varios hablantes. No elijas uno por defecto sin comprobar cuál responde a las necesidades reales de hablantes de tu proyecto.
  • Espera variaciones naturales entre generaciones: no son un error. Debido al predictor estocástico de duración, ejecutar varias veces el mismo texto con VITS producirá una cadencia ligeramente distinta en cada ocasión. Es la arquitectura funcionando según su diseño, no una incoherencia que debas depurar.
  • Si necesitas algo más específico que el TTS básico, examina primero un proyecto derivado. Si buscas clonación de voz, un despliegue extremadamente ligero o un ajuste específico para chino, es probable que uno de los derivados directos de VITS (YourTTS, Piper o GPT-SoVITS) ya haya resuelto ese problema concreto mejor que una adaptación propia de la arquitectura base.
  • Consulta VITS2 si la eficiencia de entrenamiento y las mejoras de calidad son importantes para tu proyecto. Kong y sus colaboradores publicaron una continuación directa centrada específicamente en mejorar la calidad y la eficiencia del original mediante aprendizaje adversario y refinamientos arquitectónicos.

VITS frente a VITS2 y una alternativa de flow matching

VITSVITS2F5-TTS
Enfoque centralVAE condicional + flujos de normalización + entrenamiento adversarioLa misma base, con arquitectura y entrenamiento refinadosDiffusion Transformer + flow matching condicional
Modo de generaciónNo autorregresivo, paraleloNo autorregresivo, paraleloNo autorregresivo
Modelado de la duraciónPredictor estocástico de duraciónModelado de duración mejoradoSin modelo explícito de duración
Publicación202120232024
LicenciaMITComprobar la implementación concretaCC-BY-NC (no comercial)
Ecosistema de derivadosExtremadamente grandeMás pequeño y recienteEn crecimiento, paradigma más nuevo

La importancia duradera de VITS no reside en que siga siendo por sí solo el estado del arte —varias arquitecturas más recientes ya lo superan en las cifras brutas de los benchmarks—, sino en que su diseño central demostró ser lo bastante influyente y adaptable como para convertirse literalmente en la base de una parte significativa de las herramientas TTS de código abierto que la gente usa hoy en día.

Preguntas frecuentes

¿Sigue valiendo la pena usar VITS directamente o debería elegir un modelo derivado?

Para investigación general o una necesidad sencilla de TTS con uno o varios hablantes, los checkpoints básicos de VITS siguen siendo sólidos. Para requisitos más específicos —clonación de voz, despliegue extremadamente ligero o ajuste para un idioma concreto—, uno de sus derivados (YourTTS, Piper, MeloTTS o GPT-SoVITS) normalmente ya ha adaptado la arquitectura a ese propósito exacto.

¿Cuál es la diferencia entre VITS y VITS2?

VITS2 es una continuación directa de un grupo de autores parcialmente coincidente, centrada específicamente en mejorar la calidad y la eficiencia del entrenamiento del original mediante refinamientos del aprendizaje adversario y cambios arquitectónicos, a la vez que conserva la misma filosofía central de VAE condicional.

¿Por qué el resultado de VITS suena ligeramente distinto cada vez con el mismo texto?

Es intencionado y se debe al predictor estocástico de duración, que modela la relación natural de uno a muchos entre texto y voz: una misma frase puede pronunciarse con distintos ritmos y cadencias válidos, y VITS lo refleja deliberadamente en vez de imponer siempre un resultado idéntico.

¿Se puede usar VITS gratuitamente con fines comerciales?

Sí. La versión original de VITS se publicó bajo la licencia MIT, una de las opciones más permisivas. Sin embargo, si utilizas un derivado concreto o un checkpoint entrenado por la comunidad, comprueba por separado la licencia de ese proyecto, ya que puede diferir de las condiciones del modelo base.

¿VITS admite varios hablantes?

Sí, mediante embeddings de hablante. El checkpoint oficial kakao-enterprise/vits-vctk lo demuestra directamente: fue entrenado con 109 hablantes y una variedad de acentos ingleses.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →