VALL-E: El modelo que empezó a tratar el habla como texto
- ¿Qué es VALL-E?
- Cómo se convierte el habla en un problema de modelado del lenguaje
- Un efecto secundario notable: también conserva la emoción y el entorno
- Rendimiento de VALL-E
- Cómo empezar a usar VALL-E hoy
- Consejos para trabajar con VALL-E
- VALL-E frente a modelos contemporáneos y posteriores
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Los modelos GPT no entienden el lenguaje mediante la regresión de señales continuas: predicen una y otra vez el siguiente token de una secuencia, y esa idea tan sencilla escala extraordinariamente bien. VALL-E, desarrollado por Microsoft, planteó qué ocurriría si la conversión de texto a voz funcionara del mismo modo: convertir el audio en tokens discretos y dejar que un modelo de lenguaje los predijera como predice las palabras. Este nuevo planteamiento explica por qué VALL-E se describe como un modelo de lenguaje con códec neuronal y no como un sistema TTS convencional, y constituye el punto de partida arquitectónico sobre el que se construyó directamente toda una generación posterior de modelos de clonación de voz: VALL-E 2, VALL-E X y otros.
¿Qué es VALL-E?
Microsoft presentó VALL-E en un artículo de enero de 2023, y su aportación decisiva fue tratar la conversión de texto a voz como una tarea de modelado condicional del lenguaje sobre códigos de audio discretos, en lugar de recurrir a la regresión de señales continuas de la que dependían los sistemas TTS neuronales anteriores. Para hacerlo posible, VALL-E utiliza EnCodec, un códec de audio neuronal basado en cuantificación vectorial residual, que convierte las ondas de voz reales en tokens discretos capaces de transportar tanto la identidad del hablante como sus características acústicas y que después pueden volver a decodificarse como audio de alta calidad.
El modelo se entrenó con unas 60.000 horas de voz en inglés, cientos de veces más datos de entrenamiento de los que solían utilizar los sistemas TTS de la época. La recompensa de esa escala fue una capacidad verdaderamente nueva: el aprendizaje en contexto aplicado a la clonación de voz. Basta con proporcionar a VALL-E un prompt acústico de 3 segundos de un hablante al que nunca haya oído para que genere una nueva locución con esa voz, del mismo modo que un gran modelo de lenguaje puede captar un patrón a partir de una muestra breve sin ningún entrenamiento adicional.
Cómo se convierte el habla en un problema de modelado del lenguaje
La arquitectura de VALL-E combina el modelado autorregresivo (AR) y no autorregresivo (NAR), distribuidos entre las capas de sus tokens de códec. EnCodec no produce una única secuencia de tokens por cada fotograma de audio: genera ocho capas de tablas de códigos por fotograma, cada una de las cuales captura detalles acústicos cada vez más precisos. El componente AR de VALL-E predice secuencialmente la primera capa, la más importante, condicionado por la secuencia de fonemas del texto de entrada; este es el paso que más se parece a un modelo de lenguaje tradicional que genera un token cada vez. A continuación, el componente NAR completa en paralelo las siete capas restantes, condicionado por lo que ya ha generado el modelo AR. De este modo sacrifica parte de la flexibilidad del modelo AR a cambio de una generación sensiblemente más rápida en las capas que menos influyen en la inteligibilidad general.
Un efecto secundario notable: también conserva la emoción y el entorno
Como el modelo trabaja con una muestra acústica real en vez de con una representación abstracta del hablante, se observó que VALL-E conserva de su referencia de 3 segundos mucho más que la identidad vocal: también tiende a reproducir el tono emocional del hablante e incluso el entorno acústico presente en la propia muestra, como la reverberación de la sala o las características del fondo. No se trata tanto de una función diseñada expresamente como de una propiedad emergente de condicionar el modelo directamente con tokens acústicos reales, en lugar de usar una representación comprimida que solo contenga la identidad. Es el mismo tipo de comportamiento emergente que hizo que el aprendizaje en contexto resultara tan llamativo en los modelos de lenguaje basados en texto.
Rendimiento de VALL-E
En su evaluación original frente a YourTTS, el sistema TTS zero-shot más potente disponible públicamente en aquel momento, VALL-E obtuvo resultados significativamente mejores tanto en naturalidad del habla como en similitud del hablante en los benchmarks LibriSpeech y VCTK. También demostró que podía generar resultados variados para una misma entrada mediante distintas ejecuciones de decodificación basadas en muestreo, en vez de converger siempre en un único resultado determinista.
Cómo empezar a usar VALL-E hoy
Conviene saber algo de entrada: Microsoft nunca publicó el código de entrenamiento ni los pesos de VALL-E, debido al posible uso indebido que permite una clonación de voz tan convincente a partir de solo 3 segundos. Lo que está disponible públicamente es el artículo de investigación y las muestras de demostración, no un checkpoint oficial para descargar. Hoy, el acceso práctico depende de iniciativas de la comunidad:
- Utiliza una reimplementación independiente en PyTorch. Proyectos de GitHub como
lifeiteng/vall-ereproducen la arquitectura del artículo, pero por lo general exigen entrenar un modelo propio con un conjunto de datos como LibriTTS en vez de proporcionar pesos preentrenados listos para usar. - Considera las reproducciones comunitarias de VALL-E X si buscas pesos listos para usar. VALL-E X, una extensión entre idiomas de la misma idea central y también un proyecto de investigación de Microsoft que originalmente no tuvo publicación oficial, cuenta con una popular reproducción comunitaria (
Plachtaa/VALL-E-X) que sí incluye pesos preentrenados. Es un punto de partida más inmediato si quieres escuchar en acción esta familia de arquitecturas sin entrenarla desde cero. - Ajusta tus expectativas sobre el entrenamiento si eliges empezar desde cero. Dada la escala de 60.000 horas de entrenamiento del modelo original, reproducir una calidad comparable en tu propio hardware exige una capacidad de cómputo considerable y un conjunto de datos de voz grande y limpio. Es un proyecto de nivel investigador, no algo que se pueda terminar en un fin de semana.
- Consulta VALL-E 2 si buscas un sucesor más práctico. El trabajo posterior de Microsoft abordó directamente los problemas conocidos de robustez y velocidad de VALL-E y representa una versión más refinada del mismo enfoque central. Merece la pena estudiarlo si te importa más la viabilidad en producción que analizar la arquitectura original.
Consejos para trabajar con VALL-E
- Trátalo como una referencia arquitectónica, no como un modelo listo para desplegar. Ante la falta de una publicación oficial, su principal valor práctico hoy consiste en comprender el enfoque de modelo de lenguaje con códec neuronal que VALL-E abrió y que aparece de distintas formas en muchos modelos open source de clonación más recientes.
- Espera que la emoción y el entorno de la muestra también se transfieran. Si trabajas con una reproducción y el resultado conserva de forma inesperada el ruido de fondo o el tono emocional de la muestra de referencia, se trata de una característica documentada de esta familia de arquitecturas, no de un error de la implementación concreta que utilices.
- Reserva tiempo de entrenamiento real si utilizas una reimplementación desde cero. Las implementaciones comunitarias sin pesos preentrenados necesitan una cantidad considerable de datos y cómputo para acercarse a la calidad indicada en el artículo original.
- Comprueba la licencia y la procedencia del conjunto de datos de cada reproducción. Como se trata de modelos entrenados por la comunidad y no de una publicación oficial, las condiciones de licencia y el origen de los datos de entrenamiento varían según el proyecto. Revisa el repositorio concreto que vayas a usar antes de cualquier aplicación comercial.
VALL-E frente a modelos contemporáneos y posteriores
| VALL-E | YourTTS (referencia contemporánea) | Modelos posteriores de flow matching (E2 TTS, F5-TTS) | |
|---|---|---|---|
| Enfoque central | Tokens de códec discretos + modelado del lenguaje | TTS neuronal tradicional | Flow matching, no autorregresivo |
| Escala de datos de entrenamiento | ~60.000 horas | Considerablemente menor | Comparable o menor, con un enfoque distinto |
| Duración de la muestra para clonar la voz | ~3 segundos | Normalmente se necesita más | ~5–15 segundos |
| Naturalidad/similitud (resultados publicados) | Superó a YourTTS | Referencia de comparación | Convergencia generalmente más rápida, alineación más estable |
| Pesos oficiales públicos | No | Sí | Sí (F5-TTS); no (E2 TTS) |
| Conservación de emoción/entorno | Notable y emergente | No es una función destacada | Menos enfatizada |
El verdadero legado de VALL-E no es un checkpoint que puedas descargar, sino la reformulación del TTS como un problema de predicción de tokens sobre el que, de una forma u otra, todavía se apoya una gran parte de los modelos open source actuales de clonación.
Preguntas frecuentes
¿Puedo descargar de Microsoft los pesos oficiales del modelo VALL-E?
No. Microsoft publicó el artículo de investigación y muestras de audio de demostración, pero nunca hizo públicos el código de entrenamiento ni los pesos del modelo, debido al riesgo de uso indebido que plantea una clonación tan convincente a partir de clips cortos.
¿Qué significa realmente «modelo de lenguaje con códec neuronal»?
Significa que el modelo trata la generación de voz como la predicción de tokens de audio discretos, obtenidos de un códec de audio neuronal como EnCodec, del mismo modo que un modelo de lenguaje predice tokens de texto, en lugar de realizar directamente una regresión de una señal de audio continua como hacían los sistemas TTS anteriores.
¿Cuánto audio de referencia necesita VALL-E para clonar una voz?
Tan solo 3 segundos. Utiliza el aprendizaje en contexto para generar voz nueva con ese timbre sin ningún ajuste adicional.
¿En qué se diferencian VALL-E y VALL-E X?
VALL-E X es una extensión entre idiomas de la misma arquitectura central. También nació como un proyecto de investigación de Microsoft sin publicación oficial, pero cuenta con una reproducción comunitaria popular que sí ofrece pesos preentrenados y listos para usar.
¿Existe alguna forma de ejecutar VALL-E sin tener que entrenarlo yo mismo?
Reproducciones comunitarias como Plachtaa/VALL-E-X ofrecen pesos preentrenados para la variante multilingüe; las reproducciones del VALL-E original, como lifeiteng/vall-e, suelen exigir que entrenes tu propio modelo en vez de descargar pesos ya terminados.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.