EchoraEchora
Volver a los modelos

VALL-E 2: dos ajustes y, de repente, no se distingue de una voz humana

1 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Llevar un modelo de estar «sorprendentemente cerca del habla humana» a ser «supuestamente indistinguible de ella» no siempre exige una arquitectura nueva: a veces basta con corregir los dos problemas concretos que limitaban silenciosamente al original. VALL-E 2, la continuación de VALL-E desarrollada por Microsoft, introdujo exactamente dos cambios específicos en el mismo diseño central, y el resultado se describió como el primer sistema de texto a voz zero-shot que alcanza el nivel humano, una afirmación comprobada directamente frente a grabaciones humanas reales y no solo frente a otros modelos.

¿Qué es VALL-E 2?

VALL-E 2 parte directamente del enfoque de modelado de lenguaje con códec neuronal de VALL-E: la misma idea central de tratar la generación de voz como predicción de tokens sobre códigos de audio discretos, con la misma arquitectura Transformer híbrida autorregresiva (AR) y no autorregresiva (NAR), y una capa de embeddings de texto, otra de códigos y una capa de predicción de códigos compartidas por ambos componentes. Lo que cambia no es la base, sino dos mecanismos concretos añadidos sobre ella, cada uno dirigido a una debilidad específica del modelo original.

Las dos mejoras que marcaron la diferencia

Muestreo consciente de repeticiones (Repetition Aware Sampling). El proceso de decodificación original de VALL-E usaba un muestreo aleatorio directo, que en ocasiones podía producir una salida inestable o caer en un bucle infinito y repetir indefinidamente el mismo sonido o frase. VALL-E 2 lo corrige siguiendo la repetición de tokens en el historial de decodificación y alternando de forma adaptativa entre muestreo aleatorio y muestreo por núcleo en cada paso: si la proporción de repeticiones supera un umbral definido, el modelo introduce un token vuelto a muestrear aleatoriamente de la distribución de probabilidad original, en lugar de continuar por la ruta repetitiva. El resultado es una decodificación considerablemente más estable sin sacrificar la variación natural que aporta la generación basada en muestreo.

Modelado de códigos agrupados (Grouped Code Modeling). En vez de modelar cada código del códec como un paso independiente, VALL-E 2 agrupa los códigos del códec y modela cada grupo dentro de un único frame durante el proceso de generación AR. Así acorta la longitud efectiva de la secuencia que debe procesar el modelo, lo que acelera la inferencia y aborda directamente las dificultades que las secuencias largas planteaban a la arquitectura original.

Ninguno de los dos cambios altera la idea fundamental del modelo de lenguaje con códec neuronal que introdujo VALL-E: son correcciones de ingeniería específicas para la estabilidad de la decodificación y la longitud de las secuencias, y juntas bastaron para pasar de «muy bueno» a una afirmación concreta y verificable de nivel humano.

Los resultados de nivel humano, en contexto

La evaluación empleó dos conjuntos de prueba distintos, y el más difícil ofrece el resultado más revelador. En LibriSpeech test-clean, con 40 hablantes diferentes y una locución de referencia como prompt de clonación para cada uno, VALL-E 2 superó al VALL-E original tanto en las puntuaciones de similitud del hablante (SMOS) como en las de calidad del habla (CMOS). En VCTK —una prueba de referencia bastante más difícil, con 60 hablantes que abarcan acentos mucho más diversos y hacen que la clonación zero-shot sea sustancialmente más complicada—, VALL-E 2 no solo volvió a superar a VALL-E, sino que igualó o superó las grabaciones humanas reales usadas como referencia, utilizando únicamente un prompt de 3 segundos por hablante. Ese resultado concreto en el conjunto de datos más difícil y con mayor diversidad de acentos es la base de la afirmación de nivel humano.

El artículo también indicó que VALL-E 2 podía sintetizar de forma fiable frases complejas que suponían un problema conocido para el modelo original: frases con formulaciones poco habituales o secuencias de fonemas difíciles que antes provocaban precisamente la inestabilidad que el muestreo consciente de repeticiones se diseñó para corregir.

Por qué no puedes descargar VALL-E 2

Este es el aspecto práctico más importante que hay que entender sobre el modelo, y Microsoft ha sido inusualmente directa al respecto: VALL-E 2 no se publicó deliberadamente como modelo o producto público. Los investigadores citaron exactamente los riesgos de uso indebido que cabría esperar de un sistema tan convincente, como la suplantación de voz y la imitación de una persona concreta sin su consentimiento. El propio artículo de investigación plantea sus experimentos bajo el supuesto de que los usuarios cuentan con el consentimiento de la persona cuya voz se pretende sintetizar, una salvaguarda ética particularmente explícita para una publicación científica y que refleja la seriedad con la que el equipo trató las implicaciones de lo que había creado.

En la práctica, esto significa que no existe un checkpoint oficial y que —a diferencia de VALL-E X, que cuenta con una reproducción comunitaria popular y plenamente utilizable con pesos preentrenados publicados— hasta la fecha no ha aparecido ninguna recreación open source igual de completa de las técnicas específicas de VALL-E 2, el muestreo consciente de repeticiones y el modelado de códigos agrupados. Lo que está disponible públicamente es el artículo de investigación, la página del proyecto de Microsoft con muestras de audio y marcos de evaluación como ELLA-V, utilizados junto con LibriSpeech y VCTK para evaluar cómo maneja el modelo tareas de generación complejas.

Qué significa esto si estás evaluando VALL-E 2

Si te interesa comprender el estado del arte de los modelos de lenguaje con códec neuronal, la contribución de VALL-E 2 realmente merece atención: demuestra que las correcciones en la estrategia de decodificación, y no solo modelos más grandes o más datos, pueden marcar la diferencia entre «impresionante» y «nivel humano» en una prueba rigurosa y con diversidad de acentos. Si lo que te interesa es desplegar algo, el camino práctico pasa por modelos que sí se publicaron: la reproducción comunitaria de VALL-E X para trabajos entre idiomas, o modelos open source de clonación totalmente distintos (F5-TTS, Chatterbox y CosyVoice3) para producción, ya que VALL-E 2 nunca se puso a disposición para ejecutarlo.

VALL-E 2 frente a VALL-E y VALL-E X

VALL-E 2VALL-E (original)VALL-E X
Mejora principalMuestreo consciente de repeticiones + modelado de códigos agrupadosConcepto original de modelo de lenguaje con códec neuronalExtensión interlingüística de VALL-E
Estabilidad de decodificaciónMejora considerable; corrige el problema del bucle infinitoInestabilidad conocida con algunas entradasHereda el enfoque de VALL-E
Resultado declaradoNivel humano en LibriSpeech y VCTKSuperó la referencia YourTTSTransferencia interlingüística de alta calidad
Duración del prompt de referencia~3 segundos~3 segundos~3–10 segundos
Publicación oficialNoNoNo
Reproducción comunitaria utilizableNinguna de uso extendidoRequiere entrenamiento propioSí, con pesos preentrenados publicados

La verdadera importancia de VALL-E 2 está en ser un hito de investigación y no una herramienta que puedas descargar y usar: es la evidencia más clara hasta ahora de que el enfoque de modelo de lenguaje con códec neuronal iniciado por VALL-E puede, con los ajustes de decodificación adecuados, producir habla zero-shot que los oyentes no logran distinguir de forma fiable de una grabación real.

Preguntas frecuentes

¿Puedo descargar o usar VALL-E 2?

No. Microsoft no ha publicado código oficial ni pesos preentrenados y, a diferencia de VALL-E X, hasta la fecha no existe ninguna reproducción comunitaria ampliamente disponible de las técnicas específicas de VALL-E 2. Lo que se ha publicado es el artículo de investigación y las muestras de audio.

¿Qué significa «nivel humano» en este contexto?

Significa que, en evaluaciones de referencia concretas —LibriSpeech y el conjunto VCTK, con mayor diversidad de acentos—, las puntuaciones de los oyentes para el habla generada por VALL-E 2 igualaron o superaron las de las grabaciones humanas reales usadas como referencia, empleando solo un prompt de clonación de 3 segundos por hablante.

¿Qué son Repetition Aware Sampling y Grouped Code Modeling?

Repetition Aware Sampling ajusta de forma adaptativa el proceso de decodificación según el historial de repetición de tokens para evitar salidas inestables o en bucle. Grouped Code Modeling agrupa códigos del códec para acortar la longitud efectiva de la secuencia, mejorando tanto la velocidad de inferencia como la capacidad del modelo para manejar secuencias más largas.

¿Por qué decidió Microsoft no publicar VALL-E 2?

Los investigadores citaron el riesgo de uso indebido debido a lo convincentes que son los resultados de clonación, y mencionaron en particular problemas como la suplantación de voz y la imitación de una persona concreta sin su consentimiento.

¿En qué se diferencia VALL-E 2 de VALL-E X?

VALL-E 2 mejora la estabilidad de decodificación y la calidad del habla del VALL-E original dentro de un mismo idioma mediante Repetition Aware Sampling y Grouped Code Modeling. VALL-E X, una línea de trabajo independiente, amplía VALL-E específicamente para transferir voces entre idiomas y, a diferencia de VALL-E 2, cuenta con una reproducción comunitaria utilizable y con pesos preentrenados publicados.

Convierte texto en voz con Echora

Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.

Crear voz desde texto →