NaturalSpeech 2: puede hacer cantar a una voz que nunca ha cantado
- ¿Qué problema trataba de resolver realmente NaturalSpeech 2?
- El mecanismo de muestra de voz que hace posible la generación zero-shot
- Cómo funciona la síntesis de canto zero-shot
- Rendimiento
- Cómo empezar hoy con NaturalSpeech 2
- Consejos para entender NaturalSpeech 2
- NaturalSpeech 2 frente a NaturalSpeech y VALL-E
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Este es el detalle que más destaca de NaturalSpeech 2: dale unos segundos de una persona hablando sin más —sin cantar, sin melodía, sin ningún elemento musical— y puede generar esa misma voz cantando una pieza completamente distinta, afinada y a tempo. El sucesor de NaturalSpeech creado por Microsoft se diseñó para resolver un problema mucho más difícil que el de su predecesor: llevar la calidad de nivel humano más allá de una única voz grabada en estudio, hasta hablantes y estilos arbitrarios y, como terminó demostrándose, hasta una modalidad de interpretación vocal totalmente distinta.
¿Qué problema trataba de resolver realmente NaturalSpeech 2?
El NaturalSpeech original demostró que era posible alcanzar una calidad de nivel humano en un benchmark de un solo hablante y grabaciones de estudio. Llevar esa misma calidad a conjuntos de datos grandes, diversos y obtenidos en condiciones reales —con distintas identidades de hablantes, prosodias y estilos como el canto— resultó ser un problema verdaderamente diferente. La mayoría de los sistemas TTS a gran escala de la época lo abordaban cuantizando el habla en tokens discretos y generándolos uno a uno con un modelo de lenguaje autorregresivo, el mismo enfoque general que popularizó VALL-E. Sin embargo, ese método tiende a sufrir prosodia inestable y a omitir o repetir palabras, además de perder calidad de voz a medida que aumenta la diversidad de los datos de entrenamiento.
NaturalSpeech 2 sigue un camino estructuralmente diferente: en lugar de predecir tokens discretos de forma autorregresiva, utiliza un códec de audio neuronal con cuantizadores vectoriales residuales para producir vectores latentes continuos, y genera esos vectores mediante un modelo de difusión latente condicionado por el texto de entrada. Es la misma filosofía no autorregresiva de su predecesor, aplicada a un entorno de datos mucho más difícil y diverso.
El mecanismo de muestra de voz que hace posible la generación zero-shot
Para que la generación zero-shot funcione de forma fiable a esta escala, NaturalSpeech 2 introduce un mecanismo específico de muestras de voz, diseñado expresamente para permitir el aprendizaje en contexto tanto dentro del modelo de difusión latente como en un predictor independiente de duración y tono. En la práctica, esto significa que un clip de referencia breve no solo condiciona la fase final de generación de audio: también determina cómo predice el modelo la sincronización y el contorno tonal del contenido nuevo. Es un diseño sustancialmente distinto de limitarse a añadir un embedding de hablante en una sola etapa del flujo de procesamiento.
Cómo funciona la síntesis de canto zero-shot
Esta es la capacidad a la que alude el propio subtítulo de NaturalSpeech 2 —«sintetizadores naturales y zero-shot de habla y canto»— y merece la pena entender cómo funciona realmente en vez de tratarla como un truco de caja negra.
El modelo se amplió con un conjunto de entrenamiento combinado de unas 44.000 horas de datos de habla y canto. La parte cantada se reunió a partir de grabaciones vocales rastreadas en la web: se eliminaron la música de fondo y el acompañamiento mediante un proceso específico de separación de audio, y las muestras mal alineadas se descartaron con una comprobación basada en ASR. En total, se obtuvieron unas 30 horas de datos de canto, que se sobremuestrearon y mezclaron con el conjunto de entrenamiento de voz más amplio.
Para generar una interpretación cantada, el modelo toma el tono real y el contorno de duración de una referencia de canto existente y aplica después una muestra de voz elegida para reproducir esa melodía y sincronización con el timbre de un cantante concreto. El hallazgo verdaderamente notable es que esa muestra de voz no tiene que proceder de una grabación cantada: una muestra de voz hablada basta para que NaturalSpeech 2 genere una voz cantada nueva con el timbre de ese hablante, extendiendo así la generación zero-shot a una forma de interpretación que nunca se había grabado al hablante de referencia realizando.
Rendimiento
En evaluaciones zero-shot con hablantes no vistos, NaturalSpeech 2 superó ampliamente a los anteriores sistemas TTS a gran escala en similitud de prosodia y timbre, robustez y calidad general de la voz. Mostró una similitud prosódica especialmente alta con la muestra de referencia bajo las condiciones de prueba de LibriSpeech y VCTK, y los resultados conservaron una calidad notable incluso con muestras de solo 3 segundos.
Cómo empezar hoy con NaturalSpeech 2
Al igual que con el NaturalSpeech original, Microsoft no publicó código oficial ni pesos preentrenados de NaturalSpeech 2; lo que está disponible es el artículo de investigación y las muestras de audio de la página de demostración del proyecto. Los proyectos de la comunidad cubren ese vacío, aunque con algunas advertencias importantes:
- Consulta la reimplementación
lucidrains/naturalspeech2-pytorch. Es una implementación en PyTorch de la arquitectura descrita que se mantiene en desarrollo activo, construida en torno a EnCodec como códec neuronal y con difusión de eliminación de ruido para el proceso generativo. - Ten claro que es un framework para entrenar desde cero, no un modelo preentrenado. Como ocurre con la mayoría de las reproducciones comunitarias de trabajos publicados solo como investigación, necesitarás tu propio conjunto de datos y entrenamiento; no hay ningún checkpoint oficial ni entrenado por la comunidad que ofrezca directamente la calidad descrita en el artículo.
- Comprueba el estado de desarrollo del propio proyecto antes de depender de él. Su documentación enumera tareas todavía en curso —entre ellas, ajustes de la predicción de duración y tono durante el entrenamiento y mejoras adicionales del mecanismo de atención—, así que debe tratarse como una herramienta de investigación en evolución, no como una versión terminada y estable.
- Prepárate para reunir tu propio conjunto de datos de canto si ese es tu objetivo concreto. Como la capacidad de canto de NaturalSpeech 2 surgió de datos rastreados en la web, seleccionados y filtrados cuidadosamente, y mezclados con un corpus de voz mucho mayor, reproducir ese resultado específico exige una recopilación de datos igual de deliberada, no solo entrenar con un conjunto genérico de habla.
Consejos para entender NaturalSpeech 2
- Separa las dos afirmaciones principales al evaluarlo. La clonación de voz zero-shot a gran escala y la síntesis de canto zero-shot a partir únicamente de una muestra hablada son dos resultados diferentes y destacados por sí mismos; no los confundas al decidir cuál es realmente relevante para tu caso de uso.
- Reconoce la apuesta arquitectónica contraria al modelado lingüístico con tokens discretos. La elección de difusión latente continua de NaturalSpeech 2 frente al enfoque de códec discreto más modelo de lenguaje autorregresivo empleado por contemporáneos como VALL-E responde directamente a la inestabilidad y a la omisión de palabras que puede producir ese enfoque. Es un punto de comparación útil si evalúas arquitecturas de forma más amplia.
- Tómate en serio la duración de la muestra si estás estudiando o reproduciendo el sistema. La investigación midió específicamente cómo cambia la similitud prosódica con la duración de la muestra (probando muestras de 3, 5 y 10 segundos), y las muestras más largas produjeron en general resultados mejor ajustados; es un detalle que conviene tener en cuenta al adaptar técnicas similares.
- Trata el marco de IA responsable como una restricción real, no como texto de relleno. Dada la eficacia de este enfoque para reproducir una identidad vocal en un contexto interpretativo completamente distinto (el canto), las salvaguardas de consentimiento y detección descritas por Microsoft son directamente relevantes para cualquier uso responsable de técnicas similares, no simple lenguaje legal que pueda pasarse por alto.
NaturalSpeech 2 frente a NaturalSpeech y VALL-E
| NaturalSpeech 2 | NaturalSpeech (original) | VALL-E | |
|---|---|---|---|
| Enfoque central | Latentes continuos + difusión latente | Basado en VAE, de extremo a extremo | Tokens de códec discretos + modelo de lenguaje autorregresivo |
| Escenario más adecuado | Varios hablantes, zero-shot, condiciones reales, canto | Un solo hablante, calidad de estudio | Clonación zero-shot a partir de muestras breves |
| Síntesis de canto | Sí, zero-shot, incluso con una muestra solo de habla | No es una prioridad | No es una prioridad |
| Escala de entrenamiento | ~44.000 horas (habla + canto) | Benchmark más pequeño de un solo hablante | ~60.000 horas |
| Problemas de robustez conocidos | Diseñado específicamente para evitar la inestabilidad de los tokens discretos | No es autorregresivo, por lo que no se aplica | Repetición/inestabilidad abordada después en VALL-E 2 |
| Publicación oficial | No (solo demostración de investigación) | No (solo reimplementación comunitaria) | No |
La verdadera aportación de NaturalSpeech 2 es demostrar que la vía autorregresiva con tokens discretos popularizada por VALL-E no era la única forma de ampliar el TTS zero-shot: un enfoque de difusión latente continua podía igualarlo o superarlo en robustez y calidad, y además desbloquear una capacidad verdaderamente novedosa de transferencia de interpretación vocal entre modalidades.
Preguntas frecuentes
¿NaturalSpeech 2 puede hacer cantar de verdad a alguien que nunca ha cantado?
Sí, según la investigación publicada: generar una interpretación cantada nueva con el timbre de un hablante utilizando solo una muestra de voz hablada es una de sus capacidades expresamente destacadas y probadas.
¿En qué se diferencia NaturalSpeech 2 de NaturalSpeech?
El NaturalSpeech original se centró y evaluó en la síntesis de un solo hablante con calidad de estudio. NaturalSpeech 2 aborda el problema mucho más difícil de la síntesis a gran escala, con varios hablantes, zero-shot y en condiciones reales, y utiliza difusión latente en lugar del diseño basado en VAE del original.
¿Por qué utilizó Microsoft difusión en vez de un modelo de lenguaje autorregresivo como VALL-E?
La generación autorregresiva sobre tokens discretos de habla puede sufrir prosodia inestable y omisiones o repeticiones de palabras, sobre todo a gran escala. El enfoque de difusión latente continua de NaturalSpeech 2 se diseñó específicamente para evitar esos modos de fallo.
¿Plantea NaturalSpeech 2 problemas de consentimiento relacionados con la clonación de voz?
Sí, y Microsoft los aborda directamente: la investigación se realizó bajo el supuesto de que los usuarios consienten ser el hablante objetivo, y se indica que un despliegue real necesitaría un protocolo de consentimiento y salvaguardas para detectar voz sintetizada.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.