NaturalSpeech 3: el habla no es una sola cosa, ¿por qué generarla como si lo fuera?
- ¿Qué es NaturalSpeech 3?
- FACodec: un códec neuronal creado para separar, no solo para comprimir
- El modelo de difusión factorizada
- Las cifras de los benchmarks
- El lugar de NaturalSpeech 3 dentro de la serie
- NaturalSpeech 3 vs. NaturalSpeech 2 vs. NaturalSpeech
- Preguntas frecuentes
- Convierte texto en voz con Echora
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
La mayoría de los modelos TTS tratan el habla como una única señal enmarañada que debe generarse de una sola vez: contenido, tono, voz y textura unidos y producidos en una sola pasada. NaturalSpeech 3, la entrega más reciente de la línea de investigación NaturalSpeech de Microsoft, parte de una premisa diferente: separar primero esos hilos, generar cada uno según sus propias reglas y volver a combinarlos después. Es un enfoque de divide y vencerás aplicado a la síntesis de voz, y constituye el fundamento específico sobre el que se construye NaturalSpeech 3.
¿Qué es NaturalSpeech 3?
NaturalSpeech 3 es un sistema de texto a voz zero-shot desarrollado por Microsoft Research Asia y Microsoft Azure Speech, en colaboración con investigadores de la Universidad de Ciencia y Tecnología de China, la Universidad China de Hong Kong y la Universidad de Zhejiang. Es la entrega más reciente de la línea de investigación NaturalSpeech —después de que el NaturalSpeech original estableciera un benchmark de calidad de nivel humano con un solo hablante y NaturalSpeech 2 escalara a síntesis zero-shot, multihablante y de canto mediante difusión latente— y aborda un problema para el que ninguno de sus predecesores se diseñó específicamente: la calidad del habla aún quedaba por debajo en similitud y controlabilidad, en parte porque el contenido, la prosodia, el timbre y la textura acústica se modelaban juntos como una única representación entrelazada.
El movimiento central de NaturalSpeech 3 es la factorización: descomponer el habla en subespacios separados que representan atributos distintos, modelar cada uno de forma individual y combinarlos al final. Dos componentes lo hacen posible: un códec neuronal creado específicamente para llevar a cabo esa separación y un modelo de difusión diseñado para generar por turnos cada atributo factorizado.
FACodec: un códec neuronal creado para separar, no solo para comprimir
La mayoría de los códecs de audio neuronales están diseñados para comprimir el habla en tokens con la máxima eficiencia posible, sin preocuparse especialmente por lo que esos tokens representan en términos semánticos. FACodec, el códec que introduce NaturalSpeech 3, se diseña alrededor del objetivo opuesto: mediante Factorized Vector Quantization (FVQ), descompone deliberadamente una forma de onda de voz en subespacios distintos para contenido, prosodia, timbre y detalle acústico, en lugar de producir un único flujo de códigos sin diferenciar.
Lograr una separación verdaderamente limpia entre esos subespacios —en vez de que cada uno filtrase información de la que deberían encargarse los demás— exigió combinar varias técnicas específicas durante el entrenamiento: un cuello de botella de información para eliminar los atributos que no pertenecen a un subespacio determinado, pérdidas supervisadas específicas que enseñan explícitamente a cada subespacio su atributo previsto, entrenamiento adversarial e inversión del gradiente para desalentar aún más la contaminación entre subespacios. En la decodificación, el subespacio de timbre se reincorpora mediante normalización de capas condicional a medida que se reconstruye la forma de onda final, en lugar de concatenarse sin más con todo lo demás.
El modelo de difusión factorizada
Una vez que el habla puede dividirse de forma fiable en estos subespacios de atributos, NaturalSpeech 3 los genera con un modelo de difusión construido específicamente para esa estructura factorizada: produce de forma secuencial la duración, la prosodia, el contenido y el detalle acústico, y condiciona cada elemento tanto a los atributos ya generados como a la entrada de texto a nivel de fonemas. La duración se modela explícitamente como un paso independiente —en lugar de integrarla en la prosodia— precisamente porque el sistema no es autorregresivo y necesita una señal temporal explícita sobre la que trabajar.
La ventaja práctica de este diseño es un control independiente real: dado que cada atributo posee su propio subespacio y su propio paso de generación, es posible condicionar atributos distintos con prompts distintos. Un clip de referencia puede aportar el timbre deseado mientras una señal separada da forma a la prosodia, un nivel de control granular que una única representación entrelazada sencillamente no puede ofrecer, ya que ajustar cualquier elemento en un sistema sin diferenciar implica el riesgo de arrastrar consigo a todos los demás atributos.
Las cifras de los benchmarks
NaturalSpeech 3 consiguió un nuevo resultado de vanguardia en similitud de hablante: una puntuación Sim-O de 0.67 y un SMOS (similarity mean opinion score) de 4.01, frente al Sim-O de 0.64 y el SMOS de 3.69 del sistema de referencia más potente de aquel momento. Este salto significativo se atribuyó específicamente a que FACodec separaba el timbre del resto de atributos con mayor limpieza. En términos más amplios, el sistema superó a los sistemas TTS de vanguardia anteriores en calidad, similitud, prosodia e inteligibilidad, y declaró alcanzar una calidad equiparable a la de grabaciones humanas reales. La arquitectura también se validó a escala: los resultados mejoraron al llevarla a aproximadamente 1.000 millones de parámetros y 200.000 horas de datos de entrenamiento, un salto importante frente al conjunto de entrenamiento ya considerable de 44.000 horas de NaturalSpeech 2.
El lugar de NaturalSpeech 3 dentro de la serie
Cada generación de esta línea de investigación resolvió un problema diferente y progresivamente más avanzado. El NaturalSpeech original estableció una definición rigurosa y comprobable mediante estadísticas de la calidad de nivel humano, y la alcanzó en un benchmark de un solo hablante. NaturalSpeech 2 amplió esa ambición a la generación multihablante, zero-shot y con datos reales —y, de forma destacada, a la síntesis de canto zero-shot— sustituyendo la generación autorregresiva de tokens discretos por difusión latente continua. NaturalSpeech 3 aborda una debilidad completamente distinta: incluso con una clonación zero-shot potente, el control y la separación limpia de atributos seguían siendo limitados, que es exactamente lo que los códecs factorizados y la difusión factorizada se crearon para corregir.
NaturalSpeech 3 vs. NaturalSpeech 2 vs. NaturalSpeech
| NaturalSpeech 3 | NaturalSpeech 2 | NaturalSpeech (original) | |
|---|---|---|---|
| Enfoque central | Códec factorizado (FACodec) + difusión factorizada | Latentes continuos + difusión latente | Basado en VAE, de extremo a extremo |
| Problema resuelto | Control independiente de atributos, similitud | Multihablante, zero-shot, canto | Calidad de nivel humano con un solo hablante |
| Similitud de hablante (Sim-O) | 0.67 (nuevo estado del arte en su lanzamiento) | Métrica no comparable directamente | No aplicable (un solo hablante) |
| Control independiente de atributos | Sí, mediante subespacios y prompts separados | Limitado a un prompt general de hablante/estilo | No aplicable |
| Escala de entrenamiento | 1.000 millones de parámetros, 200.000 horas | 44.000 horas | Dataset de benchmark de un solo hablante |
| Lanzamiento público oficial | No (solo el artículo de investigación) | No (existe una reimplementación comunitaria) | No (existe una reimplementación comunitaria) |
La contribución específica de NaturalSpeech 3 es demostrar que tratar el habla como un conjunto de atributos separables —en vez de como una señal indivisible— mejora simultáneamente tanto la calidad como el control. Así prolonga el hilo conductor de la serie: definir con precisión una debilidad concreta y construir después una arquitectura diseñada para cerrar exactamente esa brecha.
Preguntas frecuentes
¿Qué significa «factorizado» en NaturalSpeech 3?
Se refiere a descomponer el habla en subespacios separados y desacoplados —contenido, prosodia, timbre y detalle acústico—, cada uno modelado y generado de forma relativamente independiente, en lugar de tratar el habla como una única representación entrelazada que se genera de una sola vez.
¿Qué es FACodec?
FACodec es el códec neuronal de voz que introduce NaturalSpeech 3. Emplea Factorized Vector Quantization para dividir una forma de onda de voz en subespacios distintos de contenido, prosodia, timbre y detalle acústico, y utiliza técnicas como los cuellos de botella de información y el entrenamiento adversarial para mantener esos subespacios claramente separados.
¿Cómo se compara NaturalSpeech 3 con NaturalSpeech 2?
NaturalSpeech 2 se centró en escalar la clonación zero-shot a datos multihablante y de entornos reales, además de la síntesis de canto, mediante difusión latente continua. NaturalSpeech 3 parte de esa escala, pero se enfoca específicamente en la similitud y el control independiente, usando su códec factorizado y su método de difusión para alcanzar una nueva puntuación de vanguardia en similitud de hablante.
¿Puedo descargar o ejecutar NaturalSpeech 3?
No de forma oficial. Microsoft no ha publicado código ni pesos preentrenados y, a diferencia de NaturalSpeech 2, en el momento de redactar este artículo no existe una reimplementación comunitaria consolidada y ampliamente disponible de la arquitectura específica de NaturalSpeech 3.
¿NaturalSpeech 3 alcanza una calidad de nivel humano como el NaturalSpeech original?
Sus resultados publicados declaran una calidad equiparable a las grabaciones humanas, lo que extiende la ambición original de la serie de alcanzar calidad de nivel humano a un entorno zero-shot con control de múltiples atributos mucho más difícil, en vez del benchmark de un solo hablante del original.
Convierte texto en voz con Echora
Para un flujo en el navegador con un objetivo similar, utiliza Texto a voz de Echora. Introduce hasta 5.000 caracteres, elige una voz integrada o una voz personalizada guardada, añade etiquetas de interpretación compatibles cuando las necesites y ajusta la estabilidad. Después podrás escuchar el resultado y descargar el MP3 terminado.