Voicebox: un modelo creado para editar voz, no solo para generarla desde cero
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Un modelo TTS autorregresivo solo puede prolongar un clip desde el punto donde terminó: no puede volver atrás y corregir una palabra intermedia sin regenerar todo lo que viene después. Voicebox, el modelo de investigación de Meta desarrollado por FAIR, se creó en torno a una tarea radicalmente distinta: dado el contexto de audio circundante y un texto objetivo, rellenar el fragmento que falta en cualquier punto del clip, igual que se usaría el inpainting para editar el centro de una imagen en lugar de pintar únicamente más allá de sus bordes.
¿Qué es Voicebox?
Voicebox es un modelo no autorregresivo de flow matching entrenado con más de 50.000 horas de voz sin filtrar ni mejorar, procedentes de audiolibros de dominio público en inglés, francés, alemán, español, polaco y portugués. En vez de entrenarlo directamente para las numerosas tareas independientes en las que suelen especializarse los sistemas TTS, Meta lo entrenó con un único objetivo más general: rellenar fragmentos de voz guiándose por texto. Esa sola tarea resultó abarcar la mayoría de lo que las personas esperan en la práctica de un modelo de voz, mediante el mismo tipo de aprendizaje en contexto que hizo que GPT fuera útil para tareas en las que nunca se había entrenado de forma explícita.
Por qué rellenar fragmentos cambia lo que es posible
Como Voicebox está entrenado para reconstruir un tramo de audio enmascarado utilizando tanto la voz circundante como el texto objetivo, puede modificar cualquier parte de una muestra determinada, no solo el final de un clip, como ocurre con los modelos autorregresivos por sus limitaciones estructurales. Esa flexibilidad permite que un único modelo, entrenado en una sola tarea, se generalice a varias capacidades distintas en la práctica: síntesis de texto a voz zero-shot con apenas 2 segundos de audio de referencia; transferencia de estilo entre idiomas (leer un pasaje en otro de los seis idiomas compatibles conservando el estilo del hablante de referencia); eliminación de ruido; edición de contenido; y remuestreo diverso de un enunciado concreto. Todas ellas son manifestaciones de la misma tarea de relleno subyacente, en vez de modos especializados independientes añadidos posteriormente.
La técnica que lo hace posible: flow matching condicional
El núcleo no autorregresivo de Voicebox se basa en Conditional Flow Matching (CFM), un método que transforma una distribución inicial sencilla (ruido gaussiano) en la distribución de voz objetivo a lo largo de una variable temporal continua, condicionado tanto por la información lingüística de cada fotograma como por el contexto de audio enmascarado. Esto difiere de forma significativa de la formulación típica de un modelo de difusión. Las comparaciones de la propia Meta en aquel momento mostraron que superaba a VALL-E en inteligibilidad y similitud de audio para TTS zero-shot, mientras generaba voz unas 20 veces más rápido que los principales modelos autorregresivos de ese periodo.
El flow matching como técnica no se quedó en Voicebox: la misma idea central sustenta el enfoque que más tarde utilizaron E2 TTS y F5-TTS. Ambos se basan en la filosofía de «rellenar o enmascarar y después generar» que Voicebox ayudó a establecer, y es un pariente conceptual cercano de los decodificadores de flow matching utilizados en modelos como CosyVoice2 y CosyVoice3. Si has usado alguno de ellos, has utilizado un descendiente directo del enfoque que Voicebox demostró a gran escala.
Voicebox frente a sus descendientes arquitectónicos de código abierto
| Voicebox | E2 TTS | F5-TTS | |
|---|---|---|---|
| Técnica principal | Flow matching condicional | Flow matching, Transformer U-Net plano | Flow matching condicional + Diffusion Transformer |
| Planteamiento de la tarea de entrenamiento | Relleno general de voz guiado por texto | Relleno de texto y audio (sin modelo de duración ni alineador) | El mismo enfoque central, refinado para mejorar la robustez de la alineación |
| Duración del prompt zero-shot | ~2 segundos | Similar | ~5–15 segundos |
| Generalidad de las tareas | TTS, eliminación de ruido, edición y remuestreo con un solo modelo | Centrado principalmente en TTS | Centrado principalmente en TTS |
| Publicación pública | No (solo artículo de investigación) | No (reproducción de la comunidad mediante el repositorio de F5-TTS) | Sí, en GitHub y Hugging Face |
| Idiomas | 6 | Centrado en el inglés | Centrado principalmente en el inglés |
La importancia duradera de Voicebox radica más en demostrar que un único objetivo general de relleno, entrenado a una escala real, podía igualar o superar sistemas especializados en varias tareas de voz distintas a la vez, un enfoque que una parte considerable del campo ha seguido desarrollando desde entonces.
Preguntas frecuentes
¿Qué significa «relleno de voz»?
Significa generar una parte ausente o enmascarada de un clip de audio utilizando el contexto circundante y un texto objetivo. Esto permite que el modelo edite cualquier parte de una muestra, en lugar de limitarse a prolongarla desde el final como los modelos autorregresivos.
¿Qué relación tiene Voicebox con modelos como E2 TTS y F5-TTS?
Ambos son descendientes arquitectónicos basados en el mismo enfoque de flow matching condicional que demostró Voicebox: E2 TTS comparte directamente su filosofía de relleno y F5-TTS refinó ese mismo linaje con mejoras adicionales en la estabilidad del entrenamiento y la alineación.
¿Cuántos idiomas admite Voicebox?
Seis, según sus datos de entrenamiento: inglés, francés, alemán, español, polaco y portugués.
¿Abordó Meta el riesgo de uso indebido de Voicebox?
Sí. Además del modelo generativo, la investigación de Meta describe específicamente la creación de un clasificador capaz de distinguir la voz auténtica de la generada por Voicebox, como medida de protección documentada frente al posible uso indebido del modelo.
Genera una voz similar desde un audio de referencia
Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.