VoiceCraft: voz editada que los oyentes prefirieron a la grabación real
- ¿Qué es VoiceCraft?
- El truco técnico: enmascaramiento causal y apilamiento retardado
- Dos capacidades en un solo modelo
- El benchmark REALEDIT
- Cómo empezar con VoiceCraft
- Consejos para obtener mejores resultados
- VoiceCraft frente a modelos de clonación que solo generan
- Preguntas frecuentes
- Genera una voz similar desde un audio de referencia
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
En la propia comparación directa de naturalidad de VoiceCraft, los oyentes humanos prefirieron su voz editada a la grabación original real el 48 % de las veces: prácticamente, lanzar una moneda al aire entre un clip real y otro en el que un modelo había sustituido y regenerado una palabra. Ese resultado es la prueba más clara de para qué se creó realmente VoiceCraft: no solo para generar voz desde cero, sino para editar audio existente de forma tan convincente que la unión desaparezca.
¿Qué es VoiceCraft?
VoiceCraft es un modelo de lenguaje de códec neuronal basado en relleno de tokens, desarrollado por investigadores de la Universidad de Texas en Austin y Rembrand, y publicado por completo como código abierto: datos, código y pesos del modelo están disponibles públicamente en GitHub y Hugging Face. Está construido como un decodificador Transformer y, cuando se publicó, logró resultados de vanguardia tanto en edición de voz como en texto a voz zero-shot. La evaluación se centró específicamente en audio del mundo real —audiolibros, vídeos de YouTube y pódcasts de Spotify—, no en grabaciones limpias de estudio. Tanto clonar una voz desconocida como editar una grabación existente requiere solo unos segundos de audio de referencia.
El truco técnico: enmascaramiento causal y apilamiento retardado
Conviene entenderlo, porque es lo que hace posible editar de verdad, y no solo generar desde cero. Los modelos autorregresivos estándar generan estrictamente de izquierda a derecha, por lo que no son adecuados para insertar contenido nuevo en medio de una secuencia existente sin regenerar todo lo que hay después del punto de edición. VoiceCraft lo resuelve mediante un procedimiento de reorganización de tokens en dos pasos: enmascaramiento causal, tomado de técnicas que funcionaron en el modelado conjunto de texto e imagen, y apilamiento retardado, que gestiona de manera eficiente la estructura con múltiples libros de códigos de los códecs neuronales de voz. Juntos permiten a VoiceCraft generar rellenos condicionados por el contexto en ambas direcciones, sin dejar de usar internamente un proceso de generación autorregresivo, en lugar de requerir el enfoque totalmente no autorregresivo del que suelen depender los modelos de relleno.
Dos capacidades en un solo modelo
Gracias a esa arquitectura, VoiceCraft aborda dos tareas realmente distintas con el mismo mecanismo subyacente. La edición de voz permite insertar, eliminar, sustituir o aplicar cambios en varios fragmentos de una grabación existente: corregir una palabra, reemplazar una frase o ajustar una oración sin volver a grabar nada, ya que el modelo regenera solo el tramo afectado y no el clip completo. La clonación de voz zero-shot usa esa misma capacidad de relleno a la inversa: con unos segundos de la voz de un hablante desconocido, genera voz completamente nueva con esa voz. La mayoría de los modelos TTS están diseñados para una tarea o para la otra; VoiceCraft las trata como el mismo problema subyacente resuelto por el mismo modelo.
El benchmark REALEDIT
Para evaluar específicamente la edición de voz, el equipo de VoiceCraft creó REALEDIT, descrito como el primer benchmark realista de su tipo: 310 ejemplos del mundo real procedentes de audiolibros, vídeos de YouTube y pódcasts de Spotify, de entre 5 y 12 segundos, que incluyen inserciones, eliminaciones, sustituciones y ediciones en varios fragmentos de entre 1 y 16 palabras. El resultado de preferencia del 48 % —la voz editada elegida por encima de la grabación original auténtica en una comparación directa— salió directamente de las pruebas con este benchmark. Por eso es una cifra con credibilidad real y no un clip de demostración escogido a conveniencia.
Cómo empezar con VoiceCraft
La forma más directa de probar VoiceCraft es usar la configuración del proyecto basada en Docker, que se encarga de preparar el entorno; una vez en funcionamiento, el notebook inference_tts.ipynb es el punto de partida documentado para probar la generación TTS zero-shot. Si planeas ajustar el modelo o entrenarlo con tus propios datos, el proyecto ofrece documentación separada de configuración y entrenamiento, y recomienda AdamW específicamente por aportar más estabilidad al ajuste fino que al entrenamiento desde cero. Los pesos del modelo están disponibles públicamente en Hugging Face desde marzo de 2024, así que descargar un checkpoint preentrenado, en vez de entrenar desde cero, es el punto de partida práctico para la mayoría de los casos de uso.
Consejos para obtener mejores resultados
- Usa la edición para correcciones quirúrgicas, no para reescrituras completas. La fortaleza de VoiceCraft está en insertar, eliminar y sustituir de forma precisa una frase o un fragmento corto; para cambiar el contenido por completo, el modo estándar de generación zero-shot desde cero es más apropiado.
- Usa un clip de referencia limpio para clonar. Como solo se necesitan unos segundos de audio, una muestra clara y bien grabada de esa duración dará mejores resultados que otra similar con más ruido.
- Prueba con tu tipo de audio real antes de asumir que el rendimiento del benchmark se transferirá directamente. REALEDIT se creó expresamente con fuentes del mundo real, como pódcasts y vídeos de YouTube, en lugar de audio limpio de estudio, por lo que es un entorno de prueba significativamente realista; aun así, conviene validar directamente el perfil de ruido y la calidad de grabación específicos de tu contenido.
- Usa Docker salvo que tengas un motivo concreto para gestionar las dependencias manualmente. Hay muchos componentes —códec, procesamiento de fonemas y decodificador Transformer— que deben estar correctamente alineados, y la vía de Docker evita una parte considerable de los problemas habituales de configuración.
- Consulta VoiceCraft-X si necesitas idiomas distintos del inglés. Un modelo posterior amplía el mismo enfoque central de edición y clonación a 11 idiomas, usando un modelo de lenguaje grande para procesar texto entre idiomas sin requerir léxicos de pronunciación fonética. Merece la pena revisarlo si las necesidades lingüísticas de tu proyecto ya superan el alcance principalmente inglés de la versión original.
VoiceCraft frente a modelos de clonación que solo generan
| VoiceCraft | F5-TTS | E2 TTS | |
|---|---|---|---|
| Edición de voz (insertar/eliminar/sustituir en audio existente) | Sí, capacidad principal | No, solo generación | No, solo generación |
| Clonación de voz zero-shot | Sí, unos segundos de referencia | Sí, ~5–15 segundos | Sí, similar |
| Mecanismo principal | Autorregresivo con enmascaramiento causal y apilamiento retardado para contexto bidireccional | Flow matching no autorregresivo | Flow matching no autorregresivo |
| Publicación abierta | Sí, datos, código y pesos, todo abierto | Sí, código y pesos | No, solo artículo de investigación |
| Enfoque del benchmark | Audio del mundo real (audiolibros, YouTube, pódcasts) | Benchmarks TTS estándar | Benchmarks TTS estándar |
El nicho específico de VoiceCraft es ser uno de los pocos modelos abiertos que trata la edición de una grabación existente y la generación de una nueva como el mismo problema subyacente. La mayoría de los modelos de este sitio están diseñados únicamente para generar y no tienen ningún mecanismo para modificar audio que ya existe.
Preguntas frecuentes
¿Puede VoiceCraft editar una grabación sin regenerar todo el clip?
Sí: ese es su objetivo de diseño principal. Mediante enmascaramiento causal y apilamiento retardado, VoiceCraft regenera solo el fragmento objetivo —una palabra o frase insertada, eliminada o sustituida—, en vez de tener que recrear el clip entero.
¿Cuánto audio de referencia necesita VoiceCraft?
Solo unos segundos, tanto para clonar mediante zero-shot la voz de un hablante desconocido como para editar una grabación existente.
¿Qué es el benchmark REALEDIT?
Es un conjunto de datos realista de evaluación de edición de voz, creado por el equipo de VoiceCraft específicamente para este fin. Contiene 310 ejemplos del mundo real procedentes de audiolibros, vídeos de YouTube y pódcasts, y abarca inserciones, eliminaciones, sustituciones y ediciones en varios fragmentos.
¿VoiceCraft es gratuito y de código abierto?
Sí. Los datos, el código y los pesos preentrenados del modelo están disponibles públicamente en GitHub y Hugging Face, sin más restricciones que las expectativas de uso ético declaradas por el proyecto, que prohíben expresamente generar voz sin autorización o manipular la voz de otra persona sin su consentimiento.
¿Existe una versión multilingüe de VoiceCraft?
Sí. VoiceCraft-X, un modelo posterior, amplía el mismo enfoque unificado de edición y clonación a 11 idiomas, y utiliza un modelo de lenguaje grande para gestionar texto entre idiomas en lugar de requerir léxicos fonéticos separados para cada uno.
Genera una voz similar desde un audio de referencia
Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.