MetaVoice: creado para acertar con el ritmo emocional, no solo con las palabras
- ¿Qué es MetaVoice?
- Clonación zero-shot para inglés estadounidense y británico
- Clonación de voz entre idiomas mediante ajuste fino
- Velocidad y opciones de despliegue
- Cómo empezar con MetaVoice
- Consejos para obtener mejores resultados
- MetaVoice frente a otros modelos de clonación centrados en acentos
- Preguntas frecuentes
- Genera una voz similar desde un audio de referencia
Convierte texto y grabaciones en audio listo para escuchar
Doblaje, stems, covers y efectos de sonido, todo en el navegador.
- Texto a voz, y también clonación de voz
- Separa pistas, o genera un cover
- Regístrate para escuchar primero y decidir después
Muchos modelos TTS pronuncian bien cada palabra y aun así suenan como si estuvieran leyendo una lista de la compra. MetaVoice, creado por el equipo de metavoice.io, se desarrolló en torno a una prioridad más acotada y específica: el ritmo y el tono emocionales del habla en inglés, con un objetivo de diseño explícito que su propia documentación expresa con claridad: sin alucinaciones. En lugar de perseguir la cobertura lingüística más amplia posible, se concentra en conseguir que la interpretación en inglés transmita emociones de verdad, no que sea meramente correcta.
¿Qué es MetaVoice?
MetaVoice es un modelo open source de texto a voz con 1.200 millones de parámetros, entrenado con 100.000 horas de datos de voz y publicado bajo la licencia Apache 2.0, totalmente permisiva y sin restricciones de uso. Internamente, predice tokens de audio EnCodec a partir del texto y la información del hablante mediante un flujo de varias etapas: un componente causal de estilo GPT, un Transformer no causal y una difusión multibanda trabajan juntos para reconstruir la forma de onda final, con caché KV y procesamiento por lotes incorporados para que la inferencia resulte práctica y no se limite al ámbito de la investigación.
Clonación zero-shot para inglés estadounidense y británico
La capacidad más inmediatamente utilizable de MetaVoice es la clonación de voz zero-shot, ajustada específicamente para los acentos del inglés estadounidense y británico. Solo necesita 30 segundos de audio de referencia para reproducir la voz de un hablante objetivo, sin ningún paso de ajuste fino. Este enfoque más estrecho en los acentos —en vez de un amplio banco de voces multilingüe— es una elección deliberada: profundizar en dos acentos del inglés bien representados en lugar de repartir una cobertura superficial entre muchos idiomas.
Clonación de voz entre idiomas mediante ajuste fino
Además de su capacidad zero-shot en inglés, MetaVoice también admite clonación de voz entre idiomas, aunque este camino requiere ajuste fino y no funciona directamente al instalar el modelo. La propia documentación del proyecto informa de resultados satisfactorios al adaptar el modelo a hablantes con acento indio usando tan solo un minuto de datos de entrenamiento, una cantidad realmente pequeña para una tarea de adaptación entre idiomas. Conviene precisar qué significa esto en la práctica: el modelo base no es multilingüe de forma nativa como lo sería uno entrenado desde el principio con muchos idiomas. Ampliarlo más allá de su enfoque principal en el inglés estadounidense y británico es una adaptación que debes realizar tú mismo con tus propios datos de referencia, no una capacidad que venga lista para usar con idiomas arbitrarios.
Velocidad y opciones de despliegue
MetaVoice admite síntesis de larga duración además de sus casos de uso de clonación de clips cortos, y ofrece modos experimentales de cuantización (int4 e int8) para acelerar la inferencia a cambio de cierta pérdida de calidad de audio. int4 funciona aproximadamente al doble de velocidad que la precisión estándar bf16/fp16, por lo que es la elección más práctica si necesitas específicamente el aumento de velocidad de la cuantización; se ha informado de que int8 es, en realidad, más lento que la precisión completa por motivos que el proyecto aún no ha resuelto por completo. En arquitecturas de GPU modernas (Ampere, Ada Lovelace y Hopper), una vez compilado el modelo para la inferencia —un coste de arranque único de unos 30 a 90 segundos según el hardware—, la generación es más rápida que el tiempo real, con un factor de tiempo real inferior a 1,0.
Cómo empezar con MetaVoice
La configuración requiere clonar el repositorio del proyecto y seguir sus pasos de instalación documentados. Entre las opciones se encuentran ejecutar directamente la sesión interactiva de inferencia en Python, desplegar mediante Docker Compose con el servidor de API incluido o poner en marcha la Web UI incorporada para trabajar desde el navegador. El proyecto puede desplegarse en cualquier proveedor principal de nube mediante su servidor de inferencia, lo que facilita el alojamiento propio tanto para pruebas locales como para producción a escala. Debido al paso de calentamiento de torch.compile, planifica ese retraso inicial en el primer arranque en lugar de esperar una generación instantánea desde un inicio en frío.
Consejos para obtener mejores resultados
- Usa un clip de referencia de 30 segundos que esté realmente limpio para la clonación zero-shot. Como este es el flujo principal compatible con los acentos estadounidense y británico, una muestra bien grabada de una duración aproximada rendirá mejor que un clip más corto o con más ruido.
- Trata la adaptación entre idiomas como un proyecto de ajuste fino, no como una opción que se activa. Si necesitas una voz o un acento fuera del enfoque base en el inglés estadounidense y británico, reserva tiempo para reunir tu propio conjunto pequeño de datos de referencia y seguir el proceso documentado de ajuste fino, en vez de esperar que funcione en modo zero-shot.
- Recurre específicamente a la cuantización int4 cuando la velocidad importe más que la máxima calidad. Dada su ventaja aproximada de 2x frente a la precisión estándar, es la opción cuantizada más razonable para probar primero si la velocidad de inferencia es el cuello de botella.
- Incluye el retraso inicial de compilación en la planificación de producción. Como el modelo se compila al arrancar para después inferir más rápido que el tiempo real, incorpora ese retraso único a cualquier expectativa de latencia de inicio en frío de tu despliegue.
MetaVoice frente a otros modelos de clonación centrados en acentos
| MetaVoice | XTTS-v2 | Chatterbox | |
|---|---|---|---|
| Enfoque lingüístico principal | Inglés (estadounidense, británico) | 17 idiomas | Inglés (variante Multilingual: 23) |
| Clonación zero-shot | Sí, referencia de ~30 segundos | Sí, referencia de ~6 segundos | Sí, referencia de 5–10 segundos |
| Adaptación entre idiomas/acentos | Mediante ajuste fino (p. ej., inglés indio) | Nativa, incorporada en el modelo base | Nativa, mediante la variante Multilingual |
| Expresividad emocional | Prioridad central de diseño | Automática mediante el codificador de referencia | Parámetro explícito exaggeration |
| Parámetros | 1.2B | No se destacan públicamente | ~0.5B |
| Licencia | Apache 2.0 | Coqui Public Model License (no comercial) | MIT |
El nicho específico de MetaVoice es la profundidad frente a la amplitud: en lugar de competir por el número de idiomas, se concentra en hacer que el habla en inglés resulte emocionalmente convincente, mientras que el alcance entre idiomas queda disponible mediante ajuste fino para los equipos dispuestos a realizar ese trabajo adicional.
Preguntas frecuentes
¿MetaVoice admite chino o alternancia entre chino e inglés?
No directamente. Su enfoque documentado es el inglés estadounidense y británico, y la capacidad entre idiomas solo está disponible mediante ajuste fino con tus propios datos. No hay compatibilidad nativa documentada con chino ni con alternancia entre idiomas en el modelo base.
¿Cuánto audio de referencia necesita MetaVoice para clonar una voz?
Unos 30 segundos para la clonación zero-shot de voces en inglés estadounidense o británico. Se ha informado de que la adaptación entre idiomas o acentos mediante ajuste fino funciona con tan solo un minuto de datos.
¿MetaVoice es gratuito para uso comercial?
Sí. Se publica bajo la licencia Apache 2.0 sin restricciones de uso, una de las opciones más permisivas entre los modelos TTS open source.
¿Qué significa aquí el objetivo de diseño «sin alucinaciones»?
Refleja una prioridad de ingeniería concreta: evitar que el modelo genere palabras, sonidos o artefactos involuntarios que no estén presentes en el texto de entrada. Es un objetivo centrado en la fiabilidad junto con la prioridad de expresividad emocional, no una afirmación de que elimine todos los posibles errores de generación.
¿La cuantización afecta a la calidad del audio?
Sí. Tanto el modo int4 como el int8 intercambian parte de la calidad del audio por una inferencia más rápida, y int4 ofrece una mejora de velocidad aproximada de 2x frente a la precisión estándar.
Genera una voz similar desde un audio de referencia
Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.