EchoraEchora
Volver a los modelos

MockingBird: el fork comunitario que enseñó mandarín a un clonador de voces en inglés

9 de septiembre de 2026
•
7 min de lectura

Convierte texto y grabaciones en audio listo para escuchar

Doblaje, stems, covers y efectos de sonido, todo en el navegador.

  • Texto a voz, y también clonación de voz
  • Separa pistas, o genera un cover
  • Regístrate para escuchar primero y decidir después
Empieza a crear gratis

Real-Time-Voice-Cloning, el proyecto en el que se basa MockingBird, podía clonar una voz con unos pocos segundos de audio, pero solo en inglés. El desarrollador babysor creó un fork específicamente para cerrar esa brecha: lo volvió a entrenar y lo amplió para el chino mandarín en lugar de empezar desde cero. Ese origen impulsado por la comunidad explica precisamente por qué MockingBird se convirtió en uno de los repositorios chinos de clonación de voz con más forks y estrellas de GitHub: resolvió una carencia real y concreta para los desarrolladores de habla china, en vez de ser una publicación de investigación general que por casualidad admitía el idioma.

¿Qué es MockingBird?

MockingBird es un conjunto de herramientas open source para clonación de voz y síntesis de habla en tiempo real, creado como fork del proyecto Real-Time-Voice-Cloning basado en SV2TTS y rediseñado específicamente para el chino mandarín. Clona una voz objetivo a partir de tan solo 5 segundos de audio de referencia y genera en tiempo real cualquier habla nueva con esa voz; su entrenamiento y sus pruebas abarcaron varios de los principales conjuntos de datos de habla china.

Ventajas funcionales de MockingBird

  • Clonación de voz con 5 segundos. Un breve clip de referencia basta para capturar una voz objetivo gracias a la reutilización de un codificador preentrenado de verificación de hablantes, en lugar de entrenar desde cero el reconocimiento de voz para cada hablante nuevo.
  • Generación en tiempo real, con un motor de inferencia optimizado específicamente para la velocidad y no solo para el procesamiento offline por lotes.
  • Diseñado específicamente para el mandarín, entrenado y validado con varios conjuntos de datos de habla china —entre ellos aidatatang_200zh, MAGICDATA, AISHELL-3 y data_aishell—, en vez de tratar el chino como un añadido tardío sobre un modelo centrado primero en el inglés.
  • Realmente multiplataforma, funciona en Windows, Linux e incluso en Mac con Apple Silicon.
  • Dos formas de usarlo: una caja de herramientas gráfica para experimentar localmente de forma interactiva y un modo webserver para llamadas remotas, que cubren tanto las pruebas prácticas como la integración en una aplicación mayor.
  • Una comunidad de desarrolladores chinos grande y activa, reflejada en sus cifras de forks y estrellas en GitHub, lo que también supone más recursos comunitarios para resolver problemas y más experiencia compartida que los que suele ofrecer una publicación académica típica.

Cómo funciona realmente el truco del aprendizaje por transferencia

Esta es la decisión de ingeniería concreta que permitió crear un proyecto de clonación de voz en chino sin enormes recursos nuevos de entrenamiento, y merece la pena entenderla. El pipeline de MockingBird, heredado del enfoque SV2TTS sobre el que se construyó, se divide en tres componentes: un codificador que aprende a representar las características de la voz de un hablante (entrenado originalmente para una tarea de verificación de hablantes, que se generaliza bien para identificar «qué hace que esta voz suene como esta voz» incluso con hablantes nunca vistos durante el entrenamiento), un sintetizador que convierte el texto en un espectrograma mel condicionado por esa representación del hablante y un vocoder que transforma el espectrograma en una forma de onda real.

El enfoque de MockingBird reutiliza en gran medida tal cual el codificador y el vocoder preentrenados del proyecto original en inglés, y concentra el nuevo entrenamiento específicamente en el sintetizador, el componente encargado de transformar realmente el texto chino en contenido hablado. Como la capacidad del codificador para identificar hablantes y la del vocoder para generar formas de onda no tienen que volver a aprenderse desde cero, añadir compatibilidad con el mandarín pasó a ser un proyecto mucho más abordable que entrenar desde el principio un pipeline completamente nuevo de tres etapas. Esto explica directamente por qué la propia documentación del proyecto describe que se obtienen resultados «easy and awesome» al volver a entrenar solo uno de los tres componentes.

Primeros pasos con MockingBird

La configuración comienza por crear un entorno conda específico con Python 3.9, clonar el repositorio e instalar las dependencias mediante pip, incluido en concreto webrtcvad-wheels, junto con PyTorch y sus paquetes relacionados. Cuando el entorno esté listo, prepara una muestra de audio de entre 5 y 30 segundos de la voz objetivo; después, abre la caja de herramientas gráfica incluida para cargar la muestra, escribir el texto que quieres que pronuncie y generar el habla clonada directamente desde la interfaz. Si quieres integrarlo en otra aplicación en vez de usarlo de manera interactiva, el modo webserver expone la misma capacidad para realizar llamadas remotas.

Consejos para obtener mejores resultados

  • Usa una grabación limpia de entre 5 y 30 segundos. Aunque 5 segundos es el mínimo destacado, una muestra algo más larga y bien grabada suele ofrecer resultados más estables que ajustarse siempre al límite mínimo.
  • Prepárate para resolver problemas con las versiones de las dependencias en sistemas más nuevos. Las pruebas documentadas del proyecto se realizaron con PyTorch 1.9.0 y configuraciones concretas de GPU de alrededor de 2021. En un sistema moderno, quizá tengas que ajustar manualmente las versiones de los paquetes en lugar de dar por hecho que todas las dependencias se instalarán sin problemas.
  • Usa primero la caja de herramientas GUI antes de crear una integración personalizada. Es la forma más rápida de confirmar que tu entorno y una muestra de voz determinada funcionan realmente antes de escribir código alrededor del modo webserver.
  • Apóyate en la comunidad de desarrolladores chinos para resolver problemas de configuración. Dada la cantidad de forks y conversaciones que ha generado el proyecto en esa comunidad, es muy probable que otra persona ya haya resuelto y documentado el mensaje de error concreto que encuentres.

MockingBird frente a otras herramientas de clonación centradas en el chino

MockingBirdGPT-SoVITSXTTS-v2
Clip mínimo para clonar5 segundos5 segundos (zero-shot)~6 segundos
Arquitectura centralCodificador/sintetizador/vocoder al estilo SV2TTSHíbrido GPT + SoVITS (basado en VITS)Autorregresiva al estilo GPT-2 + VQ-VAE
Origen específico para el chinoSí, se creó como fork específicamente para añadir mandarínGran reputación en chino y japonésMultilingüe general, no específico para el chino
Herramientas integradas de preparación de datosNoSí (separación vocal, ASR y segmentación automática)No
Opciones de interfazCaja de herramientas GUI + webserverWebUI completaAPI de Python
Nivel de actividad de la comunidadGran comunidad histórica, desarrollo central menos activoMantenimiento activo y actualizaciones frecuentesForks mantenidos por la comunidad tras el cierre de Coqui

El nicho específico de MockingBird es haber sido la respuesta original, impulsada por la comunidad, a «quiero la experiencia de Real-Time-Voice-Cloning, pero en mandarín». Desde entonces, proyectos más nuevos como GPT-SoVITS han creado alternativas con un mantenimiento más activo y más funciones, pero la popularidad y la base documental de MockingBird siguen convirtiéndolo en un punto de partida realmente útil, sobre todo para quien quiera aprender cómo funcionan por dentro las arquitecturas al estilo SV2TTS.

Preguntas frecuentes

¿Cuánto audio necesita MockingBird para clonar una voz?

Tan solo 5 segundos, aunque se recomienda un intervalo de 5 a 30 segundos para obtener resultados más estables.

¿Por qué se creó MockingBird en lugar de usar directamente el proyecto original en inglés?

El proyecto Real-Time-Voice-Cloning original solo admitía inglés. MockingBird se creó como fork específicamente para volver a entrenarlo y ampliarlo al chino mandarín, usando varios conjuntos de datos de habla china para el entrenamiento y la validación.

¿MockingBird requiere entrenar un codificador de voz nuevo para el chino?

No. Esa es precisamente la eficiencia que sustenta el proyecto. Reutiliza el codificador y el vocoder preentrenados del modelo original en inglés y concentra el nuevo entrenamiento en el componente sintetizador, lo que permite añadir compatibilidad con el chino sin volver a entrenar todo el pipeline.

¿En qué plataformas funciona MockingBird?

Windows, Linux y los Mac con Apple Silicon figuran como plataformas compatibles en la documentación.

¿MockingBird sigue teniendo mantenimiento activo?

El ritmo de desarrollo central ha disminuido desde su periodo de mayor actividad y las pruebas documentadas reflejan versiones de software de alrededor de 2021. Es probable que tengas que resolver algunos problemas con las versiones de las dependencias en un sistema moderno, aunque su gran comunidad significa que la mayoría de los problemas habituales ya cuentan con soluciones documentadas.

Genera una voz similar desde un audio de referencia

Para un flujo con un objetivo similar, utiliza la Clonación de voz de Echora. Sube una grabación de tu propia voz o una que tengas permiso explícito para usar, introduce hasta 5.000 caracteres de texto nuevo y genera una voz parecida a la referencia.

Crear una voz clonada →