EchoraEchora
Voltar aos modelos

MockingBird: o fork da comunidade que ensinou um clonador de vozes em inglês a falar mandarim

9 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

O Real-Time-Voice-Cloning, projeto no qual o MockingBird se baseia, conseguia clonar uma voz com poucos segundos de áudio, mas apenas em inglês. O desenvolvedor babysor criou um fork especificamente para fechar essa lacuna, retreinando e ampliando o projeto para o chinês mandarim em vez de começar do zero. Essa origem impulsionada pela comunidade explica exatamente por que o MockingBird se tornou um dos repositórios chineses de clonagem de voz com mais forks e estrelas no GitHub: ele resolveu uma necessidade real e específica dos desenvolvedores de língua chinesa, em vez de ser uma publicação de pesquisa genérica que por acaso oferecia suporte ao idioma.

O que é o MockingBird?

O MockingBird é um kit de ferramentas open source para clonagem de voz e síntese de fala em tempo real, criado como fork do projeto Real-Time-Voice-Cloning baseado em SV2TTS e reformulado especificamente para o chinês mandarim. Ele clona uma voz de destino com apenas 5 segundos de áudio de referência e gera qualquer fala nova nessa voz em tempo real, com treinamento e testes realizados em vários dos principais conjuntos de dados de fala em chinês.

Vantagens funcionais do MockingBird

  • Clonagem de voz com 5 segundos. Um breve clipe de referência é suficiente para capturar uma voz de destino graças à reutilização de um codificador pré-treinado para verificação de falantes, em vez de treinar o reconhecimento de voz do zero para cada novo falante.
  • Geração em tempo real, com um mecanismo de inferência otimizado especificamente para velocidade, e não apenas para processamento offline em lote.
  • Criado especificamente para o mandarim, treinado e validado em vários conjuntos de dados de fala em chinês — entre eles aidatatang_200zh, MAGICDATA, AISHELL-3 e data_aishell —, em vez de tratar o chinês como um recurso tardio acrescentado a um modelo voltado primeiro para o inglês.
  • Realmente multiplataforma, funciona em Windows, Linux e até em Macs com Apple Silicon.
  • Duas formas de uso: uma caixa de ferramentas gráfica para experimentação local e interativa e um modo webserver para chamadas remotas, atendendo tanto a testes práticos quanto à integração com uma aplicação maior.
  • Uma comunidade de desenvolvedores chineses grande e ativa, refletida nas contagens de forks e estrelas do GitHub, o que também representa mais recursos comunitários para solucionar problemas e mais experiência compartilhada do que uma publicação acadêmica típica costuma oferecer.

Como o truque da aprendizagem por transferência realmente funciona

Essa foi a decisão específica de engenharia que tornou possível um projeto de clonagem de voz em chinês sem enormes recursos novos de treinamento, e vale a pena entendê-la. O pipeline do MockingBird, herdado da abordagem SV2TTS na qual ele se baseia, é dividido em três componentes: um codificador que aprende a representar as características da voz de um falante (treinado originalmente para uma tarefa de verificação de falantes, que se generaliza bem para identificar “o que faz esta voz soar como esta voz” mesmo no caso de falantes nunca vistos durante o treinamento), um sintetizador que converte o texto em um espectrograma mel condicionado por essa representação do falante e um vocoder que transforma o espectrograma em uma forma de onda real.

A abordagem do MockingBird reutiliza, em grande parte sem alterações, o codificador e o vocoder pré-treinados do projeto original em inglês, concentrando o novo treinamento especificamente no sintetizador, o componente realmente responsável por mapear o texto em chinês para o conteúdo falado. Como a capacidade do codificador de identificar falantes e a capacidade do vocoder de gerar formas de onda não precisam ser reaprendidas do zero, adicionar suporte ao mandarim se tornou um projeto consideravelmente mais viável do que treinar do início um pipeline totalmente novo com três etapas. É exatamente por isso que a própria documentação do projeto descreve resultados “easy and awesome” obtidos ao retreinar apenas um dos três componentes.

Primeiros passos com o MockingBird

A configuração começa pela criação de um ambiente conda dedicado com Python 3.9, pela clonagem do repositório e pela instalação das dependências via pip, incluindo especificamente webrtcvad-wheels, além do PyTorch e dos pacotes relacionados. Quando o ambiente estiver pronto, prepare uma amostra de 5 a 30 segundos da voz de destino. Em seguida, inicie a caixa de ferramentas gráfica incluída para carregar a amostra, digite o texto que você quer ouvir e gere a fala clonada diretamente pela interface. Para integrar o recurso a outra aplicação, em vez de usá-lo de forma interativa, o modo webserver disponibiliza a mesma capacidade para chamadas remotas.

Dicas para obter resultados melhores

  • Use uma gravação limpa com duração entre 5 e 30 segundos. Embora 5 segundos seja o mínimo em destaque, uma amostra um pouco mais longa e bem gravada tende a produzir resultados mais estáveis do que trabalhar sempre no limite mínimo.
  • Esteja preparado para solucionar problemas de versões das dependências em sistemas mais novos. Os testes documentados do projeto foram feitos com o PyTorch 1.9.0 e configurações específicas de GPU de aproximadamente 2021. Em um ambiente moderno, talvez seja necessário ajustar manualmente as versões dos pacotes, em vez de presumir que todas as dependências serão instaladas corretamente logo de início.
  • Use primeiro a caixa de ferramentas GUI antes de criar uma integração personalizada. Essa é a maneira mais rápida de confirmar que o ambiente e uma determinada amostra de voz realmente funcionam antes de escrever qualquer código em torno do modo webserver.
  • Conte com a comunidade de desenvolvedores chineses para obter ajuda na configuração. Como o projeto foi amplamente discutido e recebeu muitos forks nessa comunidade, é provável que uma mensagem de erro específica que você encontrar já tenha sido resolvida e documentada por outra pessoa.

MockingBird comparado a outras ferramentas de clonagem voltadas ao chinês

MockingBirdGPT-SoVITSXTTS-v2
Clipe mínimo para clonagem5 segundos5 segundos (zero-shot)~6 segundos
Arquitetura centralCodificador/sintetizador/vocoder no estilo SV2TTSHíbrida GPT + SoVITS (baseada em VITS)Autorregressiva no estilo GPT-2 + VQ-VAE
Origem específica para o chinêsSim, criado como fork especificamente para adicionar mandarimForte reputação em chinês e japonêsMultilíngue genérico, não específico para o chinês
Ferramentas integradas de preparação de dadosNãoSim (separação de vocais, ASR e segmentação automática)Não
Opções de interfaceCaixa de ferramentas GUI + webserverWebUI completaAPI Python
Nível de atividade da comunidadeGrande comunidade histórica, desenvolvimento central menos ativoManutenção ativa e atualizações frequentes de versãoForks mantidos pela comunidade após o encerramento da Coqui

O nicho específico do MockingBird é ser a resposta original, impulsionada pela comunidade, para “quero a experiência do Real-Time-Voice-Cloning, mas em mandarim”. Desde então, projetos mais novos como o GPT-SoVITS criaram alternativas com manutenção mais ativa e mais recursos, mas a popularidade e a base de documentação do MockingBird ainda fazem dele um ponto de partida realmente útil, principalmente para quem está aprendendo como as arquiteturas no estilo SV2TTS funcionam por dentro.

Perguntas frequentes

De quanto áudio o MockingBird precisa para clonar uma voz?

Apenas 5 segundos, com uma faixa recomendada de 5 a 30 segundos para obter resultados mais estáveis.

Por que o MockingBird foi criado em vez de simplesmente usar o projeto original em inglês?

O projeto Real-Time-Voice-Cloning original só oferecia suporte ao inglês. O MockingBird foi criado como fork especificamente para retreiná-lo e ampliá-lo para o chinês mandarim, usando vários conjuntos de dados de fala em chinês no treinamento e na validação.

O MockingBird exige o treinamento de um novo codificador de voz para o chinês?

Não. Essa é a eficiência específica por trás do projeto. Ele reutiliza o codificador e o vocoder pré-treinados do modelo original em inglês e concentra o novo treinamento no componente sintetizador, o que permite adicionar suporte ao chinês sem retreinar o pipeline inteiro.

Em quais plataformas o MockingBird funciona?

Windows, Linux e Macs com Apple Silicon são documentados como compatíveis.

O MockingBird ainda recebe manutenção ativa?

O ritmo do desenvolvimento central diminuiu desde o período de maior atividade, e os testes documentados refletem versões de software de aproximadamente 2021. É provável que você precise solucionar alguns problemas de versões das dependências em um sistema moderno, embora a grande comunidade signifique que a maioria dos problemas comuns já tem soluções documentadas.

Gere uma voz semelhante a partir de um áudio de referência

Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.

Criar uma voz clonada →