MockingBird: o fork da comunidade que ensinou um clonador de vozes em inglês a falar mandarim
- O que é o MockingBird?
- Vantagens funcionais do MockingBird
- Como o truque da aprendizagem por transferência realmente funciona
- Primeiros passos com o MockingBird
- Dicas para obter resultados melhores
- MockingBird comparado a outras ferramentas de clonagem voltadas ao chinês
- Perguntas frequentes
- Gere uma voz semelhante a partir de um áudio de referência
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
O Real-Time-Voice-Cloning, projeto no qual o MockingBird se baseia, conseguia clonar uma voz com poucos segundos de áudio, mas apenas em inglês. O desenvolvedor babysor criou um fork especificamente para fechar essa lacuna, retreinando e ampliando o projeto para o chinês mandarim em vez de começar do zero. Essa origem impulsionada pela comunidade explica exatamente por que o MockingBird se tornou um dos repositórios chineses de clonagem de voz com mais forks e estrelas no GitHub: ele resolveu uma necessidade real e específica dos desenvolvedores de língua chinesa, em vez de ser uma publicação de pesquisa genérica que por acaso oferecia suporte ao idioma.
O que é o MockingBird?
O MockingBird é um kit de ferramentas open source para clonagem de voz e síntese de fala em tempo real, criado como fork do projeto Real-Time-Voice-Cloning baseado em SV2TTS e reformulado especificamente para o chinês mandarim. Ele clona uma voz de destino com apenas 5 segundos de áudio de referência e gera qualquer fala nova nessa voz em tempo real, com treinamento e testes realizados em vários dos principais conjuntos de dados de fala em chinês.
Vantagens funcionais do MockingBird
- Clonagem de voz com 5 segundos. Um breve clipe de referência é suficiente para capturar uma voz de destino graças à reutilização de um codificador pré-treinado para verificação de falantes, em vez de treinar o reconhecimento de voz do zero para cada novo falante.
- Geração em tempo real, com um mecanismo de inferência otimizado especificamente para velocidade, e não apenas para processamento offline em lote.
- Criado especificamente para o mandarim, treinado e validado em vários conjuntos de dados de fala em chinês — entre eles aidatatang_200zh, MAGICDATA, AISHELL-3 e data_aishell —, em vez de tratar o chinês como um recurso tardio acrescentado a um modelo voltado primeiro para o inglês.
- Realmente multiplataforma, funciona em Windows, Linux e até em Macs com Apple Silicon.
- Duas formas de uso: uma caixa de ferramentas gráfica para experimentação local e interativa e um modo webserver para chamadas remotas, atendendo tanto a testes práticos quanto à integração com uma aplicação maior.
- Uma comunidade de desenvolvedores chineses grande e ativa, refletida nas contagens de forks e estrelas do GitHub, o que também representa mais recursos comunitários para solucionar problemas e mais experiência compartilhada do que uma publicação acadêmica típica costuma oferecer.
Como o truque da aprendizagem por transferência realmente funciona
Essa foi a decisão específica de engenharia que tornou possível um projeto de clonagem de voz em chinês sem enormes recursos novos de treinamento, e vale a pena entendê-la. O pipeline do MockingBird, herdado da abordagem SV2TTS na qual ele se baseia, é dividido em três componentes: um codificador que aprende a representar as características da voz de um falante (treinado originalmente para uma tarefa de verificação de falantes, que se generaliza bem para identificar “o que faz esta voz soar como esta voz” mesmo no caso de falantes nunca vistos durante o treinamento), um sintetizador que converte o texto em um espectrograma mel condicionado por essa representação do falante e um vocoder que transforma o espectrograma em uma forma de onda real.
A abordagem do MockingBird reutiliza, em grande parte sem alterações, o codificador e o vocoder pré-treinados do projeto original em inglês, concentrando o novo treinamento especificamente no sintetizador, o componente realmente responsável por mapear o texto em chinês para o conteúdo falado. Como a capacidade do codificador de identificar falantes e a capacidade do vocoder de gerar formas de onda não precisam ser reaprendidas do zero, adicionar suporte ao mandarim se tornou um projeto consideravelmente mais viável do que treinar do início um pipeline totalmente novo com três etapas. É exatamente por isso que a própria documentação do projeto descreve resultados “easy and awesome” obtidos ao retreinar apenas um dos três componentes.
Primeiros passos com o MockingBird
A configuração começa pela criação de um ambiente conda dedicado com Python 3.9, pela clonagem do repositório e pela instalação das dependências via pip, incluindo especificamente webrtcvad-wheels, além do PyTorch e dos pacotes relacionados. Quando o ambiente estiver pronto, prepare uma amostra de 5 a 30 segundos da voz de destino. Em seguida, inicie a caixa de ferramentas gráfica incluída para carregar a amostra, digite o texto que você quer ouvir e gere a fala clonada diretamente pela interface. Para integrar o recurso a outra aplicação, em vez de usá-lo de forma interativa, o modo webserver disponibiliza a mesma capacidade para chamadas remotas.
Dicas para obter resultados melhores
- Use uma gravação limpa com duração entre 5 e 30 segundos. Embora 5 segundos seja o mínimo em destaque, uma amostra um pouco mais longa e bem gravada tende a produzir resultados mais estáveis do que trabalhar sempre no limite mínimo.
- Esteja preparado para solucionar problemas de versões das dependências em sistemas mais novos. Os testes documentados do projeto foram feitos com o PyTorch 1.9.0 e configurações específicas de GPU de aproximadamente 2021. Em um ambiente moderno, talvez seja necessário ajustar manualmente as versões dos pacotes, em vez de presumir que todas as dependências serão instaladas corretamente logo de início.
- Use primeiro a caixa de ferramentas GUI antes de criar uma integração personalizada. Essa é a maneira mais rápida de confirmar que o ambiente e uma determinada amostra de voz realmente funcionam antes de escrever qualquer código em torno do modo webserver.
- Conte com a comunidade de desenvolvedores chineses para obter ajuda na configuração. Como o projeto foi amplamente discutido e recebeu muitos forks nessa comunidade, é provável que uma mensagem de erro específica que você encontrar já tenha sido resolvida e documentada por outra pessoa.
MockingBird comparado a outras ferramentas de clonagem voltadas ao chinês
| MockingBird | GPT-SoVITS | XTTS-v2 | |
|---|---|---|---|
| Clipe mínimo para clonagem | 5 segundos | 5 segundos (zero-shot) | ~6 segundos |
| Arquitetura central | Codificador/sintetizador/vocoder no estilo SV2TTS | Híbrida GPT + SoVITS (baseada em VITS) | Autorregressiva no estilo GPT-2 + VQ-VAE |
| Origem específica para o chinês | Sim, criado como fork especificamente para adicionar mandarim | Forte reputação em chinês e japonês | Multilíngue genérico, não específico para o chinês |
| Ferramentas integradas de preparação de dados | Não | Sim (separação de vocais, ASR e segmentação automática) | Não |
| Opções de interface | Caixa de ferramentas GUI + webserver | WebUI completa | API Python |
| Nível de atividade da comunidade | Grande comunidade histórica, desenvolvimento central menos ativo | Manutenção ativa e atualizações frequentes de versão | Forks mantidos pela comunidade após o encerramento da Coqui |
O nicho específico do MockingBird é ser a resposta original, impulsionada pela comunidade, para “quero a experiência do Real-Time-Voice-Cloning, mas em mandarim”. Desde então, projetos mais novos como o GPT-SoVITS criaram alternativas com manutenção mais ativa e mais recursos, mas a popularidade e a base de documentação do MockingBird ainda fazem dele um ponto de partida realmente útil, principalmente para quem está aprendendo como as arquiteturas no estilo SV2TTS funcionam por dentro.
Perguntas frequentes
De quanto áudio o MockingBird precisa para clonar uma voz?
Apenas 5 segundos, com uma faixa recomendada de 5 a 30 segundos para obter resultados mais estáveis.
Por que o MockingBird foi criado em vez de simplesmente usar o projeto original em inglês?
O projeto Real-Time-Voice-Cloning original só oferecia suporte ao inglês. O MockingBird foi criado como fork especificamente para retreiná-lo e ampliá-lo para o chinês mandarim, usando vários conjuntos de dados de fala em chinês no treinamento e na validação.
O MockingBird exige o treinamento de um novo codificador de voz para o chinês?
Não. Essa é a eficiência específica por trás do projeto. Ele reutiliza o codificador e o vocoder pré-treinados do modelo original em inglês e concentra o novo treinamento no componente sintetizador, o que permite adicionar suporte ao chinês sem retreinar o pipeline inteiro.
Em quais plataformas o MockingBird funciona?
Windows, Linux e Macs com Apple Silicon são documentados como compatíveis.
O MockingBird ainda recebe manutenção ativa?
O ritmo do desenvolvimento central diminuiu desde o período de maior atividade, e os testes documentados refletem versões de software de aproximadamente 2021. É provável que você precise solucionar alguns problemas de versões das dependências em um sistema moderno, embora a grande comunidade signifique que a maioria dos problemas comuns já tem soluções documentadas.
Gere uma voz semelhante a partir de um áudio de referência
Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.