Real-Time-Voice-Cloning: o projeto de código aberto que ensinou uma geração como a clonagem de voz realmente funciona
- O que é Real-Time-Voice-Cloning?
- Vantagens funcionais do Real-Time-Voice-Cloning
- Como a arquitetura de três etapas do SV2TTS realmente funciona
- Primeiros passos com o Real-Time-Voice-Cloning localmente
- Dicas para obter melhores resultados com o Real-Time-Voice-Cloning
- Real-Time-Voice-Cloning versus projetos mais novos de clonagem de voz de código aberto
- Perguntas frequentes
- Gere novas falas a partir de uma voz de referência no Echora
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Muito antes de as plataformas comerciais transformarem a clonagem de voz em uma assinatura mensal, um projeto gratuito ensinou uma geração de desenvolvedores como ela realmente funcionava por dentro. Real-Time-Voice-Cloning, criado por Corentin Jemine e publicado no GitHub, clona uma voz a partir de uma amostra curta usando um pipeline de três etapas chamado SV2TTS. Ele recebeu tantos forks, foi tão estudado e serviu de base para tantos outros trabalhos que, na prática, tornou-se o ponto de referência da clonagem de voz neural. Não seria sua primeira escolha para obter resultados com qualidade de produção hoje, mas executá-lo e entender como foi construído é quase um pré-requisito para compreender tudo o que veio depois.
O que é Real-Time-Voice-Cloning?
Real-Time-Voice-Cloning é um projeto gratuito e de código aberto para clonagem de voz criado por Corentin Jemine (CorentinJ no GitHub), baseado no SV2TTS — uma técnica de três etapas para clonar uma voz a partir de uma amostra curta de áudio, desenvolvida originalmente por uma equipe de pesquisa do Google em 2018. Seu slogan — “clone uma voz em 5 segundos para gerar qualquer fala em tempo real” — ficou aquém da influência que o projeto viria a ter: ele acumulou mais de 60.000 estrelas no GitHub e 9.400 forks, tornando-se uma das bases de código de clonagem de voz mais usadas e citadas já publicadas. Seu legado vai além do próprio repositório: o componente codificador foi separado em um pacote independente chamado Resemblyzer, hoje mantido pela organização Resemble AI (a empresa para a qual Jemine passou a trabalhar), e a técnica subjacente foi adaptada no MockingBird, um fork amplamente usado, voltado ao mandarim e criado especificamente para clonagem de voz em chinês.
Vantagens funcionais do Real-Time-Voice-Cloning
- Totalmente gratuito e executado inteiramente no seu próprio hardware. Sem conta, sem chave de API e sem custo por geração — tudo roda localmente depois que você instala as dependências e baixa os modelos pré-treinados.
- Uma arquitetura realmente educativa. Como o codificador, o sintetizador e o vocoder são módulos Python separados e que podem ser inspecionados, em vez de um único modelo opaco, esta é uma das bases de código mais acessíveis para entender como a clonagem de voz neural funciona internamente.
- O truque de aprendizado por transferência que tornou possível clonar vozes com amostras curtas. Este projeto é uma implementação funcional da técnica que permitiu generalizar a clonagem para um falante que o modelo nunca havia ouvido durante o treinamento — a base conceitual sobre a qual a maioria das ferramentas comerciais de clonagem posteriores foi construída.
- Uma caixa de ferramentas de verdade, não apenas scripts de treinamento.
demo_toolbox.pyoferece uma interface gráfica para gravar ou carregar uma amostra de voz, gerar fala e inspecionar os embeddings resultantes, enquantodemo_cli.pydisponibiliza um caminho por linha de comando que permite automatizar o mesmo pipeline com scripts. - Um ecossistema de forks e derivados para aprender. Por ser popular e ter uma licença permissiva, forks da comunidade, como o MockingBird, o expandem para novos idiomas, oferecendo implementações de referência funcionais além da versão original centrada no inglês.
- Modelos pré-treinados disponíveis sem precisar treiná-los por conta própria. Você pode clonar uma voz imediatamente usando os pesos pré-treinados publicados pelo autor e reservar o retreinamento completo para quando realmente precisar de outro conjunto de dados de base ou de outro idioma.
Como a arquitetura de três etapas do SV2TTS realmente funciona
A ideia central do SV2TTS, e o motivo pelo qual este projeto já conseguia clonar uma voz com apenas alguns segundos de áudio em 2019, quando a maioria dos sistemas TTS precisava de horas de fala transcrita por falante, é um truque específico de aprendizado por transferência: separar o problema de “como esta voz soa” do problema de “como fazer um modelo TTS ler texto com essa voz” e treinar cada parte com o conjunto de dados que é realmente fácil de obter para ela.
O codificador é treinado como um modelo de verificação de falantes — um sistema cuja única tarefa é decidir se dois clipes de áudio foram falados pela mesma pessoa ou por pessoas diferentes, treinado em conjuntos de dados como o VoxCeleb1, que fornecem áudio de milhares de falantes sem exigir transcrições palavra por palavra. Resolver essa tarefa de verificação força o modelo a aprender uma representação numérica compacta (um embedding) que captura as características de uma voz, independentemente do que está sendo dito. Como esse espaço de embeddings generaliza bem, ele pode produzir uma representação utilizável de uma voz que o codificador nunca encontrou antes, a partir de apenas alguns segundos dessa pessoa falando.
O sintetizador é um modelo de sequência para sequência no estilo Tacotron que recebe o texto junto com esse embedding do falante e gera um espectrograma mel — uma representação visual da fala baseada em frequências — condicionado por ambos. Treinado em conjuntos de dados como LibriSpeech e VCTK, ele aprende a ler qualquer texto de uma maneira modulada pelo embedding recebido, o que permite que um único sintetizador treinado produza fala em muitas vozes diferentes, sem precisar de um modelo separado para cada falante.
O vocoder recebe esse espectrograma mel e o converte em uma forma de onda que pode ser reproduzida. O vocoder usado aqui é baseado no WaveRNN, uma arquitetura neural escolhida especificamente por sua capacidade de gerar áudio com velocidade suficiente para uso em tempo real, em vez dos vocoders mais lentos e com maior latência comuns na época. Como essas três etapas são treinadas em grande parte de forma independente — o codificador em um conjunto de dados de verificação de falantes, o sintetizador em áudio transcrito de múltiplos falantes e o vocoder nos espectrogramas resultantes —, uma nova voz pode ser clonada durante a inferência simplesmente passando uma amostra curta pelo codificador já treinado, sem retreinar o sintetizador ou o vocoder.
Primeiros passos com o Real-Time-Voice-Cloning localmente
- Clone o repositório e prepare o ambiente. O repositório atual usa uv para gerenciar o ambiente Python e as dependências. A configuração exige Python 3.9 e PyTorch 1.10 tanto para CPU quanto para CUDA. O uv cria o ambiente adequado quando você executa um comando.
- Instale ffmpeg e uv. O ffmpeg é necessário para ler arquivos de áudio. Depois de instalar o uv, execute na raiz do repositório o comando correspondente da tabela; o uv cuidará das dependências de Python.
- Use os modelos pré-treinados. Os pesos do codificador, do sintetizador e do vocoder são baixados automaticamente na primeira execução, sem necessidade de treinar os modelos. Se o download automático falhar, use os links manuais do README oficial.
- Execute a caixa de ferramentas para uma sessão interativa.
demo_toolbox.pyabre uma interface gráfica na qual você pode gravar ou carregar uma voz de referência, gerar fala a partir do texto digitado e inspecionar visualmente o embedding resultante. - Ou use a CLI para trabalhar com scripts.
demo_cli.pyexecuta o mesmo pipeline de codificador-sintetizador-vocoder pela linha de comando, sendo mais adequado à integração em um script maior do que a caixa de ferramentas interativa. - Use uma GPU se pretende retreinar algum modelo. A caixa de ferramentas sozinha pode rodar em hardware mais modesto (um modo experimental de baixo uso de memória aceita GPUs com apenas cerca de 2GB de VRAM), mas o retreinamento mais sério de qualquer um dos três modelos se beneficia bastante de uma GPU dedicada.
| Modo de uso | CPU | GPU NVIDIA |
|---|---|---|
| Caixa de ferramentas gráfica | uv run --extra cpu demo_toolbox.py | uv run --extra cuda demo_toolbox.py |
| Exemplo de linha de comando | uv run --extra cpu demo_cli.py | uv run --extra cuda demo_cli.py |
Dicas para obter melhores resultados com o Real-Time-Voice-Cloning
- Ajuste suas expectativas antes de começar. Até o autor original reconheceu abertamente que a qualidade de saída fica atrás das alternativas comerciais e de código aberto modernas — encare o projeto como uma forma de entender como a clonagem de voz funciona, não de produzir áudio pronto para publicação.
- Use clipes de referência limpos e de um único falante. Como o codificador foi treinado com dados de verificação de falantes relativamente limpos, ruído de fundo ou falas sobrepostas na amostra de referência degradam o embedding resultante de maneira mais perceptível do que em sistemas mais novos e robustos.
- Inspecione a visualização do embedding na caixa de ferramentas antes de gerar. O gráfico de embeddings da interface pode revelar quando um clipe de referência produziu uma representação ruim ou incomum, e perceber isso ali é mais rápido do que depois de ouvir uma saída ininteligível do sintetizador.
- Comece pelos modelos pré-treinados antes de tentar retreinar. Baixar apenas o subconjunto train-clean-100 do LibriSpeech já é suficiente para experimentar a caixa de ferramentas — deixe os downloads completos do VoxCeleb1 e do VCTK para quando realmente pretender retreinar um modelo do zero.
- Confira o MockingBird se seu idioma de destino não for o inglês. Em vez de tentar adaptar por conta própria os modelos originais treinados em inglês a outro idioma, o fork existente voltado ao mandarim é um ponto de partida mais direto para esse caso específico.
Real-Time-Voice-Cloning versus projetos mais novos de clonagem de voz de código aberto
| Real-Time-Voice-Cloning (SV2TTS) | Projetos de código aberto mais novos (por exemplo, Coqui XTTS-v2, Chatterbox) | |
|---|---|---|
| Lançamento | 2019 | 2023–2025 |
| Manutenção | Arquitetura antiga; atualizações posteriores de dependências, instalação e compatibilidade | Manutenção ativa |
| Arquitetura | Codificador, sintetizador e vocoder separados (Tacotron + WaveRNN) | Frequentemente um único modelo de ponta a ponta ou arquiteturas mais integradas |
| Qualidade zero-shot | Historicamente importante, mas ultrapassada pelos padrões atuais | Consideravelmente mais natural e estável |
| Melhor uso hoje | Aprender na prática como a clonagem de voz funciona | Uso real em produção auto-hospedada ou por entusiastas |
Perguntas frequentes
O que é SV2TTS?
SV2TTS (Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis) é a técnica de três etapas que serve de base ao Real-Time-Voice-Cloning, desenvolvida originalmente por uma equipe de pesquisa do Google em 2018.
O Real-Time-Voice-Cloning ainda recebe manutenção?
A arquitetura do modelo é antiga, mas o repositório recebeu atualizações posteriores de dependências, instalação e compatibilidade. O autor também alerta que a qualidade do áudio fica atrás de alternativas mais recentes; por isso, avalie se ele atende às necessidades de um projeto de produção.
De quanto áudio o Real-Time-Voice-Cloning precisa para clonar uma voz?
De apenas alguns segundos, segundo o slogan original do projeto — embora os resultados reais dependam muito da limpeza da amostra de referência e, em geral, fiquem atrás dos sistemas de clonagem de voz mais novos em qualidade geral.
O Real-Time-Voice-Cloning é gratuito?
Sim. Ele roda no seu próprio hardware, sem exigir conta, chave de API ou assinatura — mas você precisará de um computador com capacidade razoável, de preferência com uma GPU, para executá-lo com fluidez.
Qual é a relação entre este projeto e a Resemble AI?
Corentin Jemine, criador do projeto, depois passou a trabalhar na Resemble AI, e o Resemblyzer — um pacote independente derivado do codificador de falantes deste projeto — agora é mantido pela organização da Resemble AI no GitHub.
Gere novas falas a partir de uma voz de referência no Echora
Para seguir um fluxo semelhante de clonagem de voz no navegador, envie uma gravação de referência à ferramenta de clonagem de voz do Echora, insira um novo texto e gere fala com uma voz parecida com a referência. Depois, você pode ouvir e baixar o resultado. Use apenas sua própria voz ou uma voz que você tenha permissão explícita para clonar.