GPT-SoVITS: um estúdio completo de clonagem de voz, não apenas um modelo
- O que é o GPT-SoVITS?
- Dois níveis de clonagem: 5 segundos e 1 minuto
- Histórico de versões: da v1 à v4
- A WebUI: feita para quem não quer montar pipelines de treinamento à mão
- Como começar a usar o GPT-SoVITS
- Dicas para obter resultados melhores
- GPT-SoVITS em comparação com outros modelos de clonagem few-shot
- Perguntas frequentes
- Gere uma voz semelhante a partir de um áudio de referência
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Muitos modelos open source de clonagem entregam um checkpoint e um script em Python e consideram o trabalho encerrado. O GPT-SoVITS, por sua vez, oferece o fluxo inteiro — separação de vocais, transcrição automática, segmentação do conjunto de dados, treinamento e inferência, tudo dentro de uma única interface baseada no navegador —, construído em torno de uma necessidade de dados realmente baixa: uma clonagem utilizável com 5 segundos de áudio e outra devidamente ajustada com apenas um minuto.
O que é o GPT-SoVITS?
O GPT-SoVITS é um projeto open source de clonagem de voz e conversão de texto em fala, sob a licença MIT, criado pelo desenvolvedor RVC-Boss. Ele combina a modelagem semântica de texto baseada em GPT com o SoVITS — um sistema acústico e de conversão de voz baseado em VITS — em um único pipeline. O componente GPT transforma o texto em tokens semânticos; depois, o componente SoVITS converte esses tokens, orientado pela voz de referência, na forma de onda final. Essa divisão de tarefas permite que o projeto ofereça tanto geração zero-shot instantânea quanto um ajuste fino few-shot mais aprofundado a partir da mesma arquitetura subjacente.
Ele permite geração entre chinês, inglês, japonês, coreano e cantonês e conquistou uma reputação especialmente forte pela qualidade das saídas em chinês e japonês.
Dois níveis de clonagem: 5 segundos e 1 minuto
Essa é a principal capacidade do projeto, e vale explicar com precisão o que cada nível realmente oferece. O modo zero-shot usa um clipe de referência de 5 segundos e gera imediatamente a fala com aquela voz, sem nenhuma etapa de treinamento; testes do desenvolvedor descreveram esse nível como capaz de produzir cerca de 80-95% de similaridade com a voz-alvo, o que serve para testes rápidos ou conteúdo de menor risco. O ajuste fino few-shot vai além: com cerca de um minuto de dados da voz-alvo, é possível ajustar o modelo para melhorar de forma perceptível a similaridade e a naturalidade em relação ao ponto de partida zero-shot, eliminando grande parte da distância restante até a voz real do locutor de referência.
Histórico de versões: da v1 à v4
O GPT-SoVITS passou por várias gerações arquitetônicas distintas desde o lançamento inicial, e saber qual delas atende à sua situação é mais importante do que escolher automaticamente “a mais nova”:
- v1 e v2 compartilham a mesma arquitetura fundamental — geração direta da forma de onda por meio de um decodificador VQ-VAE, sem uma etapa separada de vocoder. A v2 ampliou essa base com suporte a mais idiomas e mais dados de pré-treinamento.
- v2Pro / v2ProPlus aperfeiçoaram ainda mais a estabilidade e a compatibilidade, preservando os requisitos de hardware e a velocidade de inferência da v2. Nas comparações do próprio projeto, chegam a superar a v4 em alguns aspectos e continuam mais baratas de executar.
- v3 substituiu a arquitetura acústica central por um shortcut Conditional Flow Matching Diffusion Transformer (shortcut-CFM-DiT), produzindo uma similaridade de timbre claramente maior com o áudio de referência, menos erros de repetição ou omissão no lado do GPT e uma expressão emocional mais rica. Seu treinamento usou um conjunto de dados ampliado e filtrado por qualidade, com cerca de 7.000 horas. Como a geração dessa versão não é totalmente de ponta a ponta, ela depende do vocoder open source BigVGAN v2 para converter a saída de espectrograma mel em áudio de 24kHz, o que pode introduzir um artefato metálico devido ao upsampling por um fator não inteiro.
- v4 corrige especificamente esse problema de som metálico e gera áudio de 48kHz de forma nativa, em vez de 24kHz, evitando a qualidade um pouco abafada que poderia resultar do upsampling de um sinal de 24kHz. O próprio autor do projeto descreve a v4 como uma substituta direta e prática da v3.
O ponto prático de decisão é o seguinte: v1, v2 e v2Pro tendem a funcionar melhor com dados de treinamento de qualidade inferior ou com ruído, porque sua arquitetura sofre mais influência da média geral do conjunto de treinamento. v3 e v4 funcionam melhor especificamente com áudio de referência limpo e de alta qualidade, pois dão mais peso à reprodução fiel daquela referência exata do que à média de um conjunto de dados. Porém, elas podem ficar atrás da v1/v2 se as gravações originais não estiverem limpas.
A WebUI: feita para quem não quer montar pipelines de treinamento à mão
A interface do GPT-SoVITS reúne todo o fluxo de preparação do conjunto de dados, não apenas a inferência. Ela inclui o UVR5 para separar os vocais da música de fundo ou do ruído, reconhecimento automático de fala para transcrição (ASR em chinês por meio de modelos dedicados, e inglês e japonês por meio do Faster Whisper Large V3) e segmentação automática do áudio para dividir gravações mais longas em trechos aproveitáveis no treinamento. Para conjuntos menores, na faixa de 5 a 10 minutos, um botão de “ação tripla com um clique” encadeia automaticamente várias dessas etapas de pré-processamento — uma vantagem importante de acessibilidade para quem não se sente à vontade criando um pipeline de dados do zero.
Como começar a usar o GPT-SoVITS
- Use o pacote integrado para Windows se estiver no Windows. Há um pacote pré-compilado para download direto: dê dois cliques em
go-webui.bate a WebUI completa será iniciada sem configuração manual do ambiente. - Faça a configuração manual no Linux/Mac ou se quiser mais controle. Crie um ambiente virtual com Python 3.10 (usando
uvou conda), clone o repositório e instale as dependências compip install -r requirements.txt. - Baixe os modelos pré-treinados que correspondam à versão desejada. Cada versão (v2, v2Pro, v3, v4) tem seus próprios arquivos de checkpoint hospedados no Hugging Face. Confirme que a versão do modelo pré-treinado corresponde à versão de treinamento selecionada na WebUI, ou a geração falhará ou perderá qualidade.
- Prepare o áudio de referência com as ferramentas integradas. Execute primeiro o UVR5 se o material tiver ruído de fundo ou música; depois, use as ferramentas de segmentação automática e anotação ASR em vez de transcrever e cortar os clipes manualmente.
- Escolha a versão com base na qualidade do áudio de origem. Use v1/v2/v2Pro para gravações mais ruidosas ou de qualidade mediana; use v3 ou v4 especificamente quando o áudio de referência estiver limpo, com qualidade de estúdio, e você quiser a máxima fidelidade àquela voz exata.
- Fique atento ao problema das GPUs da série 16. As placas NVIDIA mais antigas da série 16 não têm tensor cores e podem apresentar um erro de configuração CUDA durante o treinamento; o
config.pydo projeto detecta isso automaticamente e força a precisão FP32 como solução alternativa.
Dicas para obter resultados melhores
- Comece pelo zero-shot antes de investir no ajuste fino. Um teste rápido de 5 segundos mostra se a similaridade zero-shot do modelo-base já atende ao seu caso de uso antes de você gastar tempo reunindo e preparando um minuto inteiro de áudio de treinamento.
- Associe a versão à qualidade dos dados, não à novidade. Escolher a v4 automaticamente só por ser a mais recente pode prejudicar a qualidade da saída se as gravações originais tiverem ruído; a v2Pro costuma ser a alternativa mais prática para áudios que não estão impecáveis.
- Limpe o conjunto de dados antes do treinamento, não depois. Use primeiro o UVR5 para remover ruído de fundo e música; a v3 e a v4, em especial, dependem muito da fidelidade do material fornecido.
- Aproveite de forma intencional sua força em chinês e japonês. Se o idioma principal do projeto for chinês ou japonês, o GPT-SoVITS é uma das opções open source mais fortes especificamente para esses idiomas, mais do que para conteúdo apenas em inglês, no qual outros modelos podem levar vantagem.
- Prefira a v4 à v3, a menos que tenha um motivo específico para não fazer isso. Como a v4 corrige o conhecido problema de artefato metálico da v3 e gera áudio com uma taxa de amostragem nativa maior, a orientação do próprio autor para tratá-la como substituta direta é uma escolha padrão razoável, a menos que você esteja solucionando especificamente um problema de uma configuração baseada na v3.
GPT-SoVITS em comparação com outros modelos de clonagem few-shot
| GPT-SoVITS | XTTS-v2 | Fish Speech | |
|---|---|---|---|
| Dados mínimos para uma clonagem utilizável | 5 segundos (zero-shot) | ~6 segundos | ~10–30 segundos |
| Suporte a ajuste fino | Sim, ~1 minuto de dados | Sim, por scripts da comunidade | Sim, nativo |
| Idiomas mais fortes | Chinês, japonês | Cobertura ampla de 17 idiomas | Inglês, chinês, japonês |
| Ferramentas integradas para preparar dados | Sim (separação de vocais, ASR, segmentação automática) | Não | Não |
| Licença | MIT | Coqui Public Model License (não comercial) | Voltada a pesquisa/uso não comercial |
O nicho específico do GPT-SoVITS é a combinação de uma necessidade de dados realmente baixa com uma WebUI completa que cuida tanto da preparação de dados quanto do treinamento. Principalmente para conteúdo em chinês e japonês, é difícil encontrar essa combinação reunida em outro projeto.
Perguntas frequentes
De quanto áudio eu realmente preciso para clonar uma voz com o GPT-SoVITS?
Bastam 5 segundos para uma clonagem zero-shot imediata, ou cerca de 1 minuto de áudio de referência para ajustar um modelo com similaridade e naturalidade claramente melhores.
Qual versão devo usar: v2, v3 ou v4?
Use v2 ou v2Pro se o áudio de treinamento tiver qualidade mediana ou ruído; use v3 ou v4 se as gravações de referência estiverem limpas e tiverem qualidade de estúdio, pois essas versões dão mais peso à correspondência fiel com a referência exata. Entre v3 e v4, a v4 corrige um conhecido problema de artefato metálico e gera áudio nativo de maior qualidade, por isso é a escolha padrão mais prática.
O GPT-SoVITS funciona bem em idiomas além do chinês?
Sim. Além do chinês, ele oferece suporte a inglês, japonês, coreano e cantonês, mas foi em chinês e japonês que construiu sua reputação mais forte.
O GPT-SoVITS é gratuito para uso comercial?
Sim. Ele é disponibilizado sob a licença MIT, uma das opções mais permissivas entre os projetos open source de clonagem de voz.
Preciso preparar manualmente meu próprio conjunto de dados de treinamento?
Não necessariamente. A WebUI inclui ferramentas de separação de vocais, transcrição automática e segmentação de áudio, além de uma opção com um clique para conjuntos de dados menores que encadeia automaticamente várias etapas de pré-processamento.
Gere uma voz semelhante a partir de um áudio de referência
Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.