EchoraEchora
Voltar aos modelos

GPT-SoVITS: um estúdio completo de clonagem de voz, não apenas um modelo

2 de setembro de 2026
•
7 min de leitura

Muitos modelos open source de clonagem entregam um checkpoint e um script em Python e consideram o trabalho encerrado. O GPT-SoVITS, por sua vez, oferece o fluxo inteiro — separação de vocais, transcrição automática, segmentação do conjunto de dados, treinamento e inferência, tudo dentro de uma única interface baseada no navegador —, construído em torno de uma necessidade de dados realmente baixa: uma clonagem utilizável com 5 segundos de áudio e outra devidamente ajustada com apenas um minuto.

O que é o GPT-SoVITS?

O GPT-SoVITS é um projeto open source de clonagem de voz e conversão de texto em fala, sob a licença MIT, criado pelo desenvolvedor RVC-Boss. Ele combina a modelagem semântica de texto baseada em GPT com o SoVITS — um sistema acústico e de conversão de voz baseado em VITS — em um único pipeline. O componente GPT transforma o texto em tokens semânticos; depois, o componente SoVITS converte esses tokens, orientado pela voz de referência, na forma de onda final. Essa divisão de tarefas permite que o projeto ofereça tanto geração zero-shot instantânea quanto um ajuste fino few-shot mais aprofundado a partir da mesma arquitetura subjacente.

Ele permite geração entre chinês, inglês, japonês, coreano e cantonês e conquistou uma reputação especialmente forte pela qualidade das saídas em chinês e japonês.

Dois níveis de clonagem: 5 segundos e 1 minuto

Essa é a principal capacidade do projeto, e vale explicar com precisão o que cada nível realmente oferece. O modo zero-shot usa um clipe de referência de 5 segundos e gera imediatamente a fala com aquela voz, sem nenhuma etapa de treinamento; testes do desenvolvedor descreveram esse nível como capaz de produzir cerca de 80-95% de similaridade com a voz-alvo, o que serve para testes rápidos ou conteúdo de menor risco. O ajuste fino few-shot vai além: com cerca de um minuto de dados da voz-alvo, é possível ajustar o modelo para melhorar de forma perceptível a similaridade e a naturalidade em relação ao ponto de partida zero-shot, eliminando grande parte da distância restante até a voz real do locutor de referência.

Histórico de versões: da v1 à v4

O GPT-SoVITS passou por várias gerações arquitetônicas distintas desde o lançamento inicial, e saber qual delas atende à sua situação é mais importante do que escolher automaticamente “a mais nova”:

  • v1 e v2 compartilham a mesma arquitetura fundamental — geração direta da forma de onda por meio de um decodificador VQ-VAE, sem uma etapa separada de vocoder. A v2 ampliou essa base com suporte a mais idiomas e mais dados de pré-treinamento.
  • v2Pro / v2ProPlus aperfeiçoaram ainda mais a estabilidade e a compatibilidade, preservando os requisitos de hardware e a velocidade de inferência da v2. Nas comparações do próprio projeto, chegam a superar a v4 em alguns aspectos e continuam mais baratas de executar.
  • v3 substituiu a arquitetura acústica central por um shortcut Conditional Flow Matching Diffusion Transformer (shortcut-CFM-DiT), produzindo uma similaridade de timbre claramente maior com o áudio de referência, menos erros de repetição ou omissão no lado do GPT e uma expressão emocional mais rica. Seu treinamento usou um conjunto de dados ampliado e filtrado por qualidade, com cerca de 7.000 horas. Como a geração dessa versão não é totalmente de ponta a ponta, ela depende do vocoder open source BigVGAN v2 para converter a saída de espectrograma mel em áudio de 24kHz, o que pode introduzir um artefato metálico devido ao upsampling por um fator não inteiro.
  • v4 corrige especificamente esse problema de som metálico e gera áudio de 48kHz de forma nativa, em vez de 24kHz, evitando a qualidade um pouco abafada que poderia resultar do upsampling de um sinal de 24kHz. O próprio autor do projeto descreve a v4 como uma substituta direta e prática da v3.

O ponto prático de decisão é o seguinte: v1, v2 e v2Pro tendem a funcionar melhor com dados de treinamento de qualidade inferior ou com ruído, porque sua arquitetura sofre mais influência da média geral do conjunto de treinamento. v3 e v4 funcionam melhor especificamente com áudio de referência limpo e de alta qualidade, pois dão mais peso à reprodução fiel daquela referência exata do que à média de um conjunto de dados. Porém, elas podem ficar atrás da v1/v2 se as gravações originais não estiverem limpas.

A WebUI: feita para quem não quer montar pipelines de treinamento à mão

A interface do GPT-SoVITS reúne todo o fluxo de preparação do conjunto de dados, não apenas a inferência. Ela inclui o UVR5 para separar os vocais da música de fundo ou do ruído, reconhecimento automático de fala para transcrição (ASR em chinês por meio de modelos dedicados, e inglês e japonês por meio do Faster Whisper Large V3) e segmentação automática do áudio para dividir gravações mais longas em trechos aproveitáveis no treinamento. Para conjuntos menores, na faixa de 5 a 10 minutos, um botão de “ação tripla com um clique” encadeia automaticamente várias dessas etapas de pré-processamento — uma vantagem importante de acessibilidade para quem não se sente à vontade criando um pipeline de dados do zero.

Como começar a usar o GPT-SoVITS

  1. Use o pacote integrado para Windows se estiver no Windows. Há um pacote pré-compilado para download direto: dê dois cliques em go-webui.bat e a WebUI completa será iniciada sem configuração manual do ambiente.
  2. Faça a configuração manual no Linux/Mac ou se quiser mais controle. Crie um ambiente virtual com Python 3.10 (usando uv ou conda), clone o repositório e instale as dependências com pip install -r requirements.txt.
  3. Baixe os modelos pré-treinados que correspondam à versão desejada. Cada versão (v2, v2Pro, v3, v4) tem seus próprios arquivos de checkpoint hospedados no Hugging Face. Confirme que a versão do modelo pré-treinado corresponde à versão de treinamento selecionada na WebUI, ou a geração falhará ou perderá qualidade.
  4. Prepare o áudio de referência com as ferramentas integradas. Execute primeiro o UVR5 se o material tiver ruído de fundo ou música; depois, use as ferramentas de segmentação automática e anotação ASR em vez de transcrever e cortar os clipes manualmente.
  5. Escolha a versão com base na qualidade do áudio de origem. Use v1/v2/v2Pro para gravações mais ruidosas ou de qualidade mediana; use v3 ou v4 especificamente quando o áudio de referência estiver limpo, com qualidade de estúdio, e você quiser a máxima fidelidade àquela voz exata.
  6. Fique atento ao problema das GPUs da série 16. As placas NVIDIA mais antigas da série 16 não têm tensor cores e podem apresentar um erro de configuração CUDA durante o treinamento; o config.py do projeto detecta isso automaticamente e força a precisão FP32 como solução alternativa.

Dicas para obter resultados melhores

  • Comece pelo zero-shot antes de investir no ajuste fino. Um teste rápido de 5 segundos mostra se a similaridade zero-shot do modelo-base já atende ao seu caso de uso antes de você gastar tempo reunindo e preparando um minuto inteiro de áudio de treinamento.
  • Associe a versão à qualidade dos dados, não à novidade. Escolher a v4 automaticamente só por ser a mais recente pode prejudicar a qualidade da saída se as gravações originais tiverem ruído; a v2Pro costuma ser a alternativa mais prática para áudios que não estão impecáveis.
  • Limpe o conjunto de dados antes do treinamento, não depois. Use primeiro o UVR5 para remover ruído de fundo e música; a v3 e a v4, em especial, dependem muito da fidelidade do material fornecido.
  • Aproveite de forma intencional sua força em chinês e japonês. Se o idioma principal do projeto for chinês ou japonês, o GPT-SoVITS é uma das opções open source mais fortes especificamente para esses idiomas, mais do que para conteúdo apenas em inglês, no qual outros modelos podem levar vantagem.
  • Prefira a v4 à v3, a menos que tenha um motivo específico para não fazer isso. Como a v4 corrige o conhecido problema de artefato metálico da v3 e gera áudio com uma taxa de amostragem nativa maior, a orientação do próprio autor para tratá-la como substituta direta é uma escolha padrão razoável, a menos que você esteja solucionando especificamente um problema de uma configuração baseada na v3.

GPT-SoVITS em comparação com outros modelos de clonagem few-shot

GPT-SoVITSXTTS-v2Fish Speech
Dados mínimos para uma clonagem utilizável5 segundos (zero-shot)~6 segundos~10–30 segundos
Suporte a ajuste finoSim, ~1 minuto de dadosSim, por scripts da comunidadeSim, nativo
Idiomas mais fortesChinês, japonêsCobertura ampla de 17 idiomasInglês, chinês, japonês
Ferramentas integradas para preparar dadosSim (separação de vocais, ASR, segmentação automática)NãoNão
LicençaMITCoqui Public Model License (não comercial)Voltada a pesquisa/uso não comercial

O nicho específico do GPT-SoVITS é a combinação de uma necessidade de dados realmente baixa com uma WebUI completa que cuida tanto da preparação de dados quanto do treinamento. Principalmente para conteúdo em chinês e japonês, é difícil encontrar essa combinação reunida em outro projeto.

Perguntas frequentes

De quanto áudio eu realmente preciso para clonar uma voz com o GPT-SoVITS?

Bastam 5 segundos para uma clonagem zero-shot imediata, ou cerca de 1 minuto de áudio de referência para ajustar um modelo com similaridade e naturalidade claramente melhores.

Qual versão devo usar: v2, v3 ou v4?

Use v2 ou v2Pro se o áudio de treinamento tiver qualidade mediana ou ruído; use v3 ou v4 se as gravações de referência estiverem limpas e tiverem qualidade de estúdio, pois essas versões dão mais peso à correspondência fiel com a referência exata. Entre v3 e v4, a v4 corrige um conhecido problema de artefato metálico e gera áudio nativo de maior qualidade, por isso é a escolha padrão mais prática.

O GPT-SoVITS funciona bem em idiomas além do chinês?

Sim. Além do chinês, ele oferece suporte a inglês, japonês, coreano e cantonês, mas foi em chinês e japonês que construiu sua reputação mais forte.

O GPT-SoVITS é gratuito para uso comercial?

Sim. Ele é disponibilizado sob a licença MIT, uma das opções mais permissivas entre os projetos open source de clonagem de voz.

Preciso preparar manualmente meu próprio conjunto de dados de treinamento?

Não necessariamente. A WebUI inclui ferramentas de separação de vocais, transcrição automática e segmentação de áudio, além de uma opção com um clique para conjuntos de dados menores que encadeia automaticamente várias etapas de pré-processamento.

Gere uma voz semelhante a partir de um áudio de referência

Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.

Criar uma voz clonada →