EchoraEchora
Voltar aos modelos

VITS: a arquitetura que sustenta silenciosamente uma grande parte do TTS de código aberto

9 de setembro de 2026
•
8 min de leitura

Muitos modelos de voz de código aberto bastante conhecidos acabam compartilhando o mesmo ancestral, sem que a maioria dos usuários sequer perceba: as vozes ONNX do Piper, a base multilíngue do MeloTTS, a clonagem condicionada por falante do YourTTS e a metade SoVITS do GPT-SoVITS foram todos construídos diretamente sobre a arquitetura abordada nesta página. O VITS é o sistema clássico de TTS ponta a ponta que provou que um modelo de geração paralela em uma única etapa poderia realmente igualar a qualidade dos antigos pipelines de duas etapas — e essa prova é o motivo pelo qual uma parte tão grande do ecossistema de TTS de código aberto ainda remonta a ele.

O que é o VITS?

O VITS (Variational Inference with adversarial learning for end-to-end Text-to-Speech) foi apresentado por Jaehyeon Kim, Jungil Kong e Juhee Son, da Kakao Enterprise, e publicado na ICML 2021. É um modelo de síntese de fala ponta a ponta que prevê uma forma de onda diretamente a partir de uma sequência de texto de entrada em uma única etapa, lançado sob a licença MIT. Antes do VITS, já existiam modelos ponta a ponta capazes de treinamento em uma única etapa e amostragem paralela, mas a qualidade de suas saídas ficava consistentemente abaixo dos sistemas de duas etapas — um modelo acústico treinado separadamente alimentando um vocoder também treinado separadamente. O VITS fechou diretamente essa lacuna, e sua avaliação oficial mostrou que ele superava, em pontuação média de opinião no conjunto de dados LJSpeech, os modelos de duas etapas mais fortes disponíveis publicamente.

Vantagens funcionais do VITS

  • Genuinamente ponta a ponta. O texto entra e uma forma de onda sai, sem uma etapa de vocoder treinada separadamente para gerenciar — uma verdadeira simplificação arquitetural em relação aos pipelines de duas etapas que ele foi desenvolvido para superar.
  • Geração paralela e não autorregressiva. Como o VITS não gera o áudio token por token em sequência, a inferência é rápida em comparação com alternativas autorregressivas.
  • Um preditor estocástico de duração. O mesmo texto de entrada pode ser reproduzido com ritmos e cadências diferentes, mas válidos, entre as gerações, em vez de sempre produzir um resultado idêntico e determinístico.
  • Qualidade competitiva em relação a sistemas de duas etapas, validada por avaliações de pontuação média de opinião em benchmarks de um único falante (LJSpeech) e de múltiplos falantes (VCTK).
  • Suporte nativo a múltiplos falantes por meio de embeddings de falante, sem exigir uma arquitetura fundamentalmente diferente para esse caso.
  • Uma licença MIT permissiva e uma presença no campo grande o bastante para que ele se tornasse a base sobre a qual muitos projetos posteriores foram construídos diretamente, em vez de criarem uma arquitetura acústica própria do zero.

Por dentro: a arquitetura VAE condicional

O VITS é estruturado como um autoencoder variacional condicional formado por três componentes que trabalham em conjunto: um codificador posterior, um decodificador e uma distribuição prévia condicional. Na distribuição prévia condicional, um codificador de texto baseado em Transformer e uma pilha de camadas de acoplamento de fluxos de normalização trabalham juntos para modelar, a partir do texto de entrada, características acústicas baseadas em espectrograma. Em seguida, o decodificador reconstrói a forma de onda real por meio de uma pilha de camadas convolucionais transpostas, seguindo uma filosofia de design semelhante à do vocoder HiFi-GAN, em vez de exigir o HiFi-GAN como uma etapa posterior verdadeiramente separada.

O que faz essa combinação funcionar tão bem é a abordagem de treinamento: inferência variacional ampliada com fluxos de normalização, combinada com um processo de treinamento adversarial emprestado de métodos no estilo GAN, melhorando em conjunto a capacidade expressiva do modelo generativo subjacente para além do que um VAE padrão costuma alcançar sozinho.

O preditor estocástico de duração

Esta é a escolha de design mais característica do VITS e trata de uma limitação real da maioria dos sistemas de TTS anteriores: quando uma pessoa real diz a mesma frase duas vezes, a duração e o ritmo não saem idênticos em todas as ocasiões. O VITS modela isso diretamente com um preditor estocástico de duração, usando a modelagem de incerteza sobre variáveis latentes para sintetizar fala com ritmos realmente diversos a partir do mesmo texto de entrada — em vez de impor uma única duração determinística a cada fonema, independentemente do contexto. É isso que confere à saída do VITS uma qualidade natural de um para muitos: um texto, várias interpretações válidas com cadências diferentes, em consonância com o comportamento real da linguagem falada.

Primeiros passos com o VITS

  1. Obtenha no Hugging Face um checkpoint oficial pré-treinado da Kakao Enterprise. kakao-enterprise/vits-ljs é o modelo de um único falante treinado com LJ Speech; kakao-enterprise/vits-vctk é o modelo de múltiplos falantes treinado com o conjunto de dados VCTK (109 falantes, vários sotaques do inglês) — escolha conforme precise de uma voz consistente ou de vários falantes.
  2. Use a integração com o Hugging Face Transformers para ter a configuração mais simples. O VITS é compatível diretamente com as classes VitsModel e VitsTokenizer da biblioteca transformers: execute from transformers import VitsModel, VitsTokenizer e carregue qualquer um dos checkpoints pelo nome para chegar à inferência em poucas linhas, sem configurar um vocoder separado.
  3. Use o repositório original jaywalnut310/vits no GitHub se quiser treinar ou fazer fine-tuning. Essa é a implementação oficial de referência dos autores do artigo e o ponto de partida adotado pela maioria dos projetos derivados (Piper, YourTTS e outros) ao adaptar o VITS a seus casos de uso específicos.
  4. Procure um checkpoint da comunidade específico para o idioma ou conjunto de dados antes de treinar o seu. Como a comunidade retreinou o VITS amplamente em outros idiomas e conjuntos de dados, buscar no Hugging Face um checkpoint já existente para o idioma desejado costuma ser mais rápido do que treinar do zero.

A árvore genealógica do VITS: o que foi realmente construído sobre ele

O Piper combina um modelo baseado em VITS com exportação para ONNX e fonemização por espeak-ng para implantação ultraleve em dispositivos de borda, somente com CPU. O MeloTTS se baseia especificamente no VITS e no VITS2, acrescentando características linguísticas baseadas em BERT para melhorar a prosódia. O YourTTS modifica a base do VITS com um codificador de falante dedicado e Speaker Consistency Loss para adicionar recursos zero-shot de múltiplos falantes e conversão de voz. O GPT-SoVITS usa um sistema baseado em VITS (a parte “SoVITS” do nome) no lado acústico e de conversão de voz de seu pipeline híbrido, combinado com um componente baseado em GPT para modelagem semântica. Nenhum desses projetos é uma cópia do VITS — cada um adotou a mesma arquitetura central e a modificou para um objetivo específico e diferente, exatamente o tipo de adaptabilidade que torna uma arquitetura verdadeiramente fundamental.

Dicas para obter resultados melhores

  • Use o checkpoint do LJSpeech para uma única voz consistente e o VCTK quando precisar de múltiplos falantes. Não adote um deles como padrão sem verificar qual corresponde aos requisitos reais de falantes do seu projeto.
  • Espere variações naturais entre as gerações, não um erro. Devido ao preditor estocástico de duração, executar o mesmo texto várias vezes no VITS produzirá uma cadência ligeiramente diferente em cada ocasião — é a arquitetura funcionando como foi projetada, não uma inconsistência que precisa ser depurada.
  • Consulte primeiro um projeto derivado se sua necessidade for mais específica do que o TTS básico. Se você precisa de clonagem de voz, implantação extremamente leve ou ajuste específico para chinês, é provável que um dos derivados diretos do VITS (YourTTS, Piper ou GPT-SoVITS) já tenha resolvido esse problema concreto melhor do que uma adaptação própria da arquitetura base.
  • Consulte o VITS2 se a eficiência de treinamento e as melhorias de qualidade forem importantes para seu projeto. Kong e seus colaboradores publicaram uma continuação direta voltada especificamente a ganhos de qualidade e eficiência em relação ao original por meio de aprendizado adversarial e refinamentos arquiteturais.

VITS em comparação com VITS2 e uma alternativa de flow matching

VITSVITS2F5-TTS
Abordagem centralVAE condicional + fluxos de normalização + treinamento adversarialA mesma base, com arquitetura e treinamento refinadosDiffusion Transformer + flow matching condicional
Modo de geraçãoNão autorregressivo, paraleloNão autorregressivo, paraleloNão autorregressivo
Modelagem da duraçãoPreditor estocástico de duraçãoModelagem de duração aprimoradaSem modelo explícito de duração
Lançamento202120232024
LicençaMITVerificar a implementação específicaCC-BY-NC (não comercial)
Ecossistema de derivadosExtremamente grandeMenor e mais recenteEm crescimento, paradigma mais novo

A importância duradoura do VITS não está no fato de ele ainda ser, por si só, o estado da arte — várias arquiteturas mais novas já o superam nos números brutos dos benchmarks —, mas em seu design central ter se mostrado influente e adaptável o bastante para se tornar literalmente a base de uma parcela significativa das ferramentas de TTS de código aberto que as pessoas realmente usam hoje.

Perguntas frequentes

Ainda vale a pena usar o VITS diretamente ou devo escolher um modelo derivado?

Para pesquisa em geral ou uma necessidade simples de TTS com um ou vários falantes, os checkpoints básicos do VITS continuam sólidos. Para requisitos mais específicos — clonagem de voz, implantação extremamente leve ou ajuste para um idioma específico —, um de seus derivados (YourTTS, Piper, MeloTTS ou GPT-SoVITS) normalmente já adaptou a arquitetura exatamente para esse propósito.

Qual é a diferença entre o VITS e o VITS2?

O VITS2 é uma continuação direta de um grupo de autores parcialmente coincidente, voltada especificamente a melhorar a qualidade e a eficiência de treinamento do original por meio de refinamentos no aprendizado adversarial e mudanças arquiteturais, mantendo a mesma filosofia central de VAE condicional.

Por que a saída do VITS soa um pouco diferente a cada vez com o mesmo texto?

Isso é intencional e vem do preditor estocástico de duração, que modela a relação natural de um para muitos entre texto e fala — a mesma frase pode ser dita com ritmos e cadências diferentes, mas válidos, e o VITS reflete isso deliberadamente em vez de impor uma saída idêntica todas as vezes.

O VITS é gratuito para uso comercial?

Sim. A versão original do VITS foi lançada sob a licença MIT, uma das opções mais permissivas. No entanto, se você estiver usando um derivado específico ou um checkpoint treinado pela comunidade, verifique separadamente a licença do próprio projeto, pois ela pode ser diferente dos termos do modelo base.

O VITS oferece suporte a múltiplos falantes?

Sim, por meio de embeddings de falante. O checkpoint oficial kakao-enterprise/vits-vctk demonstra isso diretamente: ele foi treinado com 109 falantes e uma variedade de sotaques do inglês.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →