EchoraEchora
Voltar aos modelos

StyleTTS 2: quando ouvintes acharam a voz sintética mais natural do que a real

31 de agosto de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Afirmar que um modelo TTS soa “quase humano” já é tão comum que virou ruído de fundo. O StyleTTS 2, criado pela mesma equipe da Universidade Columbia responsável pelo StyleTTS original, fez uma afirmação mais específica e mais fácil de testar: em uma avaliação auditiva usando o conjunto de dados LJSpeech, com um único falante, pessoas que têm o inglês como língua materna consideraram a saída sintetizada mais natural do que as gravações humanas reais usadas no treinamento. No conjunto VCTK, com múltiplos falantes, o modelo igualou as gravações humanas em vez de superá-las — um resultado mais modesto, mas ainda relevante em uma tarefa mais difícil e variada.

O que mudou em relação ao StyleTTS original

O StyleTTS 2 mantém a ideia central de seu antecessor — tratar o estilo como um componente explicitamente separado e controlável da geração —, mas muda a forma de obter esse estilo e reconstrói o processo de treinamento em torno de uma nova fonte de feedback.

Estilo amostrado por difusão, não extraído de um clipe de referência. O StyleTTS original precisava de um espectrograma mel de referência para extrair um vetor de estilo por meio de seu codificador de estilo. Já o StyleTTS 2 modela o estilo como uma variável aleatória latente gerada por difusão, o que permite produzir um estilo adequado e natural para qualquer texto sem precisar de voz de referência. Esta é a maior mudança prática entre as duas versões: com o StyleTTS 2, você não precisa ter uma amostra de voz disponível para obter resultados expressivos e variados.

Grandes modelos de linguagem de voz como discriminadores. Em vez de treinar apenas com um discriminador convencional, o StyleTTS 2 incorpora grandes modelos de linguagem de voz pré-treinados — entre eles o WavLM — para julgar se a voz gerada soa convincentemente humana. A isso se soma uma nova abordagem diferenciável de modelagem de duração, que permite treinar todo o sistema de ponta a ponta, em vez de dividi-lo em etapas separadas.

Os números da ablação: o que realmente fez diferença

Em vez de apenas afirmar que essas escolhas de projeto ajudaram, a pesquisa do StyleTTS 2 mediu a contribuição individual de cada uma por meio de testes de pontuação média comparativa de opinião (CMOS): um componente era removido por vez e a naturalidade percebida era medida novamente.

  • Remover a difusão de estilo — usando vetores aleatórios de estilo de referência em seu lugar — produziu a maior queda de qualidade entre os componentes testados, o sinal mais claro de quanto a difusão de estilo dependente do texto realmente contribui para uma saída em nível humano.
  • Remover o upsampler diferenciável de duração e retirar o discriminador baseado em WavLM provocaram, individualmente, quedas substanciais de qualidade, confirmando que os dois novos elementos da arquitetura — e não apenas um deles — estavam realizando um trabalho efetivo.
  • Remover completamente o codificador de estilo prosódico também prejudicou a naturalidade de maneira mensurável, reforçando que o conceito subjacente de vetor de estilo do StyleTTS original continuava sendo uma contribuição real, e não algo simplesmente substituído pela nova abordagem de difusão.
  • Excluir especificamente textos fora da distribuição do treinamento adversarial reduziu a robustez do modelo diante de entradas desconhecidas, o menor efeito entre os componentes testados, mas ainda significativo.

Adaptação zero-shot de falantes

Quando treinado no LibriTTS, o StyleTTS 2 superou os modelos abertos disponíveis anteriormente especificamente na adaptação zero-shot de falantes: ele gera uma voz convincente para uma voz que o modelo nunca encontrou antes usando apenas um breve clipe de referência. Combinada à amostragem de estilo baseada em difusão, essa capacidade oferece ao StyleTTS 2 duas formas independentes de introduzir variação: novos estilos de fala mesmo sem áudio de referência e a identidade clonada de um falante quando há um clipe de referência.

O que vale saber antes de começar

Alguns detalhes práticos definem como é realmente executar o StyleTTS 2:

A inferência com qualidade completa depende de um componente com licença GPL. O repositório principal não inclui esse componente diretamente por causa da licença; um fork da comunidade com licença GPL oferece um script de inferência importável — inclusive uma API experimental de streaming —, enquanto há um pacote separado totalmente coberto pela licença MIT que usa o fonemizador gruut. No entanto, essa substituição reduz um pouco a qualidade da saída devido a uma incompatibilidade entre o fonemizador e o gruut.

GPUs antigas podem introduzir artefatos audíveis. Um problema conhecido produz ruído agudo de fundo em placas de vídeo mais antigas, causado por diferenças na precisão de ponto flutuante. A solução documentada é usar uma GPU mais moderna ou recorrer à inferência por CPU.

A síntese em outros idiomas exige um modelo PL-BERT correspondente. O StyleTTS 2 pode ser treinado em outras línguas, mas precisa de um modelo PL-BERT pré-treinado específico para o idioma; para isso, está disponível um PL-BERT multilíngue treinado pela comunidade que cobre 14 idiomas.

A clonagem de voz envolve aqui uma expectativa de consentimento. Se você usar os modelos pré-treinados com um falante de referência que não faça parte dos conjuntos originais de treinamento com acesso aberto, os termos de uso do projeto pedem que você tenha permissão dessa pessoa ou deixe claro que o áudio resultante é sintetizado antes de torná-lo público.

Primeiros passos com o StyleTTS 2

  1. Clone o repositório. Execute git clone no projeto oficial yl4579/StyleTTS2 e escolha entre o caminho de inferência com licença MIT e o fork com licença GPL de acordo com suas necessidades de qualidade e restrições de licença.
  2. Baixe o checkpoint pré-treinado do LibriTTS. Disponível no Hugging Face, ele é o ponto de partida recomendado tanto para adaptação zero-shot de falantes quanto para geração de uso geral.
  3. Defina os parâmetros de amostragem por difusão. A inferência expõe parâmetros como alpha, beta, diffusion_steps e embedding_scale. Como o amostrador é ancestral, mais etapas de difusão produzem amostras mais variadas ao custo de uma geração mais lenta; ajuste de acordo com o que importa mais em seu caso de uso, variedade ou velocidade.
  4. Use primeiro o notebook de demonstração incluído para ouvir o modelo funcionando. Os notebooks de inferência do repositório reproduzem as amostras de demonstração publicadas pelo próprio modelo e calculam diretamente o fator de tempo real, oferecendo uma referência concreta de velocidade em seu próprio hardware.
  5. Combine a geração da sua GPU com a qualidade de saída esperada. Se surgirem artefatos agudos inesperados, verifique se você está usando uma GPU antiga antes de concluir que há um erro de configuração.
  6. Configure primeiro o PL-BERT se precisar de saída em outros idiomas. Antes de iniciar o treinamento, confirme que existe um modelo PL-BERT pré-treinado para o idioma desejado — ou use o PL-BERT multilíngue da comunidade —, em vez de descobrir esse requisito no meio do processo.

Dicas para obter resultados melhores

  • Aumente as etapas de difusão para ganhar variedade, não apenas qualidade. Mais etapas introduzem maior diversidade entre gerações do mesmo texto, algo útil quando você quer várias interpretações distintas, mas não é um controle que deva ser levado ao máximo por padrão se a velocidade for importante.
  • Use o fork com licença GPL se a qualidade da saída for prioridade e a licença permitir. O caminho exclusivamente MIT existe especificamente para oferecer flexibilidade de licenciamento e reconhece uma contrapartida na qualidade; escolha de forma consciente com base na restrição mais importante para o seu projeto.
  • Teste a clonagem zero-shot com a sua voz-alvo específica antes de se comprometer. Os resultados publicados descrevem uma adaptação zero-shot forte especificamente no benchmark LibriTTS; valide a qualidade com seu próprio falante de referência em vez de presumir um desempenho uniforme em todas as vozes.
  • Entenda a afirmação de que “supera gravações humanas” em seu contexto real. Ela reflete uma avaliação auditiva específica no conjunto LJSpeech, com um único falante. No VCTK, com múltiplos falantes, o resultado igualou as gravações humanas em vez de superá-las, um desfecho mais comum — e ainda assim impressionante — em uma tarefa mais difícil com várias vozes.
  • Respeite as expectativas de divulgação e consentimento relacionadas a vozes clonadas. Isso não é apenas uma formalidade jurídica: levar o assunto a sério faz parte do uso responsável da tecnologia, especialmente porque a saída pode ser muito convincente.

StyleTTS 2 vs. StyleTTS vs. outros modelos de clonagem

StyleTTS 2StyleTTS (original)XTTS-v2
Fonte do estiloAmostrado por difusão, sem necessidade de referênciaExtraído do áudio de referência por um codificador de estiloRepresentação latente de falante baseada em clipe de referência
DiscriminadorGrandes modelos de linguagem de voz (por exemplo, WavLM)Discriminador adversarial padrãoN/A (arquitetura diferente)
Adaptação zero-shot de falantesMelhor que no antecessorCompatívelCompatível, 17 idiomas
Naturalidade relatadaSupera gravações humanas no LJSpeech e iguala no VCTKForte, anterior a essa afirmaçãoForte, sem benchmark direto contra gravações humanas
Abordagem de treinamentoDe ponta a ponta, modelagem diferenciável de duraçãoVários módulos, adversarialAutorregressiva no estilo GPT
MultilínguePor meio de modelos PL-BERT da comunidadeVoltado ao inglês17 idiomas de forma nativa

O avanço central do StyleTTS 2 é eliminar a dependência de áudio de referência para criar um estilo expressivo e, ao mesmo tempo, levar a naturalidade longe o bastante para igualar ou superar gravações humanas em pelo menos um benchmark padrão. É uma afirmação realmente rara, específica e verificável de forma independente em uma área na qual “quase humano” costuma permanecer vago.

Perguntas frequentes

O StyleTTS 2 realmente soa melhor do que gravações humanas?

Em uma avaliação específica, pessoas que têm o inglês como língua materna consideraram a saída do StyleTTS 2 mais natural do que as gravações humanas reais no conjunto LJSpeech, com um único falante. No conjunto VCTK, mais difícil e com múltiplos falantes, o modelo igualou as gravações humanas em vez de superá-las. Os dois resultados são relevantes, mas vale manter em mente o contexto específico da avaliação em vez de tratá-los como uma afirmação universal.

Preciso de um clipe de áudio de referência para usar o StyleTTS 2?

Não para gerar voz expressiva e natural em geral: o estilo pode ser amostrado por difusão sem qualquer áudio de referência. Um clipe de referência continua sendo útil especificamente para clonagem zero-shot da voz de um falante em particular.

Por que o repositório menciona um problema de licença GPL?

A inferência com qualidade completa depende de um componente com licença GPL, por isso ele não é incluído diretamente no repositório principal de estilo MIT. Você pode usar um fork da comunidade com licença GPL para obter a qualidade completa ou uma alternativa totalmente coberta pela licença MIT que utiliza o fonemizador gruut, aceitando uma contrapartida moderada na qualidade.

O StyleTTS 2 pode gerar voz em outros idiomas além do inglês?

Sim, com um modelo PL-BERT pré-treinado para o idioma desejado. Um PL-BERT multilíngue treinado pela comunidade já cobre 14 idiomas, e você pode treinar o seu próprio modelo para os demais.

O que causa o ruído agudo relatado por alguns usuários?

É um artefato conhecido ligado a diferenças na precisão de ponto flutuante em GPUs antigas; usar uma GPU mais moderna ou mudar para inferência por CPU resolve o problema.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →