EchoraEchora
Voltar aos modelos

XTTS-v2: O padrão de clonagem de voz que sobreviveu à própria empresa

30 de agosto de 2026
•
8 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Muitos modelos open source são comparados ao XTTS-v2 antes de serem comparados a qualquer outra coisa. É uma posição estranha para um modelo ocupar, considerando que a Coqui AI, empresa que o criou, encerrou completamente as atividades no início de 2024. Ainda assim, o XTTS-v2 é o modelo que consolidou essa reputação: um sistema multilíngue de clonagem de voz zero-shot bom o bastante para que o desaparecimento de sua própria criadora quase não afetasse sua relevância.

O que é o XTTS-v2?

O XTTS-v2 é um modelo open source multilíngue de texto para voz e clonagem de voz desenvolvido pela Coqui AI e lançado em 2023 como um aprimoramento da arquitetura XTTS original. Ele clona a voz de um locutor usando apenas 6 segundos de áudio de referência em 17 idiomas: árabe, português brasileiro, chinês mandarim, tcheco, holandês, inglês, francês, alemão, italiano, polonês, russo, espanhol, turco, japonês, coreano, húngaro e hindi.

Em termos de arquitetura, o XTTS-v2 é baseado em GPT, e não em difusão — uma diferença significativa em relação aos modelos mais recentes de flow matching no mesmo campo. Primeiro, um VQ-VAE converte o áudio real em códigos acústicos discretos, usados como alvos de treinamento. Em seguida, um modelo de linguagem no estilo GPT-2 prevê esses tokens de áudio condicionado pelo texto de entrada e por uma representação latente do locutor. Essa representação é calculada por um codificador baseado em Perceiver, que processa o espectrograma mel de referência e o transforma em um vetor compacto capaz de capturar a identidade do locutor. Por fim, um vocoder HiFi-GAN converte a sequência de tokens em uma forma de onda de áudio de 24kHz.

O que melhorou em relação ao XTTS original

As mudanças da versão 2 se concentram exatamente nas áreas que tornam a clonagem confiável na prática, em vez de apenas plausível em uma demonstração: melhor condicionamento do locutor, suporte a vários clipes de referência com interpolação entre locutores, melhorias gerais de prosódia e qualidade de áudio, além de uma estabilidade de inferência consideravelmente maior em comparação com a versão original. Ela também mantém a clonagem entre idiomas do modelo original — grave um clipe de referência em um idioma e gere fala natural em outro, preservando a identidade vocal do locutor — junto da transferência de emoção e estilo, que acontece automaticamente pelo codificador de referência em vez de depender de controles separados e ajustados manualmente.

Testes independentes relataram pontuações de similaridade do locutor (SECS) em torno de 0,59 em condições puramente zero-shot, chegando a aproximadamente 0,72 com cerca de dez minutos de dados adicionais para fine-tuning. É uma referência útil para decidir se apenas a clonagem zero-shot será boa o bastante para o seu projeto ou se vale a pena dar o passo adicional de ajustar o modelo para uma voz específica.

O fechamento da Coqui e o que isso realmente significa para você

Vale a pena entender esse ponto com clareza antes de criar qualquer coisa com o XTTS-v2. A Coqui AI, startup sediada em Berlim e fundada por ex-engenheiros do Mozilla DeepSpeech, fechou em janeiro de 2024 e descontinuou por completo seus produtos hospedados Coqui Studio e Coqui API. A empresa encerrou as atividades sem ser adquirida, e seu repositório original no GitHub deixou de receber desenvolvimento oficial da equipe fundadora.

Na prática, isso muda menos do que você poderia esperar. O código e os pesos do modelo continuam totalmente públicos e disponíveis para download, e um fork ativo da comunidade (idiap/coqui-ai-TTS) mantém o projeto compatível com as versões atuais do Python e do PyTorch, corrigindo problemas que os mantenedores originais não chegaram a resolver. Se você instalar o pacote TTS original e encontrar falhas em uma versão moderna do Python, instalar o pacote do fork comunitário no lugar resolve a maioria delas. A desvantagem prática é que não há mais um canal oficial de suporte, e o único aspecto que mudou de forma relevante foi o licenciamento: a Coqui vendia uma licença comercial para os pesos não comerciais do XTTS-v2 e, como a empresa não existe mais, essa opção de licença comercial paga desapareceu na prática.

Primeiros passos com o XTTS-v2

  1. Instale o pacote mantido pela comunidade se você usa uma versão recente do Python. pip install coqui-tts (o fork mantido ativamente) costuma ser mais confiável que o pacote original pip install TTS no Python 3.10–3.12 com versões recentes do PyTorch.
  2. Carregue o modelo pela mesma API em qualquer um dos casos. from TTS.api import TTS seguido de TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True) funciona da mesma forma, independentemente do pacote instalado.
  3. Fique atento à restrição de segurança do PyTorch 2.6. Versões mais recentes do PyTorch bloqueiam a classe personalizada XttsConfig do XTTS-v2 com a configuração padrão weights_only=True. Você precisará permiti-la explicitamente por meio de torch.serialization.add_safe_globals antes de carregar o modelo, ou a geração falhará na etapa de carregamento.
  4. Gere um clipe clonado. tts.tts_to_file(text="your text", speaker_wav="reference.wav", language="en", file_path="output.wav") cobre o fluxo básico de clonagem zero-shot em poucas linhas.
  5. Verifique a VRAM antes da implantação. A inferência básica precisa de aproximadamente 3GB de VRAM de GPU no mínimo; para uma geração estável e mais rápida que o tempo real em produção, 8GB ou mais evitam problemas de memória durante sínteses mais longas.
  6. Faça fine-tuning se a qualidade zero-shot não for suficiente. Os forks da comunidade mantêm os scripts de treinamento necessários para o fine-tuning, já que a equipe original da Coqui não oferece mais manutenção oficial. Espere um processo de configuração mais manual do que o de um produto comercial com suporte completo.

Dicas para obter resultados melhores

  • Use um clipe de referência limpo, bem gravado e com 6 segundos ou mais. A qualidade da clonagem é diretamente sensível às condições de gravação: ruído de fundo ou distorção no áudio de referência reduzem a fidelidade de forma visivelmente maior do que em algumas arquiteturas mais recentes.
  • Experimente vários clipes de referência para obter uma identidade mais estável. O suporte do XTTS-v2 a várias referências de locutor e à interpolação entre elas pode produzir uma voz mais consistente do que depender de um único clipe curto, especialmente para vozes difíceis de capturar claramente em uma só gravação.
  • Defina as expectativas de qualidade entre idiomas de acordo com a voz. A similaridade do locutor pode ser menor para vozes com pouca representação nos dados de treinamento do que para perfis de voz comuns. Teste sua voz de destino e o par de idiomas específico antes de se comprometer com um pipeline de produção.
  • Confirme o caminho de licenciamento comercial antes de lançar um produto pago. Como a licença comercial original da Coqui não está mais à venda, analise com atenção os termos atuais da Coqui Public Model License ou considere um modelo com licença mais permissiva, como Apache 2.0 ou MIT, se o objetivo for uma implantação comercial.
  • Prefira o fork da comunidade para qualquer uso além de experimentos casuais. Como o repositório original recebe menos manutenção, o fork corrigido ativamente é uma base mais confiável para qualquer projeto que precise durar.

XTTS-v2 versus outros modelos de clonagem zero-shot

XTTS-v2F5-TTSChatterbox Multilingual
ArquiteturaAutorregressiva no estilo GPT-2 + VQ-VAEDiffusion Transformer + flow matchingBaseada em difusão
Duração do clipe de referência~6 segundos~5–15 segundos~5–10 segundos
Idiomas17Voltado principalmente para inglês23
Vários clipes de referência / interpolaçãoSimNão é um recurso centralNão é um recurso central
Manutenção oficial ativaNão (apenas fork comunitário)SimSim
Licença dos pesosCoqui Public Model License (não comercial)CC-BY-NCMIT

A longevidade do XTTS-v2 vem do fato de ter sido uma resposta inicial e realmente sólida para a clonagem zero-shot multilíngue em uma época em que havia poucas alternativas abertas. Sua arquitetura e cobertura de idiomas resistiram bem o bastante para que ele continue sendo um ponto de comparação padrão, mesmo anos depois do desaparecimento da própria criadora.

Perguntas frequentes

A Coqui AI ainda desenvolve o XTTS-v2?

Não. A Coqui AI fechou como empresa em janeiro de 2024. O código e os pesos do modelo continuam públicos, e um fork da comunidade com manutenção ativa mantém o projeto funcionando com software atual, mas não há mais suporte ou desenvolvimento oficial da Coqui.

Ainda posso usar o XTTS-v2 comercialmente?

É preciso ter cuidado. O código da biblioteca TTS subjacente usa a Mozilla Public License 2.0, favorável ao uso comercial, mas os pesos do modelo XTTS-v2 são publicados sob a Coqui Public Model License, que é não comercial. A Coqui vendia uma licença comercial separada para os pesos, mas, como a empresa não existe mais, essa opção paga deixou de estar disponível. Consulte diretamente os termos atuais da licença antes de qualquer uso comercial.

De quanto áudio de referência o XTTS-v2 precisa para clonar uma voz?

Apenas 6 segundos, embora testes independentes mostrem que a similaridade do locutor melhora ainda mais com dados adicionais de fine-tuning, como cerca de dez minutos de áudio de uma voz específica.

Por que a instalação às vezes falha em versões mais recentes do Python ou do PyTorch?

O pacote TTS original pode apresentar problemas de compatibilidade em ambientes mais recentes; instalar o fork coqui-tts mantido pela comunidade resolve a maioria deles, e o PyTorch 2.6+ exige uma chamada explícita a torch.serialization.add_safe_globals para carregar a classe de configuração personalizada do XTTS-v2.

Como o XTTS-v2 se compara a modelos mais recentes, como F5-TTS ou CosyVoice3?

O XTTS-v2 ainda oferece cobertura multilíngue competitiva e qualidade de clonagem confiável, mas não conta com desenvolvimento oficial contínuo, e vários modelos mais recentes oferecem menor latência ou licenças mais permissivas. Ele continua sendo uma opção forte pela ampla compatibilidade com idiomas e pela estabilidade testada pela comunidade, não pela velocidade de ponta.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →