XTTS-v2: O padrão de clonagem de voz que sobreviveu à própria empresa
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
Muitos modelos open source são comparados ao XTTS-v2 antes de serem comparados a qualquer outra coisa. É uma posição estranha para um modelo ocupar, considerando que a Coqui AI, empresa que o criou, encerrou completamente as atividades no início de 2024. Ainda assim, o XTTS-v2 é o modelo que consolidou essa reputação: um sistema multilíngue de clonagem de voz zero-shot bom o bastante para que o desaparecimento de sua própria criadora quase não afetasse sua relevância.
O que é o XTTS-v2?
O XTTS-v2 é um modelo open source multilíngue de texto para voz e clonagem de voz desenvolvido pela Coqui AI e lançado em 2023 como um aprimoramento da arquitetura XTTS original. Ele clona a voz de um locutor usando apenas 6 segundos de áudio de referência em 17 idiomas: árabe, português brasileiro, chinês mandarim, tcheco, holandês, inglês, francês, alemão, italiano, polonês, russo, espanhol, turco, japonês, coreano, húngaro e hindi.
Em termos de arquitetura, o XTTS-v2 é baseado em GPT, e não em difusão — uma diferença significativa em relação aos modelos mais recentes de flow matching no mesmo campo. Primeiro, um VQ-VAE converte o áudio real em códigos acústicos discretos, usados como alvos de treinamento. Em seguida, um modelo de linguagem no estilo GPT-2 prevê esses tokens de áudio condicionado pelo texto de entrada e por uma representação latente do locutor. Essa representação é calculada por um codificador baseado em Perceiver, que processa o espectrograma mel de referência e o transforma em um vetor compacto capaz de capturar a identidade do locutor. Por fim, um vocoder HiFi-GAN converte a sequência de tokens em uma forma de onda de áudio de 24kHz.
O que melhorou em relação ao XTTS original
As mudanças da versão 2 se concentram exatamente nas áreas que tornam a clonagem confiável na prática, em vez de apenas plausível em uma demonstração: melhor condicionamento do locutor, suporte a vários clipes de referência com interpolação entre locutores, melhorias gerais de prosódia e qualidade de áudio, além de uma estabilidade de inferência consideravelmente maior em comparação com a versão original. Ela também mantém a clonagem entre idiomas do modelo original — grave um clipe de referência em um idioma e gere fala natural em outro, preservando a identidade vocal do locutor — junto da transferência de emoção e estilo, que acontece automaticamente pelo codificador de referência em vez de depender de controles separados e ajustados manualmente.
Testes independentes relataram pontuações de similaridade do locutor (SECS) em torno de 0,59 em condições puramente zero-shot, chegando a aproximadamente 0,72 com cerca de dez minutos de dados adicionais para fine-tuning. É uma referência útil para decidir se apenas a clonagem zero-shot será boa o bastante para o seu projeto ou se vale a pena dar o passo adicional de ajustar o modelo para uma voz específica.
O fechamento da Coqui e o que isso realmente significa para você
Vale a pena entender esse ponto com clareza antes de criar qualquer coisa com o XTTS-v2. A Coqui AI, startup sediada em Berlim e fundada por ex-engenheiros do Mozilla DeepSpeech, fechou em janeiro de 2024 e descontinuou por completo seus produtos hospedados Coqui Studio e Coqui API. A empresa encerrou as atividades sem ser adquirida, e seu repositório original no GitHub deixou de receber desenvolvimento oficial da equipe fundadora.
Na prática, isso muda menos do que você poderia esperar. O código e os pesos do modelo continuam totalmente públicos e disponíveis para download, e um fork ativo da comunidade (idiap/coqui-ai-TTS) mantém o projeto compatível com as versões atuais do Python e do PyTorch, corrigindo problemas que os mantenedores originais não chegaram a resolver. Se você instalar o pacote TTS original e encontrar falhas em uma versão moderna do Python, instalar o pacote do fork comunitário no lugar resolve a maioria delas. A desvantagem prática é que não há mais um canal oficial de suporte, e o único aspecto que mudou de forma relevante foi o licenciamento: a Coqui vendia uma licença comercial para os pesos não comerciais do XTTS-v2 e, como a empresa não existe mais, essa opção de licença comercial paga desapareceu na prática.
Primeiros passos com o XTTS-v2
- Instale o pacote mantido pela comunidade se você usa uma versão recente do Python.
pip install coqui-tts(o fork mantido ativamente) costuma ser mais confiável que o pacote originalpip install TTSno Python 3.10–3.12 com versões recentes do PyTorch. - Carregue o modelo pela mesma API em qualquer um dos casos.
from TTS.api import TTSseguido deTTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)funciona da mesma forma, independentemente do pacote instalado. - Fique atento à restrição de segurança do PyTorch 2.6. Versões mais recentes do PyTorch bloqueiam a classe personalizada
XttsConfigdo XTTS-v2 com a configuração padrãoweights_only=True. Você precisará permiti-la explicitamente por meio detorch.serialization.add_safe_globalsantes de carregar o modelo, ou a geração falhará na etapa de carregamento. - Gere um clipe clonado.
tts.tts_to_file(text="your text", speaker_wav="reference.wav", language="en", file_path="output.wav")cobre o fluxo básico de clonagem zero-shot em poucas linhas. - Verifique a VRAM antes da implantação. A inferência básica precisa de aproximadamente 3GB de VRAM de GPU no mínimo; para uma geração estável e mais rápida que o tempo real em produção, 8GB ou mais evitam problemas de memória durante sínteses mais longas.
- Faça fine-tuning se a qualidade zero-shot não for suficiente. Os forks da comunidade mantêm os scripts de treinamento necessários para o fine-tuning, já que a equipe original da Coqui não oferece mais manutenção oficial. Espere um processo de configuração mais manual do que o de um produto comercial com suporte completo.
Dicas para obter resultados melhores
- Use um clipe de referência limpo, bem gravado e com 6 segundos ou mais. A qualidade da clonagem é diretamente sensível às condições de gravação: ruído de fundo ou distorção no áudio de referência reduzem a fidelidade de forma visivelmente maior do que em algumas arquiteturas mais recentes.
- Experimente vários clipes de referência para obter uma identidade mais estável. O suporte do XTTS-v2 a várias referências de locutor e à interpolação entre elas pode produzir uma voz mais consistente do que depender de um único clipe curto, especialmente para vozes difíceis de capturar claramente em uma só gravação.
- Defina as expectativas de qualidade entre idiomas de acordo com a voz. A similaridade do locutor pode ser menor para vozes com pouca representação nos dados de treinamento do que para perfis de voz comuns. Teste sua voz de destino e o par de idiomas específico antes de se comprometer com um pipeline de produção.
- Confirme o caminho de licenciamento comercial antes de lançar um produto pago. Como a licença comercial original da Coqui não está mais à venda, analise com atenção os termos atuais da Coqui Public Model License ou considere um modelo com licença mais permissiva, como Apache 2.0 ou MIT, se o objetivo for uma implantação comercial.
- Prefira o fork da comunidade para qualquer uso além de experimentos casuais. Como o repositório original recebe menos manutenção, o fork corrigido ativamente é uma base mais confiável para qualquer projeto que precise durar.
XTTS-v2 versus outros modelos de clonagem zero-shot
| XTTS-v2 | F5-TTS | Chatterbox Multilingual | |
|---|---|---|---|
| Arquitetura | Autorregressiva no estilo GPT-2 + VQ-VAE | Diffusion Transformer + flow matching | Baseada em difusão |
| Duração do clipe de referência | ~6 segundos | ~5–15 segundos | ~5–10 segundos |
| Idiomas | 17 | Voltado principalmente para inglês | 23 |
| Vários clipes de referência / interpolação | Sim | Não é um recurso central | Não é um recurso central |
| Manutenção oficial ativa | Não (apenas fork comunitário) | Sim | Sim |
| Licença dos pesos | Coqui Public Model License (não comercial) | CC-BY-NC | MIT |
A longevidade do XTTS-v2 vem do fato de ter sido uma resposta inicial e realmente sólida para a clonagem zero-shot multilíngue em uma época em que havia poucas alternativas abertas. Sua arquitetura e cobertura de idiomas resistiram bem o bastante para que ele continue sendo um ponto de comparação padrão, mesmo anos depois do desaparecimento da própria criadora.
Perguntas frequentes
A Coqui AI ainda desenvolve o XTTS-v2?
Não. A Coqui AI fechou como empresa em janeiro de 2024. O código e os pesos do modelo continuam públicos, e um fork da comunidade com manutenção ativa mantém o projeto funcionando com software atual, mas não há mais suporte ou desenvolvimento oficial da Coqui.
Ainda posso usar o XTTS-v2 comercialmente?
É preciso ter cuidado. O código da biblioteca TTS subjacente usa a Mozilla Public License 2.0, favorável ao uso comercial, mas os pesos do modelo XTTS-v2 são publicados sob a Coqui Public Model License, que é não comercial. A Coqui vendia uma licença comercial separada para os pesos, mas, como a empresa não existe mais, essa opção paga deixou de estar disponível. Consulte diretamente os termos atuais da licença antes de qualquer uso comercial.
De quanto áudio de referência o XTTS-v2 precisa para clonar uma voz?
Apenas 6 segundos, embora testes independentes mostrem que a similaridade do locutor melhora ainda mais com dados adicionais de fine-tuning, como cerca de dez minutos de áudio de uma voz específica.
Por que a instalação às vezes falha em versões mais recentes do Python ou do PyTorch?
O pacote TTS original pode apresentar problemas de compatibilidade em ambientes mais recentes; instalar o fork coqui-tts mantido pela comunidade resolve a maioria deles, e o PyTorch 2.6+ exige uma chamada explícita a torch.serialization.add_safe_globals para carregar a classe de configuração personalizada do XTTS-v2.
Como o XTTS-v2 se compara a modelos mais recentes, como F5-TTS ou CosyVoice3?
O XTTS-v2 ainda oferece cobertura multilíngue competitiva e qualidade de clonagem confiável, mas não conta com desenvolvimento oficial contínuo, e vários modelos mais recentes oferecem menor latência ou licenças mais permissivas. Ele continua sendo uma opção forte pela ampla compatibilidade com idiomas e pela estabilidade testada pela comunidade, não pela velocidade de ponta.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.