EchoraEchora
Voltar aos modelos

YourTTS: duas tarefas diferentes, um só modelo

8 de setembro de 2026
•
7 min de leitura

Gerar uma nova fala com uma voz nunca vista e converter uma gravação existente para a voz de outro falante parecem problemas relacionados, mas a maioria dos sistemas TTS é criada para fazer apenas uma dessas coisas. O YourTTS, desenvolvido por pesquisadores da Coqui, foi criado para fazer as duas com o mesmo modelo subjacente — síntese de voz multivoz zero-shot e conversão de voz zero-shot — e, com isso, tornou-se a primeira abordagem publicada a levar um método verdadeiramente multilíngue ao TTS multivoz zero-shot.

O que é o YourTTS?

O YourTTS é um modelo de pesquisa desenvolvido por Edresson Casanova e colegas da Coqui, construído sobre a arquitetura VITS — um modelo de ponta a ponta que combina um autoencoder variacional, treinamento adversarial e fluxos normalizantes para passar diretamente do texto a uma forma de onda, sem etapas acústicas e de vocoder separadas. O YourTTS adiciona várias modificações específicas a essa base VITS, ajustadas especialmente para geração zero-shot, multilíngue e multivoz.

Baseado em VITS, com modificações de verdade

Duas escolhas de projeto se destacam como desvios reais dos trabalhos anteriores, não como ajustes incrementais. Primeiro, o YourTTS usa texto bruto como entrada em vez de fonemas. Sistemas anteriores normalmente dependiam da fonemização, que funciona bem em idiomas com ferramentas maduras e de alta qualidade para converter grafemas em fonemas, mas apresenta resultados desiguais nos idiomas que não dispõem delas. Trabalhar diretamente com texto bruto evita essa dependência, algo importante especificamente para estender a abordagem a idiomas com poucos recursos. Segundo, um codificador de falante dedicado extrai de cada enunciado de treinamento um embedding de falante para condicionar o modelo. Ele é treinado junto com uma Speaker Consistency Loss, que compara, por distância de cosseno, os embeddings extraídos do áudio gerado com o embedding do falante original — otimizando diretamente o modelo para que ele realmente soe como o falante-alvo, e não apenas produza fala inteligível.

Duas capacidades distintas

O TTS multivoz zero-shot gera uma nova fala com uma voz na qual o modelo nunca foi treinado, usando apenas um embedding de referência calculado a partir de uma amostra curta. A conversão de voz zero-shot é uma tarefa relacionada, mas genuinamente diferente: dada uma gravação de áudio existente, ela a transforma na voz de um falante-alvo enquanto preserva o conteúdo original — o que já foi dito é convertido, em vez de se gerar um novo texto. O YourTTS alcançou resultados de ponta na primeira tarefa e resultados comparáveis ao estado da arte na segunda, ambos medidos no benchmark VCTK. É isso que o torna um sistema verdadeiramente de dupla finalidade, e não um modelo TTS com um recurso de conversão de voz acrescentado.

Uma contribuição real para idiomas com poucos recursos

O YourTTS demonstrou algo especialmente útil para além de seus números de destaque nos benchmarks: resultados zero-shot promissores em um idioma-alvo usando, durante o treinamento, dados de um único falante desse idioma. A configuração de treinamento publicada reflete isso diretamente — foram usados mais de 1.000 falantes de inglês, mas apenas 5 de francês e um único falante de português, enquanto um balanceador de lotes por idioma reservava de propósito uma parcela maior dos lotes de treinamento aos idiomas sub-representados para compensar. O fato de um sistema multilíngue e multivoz utilizável poder surgir de um conjunto de dados tão desequilibrado é a evidência específica oferecida pelo modelo de que essa abordagem poderia levar o TTS zero-shot e a conversão de voz a idiomas que não possuem conjuntos de dados tão vastos e variados em falantes quanto o inglês.

Ajuste fino para vozes difíceis

Para falantes cuja voz ou cujas características de gravação diferem significativamente de tudo o que existe nos dados de treinamento, o YourTTS permite ajuste fino com menos de um minuto de fala adicional. Segundo os resultados publicados, isso alcança uma similaridade de voz no estado da arte até nesses casos mais difíceis. Na prática, isso importa para materiais de origem com sotaque incomum, gravados em condições atípicas ou que, de outra forma, não estejam bem representados pela capacidade zero-shot do modelo-base.

Primeiros passos com o YourTTS

O caminho mais direto é a interface de linha de comando da biblioteca Coqui TTS, especificando o modelo YourTTS, um arquivo de referência do falante-alvo, um arquivo de referência de conteúdo opcional para conversão de voz e um código de idioma — a biblioteca cuida do carregamento do modelo e da inferência a partir daí. Como os links do repositório de pesquisa original estão quebrados, obter o modelo por meio do Coqui TTS — ou de seus forks comunitários mantidos ativamente — em vez da página do artigo original no GitHub é hoje o caminho mais confiável para conseguir um checkpoint funcional.

Dicas para obter resultados melhores

  • Tenha clareza sobre qual tarefa você está realmente fazendo. O TTS zero-shot (texto novo, voz nova) e a conversão de voz (áudio existente, voz nova) usam o YourTTS de maneiras diferentes. Decida de qual deles seu projeto precisa antes de configurar o pipeline, pois confundir os fluxos de trabalho é uma fonte comum de problemas.
  • Faça ajuste fino quando a voz-alvo for incomum. Se o falante de origem tiver sotaque ou características de gravação peculiares e pouco representados em dados de treinamento típicos, reserve tempo para a etapa documentada de ajuste fino com menos de um minuto em vez de esperar que apenas o zero-shot resolva tudo.
  • Use o fork do Coqui TTS mantido pela comunidade, não o repositório original. Com os links quebrados na página original de Edresson no GitHub após o encerramento da Coqui em 2024, o fork da biblioteca mantido ativamente é uma fonte mais confiável para obter um modelo funcional.
  • Respeite o consentimento ao clonar ou converter a voz de uma pessoa real. Como pesquisas documentadas mostram que o recurso de clonagem do YourTTS pode ser usado para enganar a autenticação por voz, trate qualquer implementação real que envolva a voz de uma pessoa específica como dependente da permissão explícita dela.

YourTTS versus modelos relacionados da Coqui e de transferência de voz

YourTTSXTTS-v2VoiceCraft
TTS multivoz zero-shotSim, estado da arte no lançamentoSimSim
Conversão de voz zero-shotSim, comparável ao estado da arte no lançamentoNão é o foco principalNão (o foco é a edição)
Arquitetura-baseVITS + codificador de falante + Speaker Consistency LossAutorregressiva no estilo GPT-2 + VQ-VAEAutorregressiva com mascaramento causal + empilhamento atrasado
Abordagem multilíngueA primeira desse tipo neste campo de pesquisa17 idiomasFoco no inglês
Entrada de textoTexto bruto (sem dependência de fonemizador)Processamento de texto padrãoProcessamento de texto padrão
Manutenção atualPor meio dos forks comunitários do Coqui TTSPor meio dos forks comunitários do Coqui TTSMantido ativamente pelos autores originais

O lugar específico do YourTTS nessa linhagem é o de uma pesquisa anterior da Coqui que estabeleceu o TTS multivoz zero-shot e multilíngue como uma abordagem viável — um trabalho que os modelos XTTS posteriores desenvolveram ainda mais, enquanto o próprio YourTTS continua distinto por tratar a conversão de voz como uma capacidade de primeira classe, e não como algo acrescentado depois.

Perguntas frequentes

Qual é a diferença entre o modo TTS e o modo de conversão de voz do YourTTS?

O modo TTS gera uma nova fala a partir de texto com uma voz-alvo; a conversão de voz recebe uma gravação de áudio existente e a transforma na voz de um falante-alvo enquanto preserva o conteúdo falado original — duas tarefas relacionadas, mas distintas, tratadas pelo mesmo modelo.

O YourTTS ainda está disponível para uso?

Sim, principalmente por meio da biblioteca Coqui TTS e de seus forks comunitários mantidos ativamente. Os links para baixar o modelo no repositório de pesquisa original estão quebrados após o encerramento da Coqui AI em 2024 e a exclusão do servidor de hospedagem original.

De quantos dados o YourTTS precisa para clonar uma voz?

A clonagem zero-shot funciona com uma amostra de referência curta e não requer ajuste fino. Para vozes que diferem significativamente dos dados de treinamento, está documentado que o ajuste fino com menos de um minuto de fala adicional proporciona similaridade visivelmente melhor.

Quem desenvolveu o YourTTS?

O YourTTS foi desenvolvido por Edresson Casanova e colaboradores da Coqui e publicado na ICML 2022.

O YourTTS é gratuito?

Ele está disponível por meio da biblioteca Coqui TTS de código aberto. Consulte os termos de licença atuais do pacote ou fork específico que você usar, pois os detalhes de licenciamento podem variar entre os forks mantidos pela comunidade que surgiram após o encerramento da Coqui AI.

Dê uma nova voz a uma gravação

Para mudar a voz de uma gravação sem perder o conteúdo falado nem a interpretação, use o Modificador de voz da Echora. Envie uma gravação, escolha uma voz integrada de destino ou uma amostra de referência autorizada e gere o áudio transformado no navegador.

Transformar uma gravação →