EchoraEchora
Voltar aos modelos

Parler-TTS: descreva a voz que você quer, em vez de gravá-la

4 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Todo modelo de clonagem pede primeiro a mesma coisa: um clipe de áudio de referência. Parler-TTS, desenvolvido pela Hugging Face, elimina totalmente esse requisito: em vez de uma amostra de voz, você escreve uma frase descrevendo a voz que deseja, e o modelo gera uma fala que corresponde a essa descrição. “Uma locutora com uma voz ligeiramente grave, falando rápido em uma gravação clara e próxima” é uma especificação de voz completa aqui, sem precisar de microfone.

O que é Parler-TTS?

Parler-TTS é um projeto open source de texto para fala da Hugging Face, criado como uma reprodução de pesquisas sobre orientação por linguagem natural para TTS de alta fidelidade, originalmente realizadas pela Stability AI e pela Universidade de Edimburgo. O que diferencia o projeto da maioria dos lançamentos open source nessa área é o quanto ele realmente é aberto: os conjuntos de dados, o pipeline de pré-processamento, o código de treinamento e os pesos do modelo são todos publicados sob uma licença permissiva, em vez de apenas o checkpoint final. É um lançamento significativamente mais transparente do que a maioria dos projetos TTS oferece, e é justamente isso que permite à comunidade retreinar, fazer fine-tuning ou reproduzir por completo os resultados do projeto, em vez de apenas executar inferência em uma caixa-preta.

Como o controle de voz por linguagem natural realmente funciona

Parler-TTS recebe duas entradas de texto separadas, em vez de uma: o texto que você quer que seja falado e uma descrição em linguagem natural de como ele deve soar. Essa descrição pode controlar gênero do locutor, tom, velocidade de fala e características da gravação, como ruído de fundo ou reverberação, tudo por meio de frases comuns, não de controles deslizantes numéricos nem de áudio de referência. Uma descrição como “um locutor faz um discurso monótono em ritmo acelerado em uma gravação com ruído” é interpretada e aplicada diretamente ao resultado gerado.

Fazer isso funcionar exigiu resolver um problema real de dados: conjuntos de dados de áudio não vêm acompanhados de descrições em linguagem natural. A Hugging Face criou um projeto complementar, DataSpeech, especificamente para preencher essa lacuna: ele marca amostras de fala com rótulos objetivos de características (nível de ruído, velocidade de fala, reverberação e atributos semelhantes) e depois envia esses rótulos a um grande modelo de linguagem para gerar descrições naturais a partir deles. Essa descrição gerada pelo LLM, pareada com o áudio correspondente, torna-se um dado de treinamento que ensina o Parler-TTS a associar linguagem descritiva a características acústicas reais.

O que você realmente pode controlar

Os modelos base permitem controlar por descrição o gênero, o tom, a velocidade de fala e o ambiente acústico (ruído de fundo, reverberação e clareza da gravação), atributos que são amplamente universais entre quaisquer locutores. A expressividade emocional é uma capacidade adicional baseada em fine-tuning: a Hugging Face lançou uma versão ajustada no conjunto de dados Expresso, um corpus de fala expressiva de alta qualidade com quatro locutores, especificamente para ensinar o modelo a seguir prompts de emoção e estilo de interpretação. Isso amplia o mesmo mecanismo de controle por linguagem natural para um território mais expressivo do que aquele coberto por padrão pelos modelos base.

A família de modelos

Parler-TTS foi lançado em alguns tamanhos e escalas de treinamento distintos, cada um representando um avanço em dados ou capacidade:

  • Parler-TTS Mini v0.1 — o primeiro lançamento, treinado com aproximadamente 10.500 horas de áudio, que estabeleceu a abordagem central de descrição em linguagem natural.
  • Parler-TTS Mini v1 / v1.1 — treinado com um conjunto de dados maior, de 45.000 horas, com o v1.1 melhorando especificamente o tokenizador de prompts (baseado no tokenizador do Llama 2, com vocabulário maior e tratamento de byte fallback) para simplificar futuros treinamentos multilíngues, embora o modelo subjacente e os dados de treinamento sejam, fora isso, idênticos aos do v1.
  • Parler-TTS Large v1 — um modelo com 2,2 bilhões de parâmetros, também treinado no conjunto de dados de 45.000 horas, que oferece o nível de qualidade mais alto da família com uma demanda computacional proporcionalmente maior.

Como começar com Parler-TTS

  1. Instale a biblioteca. pip install git+https://github.com/huggingface/parler-tts.git obtém o pacote de inferência diretamente do repositório de código-fonte.
  2. Carregue o modelo e o tokenizador escolhidos. Use ParlerTTSForConditionalGeneration.from_pretrained() com o checkpoint específico que você quer (Mini v0.1, Mini v1.1 ou Large v1), acompanhado do AutoTokenizer correspondente.
  3. Escreva dois prompts separados. Uma variável contém o texto que você quer que seja falado; uma segunda contém sua descrição em linguagem natural da voz e da forma de falar. Ambos são tokenizados separadamente antes de serem passados para a geração.
  4. Use dois tokenizadores se estiver no v1.1 ou posterior. Diferentemente das versões anteriores, Mini v1.1 e Large v1 usam tokenizadores separados para a descrição e para o texto falado, respectivamente. Verifique a versão da documentação que você está seguindo, pois misturar a abordagem de tokenizador único do v0.1 com um checkpoint mais recente causará problemas.
  5. Faça fine-tuning no seu próprio conjunto de dados anotado se precisar de uma capacidade específica. O pipeline DataSpeech foi projetado especificamente para ajudar você a gerar as descrições em linguagem natural necessárias para ajustar o Parler-TTS a um novo estilo de voz, idioma ou capacidade expressiva, seguindo a mesma abordagem usada para criar a versão ajustada com Expresso.

Dicas para obter melhores resultados

  • Seja específico, não vago, na descrição da voz. “Uma locutora com uma voz ligeiramente grave pronuncia as palavras em uma gravação muito clara, próxima e um pouco rápida” oferece ao modelo muito mais informação do que “uma voz normal”, e a especificidade em cada dimensão controlável (gênero, tom, velocidade e qualidade da gravação) tende a produzir resultados mais consistentes.
  • Evite descrever nacionalidade nos seus prompts. Trabalhos de fine-tuning da comunidade descobriram que incluir nacionalidade nos dados de treinamento ou nos prompts de inferência pode, na verdade, piorar a qualidade do resultado em vez de aumentar a precisão do sotaque. Omita essa informação e deixe que outros termos descritivos (sotaque, tom e ritmo) a transmitam.
  • Use especificamente o fine-tuning Expresso para prompts de emoção ou estilo de interpretação. Os modelos base são ajustados para atributos mais universais (gênero, tom, velocidade e ambiente); se seu projeto precisa de uma interpretação emocional específica, o checkpoint baseado em Expresso foi criado para isso, ao contrário do modelo base de uso geral.
  • Ajuste o tamanho do modelo às suas necessidades de qualidade. Mini v1.1 é a opção padrão mais prática para a maioria dos projetos; escolha especificamente os 2.2B parâmetros do Large v1 quando a qualidade máxima importar mais do que a velocidade de inferência e o uso de recursos.
  • Considere treinar seu próprio fine-tuning para idiomas além do inglês. Como os modelos base do Parler-TTS são voltados principalmente para o inglês, iniciativas da comunidade (um fine-tuning para francês é um exemplo documentado) mostraram que a abordagem de DataSpeech mais fine-tuning pode estender o projeto a outros idiomas, embora a qualidade e a quantidade dos conjuntos de dados abertos continuem sendo o principal gargalo prático.

Parler-TTS versus modelos de clonagem com áudio de referência

Parler-TTSXTTS-v2F5-TTS
Método de controle de vozDescrição em texto por linguagem naturalClipe de áudio de referência (~6 segundos)Clipe de áudio de referência (~5–15 segundos)
Não precisa de amostra de áudioSimNãoNão
Clona a voz de uma pessoa real específicaNão é o objetivo do projetoSim, esse é o propósito centralSim, esse é o propósito central
Abertura total do pipeline (dados + código + pesos)SimApenas código e pesosApenas código e pesos
Tamanhos dos modelosDe Mini (10.5K/45K h) a Large (2.2B parâmetros)Uma única versão atualUma única versão atual
LicençaApache 2.0Coqui Public Model License (não comercial)CC-BY-NC (não comercial)

O nicho específico do Parler-TTS é gerar sob demanda uma voz plausível e bem especificada sem precisar de uma gravação real para cloná-la. Isso é útil quando você quer controlar as características de uma voz, em vez de reproduzir a identidade de uma pessoa específica, e seu pipeline de treinamento totalmente aberto é uma verdadeira raridade entre projetos dessa escala.

Perguntas frequentes

Preciso de um clipe de áudio de referência para usar Parler-TTS?

Não. Diferentemente dos modelos de clonagem de voz, Parler-TTS gera fala com base em uma descrição em texto, por linguagem natural, da voz e do estilo de interpretação desejados, sem precisar de qualquer amostra de áudio.

Quais características da voz eu realmente posso controlar?

Os modelos base permitem controlar gênero, tom, velocidade de fala e fatores do ambiente acústico, como ruído de fundo e reverberação, todos especificados por descrições em linguagem natural. A expressividade emocional está disponível especificamente na versão ajustada com Expresso.

Parler-TTS é gratuito para uso comercial?

Sim. Ele é lançado sob a licença Apache 2.0, uma das opções mais permissivas entre modelos TTS open source, abrangendo igualmente o código, o pipeline de treinamento e os pesos.

Qual é a diferença entre Mini v1 e Mini v1.1?

Eles são treinados com dados idênticos e a mesma configuração; a única mudança do v1.1 é um tokenizador de prompts aprimorado com vocabulário maior e suporte a byte fallback, criado para simplificar futuros treinamentos multilíngues.

Parler-TTS consegue clonar a voz de uma pessoa real específica?

Não como parte central do seu projeto. Parler-TTS foi construído para gerar uma voz que corresponda a uma descrição em texto, em vez de reproduzir a identidade de um locutor de referência específico. Para clonar a voz de uma pessoa real, um modelo dedicado à clonagem é mais adequado.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →