EchoraEchora
Voltar aos modelos

ChatTTS: feito para conversar, não para ler em voz alta

4 de setembro de 2026
•
7 min de leitura

A maioria dos modelos TTS é otimizada para ler um trecho de texto de forma clara e agradável — exatamente o objetivo errado para um chatbot ou assistente de voz que deveria soar como se estivesse realmente conversando com você. Uma conversa real é cheia de pequenas pausas, uma risada ocasional e um “hum” que não está no roteiro. O ChatTTS, desenvolvido pela equipe da 2noise, foi criado especificamente em torno dessa diferença — otimizado não para narração, mas para a textura mais irregular e natural de um diálogo de verdade.

O que é o ChatTTS?

O ChatTTS é um modelo generativo de fala com 300 milhões de parâmetros, criado especificamente para cenários de conversa — diálogos de assistentes LLM, vozes de chatbots e aplicações de voz interativas — e não para narração geral ou leitura no estilo de audiolivros. Ele é compatível com chinês e inglês, e o modelo completo foi treinado com mais de 100.000 horas de dados conversacionais bilíngues, com o objetivo específico de capturar como as pessoas realmente soam quando conversam, e não apenas como o texto soa quando é lido.

Controle prosódico detalhado: risadas, pausas e interjeições

Essa é a capacidade que define o ChatTTS, e ela faz parte do processo central de geração do modelo em vez de ser acrescentada como efeito de pós-processamento. O modelo consegue prever e controlar diretamente características prosódicas detalhadas — risadas, pausas naturais e interjeições conversacionais — como parte da própria geração da fala, sem exigir que você insira manualmente tags de efeitos sonoros como ocorre em alguns outros modelos expressivos. Segundo as comparações do próprio projeto, o resultado é uma prosódia superior à da maioria das alternativas TTS de código aberto especificamente no quanto a saída parece natural e conversacional, e não na clareza com que lê o texto.

Geração com vários falantes por amostragem gaussiana

O ChatTTS é compatível com vários falantes para conversas realmente interativas entre múltiplos participantes — algo útil em cenários como diálogos simulados ou interações de assistentes com vários personagens. Vale entender a forma como ele varia os falantes: em vez de exigir um clipe de áudio de referência para cada voz, os falantes podem ser amostrados diretamente de uma distribuição gaussiana dentro do próprio processo de inferência do modelo. Isso oferece uma maneira simples de gerar diversas vozes diferentes sem precisar de uma biblioteca de clipes de referência pré-gravados para cada uma.

Uma observação sincera sobre o que está realmente disponível

Antes de desenvolver algo com base no ChatTTS, vale conhecer dois detalhes, pois eles determinam o que você pode esperar realisticamente de uma instalação auto-hospedada.

O checkpoint de código aberto não é o modelo completo. A versão interna do ChatTTS com melhor desempenho foi treinada com o conjunto completo de mais de 100.000 horas de dados e depois passou por ajuste fino supervisionado (SFT). A versão publicada no Hugging Face é um checkpoint pré-treinado com 40.000 horas e sem essa etapa de SFT — um modelo-base realmente capaz, mas não a mesma versão por trás das comparações de demonstração mais refinadas do projeto.

O código e os pesos têm licenças diferentes. O código do ChatTTS é publicado sob AGPLv3+, enquanto os pesos do modelo são lançados sob a licença CC BY-NC 4.0 — o que restringe os pesos pré-treinados ao uso não comercial. Se a implantação comercial fizer parte do seu plano, vale analisar isso com cuidado antes de desenvolver um produto em torno do checkpoint público.

Primeiros passos com o ChatTTS

  1. Clone o repositório. git clone https://github.com/2noise/ChatTTS.git fornece o código e as instruções de configuração; a instalação por pip install chattts-fork também está documentada, embora baixe quase um gigabyte de conteúdo na primeira instalação.
  2. Carregue o modelo e execute uma geração básica. Algumas linhas de Python — import ChatTTS, chat = ChatTTS.Chat(), chat.load_models() — levam você ao primeiro clipe gerado; definir compile=True durante o carregamento do modelo melhora o desempenho da inferência em troca de uma carga inicial mais demorada.
  3. Observe atentamente as regras de pontuação. A entrada de texto do ChatTTS espera especificamente vírgulas e pontos em inglês como pontuação — outros sinais são tratados como entrada inválida. Essa é uma causa comum de falhas inesperadas de geração para novos usuários que estão migrando textos com convenções de pontuação diferentes.
  4. Faça a amostragem dos falantes a partir da distribuição gaussiana para obter variedade. Em vez de buscar clipes de referência para cada voz desejada, use a amostragem de falantes integrada ao modelo para gerar diretamente uma variedade de vozes diferentes.
  5. Teste em hardware modesto antes de presumir que precisa de uma GPU potente. Um benchmark da comunidade em um mini-PC LattePanda Sigma relatou a geração de um clipe de 22 segundos em cerca de 39 segundos — uma proporção de processamento aproximada de 1:2, descrita como comparável ao desempenho de uma máquina equipada com uma RTX 4090. Isso sugere que o modelo é mais tolerante a hardware limitado do que sua quantidade de parâmetros poderia indicar.
  6. Verifique os termos atuais da licença antes do uso comercial. Dada a divisão entre AGPLv3+ e CC BY-NC 4.0, confirme se o seu caso de uso específico está coberto, principalmente se os pesos pré-treinados fizerem parte de um produto pago.

Dicas para obter resultados melhores

  • Escreva o texto especificamente para conversa, não para narração. O ChatTTS é ajustado para conteúdo em formato de diálogo — inserir uma prosa rígida e com estrutura formal não demonstra aquilo para o qual ele foi realmente criado. Frases conversacionais com pausas naturais aproveitam melhor sua modelagem de prosódia.
  • Limpe a pontuação antes da geração. Considerando os requisitos rigorosos do modelo para vírgulas e pontos em inglês, passar o texto de entrada por uma limpeza rápida para remover sinais não compatíveis evita um ponto de falha comum e fácil de prevenir.
  • Use a amostragem gaussiana de falantes para prototipar rapidamente várias vozes. É uma maneira mais rápida de testar cenários de diálogo com vários falantes do que buscar e preparar antecipadamente clipes de referência para cada personagem.
  • Ajuste as expectativas à capacidade do checkpoint público. Como o modelo publicado é a versão anterior ao SFT com 40.000 horas, e não o modelo completo ajustado com mais de 100.000 horas, calibre sua expectativa de qualidade de acordo, em vez de presumir que está recebendo exatamente o modelo apresentado nos melhores clipes de demonstração do projeto.
  • Reserve um tempo de geração realista em hardware limitado. O benchmark do LattePanda Sigma é um dado útil se você estiver considerando uma implantação em edge ou mini-PC — planeje um processamento de aproximadamente 2 vezes o tempo real em vez de presumir geração instantânea em hardware que não seja da categoria de GPU.

ChatTTS em comparação com outros modelos expressivos e bilíngues

ChatTTSBarkCosyVoice3
Principal objetivo de projetoDiálogo conversacional, chatbots/assistentesTexto para áudio generativo (fala, música, efeitos)Clonagem multilíngue com dialetos
IdiomasChinês, inglês13+9 + 18 dialetos chineses
Sons não verbaisPrevistos de forma nativa (risadas, pausas, interjeições)Tags entre colchetes ([laughter], [sighs])Não é um recurso dedicado
Vários falantesSim, por amostragem gaussianaVozes predefinidasClonagem zero-shot
Parâmetros300MNão divulgados oficialmente nessa escala0.5B
Licença dos pesosCC BY-NC 4.0 (não comercial)MITAbertos, API hospedada disponível

O nicho específico do ChatTTS é um projeto que prioriza o diálogo em exatamente dois idiomas — em vez de buscar ampla cobertura multilíngue ou o máximo alcance expressivo, ele se concentra em fazer a fala conversacional em chinês e inglês soar como uma conversa real. Para quem desenvolve a voz de um assistente ou chatbot, esse é um ponto de comparação mais relevante do que a simples quantidade de idiomas.

Perguntas frequentes

O que diferencia o ChatTTS de um modelo TTS de uso geral?

Ele é otimizado especificamente para fala conversacional e em formato de diálogo, e não para narração — prevendo diretamente pausas naturais, risadas e interjeições como parte da geração. Esse ajuste atende a casos de uso de chatbots e assistentes, em vez de apenas ler um texto em voz alta com clareza.

O modelo ChatTTS disponível publicamente é a versão completa?

Não exatamente. O modelo interno completo foi treinado com mais de 100.000 horas de dados e recebeu ajuste fino supervisionado. O checkpoint publicado no Hugging Face é uma versão pré-treinada com 40.000 horas sem essa etapa de ajuste fino.

O ChatTTS é gratuito para uso comercial?

O código está sob AGPLv3+, mas os pesos do modelo são publicados sob uma licença CC BY-NC 4.0 que restringe o uso comercial — analise atentamente os termos atuais antes de qualquer implantação comercial.

Por que o ChatTTS rejeita alguns sinais de pontuação no texto de entrada?

O processamento de texto do modelo espera especificamente vírgulas e pontos em inglês; outros sinais de pontuação são tratados como entrada inválida. Portanto, limpar o texto antecipadamente evita falhas comuns de geração.

O ChatTTS é compatível com clonagem de voz?

Não da mesma forma que modelos dedicados à clonagem. Ele permite a geração com vários falantes por meio da amostragem gaussiana de características dos falantes, em vez de reproduzir uma voz de referência específica a partir de um clipe de áudio.

Transforme um roteiro com vários locutores em áudio

Se você já tem um roteiro pronto com vários locutores, use o Texto para diálogo da Echora. Adicione até 12 blocos de diálogo e 5.000 caracteres no total, atribua uma voz a cada bloco, inclua tags de interpretação compatíveis e ajuste a estabilidade ou o reforço do locutor. Depois, você pode ouvir e baixar a conversa completa.

Criar áudio de diálogo →