EchoraEchora
Voltar a Modelos

Chatterbox Multilingual: uma voz clonada, 23 idiomas e sem desvio de sotaque

26 de agosto de 2026
7 min de leitura

Transforme texto e gravações em obras que se ouvem

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Clone uma voz em inglês com a maioria dos sistemas TTS multilíngues, mude-a para espanhol e algo dá errado: o sotaque se desvia, o ritmo muda e o resultado começa a soar como uma pessoa totalmente diferente. O Chatterbox Multilingual foi criado exatamente para resolver essa falha: um único modelo de código aberto que clona uma voz uma vez e mantém sua identidade — timbre, sotaque e cadência — em 23 idiomas, sem novo treinamento ou troca de modelo para cada mercado.

O que é o Chatterbox Multilingual?

O Chatterbox Multilingual é o modelo multilíngue de uso geral para conversão de texto em fala da Resemble AI. Ele faz parte da mesma família Chatterbox de código aberto e com licença MIT que o modelo original em inglês e a variante Turbo de baixa latência. A versão atual, V3, mantém a mesma arquitetura de 500 milhões de parâmetros de sua antecessora e melhora especificamente três aspectos: a semelhança do falante nas trocas de idioma, a redução de alucinações (menos repetições indesejadas ou continuações fora do prompt) e uma interpretação mais natural e conversacional em todos os idiomas compatíveis.

Ele aceita 23 idiomas de forma nativa: árabe, chinês, dinamarquês, holandês, inglês, finlandês, francês, alemão, grego, hebraico, hindi, italiano, japonês, coreano, malaio, norueguês, polonês, português, russo, espanhol, suaíli, sueco e turco. Assim, uma mesma versão cobre tanto idiomas amplamente falados quanto outros menos atendidos, como suaíli e malaio.

O recurso que realmente importa: transferência de voz entre idiomas

A maior parte do marketing de TTS “multilíngue” significa que o fornecedor entrega um modelo diferente — ou um ajuste fino diferente — para cada idioma, e nunca há garantia de que a identidade da voz sobreviva à troca. O Chatterbox Multilingual funciona de outra forma: você fornece um clipe de referência em qualquer idioma e o modelo pode gerar fala em qualquer um dos outros 22, preservando as características vocais do falante original. Clone uma pessoa que fala inglês e faça com que ela fale francês. Use um clipe de referência em hindi e gere alemão. O idioma do áudio de referência não precisa corresponder ao idioma gerado — esse é justamente o objetivo de um único modelo entre idiomas, em vez de 23 modelos separados.

Para projetos que precisam de controle mais preciso sobre um mercado específico, a Resemble AI também oferece um Single Language Pack: ajustes finos dedicados a seis idiomas prioritários e variantes regionais (chinês mandarim, espanhol latino-americano, espanhol da Espanha, português brasileiro, português de Portugal e hindi), voltados a casos em que a precisão do dialeto ou a pronúncia regional são mais importantes que uma cobertura ampla.

Como começar a usar o Chatterbox Multilingual

  1. Instale o pacote. pip install chatterbox-tts inclui toda a família Chatterbox, inclusive a classe multilíngue; não há um pacote separado para procurar.
  2. Carregue explicitamente o modelo multilíngue. Importe ChatterboxMultilingualTTS de chatterbox.mtl_tts (em vez da classe padrão ChatterboxTTS, usada para geração somente em inglês) e carregue-o com t3_model="v3" para usar a versão atual.
  3. Forneça um clipe de referência e um ID de idioma. Passe uma amostra de áudio de 5–10 segundos (ou mais) como referência da voz, junto com um código de idioma de duas letras (fr, ja, ru e assim por diante) para o idioma de saída.
  4. Ajuste cfg_weight para a geração entre idiomas. Definir cfg_weight como 0.0 minimiza a transferência indesejada do sotaque do idioma original do clipe de referência; o valor padrão 0.5 é ajustado para geração no mesmo idioma, não para transferência entre idiomas.
  5. Teste no navegador antes de configurar o ambiente local. A Resemble AI hospeda um Space do Hugging Face para o modelo multilíngue, útil para validar a qualidade da voz e do idioma antes de conectá-lo a um pipeline.

Dicas para melhorar os resultados entre idiomas

  • Combine a etiqueta de idioma do clipe de referência quando possível. Se a transferência entre idiomas não for seu objetivo, usar um clipe de referência no mesmo idioma que você vai gerar produz resultados mais previsíveis do que depender de ajustes em cfg_weight para compensar a diferença.
  • Use um clipe limpo de 5–20 segundos. O ruído de fundo do áudio de referência se propaga para todos os idiomas gerados a partir dele. Por isso, vale preparar bem o clipe original uma única vez em vez de corrigir artefatos idioma por idioma mais tarde.
  • Escolha o Single Language Pack quando um mercado exigir precisão. Se um idioma específico for central para seu produto — e não apenas compatível —, um ajuste fino dedicado normalmente superará o modelo multilíngue de uso geral em precisão de dialeto e pronúncia regional.
  • Espere alguma variação no início. Testes da comunidade observaram artefatos ocasionais ou inconsistências na transferência de sotaque conforme o clipe de referência. Trate as primeiras gerações de cada idioma como uma etapa de calibração, não como resultado final.
  • Reserve uma quantidade modesta de VRAM. Testes reais relatam que a geração multilíngue funciona com tranquilidade na faixa de 4 GB de VRAM em uma GPU moderna, um hardware bastante acessível para um modelo de 23 idiomas.

Chatterbox Multilingual vs. o restante da família

Chatterbox MultilingualChatterbox (original)Chatterbox Turbo
Idiomas23Somente inglêsSomente inglês
Parâmetros500 milhõesAproximadamente 500 milhões350 milhões
Transferência de voz entre idiomasSim, recurso principalNão se aplicaNão se aplica
Mais indicado paraConteúdo global/localizado, agentes multilínguesNarração em inglês, expressividade criativaAgentes de voz em tempo real sensíveis à latência
Marca d'águaPerTh integradaPerTh integradaPerTh integrada
LicençaMITMITMIT

Se seu produto precisa falar mais de um idioma com uma única voz clonada, o Multilingual é o modelo criado especificamente para essa tarefa; as variantes original e Turbo aceitam somente inglês por definição.

Perguntas frequentes

Quantos idiomas o Chatterbox Multilingual realmente aceita?

O modelo V3 de uso geral aceita 23 idiomas, desde línguas amplamente faladas, como espanhol, chinês e árabe, até outras menos atendidas, como suaíli, malaio e dinamarquês.

Posso clonar uma voz em um idioma e gerar fala em outro?

Sim. Essa transferência de voz entre idiomas é o recurso principal do Chatterbox Multilingual. Forneça um clipe de referência em qualquer idioma compatível e gere o resultado em qualquer outro, preservando a identidade vocal do falante. Definir cfg_weight como 0.0 produz os resultados mais limpos entre idiomas.

Quanto áudio de referência a clonagem de voz exige?

Bastam 5–10 segundos, embora clipes mais longos (até cerca de 20 segundos) tendam a produzir resultados mais estáveis, principalmente na transferência entre idiomas.

Qual é a diferença entre o modelo multilíngue geral e o Single Language Pack?

O modelo geral (V3) cobre os 23 idiomas com um único conjunto de pesos. O Single Language Pack oferece ajustes finos dedicados a seis idiomas prioritários — chinês mandarim, três variantes regionais de espanhol/português e hindi — para usos que exigem mais precisão de dialeto do que o modelo geral oferece.

O Chatterbox Multilingual pode ser usado gratuitamente em projetos comerciais?

Sim. Como o restante da família Chatterbox, ele é publicado sob a licença MIT, e cada clipe gerado inclui a marca d'água PerTh integrada da Resemble AI para indicar sua procedência.

Experimente um recurso semelhante de clonagem de voz multilíngue

O Chatterbox Multilingual está disponível por meio da implementação de código aberto e da demonstração oficial da Resemble AI. Se quiser testar clonagem de voz multilíngue no navegador, use a Clonagem de voz como um recurso semelhante. Ela não é o Chatterbox Multilingual nem executa o modelo Chatterbox, mas permite experimentar um fluxo parecido sem configurar o modelo localmente.

Clone apenas vozes que pertençam a você ou para as quais tenha permissão explícita.

Explorar Clonagem de voz →