EchoraEchora
Voltar aos modelos

MeloTTS: o modelo que não tropeça quando uma frase muda de idioma

3 de setembro de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Fale uma frase em chinês fluente com o nome de uma marca em inglês no meio e a maioria dos modelos TTS pronunciará mal a palavra inglesa ou forçará uma pausa estranha ao redor dela. Desenvolvido em conjunto pelo MIT e pela MyShell.ai, o MeloTTS foi criado especificamente para lidar com essa situação: seu modelo de voz chinesa lê textos que misturam chinês e inglês com naturalidade e muda a pronúncia no meio da frase como faria uma pessoa realmente bilíngue, sem tratar isso como um caso extremo que precisa ser contornado.

O que é o MeloTTS?

O MeloTTS é uma biblioteca multilíngue de texto para fala, open source e sob licença MIT, construída sobre as arquiteturas VITS e VITS2. Ela acrescenta recursos linguísticos baseados em BERT para capturar prosódia e fraseado com mais naturalidade. Abrange inglês, espanhol, francês, chinês, japonês e coreano e, algo especialmente notável para um projeto desse porte, traz cinco variantes distintas de sotaque em inglês: americano, britânico, indiano, australiano e um padrão geral. Todas fazem parte do mesmo projeto de base, sem exigir modelos separados para cada sotaque.

Vale a pena entender a extração de recursos linguísticos baseada em BERT como mais do que uma nota técnica: em vez de depender apenas de um fonemizador baseado em regras para converter texto em unidades de pronúncia, o MeloTTS obtém compreensão linguística contextual de um modelo no estilo BERT. Isso explica, em parte, por que sua prosódia e seu fraseado tendem a soar mais naturais do que os de sistemas TTS que usam apenas uma conversão mais simples de grafemas em fonemas.

Alternância nativa entre chinês e inglês

Essa é a capacidade mais marcante do MeloTTS e resolve um problema realmente comum e realmente incômodo. Conteúdo bilíngue ou com idiomas misturados — uma frase em chinês que menciona o nome de um produto, um termo técnico ou uma citação em inglês — costuma confundir a maioria dos sistemas TTS. Em geral, eles esperam uma entrada consistente em um único idioma e pronunciam errado o trecho estrangeiro ou exigem que você o divida em gerações separadas. O modelo de falante chinês do MeloTTS processa diretamente textos mistos em chinês e inglês, alternando a pronúncia de forma natural dentro de uma única frase e de uma única geração, sem exigir marcação manual de idioma nem divisão do texto.

Desempenho em tempo real em CPU

Assim como alguns outros modelos leves que vale a pena conhecer se você já comparou opções nesse segmento, o MeloTTS foi projetado para rodar confortavelmente apenas em CPU. A própria documentação do projeto afirma de forma explícita que uma CPU basta para inferência em tempo real, enquanto o suporte a GPU (cuda, cuda:0 ou mps em Apple Silicon) está disponível como acelerador opcional, e não como requisito. Isso faz dele uma alternativa real para equipes que querem cobertura multilíngue sem provisionar infraestrutura de GPU. Ainda assim, vale observar que o MeloTTS prioriza uma cobertura mais ampla de idiomas e sotaques em vez do tamanho absolutamente mínimo de algo como o Piper, que troca a amplitude multilíngue por uma leveza extrema em hardware de borda com recursos limitados.

Primeiros passos com o MeloTTS

  1. Clone o repositório e instale as dependências. Faça git clone do projeto myshell-ai/MeloTTS no GitHub e siga as etapas de instalação documentadas antes de executar qualquer código de inferência.
  2. Use a API simples em Python para a geração básica. Execute from melo.api import TTS e depois crie uma instância com um código de idioma (EN, ES, FR, ZH, JP, KR ou a variante mais recente EN_NEWEST) e uma configuração de dispositivo (cpu, cuda, cuda:0, mps ou auto para permitir a escolha automática).
  3. Selecione o sotaque específico do inglês, se for relevante. Como o MeloTTS oferece variantes distintas de inglês americano, britânico, indiano e australiano, escolha aquela que corresponde ao seu público-alvo em vez de usar o modelo geral de inglês por padrão.
  4. Ajuste o parâmetro de velocidade ao seu conteúdo. A velocidade de geração pode ser ajustada diretamente na chamada da API, o que ajuda a sincronizar o ritmo da narração com o tempo do vídeo ou com sua preferência pessoal, sem precisar de uma etapa separada de pós-processamento.
  5. Use a WebUI ou a CLI contribuídas pela comunidade para testar mais rápido. Ambas foram adicionadas por uma pessoa da comunidade sobre a biblioteca principal e permitem testar vozes e idiomas sem escrever um script em Python para cada experimento.
  6. Procure variantes regionais e ampliadas pela comunidade se seu idioma não tiver suporte nativo. Forks da comunidade — uma variante dedicada ao vietnamita é um exemplo — estenderam a abordagem do MeloTTS a idiomas com características fonológicas, como os seis tons do vietnamita, para as quais o fonemizador original não foi criado.

Dicas para obter resultados melhores

  • Aproveite de propósito a capacidade de misturar idiomas. Se o conteúdo contém naturalmente expressões bilíngues — nomes de produtos, termos técnicos ou citações estrangeiras —, inseri-lo como uma única frase com idiomas misturados, em vez de dividi-lo em chamadas separadas por idioma, é exatamente o fluxo para o qual o modelo chinês do MeloTTS foi criado.
  • Escolha desde o início o sotaque inglês certo para seu público. Usar inglês britânico em um projeto voltado ao Reino Unido ou inglês indiano para esse mercado oferece uma adequação perceptivelmente melhor do que escolher o modelo geral com tendência americana e esperar que ele soe neutro.
  • Teste a inferência em CPU no hardware de destino antes de presumir que precisa de GPU. Como o projeto foi explicitamente projetado para operar em tempo real em CPU, vale confirmar o desempenho na máquina de implantação prevista antes de provisionar recursos de GPU que talvez não sejam necessários.
  • Confira primeiro os forks da comunidade se precisar de um idioma além dos seis principais. Em vez de forçar um idioma não compatível pelo fonemizador padrão do MeloTTS, procure uma extensão existente da comunidade. Há várias justamente porque o fluxo padrão de processamento de texto não lida corretamente, de fábrica, com a fonologia de todos os idiomas.
  • Use a variante mais recente EN_NEWEST para conteúdo em inglês se a qualidade for prioridade. As versões iterativas específicas para inglês (v2, v3) sugerem refinamento contínuo desse idioma; vale testá-las em comparação com o modelo EN original em vez de supor que sejam intercambiáveis.

MeloTTS em comparação com outros modelos multilíngues adequados para CPU

MeloTTSPiperKokoro-82M
Organização responsávelMIT + MyShell.aiRhasspy / Open Home FoundationIndependente (hexgrad)
Idiomas principais6 (mais 5 variantes de sotaque em inglês)35+8
ArquiteturaVITS/VITS2 + recursos linguísticos BERTVITS + ONNX + espeak-ngStyleTTS 2 + ISTFTNet
Mistura de idiomas (alternância de código)Sim, nativa no modelo chinêsNão é um recurso específicoNão é um recurso específico
Tempo real em CPUSimSim, inclusive Raspberry PiSim
Clonagem de vozNão, catálogo fixo de vozesNão, catálogo fixo de vozesNão, catálogo fixo de vozes
LicençaMITMIT (original) / GPL-3.0 (fork atual)Apache 2.0

O nicho específico do MeloTTS entre as opções de TTS adequadas para CPU e sem clonagem é a profundidade em vez da amplitude em uma direção particular: menos idiomas no total do que o Piper, mas uma sofisticação linguística genuína — prosódia baseada em BERT e alternância nativa de código — nos idiomas compatíveis, especialmente para conteúdo bilíngue em chinês e inglês.

Perguntas frequentes

Quem desenvolveu o MeloTTS?

O MeloTTS foi desenvolvido em conjunto pelo MIT e pela MyShell.ai. O projeto foi lançado pela primeira vez em 2023 e desde então é mantido ativamente no GitHub e no Hugging Face.

O que torna o MeloTTS especialmente bom para conteúdo em chinês e inglês?

Seu modelo de falante chinês processa nativamente textos que misturam chinês e inglês e alterna corretamente a pronúncia dentro de uma única frase e geração, uma capacidade que a maioria dos sistemas TTS não oferece sem divisão manual por idioma.

O MeloTTS precisa de uma GPU?

Não. Ele foi projetado explicitamente para inferência em tempo real em CPU, com suporte a GPU disponível como acelerador opcional, e não como requisito.

O MeloTTS pode clonar a voz de uma pessoa específica?

Não. Ele usa um conjunto fixo de vozes de falantes por idioma e sotaque, em vez de clonagem de voz zero-shot a partir de um clipe de referência.

O MeloTTS é gratuito para uso comercial?

Sim. Ele é disponibilizado sob a licença MIT, que permite uso comercial e não comercial sem royalties.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →