Qwen3-TTS: Um modelo de voz que responde em menos de um décimo de segundo
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
A maioria das demonstrações de clonagem de voz faz você esperar um instante até o áudio começar — tempo suficiente para que a experiência nunca pareça uma conversa de verdade. O Qwen3-TTS, modelo de voz open source da equipe Qwen da Alibaba, foi criado para eliminar esse intervalo: uma arquitetura de duas vias que gera voz de ponta a ponta com latência até o primeiro pacote de áudio de apenas 97 milissegundos, rápida o bastante para ser integrada a um agente de voz em tempo real sem acrescentar, por si só, um atraso perceptível.
O que é o Qwen3-TTS?
O Qwen3-TTS é um modelo open source de texto para fala treinado com mais de 5 milhões de horas de dados de voz, lançado sob a licença Apache 2.0 e com pesos públicos no Hugging Face e no GitHub. Em seu núcleo está um tokenizer de voz personalizado, o Qwen3-TTS-Tokenizer-12Hz, combinado com uma arquitetura híbrida de streaming que gera áudio diretamente, em vez de passar por uma etapa separada de diffusion ou vocoder — a escolha de design responsável tanto pela baixa latência quanto pela estabilidade com textos de entrada mais longos ou com mais ruído.
O modelo abrange 10 idiomas principais — chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano — além de vários perfis de voz de dialetos chineses, e oferece pesos abertos em dois tamanhos: uma versão de 1.7B parâmetros ajustada para máxima qualidade e outra mais leve, de 0.6B, criada para hardware limitado sem abrir mão de muito em troca.
Três maneiras de gerar uma voz
O Qwen3-TTS não limita você a um único método: ele foi criado em torno de três formas distintas de gerar voz, dependendo do material que você tem disponível.
Clone uma voz com 3 segundos de áudio. Forneça um pequeno clipe de referência com a transcrição correspondente, e o modelo reproduzirá a voz da pessoa em um texto novo — um dos requisitos de áudio de referência mais curtos entre os atuais modelos open source de clonagem.
Crie uma voz a partir de uma descrição em texto. Não tem uma gravação? Descreva a voz em linguagem natural — idade, gênero, tom e personalidade — e o Qwen3-TTS gera uma nova voz correspondente, sem precisar de qualquer referência de áudio. É uma opção realmente útil quando você precisa de uma voz de personagem marcante e não quer primeiro procurar, licenciar ou gravar uma.
Escolha um preset pronto. Para projetos que só precisam de uma boa voz sem nenhuma configuração, a API hospedada oferece 49 vozes predefinidas para vários personagens. Elas são baseadas em personas nomeadas que abrangem diferentes idades, gêneros e personalidades, e podem ser trocadas instantaneamente sem configuração adicional.
Nos três modos, o modelo interpreta bem o contexto: ele ajusta tom, ritmo e expressão emocional com base na semântica do próprio texto e lida melhor com entradas confusas ou formatadas de maneira imperfeita do que os modelos de voz anteriores da mesma família.
Primeiros passos com o Qwen3-TTS
- Escolha entre hospedar por conta própria e usar a API. Hospedar os pesos abertos oferece controle total e elimina o custo por caractere; chamar a API hospedada — com modelos como
qwen3-tts-flashpara geração rápida e de baixa latência ouqwen3-tts-instruct-flashquando você precisa de controle por instruções em linguagem natural — é o caminho mais rápido se preferir não gerenciar uma infraestrutura de GPU. - Instale o pacote.
pip install qwen-ttsfornece a classeQwen3TTSModelnecessária para carregar e executar a inferência localmente. - Escolha um checkpoint adequado ao seu hardware.
Qwen/Qwen3-TTS-12Hz-1.7B-Baseé o modelo de qualidade completa e precisa de aproximadamente 6–8GB de VRAM; a variante de 0.6B roda com folga em 4–6GB, com uma perda de qualidade menor do que a diferença de tamanho sugere. - Gere uma voz clonada. Chame
generate_voice_clone()com o texto de destino, um código de idioma, um arquivo de áudio de referência e a transcrição correspondente. - Armazene em cache os prompts de referência para gerações repetidas. Se você estiver produzindo vários clipes com a mesma voz clonada, reutilize as características do prompt já calculadas em vez de calculá-las novamente a cada chamada — isso acelera de forma perceptível a geração em lote.
- Use o vLLM para obter maior vazão em produção. A equipe Qwen oferece suporte ao vLLM para o Qwen3-TTS desde o primeiro dia, e vale a pena usá-lo no lugar de um loop comum de inferência PyTorch para qualquer aplicação além de testes em pequena escala.
Teste sem precisar configurar nada
Tanto o Space oficial do Hugging Face quanto a demonstração do ModelScope permitem testar a clonagem e a criação de voz diretamente no navegador, sem instalar nada. A Alibaba Cloud também já ofereceu cotas gratuitas de caracteres para desenvolvedores que testam o modelo por meio da API do Model Studio, e plataformas de terceiros como Replicate e DeepInfra também hospedam o modelo de pesos abertos. É uma maneira simples de avaliar a qualidade antes de investir em infraestrutura local ou em um plano pago de API.
Dicas para obter resultados melhores
- Garanta que a transcrição de referência para clonagem esteja totalmente correta. A qualidade da clonagem depende muito de o texto de referência corresponder ao que realmente é dito no áudio — uma transcrição incorreta prejudica o resultado mais do que uma gravação de qualidade um pouco menor.
- Use a criação de voz quando não houver um clipe de referência real. Descrever a voz desejada costuma aproximar você mais do resultado necessário do que procurar um clipe pronto que seja “parecido o bastante”, além de evitar qualquer questão de licenciamento relacionada a uma voz real gravada.
- Comece com o modelo de 0.6B se não souber ao certo o que seu hardware comporta. Com cerca de metade da exigência da versão de 1.7B, ele mantém um bom desempenho na maioria dos casos de uso — avance apenas se precisar especificamente da fidelidade adicional.
- Use as variantes hospedadas de baixa latência em aplicações ao vivo. Se você estiver criando algo mais próximo de um agente de voz do que de geração de conteúdo em lote, as opções rápidas e de baixa latência da API foram projetadas especificamente para esse caso, então não é necessário otimizar por conta própria uma inferência auto-hospedada.
Qwen3-TTS em comparação com outros modelos open source de clonagem
| Qwen3-TTS | CosyVoice3 | Chatterbox | |
|---|---|---|---|
| Organização responsável | Alibaba (equipe Qwen) | Alibaba (FunAudioLLM) | Resemble AI |
| Parâmetros | 0.6B / 1.7B | 0.5B | ~0.5B |
| Clipe de referência para clonagem | ~3 segundos | ~3–10 segundos | 5–10 segundos |
| Latência até o primeiro pacote | ~97ms | ~150ms (hospedado) | Não é um foco principal |
| Criação de voz a partir de texto | Sim | Não | Não |
| Idiomas | 10 | 9 + 18 dialetos chineses | Inglês (variante multilíngue: 23) |
| Licença | Apache 2.0 | Aberto, com API hospedada disponível | MIT |
A vantagem específica do Qwen3-TTS é combinar latência realmente baixa com três caminhos distintos de geração — clonagem, criação de voz baseada em texto e presets prontos — em uma única versão de pesos abertos, um conjunto de recursos mais amplo do que o oferecido pela maioria dos modelos de clonagem de finalidade única e tamanho semelhante.
Perguntas frequentes
Qwen-TTS e Qwen3-TTS são o mesmo modelo?
Não exatamente. O Qwen-TTS era o modelo de voz anterior da Alibaba, disponível apenas pela API hospedada da Qwen, sem pesos públicos. O Qwen3-TTS é a geração mais recente, disponibilizada como open source com pesos para download e um conjunto mais amplo de recursos — se você pretende hospedar ou fazer fine-tuning por conta própria, o Qwen3-TTS é o modelo indicado.
O que significa qwen3-tts-flash?
É o nome de uma versão hospedada e gerenciada do Qwen3-TTS disponível pela API da Alibaba Cloud, ajustada para gerar com rapidez e baixa latência sem exigir hospedagem própria. Ela executa a mesma família de modelos subjacente da versão de pesos abertos, apenas como um serviço gerenciado.
O Qwen3-TTS pode ser usado gratuitamente?
Os pesos abertos podem ser hospedados gratuitamente sob a licença Apache 2.0. A API hospedada já ofereceu cotas gratuitas de caracteres para novos desenvolvedores, com uso pago após esse limite — consulte os preços atuais da Alibaba Cloud para saber os valores exatos.
Qual é a diferença prática entre os modelos de 0.6B e 1.7B?
O modelo de 1.7B oferece maior qualidade de saída e precisa de mais VRAM (cerca de 6–8GB); o modelo de 0.6B é mais leve (4–6GB), com uma perda de qualidade menor do que a diferença de parâmetros sugere.
Posso testar o Qwen3-TTS antes de instalar qualquer coisa?
Sim. Tanto o Space oficial do Hugging Face quanto a demonstração do ModelScope funcionam no navegador, e plataformas de hospedagem como Replicate e DeepInfra oferecem acesso por API sem configuração local.
Gere uma voz semelhante a partir de um áudio de referência
Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.