Zonos: pesos abertos com foco direto na qualidade comercial fechada
- O que é o Zonos?
- Por dentro: eSpeak, tokens DAC e duas opções de backbone
- Clonagem de voz: embeddings de locutor versus prefixos de áudio
- Controle detalhado de emoção e interpretação
- Suporte multilíngue e saída nativa em 44kHz
- Velocidade
- Primeiros passos com o Zonos
- Dicas para obter resultados melhores
- Zonos versus outros modelos de clonagem expressiva
- Perguntas frequentes
- Gere uma voz semelhante a partir de um áudio de referência
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
A Zyphra não posicionou o Zonos como “uma boa alternativa open source”. A própria equipe afirma que ele oferece expressividade e qualidade no mesmo nível, ou acima, dos principais provedores comerciais de TTS, ao mesmo tempo que disponibiliza os pesos reais sob uma licença totalmente permissiva. É uma afirmação específica e verificável, não uma declaração vaga de qualidade, e conta com o respaldo de um treinamento realmente grande: mais de 200 mil horas de voz variada, misturando deliberadamente narração neutra com material altamente expressivo, em vez de treinar principalmente com um único registro.
O que é o Zonos?
O Zonos é um modelo de texto para fala com pesos abertos lançado em versão beta em fevereiro de 2025 pela Zyphra, uma startup de IA sediada em Palo Alto. Ele é distribuído em duas variantes de backbone — um transformer padrão e uma arquitetura híbrida SSM —, ambas com 1,6 bilhão de parâmetros e disponibilizadas sob a licença Apache 2.0. Isso significa que os próprios pesos, e não apenas o código, podem ser usados gratuitamente para fins comerciais sem um contrato separado.
Por dentro: eSpeak, tokens DAC e duas opções de backbone
O Zonos segue um pipeline relativamente simples: o texto é normalizado e convertido em fonemas pelo eSpeak, e a sequência resultante conduz a previsão de tokens sobre representações do Descript Audio Codec (DAC), geradas pelo backbone transformer ou híbrido SSM conforme o checkpoint carregado. A diferença prática entre os dois não é apenas superficial: a variante híbrida incorpora componentes de state-space model ao lado da attention padrão. Esse tipo de escolha arquitetônica costuma criar compensações diferentes em velocidade e tratamento do comprimento das sequências em comparação com um transformer puro. Por isso, vale a pena testar ambos na sua carga de trabalho específica, em vez de presumir que um seja uma atualização estritamente superior ao outro.
Clonagem de voz: embeddings de locutor versus prefixos de áudio
O Zonos permite clonagem de voz zero-shot com um clipe de referência de 5 a 30 segundos, mas vale a pena entender as duas maneiras distintas de condicionar a geração a uma voz. Um embedding de locutor captura a identidade vocal geral do clipe de referência. Um prefixo de áudio — isto é, inserir literalmente um trecho do áudio de referência no início, em vez de primeiro reduzi-lo a um embedding — também pode provocar comportamentos específicos, como sussurros, que são realmente difíceis de reproduzir apenas com um embedding de locutor. Se o seu projeto precisa de um estilo de interpretação específico que um clipe de referência comum não está capturando, o prefixo de áudio é o controle mais direto.
Para situações em que você não tem nenhuma voz de referência, o Zonos também inclui opções de vozes predefinidas — vozes masculinas e femininas dos Estados Unidos e do Reino Unido, além de uma configuração de voz aleatória. Portanto, a clonagem zero-shot não é estritamente necessária para obter uma saída utilizável.
Controle detalhado de emoção e interpretação
Além da identidade da voz, o Zonos oferece controle direto sobre a velocidade da fala, a variação de tom, a frequência máxima, a qualidade geral do áudio e emoções específicas — felicidade, raiva, tristeza e medo têm suporte explícito. Esse nível de controle granular e independente tanto sobre a mecânica da interpretação quanto sobre o tom emocional é uma parte relevante da base real do posicionamento “expressivo”, em vez de um único parâmetro genérico de estilo aplicado à saída inteira.
Suporte multilíngue e saída nativa em 44kHz
O Zonos-v0.1 abrange inglês, japonês, chinês, francês e alemão e, em comparação com muitos modelos desse segmento que produzem áudio em 24kHz, chama a atenção por gerar áudio nativamente em 44kHz. Esse teto de fidelidade significativamente maior importa quando a saída entra em um pipeline de produção no qual a qualidade do áudio será examinada, em vez de apenas precisar ser inteligível.
Velocidade
Em uma RTX 4090, o Zonos opera com um fator de tempo real de aproximadamente 2x — gera cerca de 2 segundos de áudio para cada segundo de computação. Isso o coloca com folga em um patamar útil para aplicações quase em tempo real em hardware de consumo competente, embora não tenha sido desenvolvido especificamente para a latência de streaming abaixo de 200ms buscada por modelos dedicados ao tempo real.
Primeiros passos com o Zonos
- Instale primeiro a dependência eSpeak. Como o Zonos depende do eSpeak para normalizar o texto e convertê-lo em fonemas, confirme que ele está instalado no sistema antes de tentar executar a inferência — ignorar essa etapa é uma causa comum de falha na primeira execução.
- Clone o repositório e escolha o backbone. Faça
git clonedo projetoZyphra/Zonosno GitHub e carregueZyphra/Zonos-v0.1-transformerouZyphra/Zonos-v0.1-hybrid, conforme a arquitetura que deseja testar. - Crie um embedding de locutor a partir de um clipe de referência. Algumas linhas de Python — carregar o modelo, chamar
make_speaker_embedding()com o áudio de referência e depoismake_cond_dict()com o texto e o idioma de destino — cobrem o fluxo básico de clonagem zero-shot. - Use a interface do Gradio para fazer testes repetidos. Executar
python gradio_interface.pyevita o custo de recarregar o modelo a cada geração, algo que o exemplo mínimo em Python faz por padrão. Isso se torna realmente útil quando você começa a iterar, em vez de gerar apenas uma amostra. - Teste o playground hospedado antes de se comprometer com a configuração local. A Zyphra mantém uma versão hospedada em
playground.zyphra.com/audio, uma maneira rápida de avaliar a qualidade da saída e os controles disponíveis antes de investir tempo na instalação local. - Use especificamente um prefixo de áudio para comportamentos difíceis de clonar. Se um embedding de locutor sozinho não estiver produzindo os sussurros, a voz com soprosidade ou outro estilo específico de interpretação de que você precisa, mude para o método de condicionamento por prefixo de áudio.
Dicas para obter resultados melhores
- Teste as duas variantes de backbone no seu caso de uso real. Os modelos transformer e híbrido SSM não são simplesmente “antigo versus novo”: eles representam uma compensação arquitetônica real. Portanto, medir ambos com o seu tipo específico de conteúdo é mais confiável do que presumir que um seja sempre melhor.
- Use um clipe de referência realmente limpo, com duração entre 5 e 30 segundos. Como a clonagem zero-shot é ajustada em torno desse intervalo, uma amostra bem gravada e com duração dentro dessa faixa terá desempenho melhor do que um clipe muito mais curto ou prolongado sem necessidade.
- Combine os controles de emoção e interpretação de forma deliberada, não apenas um por vez. Como velocidade da fala, tom e emoção podem ser ajustados de modo independente, sobrepô-los com cuidado — por exemplo, um ritmo mais rápido combinado a um tom emocional específico — é onde a afirmação de expressividade do Zonos realmente aparece, em vez de ajustar um único parâmetro isoladamente.
- Use vozes predefinidas quando não precisar especificamente de clonagem. Se reproduzir uma voz real específica não for o objetivo, as opções integradas de vozes masculinas e femininas dos Estados Unidos e do Reino Unido evitam a etapa de procurar e preparar um clipe de referência.
- Acompanhe a versão mais recente ZONOS2 da Zyphra se precisar de mais idiomas ou menor latência. Desde então, a Zyphra lançou um modelo sucessor treinado com um conjunto de dados consideravelmente maior, suporte ampliado a idiomas e uma arquitetura mixture-of-experts voltada a reduzir a latência. Vale a pena consultá-lo caso suas necessidades específicas superem o que a v0.1 oferece.
Zonos versus outros modelos de clonagem expressiva
| Zonos | Chatterbox | F5-TTS | |
|---|---|---|---|
| Organização responsável | Zyphra | Resemble AI | Pesquisa independente (SJTU/Cambridge/Geely) |
| Parâmetros | 1.6B (duas variantes de backbone) | ~0.5B | Não é apresentado principalmente pela contagem de parâmetros |
| Clipe de referência para clonagem | 5–30 segundos | 5–10 segundos | ~5–15 segundos |
| Controle de emoções | Explícito: felicidade, raiva, tristeza, medo | Parâmetro Exaggeration | Não é um recurso específico |
| Taxa de amostragem nativa da saída | 44kHz | Não especificada com essa fidelidade | Taxas padrão de TTS |
| Idiomas | Inglês, japonês, chinês, francês, alemão | Inglês (Multilingual: 23) | Principalmente voltado ao inglês |
| Licença | Apache 2.0 | MIT | CC-BY-NC (não comercial) |
A vantagem específica do Zonos é combinar um corpus de treinamento realmente grande e de dois registros com pesos totalmente abertos e permissivos para uso comercial, além de fidelidade nativa em 44kHz. É uma combinação mais difícil de encontrar reunida em outros modelos, mesmo que sua cobertura de cinco idiomas seja mais limitada do que a de alguns concorrentes voltados ao multilinguismo.
Perguntas frequentes
O Zonos é realmente gratuito para uso comercial?
Sim. Os pesos dos modelos transformer e híbrido SSM são disponibilizados sob a licença Apache 2.0, que permite o uso comercial sem um contrato separado.
Qual é a diferença entre os modelos transformer e híbrido do Zonos?
O modelo híbrido incorpora componentes de state-space model ao lado da attention transformer padrão, representando uma compensação arquitetônica diferente, e não uma atualização direta. Testar ambos no seu caso de uso específico é a maneira confiável de escolher.
De quanto áudio de referência o Zonos precisa para clonar uma voz?
Aproximadamente 5 a 30 segundos, usando um embedding de locutor — para a identidade vocal geral — ou um prefixo de áudio — mais adequado a comportamentos específicos, como sussurrar.
Quais idiomas o Zonos oferece?
Inglês, japonês, chinês, francês e alemão na versão v0.1.
Existe uma forma hospedada de testar o Zonos sem instalar nada?
Sim. A Zyphra mantém um playground hospedado em playground.zyphra.com/audio, no qual você pode testar diretamente a clonagem de voz e os controles expressivos do modelo.
Gere uma voz semelhante a partir de um áudio de referência
Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.