EchoraEchora
Voltar aos modelos

Zonos: pesos abertos com foco direto na qualidade comercial fechada

5 de setembro de 2026
•
7 min de leitura

A Zyphra não posicionou o Zonos como “uma boa alternativa open source”. A própria equipe afirma que ele oferece expressividade e qualidade no mesmo nível, ou acima, dos principais provedores comerciais de TTS, ao mesmo tempo que disponibiliza os pesos reais sob uma licença totalmente permissiva. É uma afirmação específica e verificável, não uma declaração vaga de qualidade, e conta com o respaldo de um treinamento realmente grande: mais de 200 mil horas de voz variada, misturando deliberadamente narração neutra com material altamente expressivo, em vez de treinar principalmente com um único registro.

O que é o Zonos?

O Zonos é um modelo de texto para fala com pesos abertos lançado em versão beta em fevereiro de 2025 pela Zyphra, uma startup de IA sediada em Palo Alto. Ele é distribuído em duas variantes de backbone — um transformer padrão e uma arquitetura híbrida SSM —, ambas com 1,6 bilhão de parâmetros e disponibilizadas sob a licença Apache 2.0. Isso significa que os próprios pesos, e não apenas o código, podem ser usados gratuitamente para fins comerciais sem um contrato separado.

Por dentro: eSpeak, tokens DAC e duas opções de backbone

O Zonos segue um pipeline relativamente simples: o texto é normalizado e convertido em fonemas pelo eSpeak, e a sequência resultante conduz a previsão de tokens sobre representações do Descript Audio Codec (DAC), geradas pelo backbone transformer ou híbrido SSM conforme o checkpoint carregado. A diferença prática entre os dois não é apenas superficial: a variante híbrida incorpora componentes de state-space model ao lado da attention padrão. Esse tipo de escolha arquitetônica costuma criar compensações diferentes em velocidade e tratamento do comprimento das sequências em comparação com um transformer puro. Por isso, vale a pena testar ambos na sua carga de trabalho específica, em vez de presumir que um seja uma atualização estritamente superior ao outro.

Clonagem de voz: embeddings de locutor versus prefixos de áudio

O Zonos permite clonagem de voz zero-shot com um clipe de referência de 5 a 30 segundos, mas vale a pena entender as duas maneiras distintas de condicionar a geração a uma voz. Um embedding de locutor captura a identidade vocal geral do clipe de referência. Um prefixo de áudio — isto é, inserir literalmente um trecho do áudio de referência no início, em vez de primeiro reduzi-lo a um embedding — também pode provocar comportamentos específicos, como sussurros, que são realmente difíceis de reproduzir apenas com um embedding de locutor. Se o seu projeto precisa de um estilo de interpretação específico que um clipe de referência comum não está capturando, o prefixo de áudio é o controle mais direto.

Para situações em que você não tem nenhuma voz de referência, o Zonos também inclui opções de vozes predefinidas — vozes masculinas e femininas dos Estados Unidos e do Reino Unido, além de uma configuração de voz aleatória. Portanto, a clonagem zero-shot não é estritamente necessária para obter uma saída utilizável.

Controle detalhado de emoção e interpretação

Além da identidade da voz, o Zonos oferece controle direto sobre a velocidade da fala, a variação de tom, a frequência máxima, a qualidade geral do áudio e emoções específicas — felicidade, raiva, tristeza e medo têm suporte explícito. Esse nível de controle granular e independente tanto sobre a mecânica da interpretação quanto sobre o tom emocional é uma parte relevante da base real do posicionamento “expressivo”, em vez de um único parâmetro genérico de estilo aplicado à saída inteira.

Suporte multilíngue e saída nativa em 44kHz

O Zonos-v0.1 abrange inglês, japonês, chinês, francês e alemão e, em comparação com muitos modelos desse segmento que produzem áudio em 24kHz, chama a atenção por gerar áudio nativamente em 44kHz. Esse teto de fidelidade significativamente maior importa quando a saída entra em um pipeline de produção no qual a qualidade do áudio será examinada, em vez de apenas precisar ser inteligível.

Velocidade

Em uma RTX 4090, o Zonos opera com um fator de tempo real de aproximadamente 2x — gera cerca de 2 segundos de áudio para cada segundo de computação. Isso o coloca com folga em um patamar útil para aplicações quase em tempo real em hardware de consumo competente, embora não tenha sido desenvolvido especificamente para a latência de streaming abaixo de 200ms buscada por modelos dedicados ao tempo real.

Primeiros passos com o Zonos

  1. Instale primeiro a dependência eSpeak. Como o Zonos depende do eSpeak para normalizar o texto e convertê-lo em fonemas, confirme que ele está instalado no sistema antes de tentar executar a inferência — ignorar essa etapa é uma causa comum de falha na primeira execução.
  2. Clone o repositório e escolha o backbone. Faça git clone do projeto Zyphra/Zonos no GitHub e carregue Zyphra/Zonos-v0.1-transformer ou Zyphra/Zonos-v0.1-hybrid, conforme a arquitetura que deseja testar.
  3. Crie um embedding de locutor a partir de um clipe de referência. Algumas linhas de Python — carregar o modelo, chamar make_speaker_embedding() com o áudio de referência e depois make_cond_dict() com o texto e o idioma de destino — cobrem o fluxo básico de clonagem zero-shot.
  4. Use a interface do Gradio para fazer testes repetidos. Executar python gradio_interface.py evita o custo de recarregar o modelo a cada geração, algo que o exemplo mínimo em Python faz por padrão. Isso se torna realmente útil quando você começa a iterar, em vez de gerar apenas uma amostra.
  5. Teste o playground hospedado antes de se comprometer com a configuração local. A Zyphra mantém uma versão hospedada em playground.zyphra.com/audio, uma maneira rápida de avaliar a qualidade da saída e os controles disponíveis antes de investir tempo na instalação local.
  6. Use especificamente um prefixo de áudio para comportamentos difíceis de clonar. Se um embedding de locutor sozinho não estiver produzindo os sussurros, a voz com soprosidade ou outro estilo específico de interpretação de que você precisa, mude para o método de condicionamento por prefixo de áudio.

Dicas para obter resultados melhores

  • Teste as duas variantes de backbone no seu caso de uso real. Os modelos transformer e híbrido SSM não são simplesmente “antigo versus novo”: eles representam uma compensação arquitetônica real. Portanto, medir ambos com o seu tipo específico de conteúdo é mais confiável do que presumir que um seja sempre melhor.
  • Use um clipe de referência realmente limpo, com duração entre 5 e 30 segundos. Como a clonagem zero-shot é ajustada em torno desse intervalo, uma amostra bem gravada e com duração dentro dessa faixa terá desempenho melhor do que um clipe muito mais curto ou prolongado sem necessidade.
  • Combine os controles de emoção e interpretação de forma deliberada, não apenas um por vez. Como velocidade da fala, tom e emoção podem ser ajustados de modo independente, sobrepô-los com cuidado — por exemplo, um ritmo mais rápido combinado a um tom emocional específico — é onde a afirmação de expressividade do Zonos realmente aparece, em vez de ajustar um único parâmetro isoladamente.
  • Use vozes predefinidas quando não precisar especificamente de clonagem. Se reproduzir uma voz real específica não for o objetivo, as opções integradas de vozes masculinas e femininas dos Estados Unidos e do Reino Unido evitam a etapa de procurar e preparar um clipe de referência.
  • Acompanhe a versão mais recente ZONOS2 da Zyphra se precisar de mais idiomas ou menor latência. Desde então, a Zyphra lançou um modelo sucessor treinado com um conjunto de dados consideravelmente maior, suporte ampliado a idiomas e uma arquitetura mixture-of-experts voltada a reduzir a latência. Vale a pena consultá-lo caso suas necessidades específicas superem o que a v0.1 oferece.

Zonos versus outros modelos de clonagem expressiva

ZonosChatterboxF5-TTS
Organização responsávelZyphraResemble AIPesquisa independente (SJTU/Cambridge/Geely)
Parâmetros1.6B (duas variantes de backbone)~0.5BNão é apresentado principalmente pela contagem de parâmetros
Clipe de referência para clonagem5–30 segundos5–10 segundos~5–15 segundos
Controle de emoçõesExplícito: felicidade, raiva, tristeza, medoParâmetro ExaggerationNão é um recurso específico
Taxa de amostragem nativa da saída44kHzNão especificada com essa fidelidadeTaxas padrão de TTS
IdiomasInglês, japonês, chinês, francês, alemãoInglês (Multilingual: 23)Principalmente voltado ao inglês
LicençaApache 2.0MITCC-BY-NC (não comercial)

A vantagem específica do Zonos é combinar um corpus de treinamento realmente grande e de dois registros com pesos totalmente abertos e permissivos para uso comercial, além de fidelidade nativa em 44kHz. É uma combinação mais difícil de encontrar reunida em outros modelos, mesmo que sua cobertura de cinco idiomas seja mais limitada do que a de alguns concorrentes voltados ao multilinguismo.

Perguntas frequentes

O Zonos é realmente gratuito para uso comercial?

Sim. Os pesos dos modelos transformer e híbrido SSM são disponibilizados sob a licença Apache 2.0, que permite o uso comercial sem um contrato separado.

Qual é a diferença entre os modelos transformer e híbrido do Zonos?

O modelo híbrido incorpora componentes de state-space model ao lado da attention transformer padrão, representando uma compensação arquitetônica diferente, e não uma atualização direta. Testar ambos no seu caso de uso específico é a maneira confiável de escolher.

De quanto áudio de referência o Zonos precisa para clonar uma voz?

Aproximadamente 5 a 30 segundos, usando um embedding de locutor — para a identidade vocal geral — ou um prefixo de áudio — mais adequado a comportamentos específicos, como sussurrar.

Quais idiomas o Zonos oferece?

Inglês, japonês, chinês, francês e alemão na versão v0.1.

Existe uma forma hospedada de testar o Zonos sem instalar nada?

Sim. A Zyphra mantém um playground hospedado em playground.zyphra.com/audio, no qual você pode testar diretamente a clonagem de voz e os controles expressivos do modelo.

Gere uma voz semelhante a partir de um áudio de referência

Para um fluxo com um objetivo semelhante, use a Clonagem de voz da Echora. Envie uma gravação da sua própria voz ou de uma voz que você tenha permissão explícita para usar, insira até 5.000 caracteres de texto novo e gere uma nova fala parecida com a referência.

Criar uma voz clonada →