EchoraEchora
Voltar aos modelos

Fish Speech: o projeto de TTS que oferece dois caminhos para uma voz melhor

29 de agosto de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A maioria dos modelos de clonagem oferece exatamente um caminho para criar uma voz personalizada: inserir um clipe de referência e torcer para que o resultado zero-shot seja bom o bastante. O Fish Speech, projeto open source de texto para fala da Fish Audio, oferece uma segunda opção — ajustar o modelo diretamente para uma voz quando o zero-shot não é preciso o suficiente —, além de um nível de controle emocional e estilístico que vai muito além de uma narração monótona.

O que é o Fish Speech?

O Fish Speech é construído sobre uma arquitetura DualAR — um design de Transformer autorregressivo duplo — e foi treinado com bem mais de um milhão de horas de áudio multilíngue. A versão 1.5 do projeto abrange 13 idiomas, incluindo inglês, chinês e japonês, e obteve resultados sólidos em benchmarks independentes: pontuação ELO de 1339 no TTS Arena (primeiro lugar entre os modelos open source na época), taxa de erro de palavras de 3,5% e taxa de erro de caracteres de 1,2% em inglês, além de uma taxa de erro de caracteres de 1,3% em chinês.

O projeto continuou evoluindo depois da versão 1.5. Desde então, o Fish Audio Text to Speech lançou novas gerações na série OpenAudio, e o Fish Audio S2 agora ocupa o posto de modelo principal — treinado com mais de 10 milhões de horas de áudio e atualmente nas primeiras posições de avaliações como EmergentTTS-Eval, Seed-TTS Eval e Audio Turing Test. Se você procura especificamente o Fish Speech 1.5, ele continua sendo uma opção realmente sólida, mais leve e adequada para hospedagem própria; se a prioridade é qualidade pura e controle emocional detalhado, o S2 é a nova geração criada para isso.

Clonagem zero-shot e ajuste fino, não apenas um ou outro

Essa é a característica que define o Fish Speech em comparação com muitos concorrentes voltados à clonagem. A clonagem zero-shot funciona como você esperaria: um clipe de referência de 10 a 30 segundos é suficiente para capturar o timbre, o estilo e a tendência emocional geral de uma pessoa, sem nenhuma etapa de treinamento. Mas o Fish AI Text to Speech também oferece ajuste fino de verdade sobre essa base: quando uma voz precisa de mais precisão ou consistência do que a clonagem zero-shot consegue entregar de forma confiável — uma voz recorrente de marca ou um personagem específico ao longo de um projeto extenso —, você pode ajustar diretamente o modelo-base com seus próprios dados de áudio, em vez de aceitar o resultado que o clipe de referência produzir.

Essa abordagem dupla faz diferença na prática: o zero-shot é rápido e bom o bastante para a maioria das necessidades pontuais, mas o ajuste fino é o recurso procurado pelas equipes de produção quando uma voz precisa ser confiável ao longo de centenas de gerações, e não apenas em um único clipe.

Controle emocional realmente detalhado

Enquanto muitos modelos de TTS oferecem, no máximo, um único controle deslizante de “exagero”, o Fish Audio S2 permite controlar prosódia e emoção no nível de subpalavra por meio de tags em linguagem natural inseridas diretamente no texto — como [whisper], [excited] ou [angry] —, fazendo uma mesma frase mudar de tom durante a fala, em vez de aplicar uma única configuração emocional ao clipe inteiro. O modelo também lida nativamente com a geração de conversas com vários falantes e múltiplos turnos, e avalia a própria saída durante o treinamento com vários sinais de recompensa: precisão semântica, fidelidade às instruções, qualidade acústica e semelhança de timbre. Isso ajuda a explicar por que sua expressão emocional se sustenta, em vez de parecer apenas uma tag acrescentada a uma narração que continua monótona.

Como a arquitetura Dual-AR subjacente é estruturalmente semelhante a um modelo de linguagem padrão, o S2 também oferece suporte nativo a técnicas de inferência de LLM de alto desempenho, como processamento contínuo em lotes, cache KV paginado e cache de prefixos. É uma vantagem relevante se você atende solicitações de geração em escala, em vez de produzir clipes isolados.

Primeiros passos com o Fish Speech

  1. Escolha a versão de acordo com sua prioridade. O Fish Speech 1.5 é a opção mais leve e bem documentada para hospedagem própria em hardware modesto; o Fish Audio S2 é o atual modelo principal para obter qualidade máxima e controle emocional detalhado.
  2. Clone o repositório. git clone https://github.com/fishaudio/fish-speech fornece o código, a documentação e as instruções de instalação para a versão escolhida.
  3. Compare seu hardware com as necessidades do modelo. O Fish Speech 1.5 exige cerca de 12GB de VRAM no mínimo (24GB são recomendados para cargas de produção); confirme se sua GPU é adequada antes de definir um plano de implantação.
  4. Teste primeiro a clonagem zero-shot. Forneça um clipe de referência de 10–30 segundos e gere diretamente, sem treinamento, antes de decidir se o ajuste fino é realmente necessário para seu caso de uso.
  5. Faça o ajuste fino apenas quando o zero-shot não for preciso o suficiente. Se uma voz específica precisar manter a consistência em um grande volume de conteúdo, siga a documentação de ajuste fino do projeto em vez de gerar repetidamente a partir de um único clipe de referência e esperar consistência.
  6. Use o servidor SGLang ou vLLM-Omni nas implantações do S2 em produção. Ambos têm documentação específica para o Fish Audio S2 e aproveitam sua arquitetura semelhante à de um LLM para alcançar um desempenho significativamente maior do que um script de inferência básico.

Dicas para obter resultados melhores

  • Ajuste a duração do clipe de referência ao seu objetivo. Clipes mais curtos dentro do intervalo de 10–30 segundos geralmente são suficientes para um teste zero-shot rápido; se o resultado não for estável o bastante, esse é o sinal para passar ao ajuste fino, em vez de tentar clipes de referência cada vez mais longos.
  • Use tags de emoção com intenção, não em todo lugar. Inserir [whisper] ou [excited] em todas as frases dilui o efeito. Reserve as tags para os momentos específicos em que uma mudança na interpretação realmente importa para o conteúdo.
  • Não pule a análise da licença. Historicamente, os pesos do Fish Speech foram lançados com licenças voltadas à pesquisa e inclinadas ao uso não comercial (os pesos da versão 1.5 sob CC BY-NC-SA e o S2 sob a licença de pesquisa própria da Fish Audio). Leia com atenção os termos atuais antes de qualquer implantação comercial, pois eles diferem bastante de uma licença permissiva como MIT ou Apache 2.0.
  • Aproveite o suporte a idiomas combinados se o conteúdo alternar naturalmente. O Fish Speech foi criado para ler com fluidez textos que misturam chinês e inglês, sem configuração adicional. Isso é útil para roteiros bilíngues e evita a necessidade de dividir e juntar o áudio de duas gerações separadas.
  • Avalie as duas versões com seu conteúdo real antes de escolher. As classificações do TTS Arena e as taxas de erro publicadas são um sinal inicial útil, mas a qualidade da voz depende do conteúdo. Teste a versão 1.5 e o S2 com o estilo específico dos seus roteiros antes de definir um pipeline de produção.

Fish Speech comparado a outros modelos voltados à clonagem

Fish Speech (1.5 / S2)ChatterboxCosyVoice3
Clonagem zero-shotSim, referência de 10–30 sSim, referência de 5–10 sSim, referência de 3–10 s
Suporte a ajuste finoSim, nativoNão é um fluxo principalNão é um fluxo principal
Controle emocionalTags no nível de subpalavra (S2)Parâmetro de exageroBaseado em instruções
Idiomas13 (1.5) / mais amplo (S2)Inglês (versão multilíngue: 23)9 + 18 dialetos chineses
ArquiteturaTransformer autorregressivo duploBaseada em difusãoTokens semânticos supervisionados
LicençaPesquisa/inclinada ao uso não comercialMITAberta, com API hospedada disponível

O nicho específico do Fish Speech são as equipes que precisam de uma voz mais consistente do que um único clipe de referência pode garantir. O caminho do ajuste fino é o diferencial que a maioria dos modelos de clonagem zero-shot de propósito único simplesmente não oferece.

Perguntas frequentes

Qual é a diferença entre o Fish Speech 1.5 e o Fish Audio S2?

O Fish Speech 1.5 é a versão anterior e mais leve da mesma linhagem do projeto, adequada para hospedagem própria em hardware modesto. O Fish Audio S2 é o atual modelo principal, treinado com muito mais dados e com um controle emocional mais detalhado por meio de tags em linguagem natural; atualmente ocupa as primeiras posições de várias avaliações independentes de TTS.

O Fish Speech realmente pode receber ajuste fino ou oferece apenas clonagem zero-shot?

As duas opções são compatíveis. A clonagem zero-shot funciona com um clipe de referência de 10–30 segundos, sem nenhuma etapa de treinamento; o ajuste fino está disponível quando você precisa que uma voz específica seja mais consistente do que a clonagem zero-shot consegue entregar de forma confiável.

Como funcionam as tags de emoção no Fish Audio S2?

Você insere tags em linguagem natural como [whisper], [excited] ou [angry] diretamente no texto de entrada, e o modelo ajusta a interpretação naquele ponto específico da frase, em vez de aplicar uma única configuração emocional a toda a saída.

O Fish Speech é gratuito para uso comercial?

Verifique com atenção a licença atual antes de assumir que sim. Os pesos do Fish Speech 1.5 foram lançados sob uma licença CC BY-NC-SA (não comercial), enquanto o Fish Audio S2 é regido pela licença de pesquisa própria da Fish Audio. Nenhuma das duas é tão permissiva quanto MIT ou Apache 2.0, portanto os termos de implantação comercial precisam ser confirmados diretamente.

De qual hardware preciso para hospedar o Fish Speech por conta própria?

O Fish Speech 1.5 exige cerca de 12GB de VRAM no mínimo, com 24GB recomendados para cargas de produção. Consulte a documentação atual para saber os requisitos específicos do S2, pois sua maior escala de treinamento geralmente implica necessidades superiores de hardware.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →