EchoraEchora
Voltar aos modelos

FireRedTTS: um modelo fundacional criado para duas tarefas muito diferentes

12 de setembro de 2026
•
7 min de leitura

A equipe FireRed da Xiaohongshu não se propôs a criar um modelo de demonstração limitado: ela construiu um framework fundacional, com um pipeline de dados explícito e duas aplicações posteriores concretas para comprová-lo: clonar uma voz para dublagem e gerar fala casual e humana para um chatbot. Esses são problemas realmente diferentes — um precisa soar como uma pessoa específica, enquanto o outro precisa soar como um interlocutor natural —, e o FireRedTTS foi criado justamente para mostrar que o mesmo sistema fundacional poderia executar bem as duas tarefas.

O que é o FireRedTTS?

O FireRedTTS é um framework de texto para fala de código aberto e baseado em modelo de linguagem, desenvolvido pela equipe FireRed da Xiaohongshu e apresentado em um artigo de setembro de 2024. Ele é estruturado em três partes conectadas: um pipeline de processamento de dados que transforma áudio bruto em um conjunto de dados TTS de grande escala e ricamente anotado; um sistema TTS fundacional construído com esses dados; e aplicações posteriores demonstradas que comprovam o alcance prático do modelo fundacional. Esse enquadramento em três partes — dados, modelo fundacional e aplicações — é mais deliberado e voltado para a indústria do que uma publicação de pesquisa típica com uma única finalidade.

Vantagens funcionais do FireRedTTS

  • Um sistema fundacional de verdade, não um modelo limitado a uma única tarefa. A mesma arquitetura subjacente oferece tanto clonagem zero-shot quanto geração de fala conversacional ajustada por instruções.
  • Aprendizado em contexto consistente. O modelo sintetiza de modo estável uma fala coerente tanto com o texto do prompt quanto com o estilo do áudio do prompt, a mesma capacidade ampla que torna os grandes modelos de linguagem úteis para tarefas nas quais não receberam ajuste fino explícito.
  • Ajuste fino com poucas amostras para obter qualidade de estúdio, alcançando personagens vocais expressivos e de nível profissional com apenas uma hora de gravação do falante-alvo.
  • Construído de forma transparente sobre componentes abertos consolidados, entre eles uma abordagem de tokenizador de texto do Fish Speech, o codec de fala BigCodec, o design de convolução causal do Encodec, o ECAPA-TDNN do SpeechBrain e um modelo HuBERT pré-treinado em chinês.

Como funciona o sistema fundacional

O FireRedTTS comprime a fala em tokens semânticos discretos com um tokenizador de fala sensível à semântica, e um modelo de linguagem gera esses tokens diretamente do texto e do áudio do prompt. Esse é o mecanismo de aprendizado em contexto que permite ao modelo captar o estilo de uma voz-alvo usando apenas a referência. Em seguida, um gerador de forma de onda em duas etapas decodifica esses tokens semânticos em uma forma de onda de áudio de alta fidelidade. O código inclui duas configurações diferentes de decodificador para escolher: um decodificador LLM acústico e um decodificador de flow matching. Assim, você pode selecionar o método de geração conforme a combinação de velocidade, estabilidade e características sonoras que melhor se ajuste ao seu caso de uso.

Duas aplicações reais: dublagem e chatbots

É aqui que o enquadramento do FireRedTTS como modelo fundacional realmente mostra valor na prática. Para dublagem, o modelo oferece clonagem de voz zero-shot adequada a cenários de UGC (conteúdo gerado por usuários), clonando uma voz-alvo imediatamente e sem treinamento adicional. Também oferece ajuste fino com poucas amostras usando cerca de uma hora de gravação do falante-alvo para chegar à qualidade de voz expressiva de estúdio em PUGC (conteúdo profissional gerado por usuários), no qual um acabamento de produção superior faz diferença. Para chatbots, o FireRedTTS usa ajuste por instruções para produzir uma fala controlável, humana e de registro casual, incluindo comportamentos paralinguísticos e matizes emocionais. Ele foi ajustado especificamente para o registro de que um agente conversacional falado precisa, e não para a entrega mais formal que o trabalho de dublagem costuma exigir.

A família FireRedTTS

O lançamento original de 2024 continuou crescendo até formar uma linhagem mais ampla. O FireRedTTS-1S (2025) atualizou o sistema para uma geração realmente em streaming, oferecendo a escolha entre uma abordagem de modelo de linguagem multistream de menor latência e uma abordagem de flow matching com fator de tempo real mais baixo, dependendo da métrica mais importante para a implantação. O FireRedTTS-2 (2025) estendeu a arquitetura especificamente para a geração de diálogos longos com vários falantes em podcasts e chatbots, adicionou um tokenizador de streaming de 12.5Hz e relatou resultados líderes do setor em comparação com sistemas semelhantes de síntese de diálogo. O FireRedTTS3 (2026) avançou ainda mais na geração e edição unificadas, acrescentando design de voz controlado por instruções e a capacidade de editar com precisão trechos específicos de uma fala existente. Se o seu projeto precisa especificamente de streaming, diálogos de estilo podcast com vários falantes ou edição de fala, um desses lançamentos posteriores provavelmente é um ponto de partida mais diretamente relevante do que o modelo fundacional original.

Primeiros passos com o FireRedTTS

  1. Crie um ambiente conda dedicado. conda create --name redtts python=3.10 configura a versão necessária do Python antes de instalar qualquer outra coisa.
  2. Instale o PyTorch correspondente à sua versão do CUDA. O projeto documenta comandos de instalação específicos para CUDA 11.8 e CUDA 12.1. Usar a versão errada é uma fonte comum de erros em tempo de execução, portanto faça a correspondência com a configuração real dos seus drivers.
  3. Instale o FireRedTTS a partir do código-fonte. Execute cd fireredtts && pip install -e . e depois pip install -r requirements.txt para concluir a instalação principal.
  4. Baixe os arquivos do modelo em Model_Lists do projeto e coloque-os em pretrained_models.
  5. Escolha o decodificador no código. Importe from fireredtts.fireredtts import FireRedTTS e inicialize com config_path="configs/config_24k.json" para o decodificador LLM acústico, ou com config_path="configs/config_24k_flow.json" para o decodificador de flow matching. Escolha conforme você priorize a estabilidade da geração ou as características sonoras específicas da saída por flow matching.

Dicas para obter melhores resultados

  • Use a clonagem zero-shot para dublagens rápidas no estilo UGC e o ajuste fino com poucas amostras para trabalhos voltados a estúdio. O caminho de ajuste fino com cerca de uma hora está documentado especificamente para chegar a uma qualidade vocal expressiva e profissional; não espere que apenas o zero-shot alcance o mesmo acabamento em conteúdo premium.
  • Aproveite o ajuste por instruções para obter uma saída no estilo de chatbot. Se o objetivo for a voz de um agente conversacional, e não narração ou dublagem, a capacidade de produzir um registro casual e atento a elementos paralinguísticos é exatamente o que o FireRedTTS foi ajustado para oferecer nesse caso.
  • Escolha o decodificador de forma deliberada, não por padrão. Teste tanto o decodificador LLM acústico quanto o de flow matching com o seu conteúdo real, pois o projeto inclui os dois especificamente porque eles representam compromissos diferentes, e não porque um seja estritamente superior ao outro.

FireRedTTS em comparação com outros sistemas TTS fundacionais de equipes chinesas

FireRedTTSIndexTTSCosyVoice
Organização responsávelXiaohongshu (equipe FireRed)BilibiliAlibaba (FunAudioLLM)
Arquitetura principalTokenizador semântico + LM + decodificador de forma de onda em duas etapasBaseada em XTTS/Tortoise, estilo GPTTokens semânticos supervisionados + flow matching
Aplicações demonstradasDublagem (zero-shot + poucas amostras) e fala para chatbotsClonagem zero-shot geral, precisão da pronúncia em chinêsClonagem multilíngue zero-shot
Ajuste fino para qualidade de estúdioSim, ~1 hora de dadosNão é o foco principalNão é o foco principal
Licença / restrições de usoUso em pesquisa acadêmica declarado explicitamenteOs pesos precisam de autorização para uso comercialAberto, com API hospedada disponível

O nicho específico do FireRedTTS está em ter sido validado explicitamente para dois trabalhos posteriores realmente diferentes com um único sistema fundacional. A maioria dos lançamentos TTS semelhantes de equipes chinesas destaca um único caso de uso principal, enquanto o próprio artigo do FireRedTTS apresenta a dublagem e a fala para chatbots como provas igualmente centrais.

Perguntas frequentes

Qual é a diferença entre o FireRedTTS e lançamentos posteriores como o FireRedTTS-2?

O FireRedTTS original é o sistema fundacional, demonstrado para dublagem e fala de chatbots. O FireRedTTS-2 é voltado especificamente à geração de diálogos longos com vários falantes para podcasts, enquanto o FireRedTTS3 acrescenta geração unificada e edição de fala. Antes de começar com o original, verifique qual versão corresponde ao seu caso de uso real.

O FireRedTTS pode clonar uma voz sem treinamento adicional?

Sim, por meio de clonagem zero-shot adequada a cenários rápidos de dublagem no estilo UGC. Para obter uma qualidade expressiva superior, de nível de estúdio, o projeto também documenta um caminho de ajuste fino com poucas amostras que utiliza cerca de uma hora de gravação do falante-alvo.

O FireRedTTS é gratuito para uso comercial?

Sua funcionalidade de clonagem de voz zero-shot destina-se exclusivamente à pesquisa acadêmica e proíbe explicitamente o uso ilegal. Consulte diretamente os termos atuais de licença e uso antes de qualquer implantação comercial.

Qual decodificador devo usar, o LLM acústico ou o de flow matching?

Os dois são fornecidos porque representam compromissos diferentes, e não porque um seja estritamente melhor. Teste ambos com o seu conteúdo específico para ver qual se adapta às suas prioridades de estabilidade da geração e características sonoras da saída.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →