EchoraEchora
Voltar aos modelos

IndexTTS2: o primeiro modelo TTS capaz de acompanhar o movimento dos lábios

28 de agosto de 2026
•
7 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

Ao dublar um vídeo com a maioria dos modelos TTS, você acaba esbarrando no mesmo problema: a fala gerada fica meio segundo mais longa e o áudio sai de sincronia com a boca do personagem na tela. Os modelos TTS autorregressivos — aqueles que geram fala token por token e tendem a soar mais naturais — historicamente são os que mais sofrem com isso, porque não é possível fixar antecipadamente a duração do que eles geram. O IndexTTS2, da equipe Index da Bilibili, é o primeiro modelo TTS autorregressivo criado para resolver esse problema específico: oferecer controle preciso, em nível de milissegundos, sobre a duração real de uma fala gerada.

O que há de novo no IndexTTS2

O IndexTTS 2 é o sucessor do IndexTTS original da Bilibili e, mais do que uma atualização incremental, é uma reconstrução voltada diretamente a fluxos profissionais de dublagem e localização de conteúdo. Enquanto o modelo original reconhecia explicitamente como problemas em aberto a variedade emocional limitada e a ausência de geração por instruções, o IndexTTS2 trata ambos de forma direta e acrescenta uma capacidade que o original nunca teve: controlar exatamente quanto tempo dura uma fala gerada.

Treinado com cerca de 55.000 horas de dados de voz multilíngues em chinês, inglês e japonês, o IndexTTS2 é descrito por seus autores como capaz de alcançar simultaneamente resultados de ponta em relação aos sistemas TTS zero-shot existentes na taxa de erro de palavras, similaridade do falante e fidelidade emocional, três métricas que em outros modelos costumam melhorar umas às custas das outras.

Controle preciso de duração: o principal recurso

Esta é a principal contribuição do IndexTTS2 e ataca diretamente uma limitação estrutural do TTS autorregressivo. Como esses modelos geram voz um token por vez, sem uma duração-alvo fixa, fazer o resultado corresponder a uma duração específica — digamos, exatamente 3,2 segundos para encaixar uma fala dublada em um clipe de vídeo existente — tradicionalmente exige tentativa e erro, nova geração ou time-stretching na pós-produção, o que reduz a qualidade do áudio.

O IndexTTS2 introduz um esquema de adaptação de duração com dois modos distintos de geração:

  • Modo de duração especificada. Define explicitamente o número de tokens gerados para atingir uma duração-alvo precisa. É o modo criado para dublagem audiovisual, em que uma fala precisa caber dentro de uma janela de tempo exata para acompanhar o movimento dos lábios ou o ritmo da cena.
  • Modo de duração livre. Deixa o modelo gerar naturalmente, sem restrição na contagem de tokens, enquanto ainda reproduz com fidelidade as características prosódicas do prompt de entrada. É a melhor opção quando o ritmo natural importa mais do que atingir uma duração exata.

Vale destacar que os autores desenvolveram este método geral para que pudesse ser aplicado a outras arquiteturas TTS autorregressivas além do próprio IndexTTS2; não se trata de um artifício limitado a este modelo.

Separação entre emoção e timbre

A segunda grande novidade é separar com quem uma voz se parece de como ela se sente. Na maioria dos modelos de clonagem, o clipe de referência fornecido determina tanto a identidade do falante quanto, implicitamente, seu tom emocional: não é fácil clonar a voz de uma pessoa calma e fazê-la pronunciar uma fala irritada de maneira convincente. O IndexTTS2 separa essas duas dimensões, permitindo especificar de forma independente uma fonte de timbre e uma fonte de emoção, inclusive usando dois clipes de referência completamente diferentes.

A entrada emocional é compatível com quatro métodos distintos: apenas o áudio de referência, um prompt separado de áudio emocional associado a outro texto-alvo, uma descrição emocional em linguagem natural (por exemplo, “pareça ansioso e apressado”) ou um vetor emocional direto. O caminho de descrição em linguagem natural usa um modelo Qwen3 ajustado que atua como uma camada de instruções suaves, criada especificamente para reduzir a barreira do controle emocional sem exigir que os usuários entendam parâmetros baseados em vetores. Para manter a fala clara durante uma interpretação emocional intensa — um ponto de falha comum em que emoções fortes reduzem a inteligibilidade —, o modelo incorpora representações latentes GPT destinadas a preservar a estabilidade sob estresse emocional.

Primeiros passos com o IndexTTS2

  1. Clone o repositório. Execute git clone https://github.com/index-tts/index-tts.git e confirme que tanto o git quanto o git-lfs estão instalados no sistema antes de continuar.
  2. Instale as dependências com uv. O projeto recomenda o gerenciador de pacotes uv em vez de uma configuração manual com pip/conda: uv sync --all-extras baixa o conjunto completo de dependências.
  3. Baixe o checkpoint do IndexTTS2. hf download IndexTeam/IndexTTS-2 --local-dir=checkpoints obtém especificamente os pesos do modelo. Não reutilize um diretório de checkpoint do IndexTTS-1.5, pois os dois não são intercambiáveis.
  4. Use a classe de inferência v2. Em Python, importe de indextts.infer_v2 em vez do módulo infer original e depois chame .infer() com um prompt de áudio do falante e o texto-alvo para gerar um clipe básico.
  5. Adicione controle de duração ou emoção ao trabalho de dublagem. Quando a geração básica estiver funcionando, acrescente uma duração-alvo ou um prompt de áudio emocional à chamada de inferência. É aqui que as vantagens específicas do IndexTTS2 para dublagem realmente aparecem, não na geração padrão de uma única etapa.

Dicas para aproveitar melhor o IndexTTS2

  • Use o modo de duração especificada em qualquer conteúdo com restrições visuais de tempo. O modo de duração livre funciona bem para narração independente, mas qualquer projeto que sincronize áudio com um vídeo existente — dublagens, redublagens ou anúncios localizados — deve usar desde o início o modo com contagem explícita de tokens, em vez de corrigir o tempo na pós-produção.
  • Separe deliberadamente as fontes de timbre e emoção. Se você precisa que a voz clonada de uma pessoa específica pronuncie uma fala com um tom emocional que o clipe de referência não possui naturalmente, forneça um prompt separado de áudio emocional em vez de tentar extrair emoção de um único clipe de referência neutro.
  • Se você não é engenheiro de áudio, experimente primeiro a entrada emocional por descrição de texto. O caminho de instruções em linguagem natural baseado no Qwen3 foi criado para ser mais acessível do que vetores emocionais. Comece por ele antes de concluir que precisa ajustar parâmetros numéricos manualmente.
  • Observe a clareza na geração com emoções intensas. Embora as representações latentes GPT do IndexTTS2 sejam projetadas para preservar a inteligibilidade em interpretações com emoções fortes, ainda vale verificar pontualmente a clareza no seu conteúdo específico, em vez de presumir que será uniforme em todas as combinações de emoção e idioma.
  • Confirme os termos da licença antes de realizar trabalhos comerciais de dublagem. Assim como no IndexTTS original, os pesos do modelo são regidos pela licença de uso de modelos da Bilibili, que exige autorização para uso comercial. Verifique se ela cobre seu projeto antes de lançar um produto pago de localização ou dublagem baseado nele.

IndexTTS2 vs. IndexTTS (original)

IndexTTS2IndexTTS (1.0 / 1.5)
Controle de duraçãoPreciso, em nível de milissegundos (dois modos)Não disponível
Controle de emoçãoSeparado do timbre, 4 métodos de entradaLimitado, fraqueza reconhecida
Geração por instruçõesSim, por descrição em linguagem naturalNão disponível
Dados de treinamento~55.000 horas, chinês/inglês/japonês~10.000+ horas, chinês/inglês
Uso mais indicadoDublagem de vídeo, localização, narração emocionalClonagem zero-shot de uso geral, precisão da pronúncia em chinês
LançamentoSetembro de 2025Março de 2025 (1.0) / maio de 2025 (1.5)

Se o seu projeto envolve clonagem de voz de uso geral sem exigências rígidas de tempo, o IndexTTS original continua sendo uma opção capaz e mais simples. Se você está dublando conteúdo de vídeo em que uma fala precisa caber em uma janela de tempo específica — ou precisa que uma voz clonada expresse de forma convincente uma emoção ausente do clipe de referência —, o IndexTTS2 é a versão criada especificamente para esse trabalho.

Perguntas frequentes

Na prática, o que significa “controle de duração” no IndexTTS2?

Significa que você pode especificar exatamente quantos tokens — e, portanto, aproximadamente quanto tempo — uma fala gerada deve ocupar. Isso é essencial na dublagem, em que o diálogo precisa acompanhar o tempo de um vídeo existente, em vez de durar o tempo que o modelo gerar naturalmente.

O IndexTTS2 pode fazer uma voz clonada expressar uma emoção diferente da do clipe de referência?

Sim. Esse é o recurso de separação entre emoção e timbre. Você pode fornecer uma fonte de emoção separada — áudio, descrição de texto ou vetor emocional — independente da referência de timbre, de modo que uma voz de referência calma ainda possa pronunciar uma fala ansiosa ou empolgada.

IndexTTS2 é o mesmo que “IndexTTS 2”?

Sim, os dois nomes se referem ao mesmo modelo. O IndexTTS2, às vezes escrito IndexTTS 2, é a versão de segunda geração da Bilibili, diferente do IndexTTS original (1.0/1.5).

Quais idiomas o IndexTTS2 aceita?

Seus dados de treinamento abrangem chinês, inglês e japonês, extraídos de cerca de 55.000 horas de fala multilíngue.

O IndexTTS2 é gratuito para uso comercial?

O código é open source, mas os pesos do modelo são regidos pelo contrato de licença de uso de modelos da Bilibili, que exige autorização prévia para uso comercial. Consulte os termos atuais da licença antes de implantá-lo em um produto pago.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →