EchoraEchora
Voltar aos modelos

IndexTTS: O modelo de voz criado dentro da maior plataforma chinesa de vídeos de anime e games

28 de agosto de 2026
•
8 min de leitura

Transforme textos e gravações em áudio pronto para ouvir

Dublagem, stems, covers e efeitos sonoros, tudo no navegador.

  • Texto para fala, e também clonagem de voz
  • Separe as faixas, ou gere um cover
  • Cadastre-se para ouvir primeiro e decidir depois
Comece a criar grátis

A Bilibili, plataforma de vídeo que reúne milhões de horas de anime, games e conteúdo de criadores na China, tem um motivo prático e evidente para se importar com texto para fala: dublagem, avatares digitais e locução em escala de plataforma. O IndexTTS é o resultado de tornar pública essa necessidade interna. Desenvolvido pelo Departamento de Plataforma de IA da Bilibili e lançado como open source, ele é um modelo de clonagem de voz zero-shot projetado especificamente em torno de um problema que sistemas TTS multilíngues genéricos costumam tratar mal: pronunciar corretamente textos em chinês com todos os seus caracteres polifônicos e vocabulário de cauda longa.

O que é o IndexTTS?

O IndexTTS é um modelo autorregressivo de texto para fala no estilo GPT, desenvolvido pela equipe Index da Bilibili e construído principalmente sobre as arquiteturas XTTS e Tortoise, com um conjunto de melhorias direcionadas adicionado a essa base. Ele oferece clonagem de voz zero-shot — reproduzindo a voz de um falante a partir de um clipe de referência — em chinês e inglês, e foi treinado com mais de dez mil horas de dados de fala.

O que diferencia o IndexTTS das bases XTTS e Tortoise sobre as quais ele foi construído não é um único recurso de destaque, mas uma série de decisões deliberadas de engenharia, cada uma voltada a um ponto fraco específico dos primeiros TTS open source: precisão da pronúncia em chinês, controle de tempo e estabilidade da clonagem.

A engenharia por trás do IndexTTS

Modelagem híbrida de caracteres e pinyin. Esta é a principal contribuição do IndexTTS. A síntese de texto em chinês tem um problema persistente: caracteres polifônicos — o mesmo caractere lido de formas diferentes conforme o contexto — e vocabulário de cauda longa são frequentemente pronunciados de maneira incorreta por modelos treinados apenas com sequências de caracteres. O IndexTTS trata isso misturando caracteres e pinyin diretamente no treinamento. Durante o pré-processamento, uma parte dos caracteres não polifônicos é substituída aleatoriamente por seus equivalentes em pinyin, ensinando o modelo a usar o pinyin como um sinal de desambiguação que também pode ser fornecido na inferência para forçar uma pronúncia específica.

Controle de pausas por pontuação. O IndexTTS interpreta sinais de pontuação como sinais de tempo, permitindo controlar onde as pausas ocorrem na fala gerada apenas pela forma como o texto de entrada é pontuado, sem exigir uma marcação de tempo separada.

Um pipeline de condicionamento e decodificação reconstruído. O IndexTTS introduz um codificador condicional de fala baseado em Conformer para melhorar a forma como o modelo capta características do falante em um clipe de referência e substitui o decodificador original de códigos de fala pelo BigVGAN2. A equipe atribui a essa mudança melhorias na estabilidade do treinamento, na similaridade do timbre e na qualidade geral do áudio.

FSQ em vez de VQ no tokenizer de fala. A equipe realizou uma comparação direta entre a quantização vetorial padrão (Vector Quantization) e a quantização escalar finita (Finite-Scalar Quantization) na codificação de tokens acústicos de fala, tratando o problema de colapso do codebook que pode prejudicar sistemas baseados em VQ. Essa escolha técnica também influenciou posteriormente o projeto do tokenizer do CosyVoice2.

Desempenho nos benchmarks

Na avaliação publicada pela equipe — que mediu taxa de erro de palavras, similaridade do falante e pontuação média de opinião em conjuntos de teste em inglês e chinês —, o IndexTTS foi comparado diretamente com XTTS, CosyVoice2 (sem streaming), Fish-Speech, FireRedTTS e F5-TTS. Os resultados relatados mostram que o IndexTTS supera todos eles na taxa de erro de palavras, permanecendo competitivo especificamente com o CosyVoice2 e o F5-TTS em similaridade do falante, os dois modelos que os autores identificam como seus pares mais próximos em fidelidade de clonagem.

Vale apontar com franqueza que o artigo original do IndexTTS reconhece diretamente as próprias limitações: no lançamento, o modelo não oferecia geração de voz por instruções, cobria apenas chinês e inglês e tinha capacidade limitada de expressão emocional rica. A atualização IndexTTS-1.5 da equipe, lançada em maio de 2025, foi direcionada especificamente a melhorias de estabilidade e desempenho em inglês em relação à versão inicial 1.0.

Primeiros passos com o IndexTTS

  1. Configure um ambiente com Python 3.10. Crie um ambiente conda dedicado e instale o ffmpeg pelo gerenciador de pacotes do sistema ou com conda install -c conda-forge ffmpeg.
  2. Trate separadamente a dependência pynini no Windows, se necessário. Se pip install não conseguir compilar um wheel para pynini no Windows, instale-o com conda install -c conda-forge pynini==2.1.6 e depois execute pip install WeTextProcessing --no-deps. Essa é uma solução conhecida documentada diretamente pelo projeto.
  3. Baixe os pesos do modelo. Use huggingface-cli download para obter IndexTeam/IndexTTS (1.0) ou IndexTeam/IndexTTS-1.5, conforme a versão necessária. O checkpoint 1.5 é a melhor opção padrão para a maioria dos novos projetos, considerando suas melhorias de estabilidade.
  4. Execute a inferência pela CLI ou por Python. A ferramenta de linha de comando indextts recebe diretamente o texto e um arquivo de voz de referência; também é possível chamar a classe IndexTTS no Python para ter mais controle dentro de um pipeline maior.
  5. Use a WebUI para testar antes da integração. Execute pip install -e ".[webui]" --no-build-isolation e depois python webui.py para abrir em localhost:7860 uma interface no navegador que permite testar a clonagem e o controle de pronúncia sem escrever código.

Dicas para obter resultados melhores

  • Use substituições por pinyin de forma deliberada em caracteres polifônicos. Quando um caractere tem várias pronúncias válidas conforme o contexto, fornecer diretamente o pinyin correto é mais confiável do que esperar que o modelo deduza a leitura certa a partir do texto ao redor.
  • Pontue o texto de acordo com as pausas que você realmente deseja. Como o IndexTTS interpreta a pontuação como informação de tempo, trate a posição de vírgulas e pontos como uma ferramenta de ritmo, não apenas de correção gramatical. É uma forma de controlar o ritmo que exige menos esforço do que as opções oferecidas pela maioria dos modelos.
  • Use o IndexTTS-1.5 como padrão, a menos que tenha um motivo específico para não fazer isso. A versão 1.5 existe especificamente para corrigir problemas de estabilidade e melhorar a saída em inglês do modelo 1.0 original. Há poucos motivos para iniciar um novo projeto com o checkpoint anterior.
  • Mantenha expectativas realistas sobre o alcance emocional. A própria documentação do modelo reconhece expressividade emocional limitada em comparação com versões mais recentes focadas em emoção. Se uma interpretação dramática for central para o projeto, esta geração do IndexTTS não foi otimizada para isso.
  • Verifique a licença do modelo antes da implantação comercial. O código do IndexTTS é lançado sob Apache 2.0, mas os pesos pré-treinados usam uma licença de modelo separada da Bilibili que exige autorização prévia por escrito para uso comercial. Confirme se o seu caso de uso está coberto antes de lançar um produto comercial baseado nele.

IndexTTS vs. seus pares mais próximos

IndexTTSXTTSCosyVoice2F5-TTS
Base da arquiteturaXTTS + Tortoise, estilo GPTReferênciaTokens semânticos supervisionadosFlow matching
Controle de pronúncia em chinêsModelagem híbrida de caracteres e pinyinNão é o focoNão é um recurso específicoNão é um recurso específico
Controle de pausasPor pontuaçãoLimitadoPor instruçãoLimitado
Taxa de erro de palavras (avaliação publicada)A melhor entre os modelos comparadosReferênciaSegundo mais próximoSegundo mais próximo
Similaridade do falanteCompetitiva com os melhores modelosMenorComparávelComparável
Uso comercialOs pesos exigem autorizaçãoVariaApache 2.0Varia conforme a versão

A vantagem específica do IndexTTS em relação aos concorrentes mais próximos é a precisão da pronúncia em chinês e a simplicidade da inferência. A equipe descreve seu processo de treinamento como relativamente direto e seu uso como mais controlável do que o de vários modelos open source semelhantes, uma vantagem prática relevante para equipes que constroem pipelines de produção em vez de demonstrações de pesquisa.

Perguntas frequentes

Quem desenvolveu o IndexTTS?

O IndexTTS foi desenvolvido pelo Departamento de Plataforma de IA da Bilibili (B站), a grande plataforma chinesa de vídeos de anime, games e criadores, e lançado como open source no GitHub e no Hugging Face.

Qual é a diferença entre o IndexTTS-1.0 e o IndexTTS-1.5?

O IndexTTS-1.5, lançado em maio de 2025, é uma atualização voltada a melhorar a estabilidade do modelo e a qualidade da síntese em inglês em relação à versão 1.0 original. A maioria dos novos projetos deve usar a 1.5 como padrão.

Como o IndexTTS trata problemas de pronúncia em chinês?

Por meio da modelagem híbrida de caracteres e pinyin: o modelo é treinado com uma combinação de caracteres chineses e seus equivalentes em pinyin, o que permite fornecer diretamente o pinyin correto para corrigir um caractere polifônico ou incomum pronunciado de forma errada.

O IndexTTS é gratuito para uso comercial?

O código é lançado sob a licença Apache 2.0, mas os pesos pré-treinados usam uma licença separada da Bilibili que exige autorização prévia por escrito para uso comercial. Verifique os termos atuais da licença antes de uma implantação comercial.

Como o IndexTTS se compara ao CosyVoice2 e ao F5-TTS?

Nos benchmarks publicados pela equipe, o IndexTTS alcançou uma taxa de erro de palavras menor do que ambos e permaneceu competitivo especificamente em similaridade do falante, a métrica que mede o quanto a saída clonada corresponde à voz de referência.

Transforme texto em voz com a Echora

Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.

Criar voz a partir de texto →