IndexTTS: O modelo de voz criado dentro da maior plataforma chinesa de vídeos de anime e games
Transforme textos e gravações em áudio pronto para ouvir
Dublagem, stems, covers e efeitos sonoros, tudo no navegador.
- Texto para fala, e também clonagem de voz
- Separe as faixas, ou gere um cover
- Cadastre-se para ouvir primeiro e decidir depois
A Bilibili, plataforma de vídeo que reúne milhões de horas de anime, games e conteúdo de criadores na China, tem um motivo prático e evidente para se importar com texto para fala: dublagem, avatares digitais e locução em escala de plataforma. O IndexTTS é o resultado de tornar pública essa necessidade interna. Desenvolvido pelo Departamento de Plataforma de IA da Bilibili e lançado como open source, ele é um modelo de clonagem de voz zero-shot projetado especificamente em torno de um problema que sistemas TTS multilíngues genéricos costumam tratar mal: pronunciar corretamente textos em chinês com todos os seus caracteres polifônicos e vocabulário de cauda longa.
O que é o IndexTTS?
O IndexTTS é um modelo autorregressivo de texto para fala no estilo GPT, desenvolvido pela equipe Index da Bilibili e construído principalmente sobre as arquiteturas XTTS e Tortoise, com um conjunto de melhorias direcionadas adicionado a essa base. Ele oferece clonagem de voz zero-shot — reproduzindo a voz de um falante a partir de um clipe de referência — em chinês e inglês, e foi treinado com mais de dez mil horas de dados de fala.
O que diferencia o IndexTTS das bases XTTS e Tortoise sobre as quais ele foi construído não é um único recurso de destaque, mas uma série de decisões deliberadas de engenharia, cada uma voltada a um ponto fraco específico dos primeiros TTS open source: precisão da pronúncia em chinês, controle de tempo e estabilidade da clonagem.
A engenharia por trás do IndexTTS
Modelagem híbrida de caracteres e pinyin. Esta é a principal contribuição do IndexTTS. A síntese de texto em chinês tem um problema persistente: caracteres polifônicos — o mesmo caractere lido de formas diferentes conforme o contexto — e vocabulário de cauda longa são frequentemente pronunciados de maneira incorreta por modelos treinados apenas com sequências de caracteres. O IndexTTS trata isso misturando caracteres e pinyin diretamente no treinamento. Durante o pré-processamento, uma parte dos caracteres não polifônicos é substituída aleatoriamente por seus equivalentes em pinyin, ensinando o modelo a usar o pinyin como um sinal de desambiguação que também pode ser fornecido na inferência para forçar uma pronúncia específica.
Controle de pausas por pontuação. O IndexTTS interpreta sinais de pontuação como sinais de tempo, permitindo controlar onde as pausas ocorrem na fala gerada apenas pela forma como o texto de entrada é pontuado, sem exigir uma marcação de tempo separada.
Um pipeline de condicionamento e decodificação reconstruído. O IndexTTS introduz um codificador condicional de fala baseado em Conformer para melhorar a forma como o modelo capta características do falante em um clipe de referência e substitui o decodificador original de códigos de fala pelo BigVGAN2. A equipe atribui a essa mudança melhorias na estabilidade do treinamento, na similaridade do timbre e na qualidade geral do áudio.
FSQ em vez de VQ no tokenizer de fala. A equipe realizou uma comparação direta entre a quantização vetorial padrão (Vector Quantization) e a quantização escalar finita (Finite-Scalar Quantization) na codificação de tokens acústicos de fala, tratando o problema de colapso do codebook que pode prejudicar sistemas baseados em VQ. Essa escolha técnica também influenciou posteriormente o projeto do tokenizer do CosyVoice2.
Desempenho nos benchmarks
Na avaliação publicada pela equipe — que mediu taxa de erro de palavras, similaridade do falante e pontuação média de opinião em conjuntos de teste em inglês e chinês —, o IndexTTS foi comparado diretamente com XTTS, CosyVoice2 (sem streaming), Fish-Speech, FireRedTTS e F5-TTS. Os resultados relatados mostram que o IndexTTS supera todos eles na taxa de erro de palavras, permanecendo competitivo especificamente com o CosyVoice2 e o F5-TTS em similaridade do falante, os dois modelos que os autores identificam como seus pares mais próximos em fidelidade de clonagem.
Vale apontar com franqueza que o artigo original do IndexTTS reconhece diretamente as próprias limitações: no lançamento, o modelo não oferecia geração de voz por instruções, cobria apenas chinês e inglês e tinha capacidade limitada de expressão emocional rica. A atualização IndexTTS-1.5 da equipe, lançada em maio de 2025, foi direcionada especificamente a melhorias de estabilidade e desempenho em inglês em relação à versão inicial 1.0.
Primeiros passos com o IndexTTS
- Configure um ambiente com Python 3.10. Crie um ambiente conda dedicado e instale o
ffmpegpelo gerenciador de pacotes do sistema ou comconda install -c conda-forge ffmpeg. - Trate separadamente a dependência
pyninino Windows, se necessário. Sepip installnão conseguir compilar um wheel parapyninino Windows, instale-o comconda install -c conda-forge pynini==2.1.6e depois executepip install WeTextProcessing --no-deps. Essa é uma solução conhecida documentada diretamente pelo projeto. - Baixe os pesos do modelo. Use
huggingface-cli downloadpara obterIndexTeam/IndexTTS(1.0) ouIndexTeam/IndexTTS-1.5, conforme a versão necessária. O checkpoint 1.5 é a melhor opção padrão para a maioria dos novos projetos, considerando suas melhorias de estabilidade. - Execute a inferência pela CLI ou por Python. A ferramenta de linha de comando
indexttsrecebe diretamente o texto e um arquivo de voz de referência; também é possível chamar a classeIndexTTSno Python para ter mais controle dentro de um pipeline maior. - Use a WebUI para testar antes da integração. Execute
pip install -e ".[webui]" --no-build-isolatione depoispython webui.pypara abrir emlocalhost:7860uma interface no navegador que permite testar a clonagem e o controle de pronúncia sem escrever código.
Dicas para obter resultados melhores
- Use substituições por pinyin de forma deliberada em caracteres polifônicos. Quando um caractere tem várias pronúncias válidas conforme o contexto, fornecer diretamente o pinyin correto é mais confiável do que esperar que o modelo deduza a leitura certa a partir do texto ao redor.
- Pontue o texto de acordo com as pausas que você realmente deseja. Como o IndexTTS interpreta a pontuação como informação de tempo, trate a posição de vírgulas e pontos como uma ferramenta de ritmo, não apenas de correção gramatical. É uma forma de controlar o ritmo que exige menos esforço do que as opções oferecidas pela maioria dos modelos.
- Use o IndexTTS-1.5 como padrão, a menos que tenha um motivo específico para não fazer isso. A versão 1.5 existe especificamente para corrigir problemas de estabilidade e melhorar a saída em inglês do modelo 1.0 original. Há poucos motivos para iniciar um novo projeto com o checkpoint anterior.
- Mantenha expectativas realistas sobre o alcance emocional. A própria documentação do modelo reconhece expressividade emocional limitada em comparação com versões mais recentes focadas em emoção. Se uma interpretação dramática for central para o projeto, esta geração do IndexTTS não foi otimizada para isso.
- Verifique a licença do modelo antes da implantação comercial. O código do IndexTTS é lançado sob Apache 2.0, mas os pesos pré-treinados usam uma licença de modelo separada da Bilibili que exige autorização prévia por escrito para uso comercial. Confirme se o seu caso de uso está coberto antes de lançar um produto comercial baseado nele.
IndexTTS vs. seus pares mais próximos
| IndexTTS | XTTS | CosyVoice2 | F5-TTS | |
|---|---|---|---|---|
| Base da arquitetura | XTTS + Tortoise, estilo GPT | Referência | Tokens semânticos supervisionados | Flow matching |
| Controle de pronúncia em chinês | Modelagem híbrida de caracteres e pinyin | Não é o foco | Não é um recurso específico | Não é um recurso específico |
| Controle de pausas | Por pontuação | Limitado | Por instrução | Limitado |
| Taxa de erro de palavras (avaliação publicada) | A melhor entre os modelos comparados | Referência | Segundo mais próximo | Segundo mais próximo |
| Similaridade do falante | Competitiva com os melhores modelos | Menor | Comparável | Comparável |
| Uso comercial | Os pesos exigem autorização | Varia | Apache 2.0 | Varia conforme a versão |
A vantagem específica do IndexTTS em relação aos concorrentes mais próximos é a precisão da pronúncia em chinês e a simplicidade da inferência. A equipe descreve seu processo de treinamento como relativamente direto e seu uso como mais controlável do que o de vários modelos open source semelhantes, uma vantagem prática relevante para equipes que constroem pipelines de produção em vez de demonstrações de pesquisa.
Perguntas frequentes
Quem desenvolveu o IndexTTS?
O IndexTTS foi desenvolvido pelo Departamento de Plataforma de IA da Bilibili (B站), a grande plataforma chinesa de vídeos de anime, games e criadores, e lançado como open source no GitHub e no Hugging Face.
Qual é a diferença entre o IndexTTS-1.0 e o IndexTTS-1.5?
O IndexTTS-1.5, lançado em maio de 2025, é uma atualização voltada a melhorar a estabilidade do modelo e a qualidade da síntese em inglês em relação à versão 1.0 original. A maioria dos novos projetos deve usar a 1.5 como padrão.
Como o IndexTTS trata problemas de pronúncia em chinês?
Por meio da modelagem híbrida de caracteres e pinyin: o modelo é treinado com uma combinação de caracteres chineses e seus equivalentes em pinyin, o que permite fornecer diretamente o pinyin correto para corrigir um caractere polifônico ou incomum pronunciado de forma errada.
O IndexTTS é gratuito para uso comercial?
O código é lançado sob a licença Apache 2.0, mas os pesos pré-treinados usam uma licença separada da Bilibili que exige autorização prévia por escrito para uso comercial. Verifique os termos atuais da licença antes de uma implantação comercial.
Como o IndexTTS se compara ao CosyVoice2 e ao F5-TTS?
Nos benchmarks publicados pela equipe, o IndexTTS alcançou uma taxa de erro de palavras menor do que ambos e permaneceu competitivo especificamente em similaridade do falante, a métrica que mede o quanto a saída clonada corresponde à voz de referência.
Transforme texto em voz com a Echora
Para um fluxo no navegador com um objetivo semelhante, use o Texto para fala da Echora. Insira até 5.000 caracteres, escolha uma voz integrada ou uma voz personalizada salva, adicione tags de interpretação compatíveis quando necessário e ajuste a estabilidade. Depois, você pode ouvir o resultado e baixar o MP3 final.