EchoraEchora
返回模型列表

IndexTTS:诞生于中国最大动漫与游戏视频平台的声音模型

2026年8月28日
•
8 分钟阅读

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

B 站是中国承载了数百万小时动漫、游戏和创作者内容的视频平台,自然有非常现实的理由重视文本转语音:满足平台规模的译制配音、数字人和旁白需求。IndexTTS 正是这项内部需求走向公开的成果。它由 B 站 AI 平台部开发并以开源形式发布,是一个零样本声音克隆模型,专门针对通用多语言 TTS 系统往往难以处理的问题而设计——准确读出包含大量多音字和长尾词汇的中文文本。

什么是 IndexTTS?

IndexTTS 是由 B 站 Index 团队开发的 GPT 风格自回归文本转语音模型,主要基于 XTTS 和 Tortoise 架构,并在其上加入了一系列有针对性的改进。它支持中英文零样本声音克隆——根据参考片段复现说话人的声音——并使用超过一万小时的语音数据进行训练。

IndexTTS 与其所基于的 XTTS 和 Tortoise 的区别,并不在于某一项最醒目的功能,而在于一系列经过深思熟虑的工程选择;每一项都针对早期开源 TTS 的某个具体弱点:中文发音准确性、可控的时间节奏和克隆稳定性。

IndexTTS 背后的工程设计

汉字-拼音混合建模。 这是 IndexTTS 最具代表性的贡献。中文文本合成一直存在一个问题:完全基于汉字序列训练的模型,经常会读错多音字(同一个字会根据上下文采用不同读音)和长尾词汇。IndexTTS 在训练中直接混合汉字和拼音来解决这个问题——预处理期间,一部分非多音字会被随机替换成对应拼音,让模型学会将拼音作为消歧信号;在推理时,模型也能接收拼音来强制指定某个读音。

基于标点的停顿控制。 IndexTTS 会把标点符号作为时间信号读取,只需改变输入文本中的标点方式,就能控制生成语音的停顿位置,无需单独的时间标记。

重新构建的条件编码与解码流程。 IndexTTS 引入基于 Conformer 的语音条件编码器,以改善模型从参考片段中捕捉说话人特征的方式;同时用 BigVGAN2 替换原有的语音编码解码器。团队认为,这项改动提升了训练稳定性、音色相似度和整体音频质量。

语音 tokenizer 使用 FSQ 而非 VQ。 团队直接比较了用于编码声学语音 token 的标准向量量化(Vector Quantization)与有限标量量化(Finite-Scalar Quantization),以解决可能降低 VQ 系统表现的码本坍塌问题——这一技术选择后来也影响了 CosyVoice2 的 tokenizer 设计。

基准测试表现

在团队公布的评测中,测试指标包括中英文测试集上的单词错误率、说话人相似度和平均意见得分。IndexTTS 与 XTTS、CosyVoice2(非流式)、Fish-Speech、FireRedTTS 和 F5-TTS 进行了直接比较。报告结果显示,IndexTTS 的单词错误率优于所有这些模型;在说话人相似度方面,它与 CosyVoice2 和 F5-TTS 保持竞争力,而作者认为这两个模型是声音克隆保真度方面最接近的对手。

也需要如实指出:原始 IndexTTS 论文直接承认了自身限制——发布时,模型不支持指令式声音生成,只覆盖中文和英语,丰富情感表达能力也有限。团队于 2025 年 5 月发布的 IndexTTS-1.5 更新,专门针对初始 1.0 版本改进了稳定性和英语表现。

IndexTTS 入门

  1. 配置 Python 3.10 环境。 创建独立的 conda 环境,并通过系统包管理器或 conda install -c conda-forge ffmpeg 安装 ffmpeg。
  2. 如有需要,单独处理 Windows 上的 pynini 依赖。 如果在 Windows 上运行 pip install 时无法为 pynini 构建 wheel,请先执行 conda install -c conda-forge pynini==2.1.6,再执行 pip install WeTextProcessing --no-deps——这是项目直接记录的一种已知解决方法。
  3. 下载模型权重。 使用 huggingface-cli download 拉取 IndexTeam/IndexTTS(1.0)或 IndexTeam/IndexTTS-1.5,具体取决于你需要的版本;鉴于稳定性有所改进,1.5 checkpoint 是大多数新项目更合适的默认选择。
  4. 通过 CLI 或 Python 运行推理。 indextts 命令行工具可以直接接收文本和参考声音文件;如果需要在更大的流程中进行更多控制,也可以从 Python 调用 IndexTTS 类。
  5. 集成前使用 WebUI 测试。 先执行 pip install -e ".[webui]" --no-build-isolation,再运行 python webui.py,即可在 localhost:7860 打开浏览器界面,无需编写代码便能测试克隆和发音控制。

获得更好结果的技巧

  • 有意识地用拼音覆盖多音字读音。 当一个字会根据上下文产生多个有效读音时,直接提供正确拼音,比期待模型根据前后文推断出正确读音更可靠。
  • 用标点设置你真正想要的停顿。 IndexTTS 会把标点作为时间信息读取,因此应将逗号和句号的位置视为节奏控制工具,而不只是语法正确性问题——与多数模型提供的方法相比,这是一种成本更低的节奏控制方式。
  • 除非有明确理由,否则默认使用 IndexTTS-1.5。 1.5 版本就是为了解决原始 1.0 版本的稳定性问题并改进英语输出而发布的——新项目几乎没有理由从更早的 checkpoint 开始。
  • 对情感范围保持现实预期。 模型自己的文档承认,相比更近发布、专注情感的模型,它的情感表现力有限——如果戏剧化表达是项目核心,这一代 IndexTTS 并未针对该需求优化。
  • 商用部署前检查模型许可证。 IndexTTS 的代码采用 Apache 2.0 许可证发布,但预训练模型权重使用单独的 Bilibili 模型许可证,商业使用需要事先获得书面授权——将它用于商业产品之前,请确认你的使用场景已获得许可。

IndexTTS 与最接近的同类模型对比

IndexTTSXTTSCosyVoice2F5-TTS
架构基础XTTS + Tortoise,GPT 风格基准受监督语义 token流匹配
中文发音控制汉字-拼音混合建模并非重点没有专用功能没有专用功能
停顿控制通过标点有限通过指令有限
单词错误率(已发布评测)对比模型中最佳基准紧随其后紧随其后
说话人相似度与顶尖模型保持竞争力较低相当相当
商业使用权重需要授权因版本而异Apache 2.0因版本而异

与最接近的竞品相比,IndexTTS 的具体优势在于中文发音准确性和推理简洁性——团队认为它的训练过程相对直接,用法也比多个开源同类模型更可控;对于构建生产流程而非研究演示的团队来说,这是一个具有实际意义的优势。

常见问题

IndexTTS 由谁开发?

IndexTTS 由 B 站(Bilibili)AI 平台部开发。B 站是中国主要的动漫、游戏和创作者视频平台;该模型已在 GitHub 和 Hugging Face 上开源发布。

IndexTTS-1.0 与 IndexTTS-1.5 有什么区别?

IndexTTS-1.5 发布于 2025 年 5 月,是一次重点改进模型稳定性和英语合成质量的更新;相比原始 1.0 版本,大多数新项目都应默认选择 1.5。

IndexTTS 如何处理中文发音问题?

它采用汉字-拼音混合建模——模型使用中文汉字及其拼音混合训练,因此你可以直接提供正确拼音,修正读错的多音字或生僻字。

IndexTTS 可以免费商用吗?

代码采用 Apache 2.0 许可证发布,但预训练模型权重使用单独的 Bilibili 许可证,商业使用需要事先获得书面授权——商用部署前请检查当前许可证条款。

IndexTTS 与 CosyVoice2 和 F5-TTS 相比如何?

在团队公布的基准测试中,IndexTTS 的单词错误率低于这两个模型,同时在说话人相似度方面仍与它们保持竞争力;这一指标衡量克隆结果与参考声音的接近程度。

在浏览器中把文字转换为语音

如果你希望完成相近的“文字 → 单人语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择内置音色或已保存的自定义音色,按需添加支持的表达标签并调整语音稳定度,然后试听结果并下载生成的 MP3。

开始生成语音 →