EchoraEchora
返回模型

Kokoro TTS:好听的 TTS 模型不一定需要 GPU

2026年8月27日
阅读约 7 分钟

把文字和录音,做成能听的作品

配音、分轨、翻唱和音效,都在浏览器里完成。

  • 文字转语音,也能克隆音色
  • 分离音轨,或直接生成翻唱
  • 注册就能试听,先听再决定
免费开始创作

大多数开源语音模型都假设你有一块闲置的 GPU。Kokoro 不作这样的假设——它只有 8200 万参数,小到可以舒适地运行在 CPU 上,甚至包括多年前的笔记本电脑;同时,它还在 Hugging Face TTS Arena 排行榜上攀升至榜首,与参数规模数倍于它的模型竞争。如果你的项目需要自然的语音,却不想部署 GPU 基础设施,这个模型正是为该限制而生。

Kokoro 是什么?

Kokoro-82M 是由开发者 hexgrad 发布的开放权重文本转语音模型,采用 Apache 2.0 许可证——这意味着它可免费用于商业用途、修改和自托管,无需支付版税,闭源部署也不受限制。它采用结合 StyleTTS 2 与 ISTFTNet 的仅解码器架构;尽管体积约为 327MB,自 v1.0 发布以来,它生成的干净 24kHz 音频依然能与参数规模大得多的模型相媲美。

其名称在日语中意为“心”或“精神”——呼应了该项目的目标:让足够小、可以随处运行的模型,也能输出真正富有表现力的语音。

小模型,真实能力

Kokoro 最醒目的数字是 8200 万参数,但更实用的数字在于这种规模能带来什么:

  • 覆盖 8 种语言的 54 个声音——包括美式与英式英语、法语、日语、韩语和普通话——全部装在一个约 327MB 的权重文件中,而不是每种语言分别下载。
  • 原生 CPU 性能。 Kokoro 可在普通 CPU 硬件上以实时或更快速度运行;若有 GPU 可用,显存占用也低于 2GB——这只是同等质量模型通常所需资源的一小部分。
  • 每次生成 510 token 的生成窗口,足以生成较长的旁白片段,无需逐 token 流式处理。
  • ONNX 支持,借助社区 kokoro-onnx 包,即使在 Apple Silicon 等受限硬件上也能获得接近实时的性能。

这种体积的取舍值得预先了解:Kokoro 不支持零样本声音克隆,情绪表现范围比更大的表现型模型窄,非英语语言的质量通常也不如英语输出成熟。它针对高效、可靠的旁白进行了优化,而不是戏剧化演绎或即时声音克隆。

开始使用 Kokoro

  1. 先安装系统依赖。 Kokoro 依赖 espeak-ng 进行音素化——在安装 Python 包之前,通过系统包管理器安装它(Debian/Ubuntu 上使用 apt-get install espeak-ng),否则文本到音素转换时的设置会静默失败。
  2. 安装 Kokoro 包。 pip install kokoro soundfile 可安装核心依赖;如需日语或中文支持,请额外安装 misaki[ja]misaki[zh]
  3. 初始化管线并生成。 使用语言代码加载 KPipeline(美式英语为 'a',英式英语为 'b',以此类推),传入文本和 af_heartbm_george 等声音名称,Kokoro 会直接返回音频——从安装到生成 .wav 文件通常只需五行 Python。
  4. 生产环境可考虑 ONNX 或 Docker 路径。 对于仅 CPU 环境或希望简化部署的场景,社区维护的 kokoro-onnx 包或 kokoro-fastapi Docker 镜像(提供兼容 OpenAI 的语音端点)比自行连接原始管线更快地让服务运行起来。
  5. 尽早测试目标硬件。 Kokoro 确实可以在十年前的 CPU 这样有限的硬件上使用,但在决定采用它前,先在实际部署目标上确认可接受的延迟,能避免之后出现意外。

获得更好结果的技巧

  • 注意孤立的单词输入。 Kokoro 的音素化器针对自然句子语境进行了调校——单独输入一个单词或数字(例如单独的 “six”)偶尔可能出现误读或重音异常。使用完整句子而非片段可以避免这种情况。
  • 将长内容分块。 对于书籍或文章长度的旁白,将文本分为段落或章节大小的片段,而不是一次输入一个巨大文本——这样能让生成更可预测,也不会超出每次处理的 token 窗口。
  • 有意识地选择声音,而非沿用默认值。 有 54 个声音可选,花几分钟用实际脚本文本测试两三个候选声音是值得的——不同名称的声音质量差异明显,最合适的并不总是第一个尝试的。
  • 不要期待零样本克隆。 如果项目的核心需求是克隆某个人的声音,Kokoro 并不是合适的基础模型——应搭配专注克隆的模型,或者只在固定声音库足够的旁白场景中使用 Kokoro。
  • 若要替代云端 TTS 供应商,可使用兼容 OpenAI 的 API 封装。 kokoro-fastapi 专门设计为本地替代兼容 OpenAI 风格 TTS API 的方案,因此能尽量减少现有集成代码的改动。

Kokoro 与其他轻量及克隆导向模型的对比

Kokoro-82MChatterbox TurboChatterbox / Dia
参数量8200 万3.5 亿5 亿–16 亿
可在 CPU 上运行是,原生支持面向 GPU面向 GPU
声音克隆是,零样本
语言8 种英语英语(Multilingual:23 种)
最适合离线旁白、边缘设备、成本敏感型部署实时语音智能体富有表现力的对话、克隆声音
许可证Apache 2.0MITApache 2.0 / MIT

Kokoro 并不试图在克隆或情绪表现范围上竞争——它的全部价值在于,在其他模型根本无法运行的硬件上,提供扎实、可靠的 TTS。如果克隆或戏剧化表现力是优先事项,更大的模型会更合适;如果优先事项是“低成本、随处、长期运行”,Kokoro 很难被超越。

常见问题

Kokoro 真的可以不使用 GPU 运行吗? 可以。Kokoro 专为在 CPU 硬件上高效运行而设计,包括较旧的机器,速度可达实时或接近实时——GPU 是可选项,而非必需项。

Kokoro 支持声音克隆吗? 不支持。Kokoro 提供固定的 54 个内置声音,而不是从参考片段进行零样本克隆。若需要克隆声音,Chatterbox 等模型会更合适。

Kokoro 支持哪些语言? 支持 8 种语言,包括美式英语、英式英语、法语、日语、韩语和普通话;英语通常能提供最成熟的输出质量。

Kokoro 可以免费商用吗? 可以。它采用 Apache 2.0 许可证发布,允许商业部署、修改和闭源集成,且无需支付版税。

大规模运行 Kokoro 的成本是多少? 自行托管时,Kokoro 的运行成本较低——社区报告称,在低价 GPU 实例上的成本可低至每小时几美分;API 提供商也曾以每百万输入字符不到 1 美元的价格提供它。

体验类似的文本转语音功能

Kokoro 可通过其开源实现和社区工具使用。如果想在浏览器中创建语音,可以试用 Echora AI 文字转语音 这一类似功能。它不是 Kokoro,也不提供该模型专属的声音、运行特征或自托管选项,但无需在本地配置模型即可创建 AI 语音音频。

探索 AI 文字转语音 →