LOVO AI (Genny):在一个浏览器标签页中完成旁白、视频制作与声音克隆
LOVO AI 是一家位于美国加利福尼亚州伯克利的公司,由 Charlie Choi 和 Tom Lee 于 2019 年创立,并于 2021 年 8 月完成了由 Kakao Entertainment 和 LG CNS 领投的 450 万美元 Pre-Series A 轮融资。其产品 Genny 着手解决一个具体的工作流问题:制作一支带有旁白的完整视频,通常意味着要在文字转语音工具、视频编辑器和字幕工具之间来回切换,每一步都得导出文件,再重新导入。Genny 将这一切——脚本撰写、语音生成、视频编辑和自动字幕——整合进同一个浏览器工作区,面向不想为了完成一支视频而管理三份独立订阅的社交媒体创作者、营销人员和在线学习团队。
LOVO AI (Genny) 的功能优势
- 语音生成与视频编辑共用一个工作区。 生成的旁白会直接放到时间线上,与视频素材和音乐并列,无需从一个工具导出后再导入另一个工具。
- 规模大、覆盖广的声音库。 500+ 种声音覆盖 100+ 种语言,并提供 30+ 种预设情绪风格,无需克隆声音,就能满足多种口音和使用场景的需求。
- Pro V2 的自然语言指导带来了真正不同的交互方式。 你不再需要一点点调整音高、语速和重音滑块,而是直接在脚本里写入
[sobbing]、[british accent]或[speak more slowly and sound nervous]这样的方括号指令,由模型理解并执行。 - 通过短样本克隆声音。 使用大约一分钟的录音即可创建自定义声音,在包含该功能的套餐中,可以将其重复用于不限数量的项目。
- 自动字幕与同一次语音生成调用关联。 字幕与旁白使用同一份脚本和时间数据生成,无需另行执行转录。
- 同一标签页内提供 AI 脚本写作和图像生成工具。 制作短内容时,甚至在开始生成语音之前,就能在工作区内完成脚本初稿和背景画面,无需离开当前页面。
Genny 可通过指令控制的声音与编辑器如何运作
这里更值得关注的技术部分是 2025 年 5 月推出的 Pro V2,它把语音指导重新定义为语言理解问题,而不是参数调节问题。较早的 TTS 界面——包括 LOVO 自己早期的声音——会把情绪和表达方式放在脚本之外,通过单独的滑块或预设来调整。Pro V2 则接受直接写在正文中的方括号指令,并将其放在所作用的文本之前,例如:[laughing and joking around] hahaha, and he said what? 或 [super embarrassed] I can't believe I just did that. 模型会像演员阅读舞台指示一样理解括号中的指导,随之调整表达方式、节奏以及笑声或啜泣等非语言声音;它还可以为同一句台词生成多个版本,让你选择最合适的演绎,而不必接受第一次输出。
Genny 的视频部分也围绕同样的“单次调用”原则构建:由于旁白、对应的时间数据和脚本都来自同一个生成步骤,自动字幕可以直接从这些数据中得出,无需事后单独执行语音转文字,时间线编辑器也能将生成的音频精确放置到视频素材的对应位置,省去手动同步。这就是一体化架构的实际价值——它的重点并不在于某个单项功能是否同类最佳,而在于消除把三家公司分别开发的 TTS 工具、视频编辑器和字幕生成器拼在一起时,反复导出和重新对齐带来的麻烦。
让 Genny 的声音获得更好效果的技巧
- 把方括号指令写成舞台指示,而不只是情绪标签。
[speak warmly, as if reassuring a nervous client]比[nervous]这样的单个词能给模型提供更多依据,因为它是在理解自然语言,而不是从固定情绪列表中选择一项。 - 对情绪分量重的台词生成多个版本。 Pro V2 支持为每句台词生成多个版本,正是因为每次生成的表达可能不同;对于最看重语气的台词,应把第一次结果当作初稿,而非定稿。
- 在确定项目用声之前,从 500+ 种声音中挑选多种试听。 评测者一直指出,相比声音筛选更严格的平台,LOVO 声音库内部的质量差异更大,因此,最适合你内容的声音未必是排在前面或默认选中的那一个。
- 即使技术上只需一分钟,也要在安静的房间里用质量过得去的麦克风录制克隆源音频。 与任何短样本克隆方法一样,这一分钟里的背景噪声会直接融入最终生成的声音。
- 为渲染预留缓冲时间,尤其是导出较长的 1080p 视频时。 云端渲染速度会随服务器负载变化,据报告,在使用高峰期导出较长视频时,耗时会明显增加。
LOVO AI (Genny) 与 Descript Overdub 对比
| LOVO AI (Genny) | Descript Overdub | |
|---|---|---|
| 核心工作流 | 在同一工作区内从脚本到语音,再到视频 | 通过转录文本编辑已有录音 |
| 声音克隆 | 约 1 分钟,可克隆任何已获得本人同意的声音 | 仅限自己的声音,设计上就设有同意验证门槛 |
| 视频处理 | 内置时间线编辑器,用于创建新视频 | 通过转录文本编辑已有视频或音频 |
| 最适合 | 从零开始,基于脚本和旁白制作视频 | 修正已经录制的内容,或为其添加旁白 |
| 情绪指导 | 方括号内的自然语言提示(Pro V2) | 在真实录音中插入语音,并匹配衔接处 |
这两款工具都将语音生成整合进更广泛的编辑环境,而不是把它作为独立功能提供,但它们解决的是不同制作阶段的问题。Genny 面向从零创建视频的流程——脚本、语音、画面和字幕一起生成。Overdub 则用于修正已录制的音频,或为其添加旁白,并且特意把克隆限制为用户自己的声音,以避免同意授权方面的问题,而这正是 LOVO 当前法律纠纷的核心。如果你的工作流从一张白纸开始,Genny 的一体化方式更直接匹配需求;如果起点是一段只需修正的已有录音,Overdub 解决的则是更集中、更具体的问题。
常见问题
LOVO AI (Genny) 还在运营吗?
截至本文撰写时,Lovo Inc. 在面临涉嫌未经授权克隆声音的集体诉讼期间,已申请 Chapter 7 破产(清算程序),相关诉讼也因此中止。其网站仍可访问,但关于服务可靠性和账户访问情况的反馈并不一致;在将它用于付费项目或正式制作之前,请先核实当前状态。
LOVO AI (Genny) 用来做什么?
Genny 用于在一个浏览器工作区内,端到端制作带有旁白的视频,涵盖脚本撰写、文字转语音旁白、声音克隆、视频编辑和自动字幕生成。
LOVO AI 的声音克隆如何运作?
使用大约一分钟的录音即可创建自定义声音;之后,在包含该功能的套餐中,生成的声音模型可以在多次生成中重复使用。
什么是 Pro V2 声音?
Pro V2 是 LOVO 于 2025 年 5 月推出的可通过指令控制的文字转语音引擎,接受直接写在脚本中的方括号自然语言指令,例如 [sobbing] 或 [british accent],无需另行使用情绪或节奏控制项。
LOVO AI (Genny) 支持多少种声音和语言?
声音库提供覆盖 100+ 种语言的 500+ 种声音;除 Pro V2 的自然语言指导外,标准声音还提供 30+ 种预设情绪风格。
使用 Echora 为视频生成旁白
如果希望在浏览器中完成类似的“脚本 → 语音”流程,可以使用 Echora 的文字转语音。输入最多 5,000 个字符,选择声音并生成旁白。试听结果后,下载 MP3,即可将其用于你的视频编辑器。