EchoraEchora
返回博客
人声分离

如何去除音频中的背景音乐并保留人声

•
阅读约 12 分钟

有时,人声背后的音乐恰恰是你想去除的部分。你可能有一段录音,其中有人在配乐上说话或唱歌,希望更清楚地听到人声,而不必从头重新制作音频。

基于 AI 的背景音乐去除工具,可以通过从成品音频文件中分离人声与音乐伴奏来提供帮助。AI 并不是简单地降低整体音量或应用通用降噪滤镜,而是分析混合录音,估算哪些部分属于人声、哪些属于音乐。

这样就可以从音频中去除音乐,并将以人声为主的结果作为主要输出。

这种方式适合专注于人声的聆听、人声练习、音频分析、编辑,以及其他已获授权的项目。不过,了解这种分离方式能做什么、不能做什么,也很重要。

背景音乐去除工具示意:从音频中去除背景音乐并保留人声,输出仍可能有少量音乐残留
去除背景音乐、保留人声的概念示意。处理后仍可能残留音乐,也可能影响部分人声细节,实际效果取决于源音频。

从音频中去除背景音乐是什么意思?

当人声和音乐一起录制时,通常会合并为一个音频混音。人声背后可能是一条包含鼓、贝斯、吉他、钢琴、合成器、效果声和其他音乐元素的伴奏。

这些部分混合在一起后,就无法通过简单的音量控制,在不影响人声的情况下只关闭音乐。

AI 分离工具会分析成品混音,估算其中的主要组成部分,从而处理这个问题。

Echora 的人声分离器会从一份上传音频中生成两条同步结果:

  • 人声(Vocals)——估算出的人声部分
  • 伴奏(Instrumental)——估算出的音乐伴奏,其中的人声已被减弱

如果目标是保留人声并减弱音乐,就应重点关注人声输出。

这与在音频编辑器中简单地降低背景音乐音量不同。传统音量控制会影响整条音轨或选定的频率范围,而声源分离会尝试区分已经混合在一起的不同声音成分。

结果也应被理解为 AI 估算出的分离音轨,而不是恢复出来的原始录音音轨。系统处理的是成品混音,并不会访问原始录音棚工程。

去除背景音乐与降噪的区别

背景音乐去除工具和降噪工具听起来可能相似,但它们解决的是不同的音频问题。

当不需要的声音本身是音乐时,应使用背景音乐去除。例如,一段人声录音的背景中可能有钢琴、节拍、吉他伴奏或其他音乐编排。

降噪处理的则是不需要的非音乐声音,例如:

  • 风声
  • 嘶声
  • 电流嗡鸣
  • 房间噪声
  • 空调噪声
  • 麦克风噪声

这些声音的特性与音乐编曲不同。

如果录音中有人伴着歌曲说话,去除歌曲属于声源分离问题。如果同一段录音中还有持续的空调嗡鸣,减弱嗡鸣则属于噪声清理问题。

这一区别很重要,因为通用降噪工具不一定是为从复杂音乐中分离人声而设计的。同样,也不应将音乐分离工具描述成适用于所有背景噪声的通用解决方案。

Echora 的人声分离器用于从上传音频中分离人声与音乐伴奏,并不是用来处理视频,也不是通用的环境噪声去除工具。

哪些音频更适合去除背景音乐?

最初使用的源文件,会直接影响分离结果的实用性。

只要条件允许,就应使用你有权处理的、最清晰的音频版本。更干净的源文件能为分离系统提供更多有用信息,而反复压缩和转码可能引入额外的音频伪影。

例如,重度压缩的副本可能已经包含较早版本中不存在的失真或其他变化。AI 在区分人声与音乐的同时,还需要处理这些变化。

编曲本身也会增加分离难度。

简单的人声配上轻柔背景音乐,可能比包含鼓、吉他、多层和声、强烈效果和持续乐器音的密集制作更容易分离。

人声和音乐也可能占据重叠的频率范围。演唱者的声音可能与钢琴、吉他、合成器、镲片或其他乐器共享频段。混响和延迟还会将人声与音乐进一步扩散到混音中。

因此,同一款背景音乐去除工具,在不同录音上也可能得到不同结果。

实用原则很简单:从能够获得的最佳源文件开始,通过试听判断最终结果,而不要假定每段录音都能以完全相同的方式分离。

如何去除音频中的音乐并保留人声

准备好合适的音频文件后,操作流程很直接。

步骤 1:选择你有权处理的音频文件

先选择一段你拥有相关权利或已获处理许可的录音。

去除录音中的音乐,不会改变底层词曲或录音的版权状态。如果打算发布、分发或商业使用处理结果,应确保拥有必要的权利。

步骤 2:将音频上传到 Echora

打开人声分离器,上传音频文件。

Echora 支持 MP3、WAV、M4A、AAC 和 FLAC 文件,大小上限为 50 MB,时长上限为 30 分钟。

如果同一段录音有多个版本,应选择最清晰的源文件,而不是经过反复压缩或转码的副本。

步骤 3:开始分离

提交录音,让 AI 分析成品混音。

系统会估算人声和伴奏部分,并生成对应结果。

这与手动尝试使用 EQ 或滤镜去除音乐有重要区别。分离过程并不是只针对几个频段,而是利用混合录音中更完整的声音结构。

目标不是重新制作一条新的人声音轨,也不是生成替代音乐,而是估算成品音频中已经存在的组成部分。

步骤 4:试听以人声为主的结果

处理完成后,先试听人声结果,再决定是否下载。

Echora 的同步混音器允许你对照人声和伴奏输出,调整它们的相对音量、将任意一条结果静音,并通过波形跳转到不同段落。

这样更容易判断哪些部分有效减弱了音乐,以及哪些部分仍能听到一些伴奏。

步骤 5:下载结果

检查重要段落并确认结果满足需求后,即可下载分离后的音频。

对于以人声为主的项目,应该使用人声结果。

如何检查背景音乐是否去除得当

有用的分离结果不只是音乐变小了,还需要检查人声是否保持清晰、自然。

先试听录音中的几个不同部分,不要只根据一个容易处理的段落判断结果。

重点检查以下方面。

聆听残留音乐

留意容易辨认的乐器,例如:

  • 吉他
  • 钢琴
  • 鼓
  • 贝斯
  • 合成器
  • 其他伴奏

结果中可能仍有少量音乐残留,尤其是在密集的段落中。关键是结果是否适合你的预期用途。

检查人声是否发生变化

去除音乐有时也会影响人声的某些部分,因为这两个声源在原始混音中可能存在重叠。

留意以下方面的变化:

  • 人声清晰度
  • 高频细节
  • 低频厚度
  • 辅音
  • 持续音
  • 人声动态

如果人声的重要部分也受到了损伤,那么背景音乐更少的结果,并不一定更好。

检查伴唱

背景和声的分离表现可能与主唱不同。

根据编曲的不同,它们可能仍然清晰可闻,可能变轻,也可能部分融入分离结果之中。

对照较难处理的段落

副歌、密集的乐器段落、效果较重的部分,以及混响明显的片段,都特别适合用来检查分离效果。

将原始录音与分离输出的同一段落对照,会更容易听出细微变化。

为什么仍可能残留部分背景音乐?

AI 分离并不是打开原始录音棚工程,找出一条隐藏的音乐音轨,而是从成品混音中估算不同组成部分。

这一区别也解释了为什么处理后仍可能保留一些音乐素材。

人声与乐器可能在频率、时间和空间信息上重叠。人声周围还可能有混响、延迟、和声或其他效果,使系统难以准确判断哪些声音属于演唱者、哪些属于伴奏。

密集的编曲还会带来另一项挑战。当多件乐器与人声占据相近的频谱区域时,要将它们完全分离就会更加困难。

经过强烈处理的录音也是如此。压缩、削波、失真和其他混音处理,都会成为待分析信号的一部分。

因此,不应期待每段录音都能生成完全没有音乐的人声音轨。

更实用的判断方式是问:

人声是否仍然足够清晰,能够满足我的使用目的?

对于日常聆听或练习,少量音乐残留可能可以接受。要求更高的制作流程,则可能需要更干净的源素材或进一步编辑。

保留人声后的音频有哪些用途?

音乐被减弱后,分离出的人声可以用于多个方面。

用于人声练习时,你可以更专注于发音、节奏把握、乐句处理、旋律和表达方式,不受完整音乐编排的干扰。

用于音频分析时,以人声为主的音轨可以让单独的表演细节更容易研究。

用于编辑时,如果某个已获授权的创意项目需要更细致地控制人声部分,分离结果可以作为项目素材使用。

在比较同一人声如何与不同音乐编排配合时,它也可以作为参考。

重要的是让结果符合你的实际用途。AI 分离生成的是从原始混音中估算出的组成部分,因此,不应自动将输出视为未经处理的录音棚人声录音。

即使从技术上很容易分离音频,你是否有权再次使用底层录音,仍是另一回事。发布或商业使用结果,依然取决于原始素材所附带的权利。

背景音乐去除工具与人声分离器是一回事吗?

这两个术语密切相关,因为都涉及从混合录音中分离人声和音乐,但描述目标结果的角度略有不同。

背景音乐去除工具强调的是任务:

减弱音乐,同时保留人声。

人声分离器强调的是输出:

分离并保留人声部分。

实际使用中,它们可以描述同一种两轨分离流程。

Echora 的人声分离器会从上传录音中同时生成人声和伴奏结果。因此,如果目标是保留声音并减弱音乐伴奏,就可以使用人声这一侧的输出。

这与更全面的音轨分离器不同,后者旨在将音乐拆分为人声、鼓、贝斯、吉他、钢琴和其他乐器等多个类别。

因此,应根据实际需要的输出选择合适流程。如果只需要将人声与音乐分开,生成人声和伴奏两条结果的流程,比完整的多轨分离更直接。

常见问题

可以从任何音频中去除背景音乐吗?

你可以尝试对许多录音进行音乐分离,但结果会随源音频的不同而变化。音频质量、编曲复杂程度、人声效果、混响、伴唱以及重叠频段,都可能影响结果。

AI 可以完全去除背景音乐吗?

不一定。AI 是从成品混音中估算音乐和人声部分,因此,分离后的人声输出中可能仍然存在一些音乐。复杂编曲和较重的效果会让完全分离更加困难。

人声会与原来完全一样吗?

不一定。如果人声与音乐在原始混音中相互重叠,分离过程中可能会影响一些人声细节。应始终先试听结果,并与原始录音对照。

去除背景音乐与降噪是一回事吗?

不是。背景音乐去除旨在将音乐伴奏与人声分开。降噪则针对嘶声、嗡鸣、风声或房间噪声等不需要的声音。它们是不同的音频处理任务。

从音频中去除音乐的最佳方法是什么?

对于已获授权的录音,AI 人声分离工具可以分析成品混音,并分离人声和伴奏部分。先选择能够获得的最清晰源文件,仔细试听输出,并在下载前检查较难处理的段落。

分离后的人声可以商用吗?

这取决于原始录音和词曲所附带的权利。使用 AI 分离音频,不会自动赋予你发布、分发或商业使用源素材的许可。

使用 Echora 去除背景音乐并保留人声

从混合录音中去除音乐,并不一定要手动反复尝试滤镜和均衡器。

使用 Echora 的人声分离器,可以上传已获授权的音频文件,让 AI 分离人声与伴奏部分,试听以人声为主的结果,并在符合需求时下载。

为了获得更可靠的处理流程,应从干净的源文件开始,检查录音中的多个不同段落,同时关注结果的两个方面:音乐还残留多少,以及人声是否自然地保留了下来。

试用 Echora 人声分离器