YouTube 转伴奏:把任意歌曲做成卡拉OK music
2026-08-04
YouTube 上没有"伴奏版"按钮。如果你想跟着某首歌唱——一首从来没发行过官方伴奏的歌、一首翻唱、或者一首本地点唱机根本没收录的外语歌——你只能自己做伴奏。
好消息是,这件事现在只要两步,五分钟搞定,而且不花钱。第一步是把歌曲变成音频文件,第二步是把这个文件丢给 AI 模型,让它把人声和其他所有声音分开。
快速答案
- 复制这首歌的 YouTube 链接。
- 用 OnlyMP3.tools 转成 320 kbps 的 MP3。 这一步选什么码率,比平时听歌重要得多,下面细说。
- 把 MP3 上传到 AI 人声分离工具,比如 SongToKaraoke,它会把音轨拆成人声和伴奏两部分。
- 下载伴奏那一轨,这就是你的卡拉OK music。
整个流程就这些。剩下的篇幅解释每一步为什么这么做、哪些歌能分得干净、以及结果不对劲时该怎么办。
为什么不能"直接把人声调小"
老一辈做伴奏的招数叫中置声道消除。主唱人声通常混在正中间,也就是左右声道的信号完全一样。把一个声道减去另一个,任何完全居中的声音都会被抵消——包括人声。
这招勉强能用,也正因如此,早在 AI 出现之前就有一堆免费的"消音"工具。但它有两个致命问题:
- 正中间的其他东西也一起没了。 底鼓、军鼓、贝斯基本上也都是居中的。你把歌手干掉的同时,整个节奏组也没了。
- 混响还留着。 人声的混响尾巴是立体声而不是居中的,所以你会听到一层幽灵般的演唱回音,但没有演唱本体。听起来相当阴间。
现在的 AI 分离走的是完全不同的路子。Demucs 这类模型是拿几万首有独立分轨的歌训练出来的,所以它学会的是人声听起来是什么样,而不是人声待在立体声场的哪个位置。它靠声音特征把人声抠出来,鼓、贝斯和其他乐器原封不动。
实际差距非常明显。中置消除给你一段单薄、空洞、没有鼓的东西;AI 分离给你的,听着就是真正的伴奏。
第一步:把歌下载成 MP3
把 YouTube 链接粘进 OnlyMP3.tools,选码率,下载。
选 320 kbps。 平时听歌,192 和 320 的区别绝大多数人听不出来,我们通常也说按需选就行。但人声分离是个例外,原因如下。
MP3 压缩的原理,是丢掉编码器判断你不会注意到的音频信息。码率越低丢得越多——尤其是高频部分,以及那些被更响的声音掩蔽掉的弱信号段落。而这些地方,恰恰就是分离模型用来区分"人声"和"吉他"的依据。你喂给它一个 128 kbps 的文件,等于是要它从已经被故意扔掉的数据里把人声重建出来。
失真会表现为伴奏里一种水声般的、飘忽的质感,在镲片和混响尾音上最明显。道理跟你不该去修一张已经被低质量 JPEG 压过五轮的照片一样。
想完整了解每个码率档位到底牺牲了什么,可以看OnlyMP3 码率指南。
还有一点要知道:源视频的质量是你抬不高的天花板。 如果这首歌是别人拿低质量音源传上 YouTube 的,你选 320 kbps 只会得到一个体积很大的烂音频。尽量找官方艺人频道,或者官方的 "Artist - Topic" 频道——那些通常是唱片公司母带直接推送的。
第二步:分离人声
把 MP3 上传到 AI 分离工具。SongToKaraoke 就是专门干这个的——传一首歌,它给你一份可以直接下载、直接开唱的无人声伴奏。如果你连鼓和贝斯也想要单独文件,也有做多轨拆分的通用工具,但做卡拉OK只需要两轨就够。
处理时间一般在半分钟到几分钟之间,取决于歌有多长。模型跑在服务器上,所以手机性能差不影响。
你拿回来的是一条伴奏轨:同一首歌,同样的速度、同样的调、同样的编曲,只是没有了主唱。
哪些歌能分干净,哪些不行
效果因曲风和制作方式差别很大。这是决定你满不满意的最大变量。
| 歌曲类型 | 通常效果 | 原因 |
|---|---|---|
| 现代流行、嘻哈、电音 | 极好 | 多轨制作干净,人声混得独立,训练数据也最多 |
| 摇滚、金属 | 好 | 人声分得出来;失真很重的吉他偶尔会干扰模型 |
| 民谣、创作歌手 | 好到一般 | 人声和木吉他频段重叠,会有一些串音 |
| 带管乐的爵士、灵魂乐 | 一般 | 萨克斯、小号的音域和人声重叠 |
| 合唱、歌剧、大量阿卡贝拉 | 差 | 当"乐器"本身也是人声,就没什么可分的 |
| 现场录音、私录版 | 差 | 观众噪音和场地串音污染了每一轨 |
| 1965 年前的老单声道录音 | 一般到差 | 所有声音挤在一个声道里,还有很重的磁带压缩 |
大原则是:原始录音里人声越独立,模型就越能把它还原出来。 在隔音棚里分开录的棚制流行歌能分得非常漂亮;1958 年用两支麦克风录的现场爵士就不行。
"效果好"到底是什么水平
就算分得很干净,也不等于官方发行的伴奏版。你应该预期到:
- 响的段落偶尔有人声残影,尤其是长音。
- 镲片会稍微发闷。 高频正是人声和镲重叠最多的地方,模型有时会削过头。
- 和声可能保得住,也可能保不住。 大多数模型把和声和叠录人声都算作"人声",会连着主唱一起去掉。如果这首歌的副歌靠的就是层层叠叠的和声,伴奏会显得很空。
自己在家唱、聚会唱、或者练歌,这些都无所谓。但如果你打算把演唱录下来发出去,先把整轨从头到尾仔细听一遍。
常见用途
- 家庭卡拉OK:唱那些点唱平台没有版权的歌——外语歌、独立发行、专辑里的冷门曲目。
- 练声。 歌手用伴奏按原速、原编曲练歌,比用钢琴缩谱真实得多。
- 试音和翻唱。 用原曲提取的伴奏,效果远好过 MIDI 做的粗糙模拟。
- 音乐教学。 课上放伴奏,房间里唯一的人声就是学生自己的。
- 舞蹈和编舞,人声反而干扰数拍子。
出问题怎么办
伴奏里还隐约有人声。 一般是源文件质量的问题。找一个画质音质最好的版本,重新用 320 kbps 下一遍再试。如果这首歌本身是很密的现场混音、或者和声特别多,那可能就到极限了。
伴奏听起来单薄、像"泡在水里"。 典型的低码率输入失真。检查一下你下的是多少码率,如果是 128 或 192,用 320 重做。
鼓跟人声一起消失了。 这是中置声道消除的典型特征,不是 AI 分离。有些免费"消音"网站到现在还在用老的相减法。换一个真正做分轨分离的工具。
上传失败或者超时。 超长文件(DJ set、整场演唱会录音、一小时的混音)可能超出处理上限。先剪出你真正要的那首歌。
下载下来是 .html 而不是音频文件。
说明那个转换器给你的是广告跳转页而不是文件。这是个危险信号——参考我们那篇怎样挑选转换器。
关于版权
为了自己练歌或者家庭卡拉OK而制作伴奏版,在大多数司法辖区通常被视为个人使用。但把这条伴奏发布出去、拿去卖、或者当作有商业收益内容的配乐,那是另一回事——不管你从文件里删掉了什么,词曲版权和录音版权都还在。
你的卡拉OK之夜只发生在客厅里,没问题。要是传到了有收益的频道上,那就得研究授权了。
常见问题
需要装什么软件吗? 不需要。两步都在浏览器里完成。下载 MP3 在 OnlyMP3.tools 上做,分离在对方服务器上跑。
手机上能做吗? 可以,两步都是网页版。唯一麻烦的是 iOS 上的文件管理——MP3 会落在"文件"App 的"下载"里,从那儿上传就行。
做出来的伴奏还是原调吗? 是。分离不会改变音高和速度。如果你需要移调,那是拿到伴奏之后的另一道工序。
能只要人声吗? 能,同一次处理会产出两轨。单独的人声轨(也就是"阿卡贝拉")是这次拆分的另一半,做混音或者研究歌手唱法时很有用。
为什么我的结果比官方伴奏差? 因为官方伴奏是真正的多轨在混音时不加人声轨;而分离是一种重建——它是在推测原本有什么。这几年差距缩小了非常多,但还没抹平。
320 kbps 真的有必要吗? 在这个流程里,比平时听歌重要得多。分离质量的上限,直接由压缩后还剩多少原始音频信息决定。
结语
两步:先拿到干净的 MP3,再把人声拆出来。第一步选的码率决定了第二步的天花板,这也是整个流程里唯一一个不那么直觉的点——哪怕你平时随便听听就够了,这次也要下 320 kbps。
先去 OnlyMP3.tools 把歌下下来,然后丢给 SongToKaraoke 出伴奏。