← Blog

YouTube 轉伴奏:把任意歌曲做成卡拉OK音軌

2026-08-04

YouTube 上沒有「伴奏版」按鈕。如果你想跟著某首歌唱——一首從來沒發行過官方伴奏的歌、一首翻唱、或者一首本地點唱機根本沒收錄的外語歌——你只能自己做伴奏。

好消息是,這件事現在只要兩步,五分鐘搞定,而且不用花錢。第一步是把歌曲變成音訊檔,第二步是把這個檔案丟給 AI 模型,讓它把人聲和其他所有聲音分開。

快速答案

  1. 複製這首歌的 YouTube 連結。
  2. OnlyMP3.tools 轉成 320 kbps 的 MP3。 這一步選什麼位元率,比平常聽歌重要得多,下面細說。
  3. 把 MP3 上傳到 AI 人聲分離工具,例如 SongToKaraoke,它會把音軌拆成人聲和伴奏兩部分。
  4. 下載伴奏那一軌,這就是你的卡拉OK音軌。

整個流程就這些。剩下的篇幅解釋每一步為什麼這麼做、哪些歌能分得乾淨、以及結果不對勁時該怎麼辦。

為什麼不能「直接把人聲調小」

老一輩做伴奏的招數叫中置聲道消除。主唱人聲通常混在正中間,也就是左右聲道的訊號完全一樣。把一個聲道減去另一個,任何完全置中的聲音都會被抵消——包括人聲。

這招勉強能用,也正因如此,早在 AI 出現之前就有一堆免費的「消音」工具。但它有兩個致命問題:

  • 正中間的其他東西也一起沒了。 大鼓、小鼓、貝斯基本上也都是置中的。你把歌手幹掉的同時,整個節奏組也沒了。
  • 殘響還留著。 人聲的殘響尾巴是立體聲而不是置中的,所以你會聽到一層幽靈般的演唱回音,卻沒有演唱本體。聽起來相當詭異。

現在的 AI 分離走的是完全不同的路子。Demucs 這類模型是拿幾萬首有獨立分軌的歌訓練出來的,所以它學會的是人聲聽起來是什麼樣,而不是人聲待在立體聲場的哪個位置。它靠聲音特徵把人聲摳出來,鼓、貝斯和其他樂器原封不動。

實際差距非常明顯。中置消除給你一段單薄、空洞、沒有鼓的東西;AI 分離給你的,聽起來就是真正的伴奏。

第一步:把歌下載成 MP3

把 YouTube 連結貼進 OnlyMP3.tools,選位元率,下載。

選 320 kbps。 平常聽歌,192 和 320 的差別絕大多數人聽不出來,我們通常也說按需選就好。但人聲分離是個例外,原因如下。

MP3 壓縮的原理,是丟掉編碼器判斷你不會注意到的音訊資訊。位元率越低丟得越多——尤其是高頻部分,以及那些被更響的聲音遮蔽掉的弱訊號段落。而這些地方,恰恰就是分離模型用來區分「人聲」和「吉他」的依據。你餵給它一個 128 kbps 的檔案,等於是要它從已經被故意扔掉的資料裡把人聲重建出來。

失真會表現為伴奏裡一種水聲般的、飄忽的質感,在鈸和殘響尾音上最明顯。道理跟你不該去修一張已經被低品質 JPEG 壓過五輪的照片一樣。

想完整了解每個位元率檔位到底犧牲了什麼,可以看OnlyMP3 位元率指南

還有一點要知道:來源影片的品質是你抬不高的天花板。 如果這首歌是別人拿低品質音源傳上 YouTube 的,你選 320 kbps 只會得到一個體積很大的爛音訊。盡量找官方藝人頻道,或者官方的 "Artist - Topic" 頻道——那些通常是唱片公司母帶直接推送的。

第二步:分離人聲

把 MP3 上傳到 AI 分離工具。SongToKaraoke 就是專門做這件事的——傳一首歌,它給你一份可以直接下載、直接開唱的無人聲伴奏。如果你連鼓和貝斯也想要獨立檔案,也有做多軌拆分的通用工具,但做卡拉OK只需要兩軌就夠。

處理時間一般在半分鐘到幾分鐘之間,取決於歌有多長。模型跑在伺服器上,所以手機效能差不影響。

你拿回來的是一條伴奏軌:同一首歌,同樣的速度、同樣的調、同樣的編曲,只是沒有了主唱。

哪些歌能分乾淨,哪些不行

效果因曲風和製作方式差別很大。這是決定你滿不滿意的最大變數。

歌曲類型通常效果原因
現代流行、嘻哈、電音極好多軌製作乾淨,人聲混得獨立,訓練資料也最多
搖滾、金屬人聲分得出來;失真很重的吉他偶爾會干擾模型
民謠、創作歌手好到普通人聲和木吉他頻段重疊,會有一些串音
帶管樂的爵士、靈魂樂普通薩克斯風、小號的音域和人聲重疊
合唱、歌劇、大量阿卡貝拉當「樂器」本身也是人聲,就沒什麼可分的
現場錄音、私錄版觀眾噪音和場地串音污染了每一軌
1965 年前的老單聲道錄音普通到差所有聲音擠在一個聲道裡,還有很重的磁帶壓縮

大原則是:原始錄音裡人聲越獨立,模型就越能把它還原出來。 在隔音間裡分開錄的錄音室流行歌能分得非常漂亮;1958 年用兩支麥克風錄的現場爵士就不行。

「效果好」到底是什麼水準

就算分得很乾淨,也不等於官方發行的伴奏版。你應該預期到:

  • 響的段落偶爾有人聲殘影,尤其是長音。
  • 鈸會稍微發悶。 高頻正是人聲和鈸重疊最多的地方,模型有時會削過頭。
  • 和聲可能保得住,也可能保不住。 大多數模型把和聲和疊錄人聲都算作「人聲」,會連著主唱一起去掉。如果這首歌的副歌靠的就是層層疊疊的和聲,伴奏會顯得很空。

自己在家唱、聚會唱、或者練歌,這些都無所謂。但如果你打算把演唱錄下來發出去,先把整軌從頭到尾仔細聽一遍。

常見用途

  • 家庭卡拉OK:唱那些點唱平台沒有版權的歌——外語歌、獨立發行、專輯裡的冷門曲目。
  • 練唱。 歌手用伴奏按原速、原編曲練歌,比用鋼琴縮譜真實得多。
  • 試音和翻唱。 用原曲提取的伴奏,效果遠好過 MIDI 做的粗糙模擬。
  • 音樂教學。 課堂上放伴奏,房間裡唯一的人聲就是學生自己的。
  • 舞蹈和編舞,人聲反而干擾數拍子。

出問題怎麼辦

伴奏裡還隱約有人聲。 一般是來源檔案品質的問題。找一個音質最好的版本,重新用 320 kbps 下一遍再試。如果這首歌本身是很密的現場混音、或者和聲特別多,那可能就到極限了。

伴奏聽起來單薄、像「泡在水裡」。 典型的低位元率輸入失真。檢查一下你下的是多少位元率,如果是 128 或 192,用 320 重做。

鼓跟人聲一起消失了。 這是中置聲道消除的典型特徵,不是 AI 分離。有些免費「消音」網站到現在還在用老的相減法。換一個真正做分軌分離的工具。

上傳失敗或者逾時。 超長檔案(DJ set、整場演唱會錄音、一小時的混音)可能超出處理上限。先剪出你真正要的那首歌。

下載下來是 .html 而不是音訊檔。 說明那個轉換器給你的是廣告跳轉頁而不是檔案。這是個危險訊號——參考我們那篇怎樣挑選轉換器

關於版權

為了自己練歌或者家庭卡拉OK而製作伴奏版,在大多數司法管轄區通常被視為個人使用。但把這條伴奏發布出去、拿去賣、或者當作有商業收益內容的配樂,那是另一回事——不管你從檔案裡刪掉了什麼,詞曲版權和錄音版權都還在。

你的卡拉OK之夜只發生在客廳裡,沒問題。要是傳到了有收益的頻道上,那就得研究授權了。

常見問題

需要裝什麼軟體嗎? 不用。兩步都在瀏覽器裡完成。下載 MP3 在 OnlyMP3.tools 上做,分離在對方伺服器上跑。

手機上能做嗎? 可以,兩步都是網頁版。唯一麻煩的是 iOS 上的檔案管理——MP3 會落在「檔案」App 的「下載項目」裡,從那兒上傳就行。

做出來的伴奏還是原調嗎? 是。分離不會改變音高和速度。如果你需要移調,那是拿到伴奏之後的另一道工序。

能只要人聲嗎? 能,同一次處理會產出兩軌。單獨的人聲軌(也就是「阿卡貝拉」)是這次拆分的另一半,做混音或者研究歌手唱法時很有用。

為什麼我的結果比官方伴奏差? 因為官方伴奏是真正的多軌在混音時不加人聲軌;而分離是一種重建——它是在推測原本有什麼。這幾年差距縮小了非常多,但還沒抹平。

320 kbps 真的有必要嗎? 在這個流程裡,比平常聽歌重要得多。分離品質的上限,直接由壓縮後還剩多少原始音訊資訊決定。

結語

兩步:先拿到乾淨的 MP3,再把人聲拆出來。第一步選的位元率決定了第二步的天花板,這也是整個流程裡唯一一個不那麼直覺的點——哪怕你平常隨便聽聽就夠了,這次也要下 320 kbps。

先去 OnlyMP3.tools 把歌下下來,然後丟給 SongToKaraoke 出伴奏。