← Blog

Von YouTube zum Karaoke: Aus jedem Song ein Playback machen

2026-08-04

Auf YouTube gibt es keinen „Karaoke-Version"-Button. Wenn du zu einem bestimmten Song singen willst — einem Titel, von dem nie ein offizielles Instrumental erschienen ist, einem Cover, oder einem fremdsprachigen Lied, das deine Karaoke-Anlage nie gehört hat — musst du das Playback selbst bauen.

Die gute Nachricht: Das ist inzwischen eine Sache von zwei Schritten, etwa fünf Minuten, und kostet nichts. Schritt eins: den Song als Audiodatei besorgen. Schritt zwei: diese Datei durch ein KI-Modell schicken, das den Gesang vom Rest trennt.

Die Kurzantwort

  1. YouTube-URL des gewünschten Songs kopieren.
  2. Mit OnlyMP3.tools als MP3 mit 320 kbps herunterladen. Die Bitrate ist hier wichtiger als beim normalen Hören — dazu gleich mehr.
  3. Das MP3 in ein KI-Tool zur Gesangstrennung hochladen, zum Beispiel SongToKaraoke, das den Track in Gesang und Instrumental aufteilt.
  4. Den Instrumental-Stem herunterladen. Das ist dein Karaoke-Playback.

Das ist der gesamte Ablauf. Der Rest dieses Artikels erklärt, warum jeder Schritt so wichtig ist, welche Songs sich sauber trennen lassen und was zu tun ist, wenn das Ergebnis nicht stimmt.

Warum man den Gesang nicht einfach „leiser drehen" kann

Der alte Trick zum Karaoke-Bauen hieß Center-Kanal-Auslöschung. Der Leadgesang sitzt fast immer exakt in der Mitte, das heißt: identisches Signal auf links und rechts. Subtrahiert man einen Kanal vom anderen, löscht sich alles perfekt Zentrierte aus — auch die Stimme.

Das funktioniert halbwegs, und deshalb gab es kostenlose „Vocal Remover" schon lange vor der KI. Aber es hat zwei fatale Schwächen:

  • Alles andere in der Mitte verschwindet mit. Bassdrum, Snare und Bass sind ebenfalls fast immer zentriert. Du verlierst die komplette Rhythmusgruppe zusammen mit dem Sänger.
  • Der Hall bleibt. Die Hallfahne der Stimme ist stereo, nicht zentriert — du bekommst ein geisterhaftes Echo des Gesangs, ohne den Gesang selbst. Das klingt gespenstisch.

Moderne KI-Trennung arbeitet völlig anders. Modelle wie Demucs wurden mit Zehntausenden Songs trainiert, für die isolierte Stems vorlagen. Sie haben also gelernt, wie eine menschliche Stimme klingt, und nicht, wo sie im Stereobild sitzt. Sie ziehen den Gesang anhand seines akustischen Fingerabdrucks heraus und lassen Drums, Bass und Instrumente unangetastet.

Der praktische Unterschied ist gewaltig. Center-Auslöschung liefert einen dünnen, hohlen Track ohne Schlagzeug. KI-Trennung liefert etwas, das nach dem echten Instrumental klingt.

Schritt 1: Den Song als MP3 holen

YouTube-URL bei OnlyMP3.tools einfügen, Bitrate wählen, herunterladen.

Nimm 320 kbps. Beim normalen Hören ist der Unterschied zwischen 192 und 320 für die meisten nicht wahrnehmbar, und normalerweise sagen wir: nimm, was zum Zweck passt. Die Gesangstrennung ist die Ausnahme — hier ist der Grund.

MP3-Kompression funktioniert, indem sie Audioinformationen wegwirft, von denen der Encoder annimmt, dass du sie bewusst nicht bemerkst. Bei niedrigeren Bitraten wirft er mehr weg — besonders in den Höhen und in leisen Passagen, die von lauteren Klängen verdeckt werden. Genau diese Bereiche nutzt das Trennungsmodell aber, um eine Stimme von einer Gitarre zu unterscheiden. Eine 128-kbps-Datei zu übergeben heißt: Rekonstruiere eine Stimme aus Daten, die absichtlich verworfen wurden.

Die Artefakte zeigen sich als wässrige, schwebende Qualität im Instrumental, am deutlichsten auf Becken und Hallfahnen. Aus demselben Grund bearbeitet man kein Foto, das bereits fünfmal als schlechtes JPEG gespeichert wurde.

Was jede Bitrate-Stufe tatsächlich kostet, steht ausführlich im OnlyMP3 Bitraten-Guide.

Noch etwas Wichtiges: Die Qualität des Quellvideos ist eine Decke, die du nicht anheben kannst. Wenn jemand den Song aus einem schlechten Rip hochgeladen hat, bekommst du mit 320 kbps nur eine große Datei mit schlechtem Audio. Bevorzuge offizielle Künstlerkanäle oder offizielle „Artist - Topic"-Kanäle — die werden in der Regel vom Master des Labels gespeist.

Schritt 2: Den Gesang trennen

Lade das MP3 in ein KI-Trennungstool. SongToKaraoke ist genau für diesen Zweck gebaut: Song hochladen, gesangfreies Instrumental zurückbekommen, herunterladen, lossingen. Es gibt auch allgemeine Stem-Splitter, wenn du Drums und Bass ebenfalls als eigene Dateien willst — für Karaoke reicht die Zweiteilung.

Die Verarbeitung dauert je nach Länge meist zwischen dreißig Sekunden und ein paar Minuten. Das Modell läuft serverseitig, ein langsames Handy ist also kein Problem.

Zurück bekommst du einen Instrumental-Stem: derselbe Song, dasselbe Tempo, dieselbe Tonart, dasselbe Arrangement — nur ohne Leadgesang.

Welche Songs sich sauber trennen lassen

Die Ergebnisse schwanken stark nach Genre und Produktionsweise. Das ist der wichtigste Faktor dafür, ob du mit dem Resultat zufrieden bist.

SongtypTypisches ErgebnisWarum
Moderner Pop, Hip-Hop, EDMSehr gutSaubere Mehrspurproduktion, Gesang klar abgesetzt, viele ähnliche Trainingsdaten
Rock und MetalGutGesang trennt sich gut; stark verzerrte Gitarren verwirren das Modell gelegentlich
Akustische Singer-SongwriterGut bis mittelStimme und Akustikgitarre teilen sich den Frequenzbereich, daher etwas Übersprechen
Jazz und Soul mit BläsernMittelSaxofon und Trompete überlappen mit dem Stimmbereich
Chor, Oper, viel A-cappellaSchlechtWenn das „Instrument" selbst eine Stimme ist, gibt es nichts zu trennen
Live-Aufnahmen, BootlegsSchlechtPublikumsgeräusche und Raumübersprechen verunreinigen jeden Stem
Alte Mono-Aufnahmen (vor 1965)Mittel bis schlechtAlles liegt auf einem Kanal, dazu starke Bandkompression

Faustregel: Je isolierter der Gesang in der Originalaufnahme war, desto besser bekommt ihn das Modell wieder heraus. Ein in Gesangskabinen produzierter Poptrack trennt sich hervorragend. Ein Live-Jazz von 1958, aufgenommen mit zwei Mikrofonen, nicht.

Wie „gut" tatsächlich klingt

Auch eine saubere Trennung ist nicht dasselbe wie ein offiziell veröffentlichtes Instrumental. Rechne mit:

  • Gelegentlichen Gesangsgeistern in lauten Passagen, besonders bei gehaltenen Tönen.
  • Leicht weicheren Becken. In den Höhen überlappen Gesang und Becken am stärksten, deshalb schneidet das Modell dort manchmal zu viel weg.
  • Backing Vocals, die bleiben oder verschwinden. Die meisten Modelle behandeln Harmonien und Doppelungen als „Gesang" und entfernen sie mit der Leadstimme. Wenn der Refrain von gestapelten Harmonien lebt, wirkt das Instrumental leer.

Zum Mitsingen zu Hause, auf einer Party oder zum Üben spielt nichts davon eine Rolle. Für eine Aufnahme, die veröffentlicht werden soll, hör den kompletten Track vorher aufmerksam durch.

Typische Anwendungen

  • Karaoke zu Hause für Songs, die kein Karaoke-Dienst lizenziert — fremdsprachige Titel, Indie-Releases, tiefe Albumtracks.
  • Gesangsübung. Sänger proben mit dem echten Arrangement im Originaltempo statt mit einem Klavierauszug.
  • Vorsingen und Cover. Ein Playback aus der Originalaufnahme klingt deutlich besser als eine MIDI-Nachbildung.
  • Musikunterricht. Das Instrumental läuft, die einzige Stimme im Raum ist die des Schülers.
  • Tanz und Choreografie, wo der Gesang beim Zählen stört.

Fehlerbehebung

Im Instrumental ist noch leiser Gesang zu hören. Meist ein Problem der Quellqualität. Lade den Song aus dem besten verfügbaren Upload erneut mit 320 kbps und versuche es nochmal. Bei dichten Live-Mixen oder viel Harmoniegesang kann das aber das Maximum sein.

Das Instrumental klingt dünn oder „unter Wasser". Klassisches Artefakt einer Datei mit niedriger Bitrate. Prüfe, mit welcher Bitrate du heruntergeladen hast. Bei 128 oder 192: neu mit 320.

Das Schlagzeug ist mit dem Gesang verschwunden. Das ist die Signatur der Center-Kanal-Auslöschung, nicht der KI-Trennung. Manche kostenlosen „Vocal Remover"-Seiten nutzen immer noch die alte Subtraktionsmethode. Nimm ein Tool, das echte Stemtrennung macht.

Der Upload schlägt fehl oder läuft in einen Timeout. Sehr lange Dateien (DJ-Sets, komplette Konzertmitschnitte, einstündige Mixe) können die Verarbeitungsgrenzen sprengen. Schneide vorher den gewünschten Song heraus.

Heruntergeladen wird eine .html statt Audio. Dein Konverter hat eine Werbeweiterleitung statt einer Datei ausgeliefert. Das ist ein Warnsignal — siehe unseren Leitfaden dazu, worauf man bei einem Konverter achtet.

Hinweis zum Urheberrecht

Eine Instrumentalversion für privates Üben oder Karaoke zu Hause herzustellen, gilt in den meisten Rechtsordnungen üblicherweise als Privatgebrauch. Dieses Instrumental zu veröffentlichen, zu verkaufen oder als Soundtrack für monetarisierte Inhalte zu verwenden, ist etwas anderes — Komposition und Masteraufnahme bleiben geschützt, egal was du aus der Datei entfernt hast.

Wenn dein Karaoke-Abend im Wohnzimmer bleibt, ist alles in Ordnung. Landet er auf einem monetarisierten Kanal, kümmere dich um Lizenzen.

FAQ

Muss ich etwas installieren? Nein. Beide Schritte laufen im Browser. Der MP3-Download passiert auf OnlyMP3.tools, die Trennung auf den Servern des Trennungsdienstes.

Funktioniert das auf dem Handy? Ja, beide Schritte sind webbasiert. Der einzige Reibungspunkt ist die Dateiverwaltung unter iOS — das MP3 landet in der Dateien-App unter Downloads, von dort lädst du es hoch.

Bleibt die Tonart gleich? Ja. Die Trennung verändert weder Tonhöhe noch Tempo. Eine andere Tonart ist ein separater Transpositionsschritt danach.

Kann ich stattdessen nur den Gesang bekommen? Ja — derselbe Vorgang erzeugt beide Stems. Der isolierte Gesang (das „Acapella") ist die andere Hälfte derselben Trennung, nützlich zum Remixen oder um genau zu hören, was ein Sänger macht.

Warum klingt mein Ergebnis schlechter als ein offizielles Instrumental? Weil ein offizielles Instrumental die echte Mehrspuraufnahme ohne Gesangsspur ist. Trennung ist eine Rekonstruktion — sie schätzt, was da war. Der Abstand ist in den letzten Jahren enorm geschrumpft, aber er ist nicht verschwunden.

Sind 320 kbps wirklich nötig? Für diesen Ablauf ja, mehr als beim normalen Hören. Die Trennungsqualität ist direkt davon begrenzt, wie viel vom Originalaudio die Kompression überlebt hat.

Fazit

Zwei Schritte: sauberes MP3 besorgen, dann den Gesang herauslösen. Die Bitrate aus Schritt eins bestimmt die Obergrenze für Schritt zwei — das ist der einzige nicht offensichtliche Teil des Ganzen. Lade mit 320 kbps herunter, auch wenn du dich sonst mit weniger zufriedengeben würdest.

Hol dir den Song zuerst bei OnlyMP3.tools und schick ihn dann durch SongToKaraoke, um das Playback zu bekommen.