← Blog

Da YouTube al karaoke: trasforma qualsiasi canzone in una base

2026-08-04

Su YouTube non esiste un pulsante «versione karaoke». Se vuoi cantare su un brano preciso — un pezzo di cui non è mai uscita la base ufficiale, una cover, o una canzone in una lingua che il karaoke sotto casa non ha mai sentito — la base devi costruirtela da solo.

La buona notizia è che oggi si tratta di due passaggi, cinque minuti circa, a costo zero. Il primo è procurarsi la canzone come file audio. Il secondo è far passare quel file attraverso un modello di IA che separa la voce da tutto il resto.

La risposta breve

  1. Copia l'URL YouTube della canzone che ti interessa.
  2. Convertila in MP3 a 320 kbps con OnlyMP3.tools. Qui il bitrate conta molto più che per il semplice ascolto — sotto spieghiamo perché.
  3. Carica quell'MP3 su uno strumento di separazione vocale con IA come SongToKaraoke, che divide il brano in voce e strumentale.
  4. Scarica la traccia strumentale. Quella è la tua base karaoke.

Il processo è tutto qui. Il resto della guida spiega perché ogni passaggio conta, quali canzoni si separano bene e cosa fare quando il risultato non suona come dovrebbe.

Perché non basta «abbassare la voce»

Il vecchio trucco per fare le basi si chiamava cancellazione del canale centrale. La voce solista è quasi sempre missata esattamente al centro, cioè con segnale identico nei canali sinistro e destro. Sottraendo un canale dall'altro, tutto ciò che è perfettamente centrato si annulla — voce compresa.

Più o meno funziona, ed è per questo che i «vocal remover» gratuiti esistevano molto prima dell'IA. Ma ha due difetti fatali:

  • Sparisce anche tutto il resto che sta al centro. Cassa, rullante e basso sono quasi sempre centrati. Perdi l'intera sezione ritmica insieme al cantante.
  • Il riverbero sopravvive. La coda di riverbero della voce è stereo, non centrata: ti ritrovi un'eco spettrale del canto senza il canto. Suona inquietante.

La separazione con IA funziona in modo completamente diverso. Modelli come Demucs sono stati addestrati su decine di migliaia di canzoni di cui erano disponibili le tracce isolate, quindi hanno imparato come suona una voce umana, non dove si colloca nel campo stereo. Estraggono la voce in base alla sua impronta acustica, lasciando intatti batteria, basso e strumenti.

La differenza pratica è enorme. La cancellazione centrale restituisce una traccia sottile e vuota, senza batteria. La separazione IA restituisce qualcosa che suona come la vera strumentale.

Passaggio 1: procurarsi la canzone in MP3

Incolla l'URL YouTube su OnlyMP3.tools, scegli il bitrate e scarica.

Scegli 320 kbps. Per l'ascolto normale la differenza tra 192 e 320 è impercettibile per la maggior parte delle persone, e di solito diciamo di scegliere in base all'uso. La separazione vocale è l'eccezione, ed ecco perché.

La compressione MP3 funziona buttando via le informazioni audio che il codificatore prevede tu non noterai coscientemente. A bitrate più bassi ne butta di più — in particolare nelle alte frequenze e nei passaggi deboli dove un suono è mascherato da uno più forte. E sono proprio le regioni che il modello di separazione usa per distinguere una voce da una chitarra. Dargli un file a 128 kbps significa chiedergli di ricostruire una voce da dati eliminati di proposito.

Gli artefatti si manifestano come una qualità acquosa e oscillante nella strumentale, più evidente su piatti e code di riverbero. È lo stesso motivo per cui non si ritocca una foto già salvata cinque volte come JPEG di bassa qualità.

Per il quadro completo di quanto costa ogni livello di bitrate, leggi la guida ai bitrate di OnlyMP3.

Un'altra cosa da sapere: la qualità del video di partenza è un tetto che non puoi alzare. Se qualcuno ha caricato la canzone da un rip di bassa qualità, chiedere 320 kbps ti darà solo un file grande con dentro audio scadente. Preferisci i canali ufficiali degli artisti o i canali ufficiali «Artist - Topic»: di norma vengono alimentati dal master dell'etichetta.

Passaggio 2: separare la voce

Carica l'MP3 su uno strumento di separazione IA. SongToKaraoke è pensato esattamente per questo: carichi una canzone e ti restituisce una strumentale senza voce, da scaricare e cantarci sopra. Esistono anche separatori di stem generici se vuoi batteria e basso come file separati, ma per il karaoke basta la divisione in due.

L'elaborazione richiede di solito da trenta secondi a qualche minuto, a seconda della durata. Il modello gira lato server, quindi un telefono lento non è un problema.

Quello che ottieni è uno stem strumentale: stessa canzone, stesso tempo, stessa tonalità, stesso arrangiamento, senza la voce solista.

Quali canzoni si separano bene

I risultati variano moltissimo per genere e stile di produzione. È il fattore che più di ogni altro determina se sarai soddisfatto.

Tipo di branoRisultato tipicoPerché
Pop moderno, hip-hop, EDMOttimoProduzione multitraccia pulita, voce ben distinta, molti dati di addestramento simili
Rock e metalBuonoLa voce si separa bene; le chitarre molto distorte a volte confondono il modello
Cantautorato acusticoDa buono a discretoVoce e chitarra acustica condividono la stessa gamma di frequenze, quindi resta qualche residuo
Jazz e soul con fiatiDiscretoSax e tromba si sovrappongono all'estensione vocale umana
Corale, opera, molto a cappellaScarsoQuando lo «strumento» è a sua volta voce, non c'è nulla da separare
Registrazioni dal vivo, bootlegScarsoRumore del pubblico e rientri di sala contaminano ogni stem
Vecchie registrazioni mono (prima del 1965)Da discreto a scarsoTutto è impilato su un solo canale, con forte compressione a nastro

La regola generale: più la voce era isolata nella registrazione originale, meglio il modello riesce a tirarla fuori. Un pezzo pop registrato in cabine isolate si separa magnificamente. Un jazz dal vivo del 1958 registrato con due microfoni, no.

Cosa vuol dire davvero un «buon» risultato

Anche una separazione pulita non equivale a una strumentale ufficiale. Aspettati:

  • Fantasmi vocali occasionali nelle sezioni piene, soprattutto sulle note tenute.
  • Piatti leggermente smorzati. Le alte frequenze sono dove voce e piatti si sovrappongono di più, quindi il modello a volte taglia un po' troppo.
  • Cori che possono sopravvivere o no. La maggior parte dei modelli tratta armonie e raddoppi come «voce» e li rimuove insieme alla solista. Se il ritornello si regge su armonie sovrapposte, la strumentale può risultare vuota.

Per cantare a casa, a una festa o per esercitarsi, niente di tutto questo conta. Per un'esecuzione registrata che pensi di pubblicare, ascolta prima l'intera traccia con attenzione.

Usi comuni

  • Karaoke casalingo per canzoni che nessun servizio ha in licenza: brani in lingua straniera, uscite indipendenti, tracce d'album poco note.
  • Esercizio vocale. I cantanti provano sull'arrangiamento reale a tempo originale invece che su una riduzione per pianoforte.
  • Provini e cover. Una base ricavata dalla registrazione originale suona molto meglio di un'approssimazione MIDI.
  • Didattica musicale. Metti la strumentale a lezione e l'unica voce nella stanza è quella dell'allievo.
  • Danza e coreografia, dove la voce distrae dal contare.

Risoluzione dei problemi

Nella strumentale si sente ancora un po' di canto. Di solito è un problema di qualità della sorgente. Riscarica la canzone a 320 kbps dal caricamento migliore disponibile e riprova. Se il brano è un mix dal vivo molto denso o pieno di armonie, potrebbe essere il massimo ottenibile.

La strumentale suona sottile o «sott'acqua». Classico artefatto da input a basso bitrate. Controlla a che bitrate hai scaricato: se era 128 o 192, rifallo a 320.

La batteria è sparita insieme alla voce. È la firma della cancellazione del canale centrale, non della separazione IA. Alcuni siti gratuiti di «rimozione voce» usano ancora il vecchio metodo per sottrazione. Usa uno strumento che faccia vera separazione di stem.

Il caricamento fallisce o va in timeout. File molto lunghi (DJ set, registrazioni di concerti interi, mix di un'ora) possono superare i limiti di elaborazione. Ritaglia prima la canzone che ti serve.

Viene scaricato un .html invece dell'audio. Il convertitore ti ha servito un redirect pubblicitario anziché un file. È un campanello d'allarme — vedi la nostra guida su cosa guardare in un convertitore.

Una nota sul diritto d'autore

Creare una versione strumentale per esercitarsi in privato o per il karaoke di casa è generalmente trattato come uso personale nella maggior parte degli ordinamenti. Pubblicare quella strumentale, venderla o usarla come colonna sonora di contenuti monetizzati è un'altra cosa: composizione e registrazione originale restano protette a prescindere da cosa hai tolto dal file.

Se la serata karaoke resta in salotto, sei a posto. Se finisce su un canale monetizzato, informati sulle licenze.

FAQ

Devo installare qualcosa? No. Entrambi i passaggi avvengono nel browser. Il download dell'MP3 su OnlyMP3.tools, la separazione sui server del servizio di separazione.

Funziona da telefono? Sì, entrambi i passaggi sono web. L'unico attrito è la gestione file su iOS: l'MP3 finisce nell'app File sotto Download, e lo carichi da lì.

La base karaoke resta nella stessa tonalità? Sì. La separazione non altera né intonazione né tempo. Se ti serve un'altra tonalità, è un passaggio di trasposizione successivo.

Posso ottenere solo la voce? Sì, lo stesso processo produce entrambi gli stem. La voce isolata (l'«a cappella») è l'altra metà della stessa divisione, utile per remixare o per studiare esattamente cosa fa un cantante.

Perché il mio risultato suona peggio di una strumentale ufficiale? Perché una strumentale ufficiale è il vero multitraccia missato senza il canale vocale. La separazione è una ricostruzione: stima cosa c'era. Il divario si è ridotto enormemente negli ultimi anni, ma non si è chiuso.

Servono davvero 320 kbps? Per questo flusso sì, molto più che per l'ascolto normale. La qualità della separazione è limitata direttamente da quanto audio originale è sopravvissuto alla compressione.

Conclusione

Due passaggi: ottenere un MP3 pulito, poi estrarne la voce. Il bitrate scelto al passaggio uno determina il tetto del passaggio due, ed è l'unico punto non ovvio dell'intero processo: scarica a 320 kbps anche se di solito ti accontenteresti di meno.

Comincia prendendo la canzone su OnlyMP3.tools, poi passala per SongToKaraoke per ottenere la base.