Gesang aus einem Lied entfernen: 5 einfache Methoden (2026)
Stimme aus einem Lied entfernen – mit KI-Vocal-Remover, Audacity, UVR, DAW oder Smartphone. Anleitungen, Lösungen bei Problemen und rechtliche Grundlagen.
Vor ein paar Jahren hieß „Gesang aus einem Lied entfernen“ noch: die Phase eines Kanals umkehren und auf das Beste hoffen.
Meist kam dabei ein hohler Mono-Brei heraus – die Stimme hallte im Hintergrund noch nach, und die Basslinie war verschwunden.
Dieser Trick hat ausgedient. Heutige KI-Modelle zur Quellentrennung wurden mit Tausenden von Mehrspuraufnahmen trainiert. Sie lösen eine Stimme so sauber aus einem fertigen Mix, dass es für Karaoke, Übungstracks, Remixe und sogar grobe Demos reicht.
Der Haken: Inzwischen gibt es ein Dutzend Wege dorthin, und sie sind nicht alle gleich gut.
In diesem Leitfaden lernen Sie fünf Methoden kennen, die wirklich funktionieren – vom Browser-Tool, das in einer Minute fertig ist, bis zur kostenlosen Desktop-Software. Außerdem erfahren Sie, was veröffentlichte Benchmarks über die Qualität sagen, wie Sie die häufigsten Probleme beheben und wo die rechtlichen Grenzen verlaufen.
Das erfahren Sie hier:
- Den schnellsten Weg, Gesang zu entfernen – ganz ohne Installation
- Wie es kostenlos in Audacity klappt, inklusive des KI-Plug-ins, das die meisten Anleitungen übersehen
- Wann sich eine Desktop-App wie Ultimate Vocal Remover die Einrichtung lohnt
- Wie Sie den Stem-Splitter nutzen, der in Logic Pro, Ableton Live und FL Studio bereits eingebaut ist
- Wie Sie Geistergesang, Hall-Fahnen und „wässrig“ klingende Instrumentals beheben
- Was Sie mit dem Ergebnis rechtlich dürfen – und was nicht
Kurze Antwort: Um den Gesang aus einem Lied zu entfernen, laden Sie die Audiodatei in einen KI-Vocal Remover hoch, lassen das Modell den Song in zwei Stems trennen und laden dann das Instrumental herunter. Ein dreiminütiger Song dauert etwa eine Minute. Als kostenlose Offline-Option eignen sich Audacity mit Intels Plug-in OpenVINO Music Separation oder die Desktop-App Ultimate Vocal Remover.
Welche Methode ist die richtige für Sie?
Jede der folgenden Methoden liefert ein Instrumental. Sie unterscheiden sich in Tempo, Kosten, Einrichtungsaufwand und darin, wie viel Kontrolle Sie haben.
Hier die Kurzfassung, bevor es Schritt für Schritt losgeht.
Die 5 Methoden im Überblick
| Methode | Kosten | Einrichtung | Tempo (3-Minuten-Song) | Qualität | Am besten für |
|---|---|---|---|---|---|
| 1. Online-KI-Vocal-Remover | Täglich ein Song kostenlos, danach kostenpflichtig | Keine | ~1 Minute | Hoch | Die meisten Nutzer, Smartphones, einmalige Aufgaben |
| 2. Audacity + KI-Plug-in | Kostenlos | Mittel | 1–3 Minuten | Hoch | Bestehende Audacity-Nutzer, Offline-Arbeit |
| 3. Ultimate Vocal Remover | Kostenlos | Mittel bis hoch | Sekunden (GPU) bis Minuten (CPU) | Sehr hoch, fein einstellbar | Fortgeschrittene, Stapelverarbeitung |
| 4. Stem-Splitter der DAW | In der DAW enthalten | Gering, wenn Sie sie besitzen | ~1 Minute | Hoch | Produzenten, die schon mit Logic, Ableton oder FL arbeiten |
| 5. Smartphone-Apps | Freemium | App-Installation | ~1 Minute | Hoch | Musiker, die unterwegs üben |
Schnell entscheiden
Wenn Sie nicht wissen, wo Sie anfangen sollen, folgen Sie dem Schema unten. Die meisten sind schon nach der ersten Frage fertig.
💡 Profi-Tipp: Bevor Sie irgendetwas trennen, suchen Sie nach einem offiziellen Instrumental. Viele Alben enthalten eines, und Karaoke-Versionen bekannter Songs sind vielfach lizenziert erhältlich. Ein offizielles Instrumental schlägt ein extrahiertes immer.
Vorab: So funktioniert das Entfernen von Gesang wirklich
Für ein Ergebnis brauchen Sie die Theorie nicht. Sie bewahrt Sie aber vor den häufigsten Fehlern – vor allem dann, wenn ein Ergebnis falsch klingt und Sie wissen wollen, warum.
Was bedeutet „Gesang entfernen“?
Gesang entfernen heißt, einen fertigen Song in einzelne Ebenen – sogenannte Stems – aufzuteilen und alles außer der Stimme zu behalten.
Die meisten Tools liefern zwei Stems:
- Gesang (Acapella): Leadstimme und Harmonien ohne Instrumente
- Instrumental (Karaoke-Spur): Schlagzeug, Bass, Gitarren, Keys und alles Übrige
Manche Tools gehen weiter und trennen vier oder sechs Stems: Gesang, Schlagzeug, Bass, Klavier, Gitarre und „Sonstiges“. Wenn es nur ums Entfernen des Gesangs geht, sind zwei Stems meist sauberer, weil das Modell nur eine einzige Entscheidung treffen muss.
Methode A: Phasenauslöschung (der alte Trick)
Die Phasenauslöschung beruht auf einer Gewohnheit beim Mischen: Der Leadgesang liegt fast immer genau in der Mitte des Panoramas und ist daher im linken und rechten Kanal identisch.
So funktioniert es
- Den Stereo-Song in linken und rechten Kanal aufteilen.
- Die Wellenform eines Kanals umkehren (invertieren).
- Beide Kanäle wieder zusammenmischen.
Alles, was auf beiden Seiten identisch ist, löscht sich zu Stille aus. Der Gesang verschwindet – und mit ihm alles andere, was in der Mitte liegt.
Warum das Ergebnis meist enttäuscht
Genau dieser letzte Punkt ist das Problem. Bass, Kickdrum und Snare werden ebenfalls in die Mitte gemischt, also verschwinden auch sie.
Gleichzeitig überleben die Teile des Gesangs, die nicht auf beiden Seiten identisch sind:
- Stereo-Hall und -Delay auf der Stimme
- Backgroundgesang und Doppelungen, die links und rechts im Panorama liegen
- Jede Gesangsspur, die leicht außermittig gemischt wurde
Und ist die Datei mono, sind beide Kanäle ohnehin identisch. Löscht man sie gegeneinander aus, verschwindet der komplette Song.
Methode B: KI-Quellentrennung (der moderne Weg)
Der KI-Trennung ist es egal, wo die Stimme im Panorama liegt. Sie orientiert sich daran, wie die Stimme klingt.
So funktioniert es
Ein Song lässt sich als Spektrogramm darstellen: eine Karte, die zeigt, welche Frequenzen zu jedem Zeitpunkt erklingen.
Ein Trennungsmodell hat Tausende von Songs analysiert, bei denen Gesangs- und Instrumentalspur getrennt vorlagen. Dabei hat es gelernt, wie eine menschliche Stimme auf dieser Karte aussieht.
Bei einem neuen Song sagt es eine „Maske“ der Bereiche voraus, die zur Stimme gehören. Mit der Maske erzeugt es das Acapella, mit ihrer Umkehrung das Instrumental.
Phasenauslöschung und KI im Vergleich
| Phasenauslöschung | KI-Quellentrennung | |
|---|---|---|
| Funktioniert mit Mono-Dateien | Nein | Ja |
| Bass und Kickdrum bleiben erhalten | Nein | Ja |
| Kommt mit Stereo-Hall zurecht | Nein | Größtenteils |
| Kommt mit breit verteiltem Backgroundgesang zurecht | Nein | Größtenteils |
| Ausgabe | Nur Instrumental in Mono | Gesang und Instrumental in Stereo |
| Spezielle Software nötig | Nein | Ja (Online-Tool, Plug-in oder App) |
| Typisches Ergebnis | Hohl, Gesang nur teilweise entfernt | Sauber, gelegentlich leichte Artefakte |
Wie gut sind KI-Vocal-Remover 2026?
Forscher messen die Trennqualität mit dem SDR (Signal-to-Distortion Ratio) in Dezibel – auf einem Standard-Testdatensatz aus 50 Songs namens MUSDB18-HQ. Höher ist besser, und alle 3 dB halbiert sich der verbleibende Fehler ungefähr.
So hat sich die Gesangsspur bei bekannten Modellen verbessert:
| Modell | Entwickelt von | Jahr | SDR Gesang | Quelle |
|---|---|---|---|---|
| Spleeter | Deezer | 2019 | ~5,9 dB (Durchschnitt aller Stems) | Vergleich in der Demucs-README |
| Hybrid Transformer Demucs | Meta AI | 2022 | 8,93 dB | arXiv:2211.08553 |
| HT Demucs, feinabgestimmt | Meta AI | 2022 | 9,20 dB | arXiv:2211.08553 |
| Band-Split RNN | Luo & Yu | 2022 | 10,47 dB | angegeben in arXiv:2211.08553 |
| BS-RoFormer (ohne zusätzliche Daten) | ByteDance | 2023 | 10,66 dB | arXiv:2309.02612 |
| BS-RoFormer (+500 Songs) | ByteDance | 2023 | 12,72 dB | arXiv:2309.02612 |
Das Fazit: Innerhalb eines einzigen Forschungsjahres (2022 bis 2023) stiegen die besten veröffentlichten Gesangswerte von etwa 9–10,5 dB auf 12,7 dB. Genau diese Modelle oder enge Verwandte laufen heute in kostenlosen und günstigen Tools.
📝 Hinweis: Benchmark-Werte sind Durchschnittswerte. Ein sparsam arrangierter Akustiksong lässt sich besser trennen als ein dichtes, stark komprimiertes Rock-Master – egal, welches Modell Sie verwenden.
Methode 1: Gesang online mit einem KI-Vocal-Remover entfernen
Am besten für: alle, die in etwa einer Minute ein sauberes Instrumental wollen – am Computer oder auf dem Smartphone.
Mit dieser Methode sollten Sie anfangen. Es gibt nichts zu installieren, Sie brauchen keine GPU, und Sie hören sofort, ob das Ergebnis gut genug ist, bevor Sie Zeit in etwas anderes investieren.
Schritt 1: Audiodatei vorbereiten
Gute Quelle, gutes Ergebnis. Vor dem Hochladen:
- Nehmen Sie die beste Quelle, die Sie haben. WAV oder FLAC schlägt MP3. Eine MP3 mit 320 kbps schlägt eine mit 128 kbps.
- Verzichten Sie auf Bildschirmaufnahmen und über Lautsprecher neu aufgenommenes Audio. Raumhall und die Klangfärbung von Lautsprechern verwirren das Modell.
- Schneiden Sie Stille oder lange Intros weg, wenn Ihre Datei nahe an der Längengrenze liegt.
Unterstützte Formate und Grenzen
| Einstellung | AnySpeech Vocal Remover |
|---|---|
| Unterstützte Formate | MP3, WAV, FLAC, M4A (dazu OGG und AAC) |
| Max. Dateigröße | 50 MB |
| Max. Länge | 10 Minuten pro Song |
| Ausgabe | Gesang und Instrumental, beide als MP3 |
| Kostenloser Plan | 1 Song pro Tag mit kostenlosem Konto |
| Bezahlte Nutzung | 500 Credits pro Audiominute |
Videodateien werden nicht direkt angenommen. Exportieren Sie zuerst die Tonspur als MP3.
Schritt 2: Hochladen und Trennung starten
- Öffnen Sie den KI-Vocal-Remover.
- Ziehen Sie Ihre Datei in den Upload-Bereich oder tippen Sie auf dem Smartphone auf Upload a File (Datei hochladen).
- Klicken Sie auf Remove Vocals (Gesang entfernen).
Ein typischer dreiminütiger Song ist in etwa einer Minute fertig. Längere Tracks brauchen ungefähr proportional länger.
Schritt 3: Beide Stems anhören
Laden Sie nicht sofort herunter. Spielen Sie beide Spuren auf der Seite ab und hören Sie an den zwei Stellen genau hin, an denen Probleme zuerst auffallen:
Wo Sie hinhören sollten
- Der lauteste Refrain. In dichten Passagen verstecken sich schwache Gesangsreste im Instrumental.
- Die leiseste Strophe. Sparsame Passagen legen „wässrige“ Artefakte im Instrumental offen.
Klingt beides sauber, sind Sie fertig. Wenn nicht, springen Sie zum Abschnitt zur Fehlerbehebung.
Schritt 4: Herunterladen, was Sie brauchen
Laden Sie das Instrumental für Karaoke oder zum Üben herunter, das Acapella für Remixe oder die Arbeit am Songtext – oder beides. Kostenlose Konten erhalten beide Stems in voller Länge, keine 30-Sekunden-Vorschau.
Weitere beliebte Online-Vocal-Remover
Die meisten Online-Tools nutzen ähnliche Modellfamilien. Die praktischen Unterschiede liegen bei den kostenlosen Kontingenten, den Längenbegrenzungen und der Zahl der Stems.
| Tool | Kostenloser Plan (Stand: September 2026) | Stems | Hinweise |
|---|---|---|---|
| AnySpeech | 1 Song/Tag, bis 10 Min. | 2 | Dasselbe Konto deckt auch Sprachisolierung, Transkription und TTS ab |
| LALAL.AI | Begrenzte Freiminuten | Verschiedene Stem-Typen | Starke Qualität; bezahlte Minutenpakete |
| Moises | 5 Uploads/Monat, je 5 Min. | 2–6 (kostenpflichtig) | Auch als iOS- und Android-App |
| BandLab Splitter | Kostenlos, Dateien bis 15 Min. | 4 | Erfordert ein BandLab-Konto |
| VocalRemover.org | Kostenlos mit Werbung | 2 | Schnelle einmalige Trennungen |
Kostenlose Kontingente ändern sich oft – prüfen Sie daher die Preisseite des jeweiligen Tools, bevor Sie sich auf eine Grenze verlassen. Einen ausführlicheren direkten Vergleich finden Sie in unserer Übersicht der besten Tools zur Audio-Isolierung.
Methode 2: Gesang in Audacity entfernen (kostenlos)
Am besten für: alle, die Audio ohnehin in Audacity bearbeiten und einen kostenlosen Offline-Workflow wollen.
Audacity ist der meistgesuchte Weg – und zugleich der am häufigsten missverstandene. Es gibt drei verschiedene Ansätze, und die meisten älteren Anleitungen behandeln nur den schwächsten davon.
Option A: Das KI-Plug-in Music Separation (empfohlen)
Intel stellt kostenlos die OpenVINO AI plugins for Audacity bereit. Eines davon, Music Separation, führt ein Demucs-v4-Modell lokal auf Ihrem Rechner aus.
So erhalten Sie Stems in KI-Qualität, ohne etwas hochzuladen.
So installieren Sie es
- Rufen Sie die offizielle Download-Seite von Audacity auf und suchen Sie den Abschnitt OpenVINO AI plugins.
- Laden Sie die Version herunter, die zu Ihrer Audacity-Version und Ihrem Betriebssystem passt.
- Führen Sie das Installationsprogramm aus und starten Sie Audacity neu.
- Öffnen Sie Effect › Plugin Manager und stellen Sie sicher, dass die OpenVINO-Effekte aktiviert sind.
📝 Hinweis: Das Plug-in ist für bestimmte Audacity-Versionen gebaut. Taucht es nach der Installation nicht auf, prüfen Sie die Kompatibilitätshinweise auf der Download-Seite. Für eine brandneue Audacity-Version erscheint das passende Plug-in manchmal etwas später.
So trennen Sie den Gesang ab
- Öffnen Sie Ihren Song in Audacity (File › Open).
- Markieren Sie die gesamte Spur mit Ctrl+A (bzw. Cmd+A auf dem Mac).
- Gehen Sie zu Effect › OpenVINO AI Effects › OpenVINO Music Separation.
- Stellen Sie Separation Mode (Trennmodus) auf (2 Stem) Instrumental, Vocals.
- Wählen Sie ein Gerät: GPU oder NPU, sofern vorhanden, andernfalls CPU.
- Klicken Sie auf Apply (Anwenden) und warten Sie. Das dauert meist ein bis drei Minuten.
- Audacity legt für jeden Stem eine neue Spur an. Schalten Sie die Gesangsspur stumm oder löschen Sie sie.
- Exportieren Sie das Instrumental über File › Export Audio.
2-Stem- und 4-Stem-Modus im Vergleich
| Modus | Ausgabespuren | Sinnvoll, wenn |
|---|---|---|
| 2 Stems | Instrumental, Gesang | Sie nur den Gesang entfernen wollen. Das ist sauberer und schneller. |
| 4 Stems | Schlagzeug, Bass, Gesang, Sonstiges | Sie die Instrumente neu ausbalancieren oder einen Übungsmix bauen wollen. |
Option B: Der Effekt Vocal Reduction and Isolation
Das ist der klassische Effekt, den die meisten Audacity-Anleitungen beschreiben. Er basiert auf der Auslöschung des Mittenkanals, nicht auf KI – rechnen Sie also mit den oben beschriebenen Grenzen.
Wichtig: Seit Audacity 3.5 ist dieser Effekt nicht mehr in der Standardinstallation enthalten. Sie müssen ihn von der Plug-in-Seite von Audacity herunterladen, über Tools › Nyquist Plugin Installer installieren und im Plugin Manager aktivieren.
So verwenden Sie ihn
- Markieren Sie den gesamten Song.
- Gehen Sie zu Effect › Special › Vocal Reduction and Isolation.
- Stellen Sie Action (Aktion) auf Remove Vocals.
- Passen Sie die Einstellungen unten an, klicken Sie auf Preview (Vorhören) und dann auf Apply.
Die Einstellungen erklärt
| Einstellung | Standardwert | Was sie bewirkt | Wann Sie sie ändern sollten |
|---|---|---|---|
| Strength | 1,0 | Wie aggressiv mittig liegendes Audio entfernt wird | Leicht erhöhen, wenn Gesang übrig bleibt; senken, wenn der Mix hohl klingt |
| Low Cut for Vocals | 120 Hz | Frequenzen darunter bleiben unangetastet | Hält Bass und Kickdrum intakt – also nicht deutlich erhöhen |
| High Cut for Vocals | 9.000 Hz | Frequenzen darüber bleiben unangetastet | Senken, damit Becken und Hi-Hats brillant bleiben |
Option C: Die manuelle Invertierungsmethode
Sie erledigt dieselbe Aufgabe von Hand. Nützlich ist das vor allem, um das Prinzip zu verstehen, oder auf einem Rechner, auf dem Sie keine Plug-ins installieren können.
- Klicken Sie auf das Menü am Spurnamen und wählen Sie Split Stereo to Mono.
- Markieren Sie nur die untere Spur.
- Gehen Sie zu Effect › Special › Invert.
- Markieren Sie beide Spuren und wählen Sie Tracks › Mix › Mix and Render.
Das Ergebnis ist eine einzelne Mono-Spur, in der alle mittig liegenden Anteile ausgelöscht sind.
Die Audacity-Optionen im Vergleich
| KI-Plug-in | Effekt Vocal Reduction | Manuelle Invertierung | |
|---|---|---|---|
| Technik | KI (Demucs v4) | Mittenauslöschung + EQ-Bänder | Phasenauslöschung |
| Bass und Schlagzeug bleiben erhalten | Ja | Teilweise | Nein |
| Funktioniert mit Mono-Dateien | Ja | Nein | Nein |
| Stereo-Ausgabe | Ja | Ja | Nein |
| Zusätzlicher Download | Ja | Ja (seit 3.5) | Nein |
Methode 3: Ultimate Vocal Remover nutzen (kostenlose Desktop-App)
Am besten für: Fortgeschrittene, die die höchste kostenlose Qualität, volle Kontrolle über die Modelle und unbegrenzte Stapelverarbeitung wollen.
Ultimate Vocal Remover (UVR) ist eine kostenlose Open-Source-Desktop-App für Windows, macOS und Linux. Sie ist eine grafische Oberfläche für zahlreiche Trennungsmodelle, darunter Demucs, MDX-Net und die neuere Roformer-Familie.
Was Sie brauchen
| Voraussetzung | Empfehlung |
|---|---|
| Betriebssystem | Windows 10/11, macOS oder Linux |
| GPU | Eine NVIDIA-Karte beschleunigt die Verarbeitung enorm. Macs mit Apple Silicon werden unterstützt. |
| Nur CPU | Funktioniert, aber ein einzelner Song kann mehrere Minuten dauern |
| Speicherplatz | Einige GB, da jedes heruntergeladene Modell Platz belegt |
| Vorkenntnisse | Sie sollten sich zutrauen, Modelle und Einstellungen selbst zu wählen |
So entfernen Sie Gesang mit UVR
- Laden Sie UVR aus dem offiziellen GitHub-Repository herunter und installieren Sie es.
- Klicken Sie auf Select Input und wählen Sie Ihren Song.
- Wählen Sie einen Ausgabeordner.
- Wählen Sie eine Process Method (siehe Tabelle unten).
- Wählen Sie im Drop-down-Menü ein Modell. Ist es nicht installiert, laden Sie es über das Download-Center herunter.
- Setzen Sie das Häkchen bei GPU Conversion, wenn Sie eine unterstützte Grafikkarte haben.
- Wählen Sie Ausgabeoptionen wie Instrumental Only oder Vocals Only und klicken Sie auf Start Processing.
Welche Modellfamilie Sie wählen sollten
| Process Method | Stärken | Schwächen |
|---|---|---|
| Roformer-Modelle (z. B. BS-Roformer) | Derzeit mit die saubersten Trennungen von Gesang und Instrumental | Rechenintensiver; ohne GPU langsam |
| MDX-Net | Sauberer Gesang, guter Allrounder | Kann bei dichten Mixen leichte Artefakte hinterlassen |
| Demucs v4 | Natürlicher Klang, kann mehrere Stems trennen | Geht mit Backgroundgesang gelegentlich weniger konsequent um |
| VR Architecture | Schnell; enthält De-Echo- und De-Reverb-Modelle | Älterer Ansatz für die Haupttrennung |
Ein Workflow in zwei Durchgängen für schwierige Songs
Der größte Vorteil von UVR ist die Verkettung von Modellen:
- Trennen Sie den Song mit einem starken Gesangsmodell (Roformer oder MDX-Net).
- Lassen Sie ein De-Reverb- oder De-Echo-Modell über das Instrumental laufen, um restlichen Gesangshall zu entfernen.
Das ist etwas anderes, als dieselbe Trennung zweimal durchzuführen – das macht die Sache meist schlimmer. Mehr dazu in der Fehlerbehebung.
Methode 4: Den integrierten Stem-Splitter Ihrer DAW nutzen
Am besten für: Produzenten, die bereits Logic Pro, Ableton Live Suite oder FL Studio besitzen.
Stem-Trennung ist inzwischen eine Standardfunktion in DAWs. Wenn Sie ohnehin für eine davon bezahlen, brauchen Sie womöglich gar kein weiteres Tool.
Stem-Splitter der DAWs im Vergleich
| DAW | Name der Funktion | Stems | Voraussetzungen |
|---|---|---|---|
| Logic Pro | Stem Splitter | Gesang, Schlagzeug, Bass, Sonstiges (neuere Versionen ergänzen Gitarre und Klavier) | Logic Pro 11 oder neuer auf einem Mac mit Apple Silicon oder Logic Pro für iPad |
| Ableton Live | Separate Stems | Gesang, Schlagzeug, Bass, Sonstiges | Live 12.3 oder neuer, nur in der Suite-Edition |
| FL Studio | Extract stems from sample | Gesang, Schlagzeug, Bass, Instrumente | FL Studio 21.2 oder neuer, ab Producer Edition |
So geht es in Logic Pro
- Ziehen Sie den Song auf eine Audiospur.
- Markieren Sie die Region.
- Klicken Sie bei gedrückter Control-Taste auf die Region und wählen Sie Processing › Stem Splitter.
- Wählen Sie ein Preset oder markieren Sie die gewünschten Stems und starten Sie die Trennung.
- Schalten Sie die Gesangsspur stumm und bouncen Sie den Rest.
So geht es in Ableton Live 12.3+
- Ziehen Sie den Song auf eine Audiospur.
- Klicken Sie mit der rechten Maustaste auf den Clip und wählen Sie Separate Stems to New Audio Tracks.
- Markieren Sie die gewünschten Stems und wählen Sie High Quality (High Speed nur für schnelle Vorschauen).
- Die Stems landen in einer farbcodierten Gruppe. Deaktivieren Sie die Gesangsspur und exportieren Sie den Rest.
So geht es in FL Studio
- Ziehen Sie den Song in die Playlist oder das Channel Rack.
- Klicken Sie in der Playlist mit der rechten Maustaste auf den Audioclip und wählen Sie Extract stems from sample. Beim ersten Mal lädt FL Studio das Modell kostenlos herunter.
- Wählen Sie je nach Bedarf Schlagzeug, Bass, Instrumente und Gesang. Jeder Stem landet auf einer eigenen Spur.
- Schalten Sie den Gesang stumm und rendern Sie den Rest.
💡 Profi-Tipp: Menünamen ändern sich von Update zu Update. Wenn Sie die Option nicht finden, suchen Sie in der Hilfe Ihrer DAW nach „stem separation“. Der Ablauf ist überall nahezu gleich.
Methode 5: Gesang auf dem iPhone oder Android-Smartphone entfernen
Am besten für: Musiker, die unterwegs üben, oder alle, die gerade keinen Computer zur Hand haben.
Option A: Ein Browser-Tool nutzen (keine App nötig)
Webbasierte Vocal Remover funktionieren auch im mobilen Safari und in Chrome.
- Speichern Sie den Song in der Dateien-App (iPhone) oder im Download-Ordner (Android).
- Öffnen Sie den Vocal Remover in Ihrem Browser.
- Tippen Sie auf Upload a File und wählen Sie den Song.
- Tippen Sie auf Remove Vocals und spielen Sie die Stems anschließend ab oder laden Sie sie herunter.
Option B: Eine spezielle App nutzen
| App | Plattformen | Kostenloser Plan | Besonderheit |
|---|---|---|---|
| Moises | iOS, Android, Web | 5 Uploads/Monat, je 5 Min. | Tonhöhe, Tempo und Akkorderkennung zum Üben |
| BandLab | iOS, Android, Web | Kostenlos | Der Splitter speist direkt in BandLabs mobiles Studio ein |
| Logic Pro für iPad | iPadOS | Abo | Vollwertiger Stem Splitter für unterwegs |
Option C: Gesang beim Streaming leiser stellen
Wenn Sie nur mitsingen wollen, müssen Sie womöglich gar nichts trennen.
Mit Apple Music Sing können Abonnenten von Apple Music bei unterstützten Songs den Gesang live leiser drehen – mit Songtext in Echtzeit. Das Instrumental können Sie nicht herunterladen, aber für Karaoke zu Hause ist es sofort verfügbar und vollständig lizenziert.
Bonus: Ein Acapella aus einem offiziellen Instrumental gewinnen
Manchmal wollen Sie genau das Gegenteil: den Gesang ohne die Musik.
Haben Sie sowohl den kompletten Song als auch sein offizielles Instrumental, gibt es einen cleveren Trick.
So funktioniert es
Der komplette Mix ist „Instrumental + Gesang“. Ziehen Sie das Instrumental ab, bleibt nur der Gesang übrig.
- Laden Sie beide Dateien untereinander in Audacity.
- Invertieren Sie das Instrumental (Effect › Special › Invert).
- Richten Sie beide Spuren am Anfang exakt aufeinander aus.
- Spielen Sie den Mix ab oder exportieren Sie ihn. Übrig bleibt nur der Gesang.
Wann es nicht klappt
| Problem | Ursache |
|---|---|
| Musik ist weiterhin hörbar | Die beiden Dateien stammen von unterschiedlichen Masters oder haben eine unterschiedliche Lautheit |
| Seltsamer Flanging-Effekt | Die Spuren sind um ein paar Samples gegeneinander verschoben |
| Funktioniert überhaupt nicht | Eine der Dateien ist eine verlustbehaftete MP3, was die Wellenform verändert |
Scheitert der Trick, liefert Ihnen ein KI-Vocal-Remover allein aus dem kompletten Song ein saubereres Acapella.
So beheben Sie ein schlechtes Ergebnis beim Entfernen von Gesang
Selbst die besten Modelle stolpern bei manchen Songs. Die gute Nachricht: Die meisten Probleme haben eine klare Ursache und eine schnelle Lösung.
Problem 1: Geistergesang im Refrain
Was Sie hören: leise Harmonien oder gedoppelten Gesang in den lautesten Passagen.
Ursache: Backgroundgesang ist oft breit im Panorama verteilt und stark bearbeitet, sodass er für das Modell eher wie ein Instrument wirkt.
So beheben Sie es:
- Probieren Sie ein anderes Modell. Roformer-basierte Modelle erfassen Backgroundspuren besonders zuverlässig.
- Setzen Sie nur im Refrain eine sanfte EQ-Absenkung im Bereich von 1–4 kHz.
- Nehmen Sie für Karaoke eine leichte Spur in Kauf. Ein Live-Sänger überdeckt sie vollständig.
Problem 2: Ein Echo der Stimme bleibt zurück
Was Sie hören: eine verwaschene Hall-Fahne nach jeder Gesangsphrase.
Ursache: Hall und Delay verteilen den Gesang zeitlich und im Stereoraum, sodass ein Teil davon als „Raum“ statt als „Stimme“ eingestuft wird.
So beheben Sie es:
- Lassen Sie ein De-Reverb- oder De-Echo-Modell über das Instrumental laufen (UVR bringt mehrere mit).
- Bei kurzen Pausen helfen auch ein Noise Gate oder eine sorgfältige Lautstärkeautomation.
Problem 3: Das Instrumental klingt „wässrig“
Was Sie hören: einen wabernden Unterwasser-Klang bei Becken, Flächen oder Gitarren.
Ursache: Das Modell ist dort unsicher, wo sich Stimme und Instrumente Frequenzen teilen. MP3s mit niedriger Bitrate verschlimmern das, weil die Kompression genau diese Details bereits verwischt hat.
So beheben Sie es:
- Starten Sie erneut mit einer WAV-, FLAC- oder 320-kbps-Datei.
- Verwenden Sie den 2-Stem-Modus statt 4 oder 6 Stems.
- Probieren Sie eine andere Modellfamilie.
Warum die Qualität der Quelle so viel ausmacht
| Quelldatei | Zu erwartendes Ergebnis |
|---|---|
| WAV / FLAC (verlustfrei) | Sauberste Trennung |
| MP3 320 kbps / AAC 256 kbps | Sehr nah an verlustfrei |
| MP3 128 kbps | Hörbare Artefakte bei Becken und Hall |
| Bildschirmaufnahme, über Lautsprecher neu aufgenommen | Schwach; der Raumklang verwirrt das Modell |
Problem 4: Schlagzeug und Bass sind verschwunden
Ursache: Sie haben die Phasenauslöschung verwendet, die alles entfernt, was in der Mitte des Panoramas liegt.
Lösung: Wechseln Sie zu einer der oben beschriebenen KI-Methoden.
Problem 5: Es hat sich gar nichts geändert
Ursache: Die Datei ist mono (häufig bei alten Aufnahmen und manchen YouTube-Rips). Es gibt keinen Stereo-Unterschied, den die Auslöschung nutzen könnte.
Lösung: Bei Mono-Dateien funktioniert nur die KI-Trennung.
Problem 6: Nach einem zweiten Durchgang wurde es schlimmer
Ursache: Jede Trennung fügt winzige Artefakte hinzu. Schicken Sie ein Instrumental erneut durch dasselbe Modell, summieren sie sich.
Lösung: Trennen Sie immer vom Originalsong aus. Brauchen Sie zusätzliche Bereinigung, nehmen Sie eine andere Art von Modell, etwa De-Reverb, statt dasselbe zu wiederholen.
Was können Sie mit den getrennten Stems anfangen?
Sobald Sie saubere Stems haben, eröffnen sich viele Projekte.
Einsatzmöglichkeiten für das Instrumental
- Karaoke: Singen Sie zum Originalarrangement statt zu einer billigen MIDI-Version.
- Instrumente üben: Spielen Sie mit der kompletten Band – nur ohne den Part, den Sie gerade lernen.
- Cover-Aufnahmen: Proben Sie Ihre eigene Gesangsaufnahme zum echten Playback.
- Hintergrundmusik für private Projekte: Diashows, Familienvideos oder Referate, die Sie nicht veröffentlichen.
Einsatzmöglichkeiten für das Acapella
- Remixe und Mashups: das Rohmaterial für DJs und Produzenten (lesen Sie die rechtlichen Hinweise unten, bevor Sie etwas veröffentlichen).
- Gesangsstudium: Hören Sie Phrasierung, Atmer und Harmonien, die im kompletten Mix untergehen.
- Songtexte transkribieren: Eine isolierte Gesangsspur lässt sich deutlich leichter transkribieren. Laden Sie das Acapella in ein Speech-to-Text-Tool hoch, um einen Entwurf des Songtexts mit Zeitstempeln zu erhalten.
Kein Song? Dann ist ein Voice Isolator das richtige Tool
Handelt es sich bei Ihrem Audio um einen Podcast, ein Interview oder ein Video mit Hintergrundgeräuschen statt um Musik, ist ein Vocal Remover das falsche Werkzeug. Ein Voice Isolator ist auf Sprache abgestimmt und entfernt Brummen, Verkehrslärm und Raumklang statt Instrumenten.
Und wenn Sie nur klarere Anrufe brauchen, hat Ihr Smartphone die Funktion womöglich schon eingebaut. So können Sie die Stimmisolierung aktivieren – auf iPhone, Mac und Android.
Ist es legal, Gesang aus einem Lied zu entfernen?
Den Gesang aus einem Song, den Sie rechtmäßig besitzen, für den privaten Gebrauch zu entfernen, ist in der Regel unproblematisch. Das Ergebnis zu veröffentlichen oder zu verkaufen, ist es meist nicht – es sei denn, Sie haben eine Erlaubnis.
Das Trennen einer Datei an sich ist selten das Problem. Entscheidend ist, was Sie anschließend mit den Stems machen.
Warum Stems heikel sind
An einem veröffentlichten Song bestehen zwei getrennte Rechte:
- Die Komposition: Melodie und Text, deren Rechte bei den Songwritern und Musikverlagen liegen.
- Die Tonaufnahme: die konkret aufgenommene Darbietung, deren Rechte meist beim Plattenlabel liegen.
Ein extrahiertes Instrumental ist nach wie vor Teil der ursprünglichen Tonaufnahme. Selbst wenn Sie also eine Lizenz haben, einen Song zu covern, umfasst diese Lizenz in der Regel nicht die Nutzung der Aufnahme des Labels.
Nutzungsarten nach Risikostufe
| Was Sie tun | Risiko | Warum |
|---|---|---|
| Zu Hause üben oder mitsingen | Gering | Private, nicht kommerzielle Nutzung |
| Einen Mix analysieren oder Songtexte für sich selbst transkribieren | Gering | Private, nicht kommerzielle Nutzung |
| Private Karaoke mit Freunden | Gering | Keine öffentliche Verbreitung |
| Ein Cover-Video zum extrahierten Instrumental posten | Mittel | Plattformen können Ansprüche geltend machen, den Ton stummschalten oder das Video entfernen |
| Einen Remix oder ein Mashup auf Streamingdiensten veröffentlichen | Hoch | Erfordert die Erlaubnis des Rechteinhabers der Aufnahme |
| Das Acapella in einem Track samplen, den Sie verkaufen oder monetarisieren | Hoch | Erfordert die Klärung der Rechte an Aufnahme und Komposition |
📝 Hinweis: Dies ist eine allgemeine Orientierung und keine Rechtsberatung. Das Urheberrecht unterscheidet sich von Land zu Land. Wenn Sie etwas veröffentlichen oder monetarisieren möchten, das auf der Aufnahme eines anderen Künstlers aufbaut, sprechen Sie mit einem auf Musikrecht spezialisierten Anwalt oder klären Sie das Sample vorher.
Sichere Alternativen für öffentliche Projekte
- Lizenzieren Sie ein offizielles Instrumental oder eine offizielle Karaoke-Version.
- Verwenden Sie lizenzfreie Playbacks.
- Nehmen Sie Ihr eigenes Arrangement des Songs auf und lizenzieren Sie die Komposition als Cover.
Häufig gestellte Fragen
Kann ich den Gesang kostenlos aus einem Lied entfernen?
Ja. Zu den kostenlosen Optionen gehören Audacity mit Intels Plug-in OpenVINO Music Separation, die Desktop-App Ultimate Vocal Remover und Online-Tools mit kostenlosem Plan. Der Vocal Remover von AnySpeech gibt kostenlosen Konten einen Song pro Tag, bis zu 10 Minuten und 50 MB, und beide Stems lassen sich vollständig herunterladen.
Wie entfernt man Gesang aus einem Lied am besten?
Für die meisten bietet ein Online-KI-Vocal-Remover die beste Balance aus Qualität und Aufwand: hochladen, etwa eine Minute warten, herunterladen. Produzenten mit Logic Pro, Ableton Live Suite oder FL Studio können den integrierten Stem-Splitter nutzen. Fortgeschrittene, die maximale Kontrolle wollen, sollten Ultimate Vocal Remover mit einem Roformer-Modell ausprobieren.
Wie entferne ich Gesang aus einem Lied in Audacity?
Installieren Sie Intels kostenlose OpenVINO-KI-Plug-ins, markieren Sie den Song und wählen Sie Effect › OpenVINO AI Effects › OpenVINO Music Separation im 2-Stem-Modus. Der ältere Effekt Vocal Reduction and Isolation funktioniert weiterhin, arbeitet aber mit Mittenkanal-Auslöschung und ist seit Audacity 3.5 ein separater Download statt eines integrierten Effekts.
Warum höre ich nach dem Vocal Remover immer noch Gesang?
Meist handelt es sich um Backgroundgesang, Doppelungen oder Hall-Fahnen. Sie liegen breit im Panorama oder sind zeitlich verwischt, was ihre Zuordnung erschwert. Probieren Sie ein anderes Modell, starten Sie mit einer verlustfreien Datei und lassen Sie ein De-Reverb-Modell über das Instrumental laufen. Bei der Phasenauslöschung sind Gesangsreste zu erwarten – der Wechsel zur KI löst die meisten Fälle.
Kann man Gesang aus einem Mono-Song entfernen?
Nur mit KI-Trennung. Die Phasenauslöschung braucht einen Unterschied zwischen linkem und rechtem Kanal, und eine Mono-Datei hat keinen – die Auslöschung bewirkt also entweder nichts oder löscht den ganzen Song. KI-Modelle orientieren sich am Klang der Stimme, nicht an ihrer Position im Stereobild, deshalb lassen sich Mono-Aufnahmen problemlos trennen.
Verschlechtert das Entfernen von Gesang die Audioqualität?
Leicht. Selbst die besten Modelle hinterlassen schwache Artefakte, am deutlichsten hörbar bei Becken, Hall und lang gehaltenen Flächen. Mit einer WAV-, FLAC- oder 320-kbps-MP3-Datei als Ausgangsmaterial halten Sie sie minimal. Dichte, stark komprimierte Masters zeigen mehr Artefakte als sparsam arrangierte oder akustische Songs.
Wie bekomme ich nur den Gesang (Acapella) aus einem Song?
Nutzen Sie dieselben Tools und laden Sie statt des Instrumentals die Gesangsspur herunter. Jede Methode in diesem Leitfaden liefert beides. Haben Sie bereits das offizielle Instrumental, können Sie es auch invertiert gegen den kompletten Song laufen lassen, um die Musik auszulöschen – allerdings nur, wenn beide Dateien vom selben Master stammen.
Kann ich auf dem iPhone Gesang aus einem Lied entfernen?
Ja. Öffnen Sie einen browserbasierten Vocal Remover in Safari und laden Sie den Song aus der Dateien-App hoch, oder installieren Sie eine App wie Moises oder BandLab. Wenn Sie nur mitsingen wollen, kann Apple Music Sing den Gesang bei unterstützten Songs leiser stellen, ohne eine Datei zu erzeugen.
Kann ich Gesang aus einem YouTube-Video entfernen?
Nur, wenn Sie die Rechte an dem Audio haben. Laden Sie die Tonspur auf legalem Weg herunter oder exportieren Sie sie (zum Beispiel Ihre eigenen Uploads aus YouTube Studio), speichern Sie sie als MP3 oder WAV und lassen Sie sie anschließend durch einen Vocal Remover laufen. Die meisten Online-Vocal-Remover akzeptieren Audiodateien, keine Videolinks oder Videodateien.
Wie lange dauert es, Gesang aus einem Lied zu entfernen?
Mit einem Online-KI-Tool dauert ein dreiminütiger Song rund eine Minute. Das KI-Plug-in für Audacity braucht auf einem modernen Rechner meist ein bis drei Minuten. Ultimate Vocal Remover ist mit einer starken NVIDIA-GPU in Sekunden fertig, kann allein auf der CPU aber mehrere Minuten benötigen.
Das Fazit
Gesang aus einem Lied zu entfernen, war früher ein Partytrick, der nur halb funktionierte. Die KI-Trennung hat daraus eine zuverlässige Aufgabe von einer Minute gemacht.
So gehen Sie am einfachsten vor:
- Starten Sie online. Laden Sie einen Song in einen KI-Vocal-Remover hoch und hören Sie sich den Refrain an.
- Wechseln Sie bei Bedarf auf lokale Tools. Nutzen Sie das KI-Plug-in für Audacity oder Ultimate Vocal Remover für Offline- oder Massenverarbeitung.
- Nutzen Sie Ihre DAW, wenn Sie ohnehin in Logic, Ableton oder FL Studio produzieren.
- Füttern Sie das Tool mit gutem Audio. Eine verlustfreie Quelle löst mehr Probleme als ein Tool-Wechsel.
- Bleiben Sie im privaten Rahmen, sofern Sie keine Erlaubnis für die Aufnahme haben.
Bereit, es auszuprobieren? Laden Sie einen Song in den kostenlosen KI-Vocal-Remover hoch und erhalten Sie in etwa einer Minute Acapella und Instrumental. Keine Kreditkarte nötig.
Arbeiten Sie auch jenseits von Musik mit Stimmen, lesen Sie unseren Leitfaden, wie Sie Audio in Text umwandeln, oder vergleichen Sie die Optionen in unserer Übersicht der besten Tools zur Audio-Isolierung.
Autor

Kategorien
Weitere Beiträge
Transkript von einem YouTube-Video erhalten: 6 Methoden (2026)
YouTube Transkript anzeigen, kopieren und herunterladen: am PC, am Handy, als TXT/SRT, mit YouTube Studio, bei Videos ohne Untertitel und per Code.

Hintergrundmusik aus einem Video entfernen: 7 Methoden (2026)
Musik aus dem Video entfernen, Stimme behalten: 7 Methoden mit Online-KI-Tools, CapCut, YouTube Erase song, Resolve, Premiere, iPhone und Audacity.


Wie man KI Text-zu-Sprache verwendet: Vollständiger Leitfaden für Anfänger (2025)
Lernen Sie Schritt für Schritt, wie man KI Text-zu-Sprache-Tools verwendet. Entdecken Sie kostenlose Optionen, vergleichen Sie Stimm-Qualität und erhalten Sie praktische Tipps zur Erstellung natürlich klingender Voiceovers.
