Wie du aus 1–3 Minuten Sprachsample eine deutsche TTS-Stimme baust, die für Podcast-Intros, Audio-Werbung oder Erklärvideos funktioniert.
Eine geklonte deutsche Stimme in ElevenLabs, einsetzbar für Podcast-Intros, Audio-Werbung, Hörbücher oder Erklärvideo-Voiceover. Plus eine klare Antwort, wann das rechtlich erlaubt ist.
Die Qualität des Clons hängt zu 80% am Sample. Best Practices:
Ein guter Sample-Text für Deutsch: einmal Tagesschau-Anlauf vorlesen ("Guten Abend meine Damen und Herren..."), dann ein Interview-Statement, dann einen kurzen Witz. ~2 Minuten reichen.
"Voice Lab" → "Add Voice" → "Instant Voice Clone". Upload des Samples. Name vergeben. Wichtig: Labels setzen — "german", "male/female/non-binary", Altersgruppe. Diese Labels werden für spätere Optimierungen benutzt.
Öffne "Speech Synthesis", wähle deine neue Stimme, Modell: Multilingual v2 (NICHT v1, das ist schlechter im Deutschen). Probetext:
Stability auf 0.55, Similarity auf 0.75. Generate. Anhören. Wenn die Stimme noch "Computer-haft" klingt: Stability senken (mehr Variation), Similarity ggf. anpassen.
Deutsche Eigennamen sind die Hauptfehlerquelle. ElevenLabs unterstützt phonetische Hints in eckigen Klammern:
Für Markennamen schreibst du sie phonetisch aus: "Microsoft" → "Maikrosoft", "ChatGPT" → "Tschat-Dschiii-Pi-Tii".
ElevenLabs verlangt im Pro-Tarif (Voice-Cloning mit längeren Samples) eine Voice-Verification — du musst nachweisen, dass die Stimme dir gehört oder dass Einwilligung vorliegt.