
Vertonung scheitert selten an der Stimme, sondern daran, dass Untertitel in eine andere App wandern: Die Uhr ist weg, der Mund passt nicht, jede Korrektur heißt komplett neu aufnehmen. Im Studio gilt: Cues erst prüfen, dann jede Zeile auf derselben Timeline synthetisieren. Die Vertonung kommt als Extra-Spur, Originalton kann bleiben.
Zuerst saubere Cues
Text ohne Zeitstempel wird von vorn bis hinten gelesen, die Länge ist geraten. Die Reihenfolge, die hält:
- Zuerst eine Cue-Liste mit Ein- und Ausgang (Sprache, Hardsub-OCR oder importiertes SRT).
- Tippfehler, Namen und Atempausen korrigieren, dann erst vertonen.
- Die Synthese liest die aktuellen Cues — kein zweites Projekt.
Der Zehn-Minuten-Untertitelweg steht in diesem Leitfaden. Eine schiefe Achse zu vertonen vergrößert nur die Fehler.
Vertonung auf derselben Timeline
- Öffnen Sie das Studio und setzen Sie ein Projekt fort oder legen Sie eine lokale MP4- oder MOV-Datei ab. Die Datei bleibt im Browser.
- Prüfen Sie, dass die Cue-Liste Korrektur gelesen ist. Fehlt sie noch, erst erkennen oder SRT importieren.
- KI-Vertonung ankreuzen. Chinesisch nutzt 晓晴; Englisch wählt aus mehreren Stimmen. Bei Automatisch nutzen chinesische Zeilen 晓晴, englische die gewählte englische Stimme.
- Das Tempo folgt standardmäßig der Cuedauer. Klingt eine Zeile dünn und gehetzt, ändern Sie Wörter oder Ein-/Ausgang — nicht die ganze Datei auf 1,4× ziehen.
- Originalton standardmäßig anlassen. Die Vertonung ist eine Extra-Spur, das Bild bleibt am Quellmaterial. Originalton nur stummschalten, wenn die Stimme ihn vollständig ersetzen soll.
Der Free-Tarif enthält einen Vertonungslauf pro Monat. Stimmen, Mix und Kontingente stehen unter Funktionen und Preise.
Vor dem Erzeugen nur drei Dinge
- Satzzeichen: Anführungszeichen und Auslassungspunkte erzeugen merkwürdige Pausen — in Punkt oder Komma ändern.
- Ein Atemzug pro Cue: Zwei Sätze in einer Cue lassen die Stimme am falschen Ort einatmen.
- Chinesisch und Englisch gemischt: Markennamen dürfen englisch bleiben. Wechseln ganze Klauseln die Sprache, ist Automatisch mit zwei Stimmen stabiler als eine festgesetzte Stimme.
Was meist bricht
Vertonung als „ganze Datei vorlesen“: leere Köpfe, Lacher und Stinger werden mitgesprochen. Diese Cues zuerst löschen oder leeren. Immer durchhören — das Modell ist schnell, Mundbild und Pegel gehören Ihnen.
Wenn noch eine Übersetzung nötig ist: erst übersetzen, dann vertonen; die Uhr bewegt sich nicht. Die Gesamtfolge steht in Creator-Post 2026.
Fertig gelesen? Eins machen. Freikontingent ist bereit.