← Blog

Anleitung2026-09-15 · 7 Lesen

KI-Vertonung auf derselben Untertitelspur | AI Video Factory

KI-Vertonung auf derselben Untertitelspur | AI Video Factory

Vertonung scheitert selten an der Stimme, sondern daran, dass Untertitel in eine andere App wandern: Die Uhr ist weg, der Mund passt nicht, jede Korrektur heißt komplett neu aufnehmen. Im Studio gilt: Cues erst prüfen, dann jede Zeile auf derselben Timeline synthetisieren. Die Vertonung kommt als Extra-Spur, Originalton kann bleiben.

Zuerst saubere Cues

Text ohne Zeitstempel wird von vorn bis hinten gelesen, die Länge ist geraten. Die Reihenfolge, die hält:

  1. Zuerst eine Cue-Liste mit Ein- und Ausgang (Sprache, Hardsub-OCR oder importiertes SRT).
  2. Tippfehler, Namen und Atempausen korrigieren, dann erst vertonen.
  3. Die Synthese liest die aktuellen Cues — kein zweites Projekt.

Der Zehn-Minuten-Untertitelweg steht in diesem Leitfaden. Eine schiefe Achse zu vertonen vergrößert nur die Fehler.

Vertonung auf derselben Timeline

  1. Öffnen Sie das Studio und setzen Sie ein Projekt fort oder legen Sie eine lokale MP4- oder MOV-Datei ab. Die Datei bleibt im Browser.
  2. Prüfen Sie, dass die Cue-Liste Korrektur gelesen ist. Fehlt sie noch, erst erkennen oder SRT importieren.
  3. KI-Vertonung ankreuzen. Chinesisch nutzt 晓晴; Englisch wählt aus mehreren Stimmen. Bei Automatisch nutzen chinesische Zeilen 晓晴, englische die gewählte englische Stimme.
  4. Das Tempo folgt standardmäßig der Cuedauer. Klingt eine Zeile dünn und gehetzt, ändern Sie Wörter oder Ein-/Ausgang — nicht die ganze Datei auf 1,4× ziehen.
  5. Originalton standardmäßig anlassen. Die Vertonung ist eine Extra-Spur, das Bild bleibt am Quellmaterial. Originalton nur stummschalten, wenn die Stimme ihn vollständig ersetzen soll.

Der Free-Tarif enthält einen Vertonungslauf pro Monat. Stimmen, Mix und Kontingente stehen unter Funktionen und Preise.

Vor dem Erzeugen nur drei Dinge

  • Satzzeichen: Anführungszeichen und Auslassungspunkte erzeugen merkwürdige Pausen — in Punkt oder Komma ändern.
  • Ein Atemzug pro Cue: Zwei Sätze in einer Cue lassen die Stimme am falschen Ort einatmen.
  • Chinesisch und Englisch gemischt: Markennamen dürfen englisch bleiben. Wechseln ganze Klauseln die Sprache, ist Automatisch mit zwei Stimmen stabiler als eine festgesetzte Stimme.

Was meist bricht

Vertonung als „ganze Datei vorlesen“: leere Köpfe, Lacher und Stinger werden mitgesprochen. Diese Cues zuerst löschen oder leeren. Immer durchhören — das Modell ist schnell, Mundbild und Pegel gehören Ihnen.

Wenn noch eine Übersetzung nötig ist: erst übersetzen, dann vertonen; die Uhr bewegt sich nicht. Die Gesamtfolge steht in Creator-Post 2026.

Fertig gelesen? Eins machen. Freikontingent ist bereit.