
Am fertigen Video kostet selten der Schnitt die meiste Zeit, sondern Sprache in lesbare Untertitel zu verwandeln. Fünf Minuten Off können einen Nachmittag fressen, wenn Sie von Hand tippen und die Spur schieben. Das ist der Weg, den wir im Studio wiederholt gegangen sind: Datei wählen, prüfen, exportieren — in etwa zehn Minuten eine veröffentlichbare Fassung.
Zuerst prüfen, ob die Datei zum Diktat passt
Klare Stimme in ruhiger Umgebung eignet sich für Spracherkennung. Fehlt fast jede Stimme und stehen nur eingebrannte Buchstaben im Bild, nutzen Sie OCR für Hardsubs statt eines erzwungenen Transkripts.
Nach dem Upload prüft das Studio Dauer, Auflösung und ob eine Stimme vorhanden ist. Funktionen erst danach ankreuzen spart Kontingent gegenüber einem Start mit allem an.
Ein Zehn-Minuten-Weg
- Öffnen Sie das Studio und legen Sie eine lokale MP4- oder MOV-Datei ab. Das Material bleibt im Browser, nicht in einem öffentlichen Pool.
- Nach der Erkennung KI-Untertitel erzeugen ankreuzen. Bei Lärm oder starkem Akzent ist Automatisch oft stabiler als festes Chinesisch oder Englisch.
- In der Korrektur Tippfehler beheben, zu lange Zeilen teilen und Ein- und Ausblendung an Atempausen legen.
- Eine MP4 mit eingebrannten Untertiteln exportieren oder SRT / VTT für CapCut oder Premiere speichern.
Der Free-Tarif enthält einen Lauf pro Monat — genug, um den Ablauf zu lernen. Stil, Zweisprachigkeit und Kontingente stehen unter Funktionen und Preise.
In der Korrektur nur drei Dinge
- Tippfehler: Namen, Marken und Zahlen laufen zuerst davon. Vor der Veröffentlichung einmal scannen.
- Zeilenlänge: Hochformat etwa 14 chinesische Zeichen oder eine kurze deutsche Klausel; Gesichter nicht verdecken.
- Timing: Zeile etwa 0,1 s vor der Stimme zeigen, ausblenden sobald die Stimme endet.
Was meist bricht
Starkes Grundrauschen, überlappende Sprecher oder eine Hochformat-Datei als Querformat zu behandeln senken die Trefferquote. Leere Köpfe und Schwänze vor dem Modell abschneiden. Die Cues immer überfliegen — das Modell ist schnell, den letzten Pass besitzen Sie.
Wenn danach noch Vertonung nötig ist, auf derselben Timeline bleiben — siehe KI-Vertonung. Übersetzung steht in zweisprachigen Untertiteln, Cover in Creator-Post 2026.
Fertig gelesen? Eins machen. Freikontingent ist bereit.