
Когда вшитый OCR ошибается, модель часто ни при чём. Кадр — при чём. Логотипы, часы, стикеры и прогресс-бары читаются как слова. Смените рамку и частоту кадров, прежде чем винить движок.
Сначала смените рамку
По умолчанию нижние 40% кадра. Это покрывает большинство горизонтальных закадров и ломается, когда:
- вертикальные субтитры сидят по центру или сверху
- угловой логотип или дата попадают в рамку
- анимации лайков проходят по полосе субтитров
Оставьте только субтитр внутри рамки. Логотипы, часы и стикеры — снаружи. Небольшой запас нормален; половина кадра — нет.
Затем смените частоту кадров
0,5–2 fps обычно хватает. Слишком плотно — одно предложение распадается на несколько дублей. Слишком редко — пропадает вспышка текста.
Попробуйте так:
- Прогон 1 fps — посмотреть, чего не хватает.
- Если строки падают, 2 fps — не прыгать сразу на 8.
- Если одно предложение искрошено, вернуться к 0,5 fps и склеить в правке.
Низкий контраст (жёлтый на светлой стене, тонкий обвод) лучше чинить осветлением исходника, а не более частой выборкой.
Правка всё равно нужна
OCR превратит 了 в 子 и разобьёт английские имена. После прохода:
- склеить реплики одного предложения
- удалить мусор логотипов и водяных знаков
- подвинуть вход/выход к дыханию
Начните в студии и отметьте распознавание жёстких субтитров. Если в файле чистая голосовая дорожка, речь распознаётся быстрее и стабильнее — см. субтитры за десять минут.
Дочитали? Сделайте одно. Бесплатная квота уже есть.