
В готовом ролике больше всего времени обычно уходит не на монтаж, а на то, чтобы речь стала читаемыми субтитрами. Пять минут закадра вручную и с подгонкой таймлайна съедают полдень. Ниже путь, который мы много раз проходили в студии: выбрать файл, проверить, выгрузить — примерно за десять минут получить версию к публикации.
Сначала решите, подходит ли файл под «диктовку»
Чистый голос в тихой комнате — для распознавания речи. Если голоса почти нет, а буквы вшиты в картинку, не форсируйте транскрипт, идите в OCR жёстких субтитров.
После загрузки студия сначала смотрит длительность, разрешение и есть ли голос. Функции лучше включать после детекции, а не все сразу — так экономнее лимит.
Путь на десять минут
- Откройте студию и перетащите локальный MP4 или MOV. Файл остаётся в браузере, не в общем пуле.
- Когда детекция закончится, отметьте Сгенерировать субтитры ИИ. При шуме или смешанном акценте Авто обычно стабильнее, чем жёсткий китайский или английский.
- В правке: опечатки, слишком длинные строки, точки входа и выхода к вдохам.
- Выгрузите MP4 с вшитыми субтитрами или сохраните SRT / VTT для CapCut или Premiere.
В бесплатном тарифе один запуск в месяц — хватит, чтобы пройти цикл. Стили, двуязычность и лимиты — на возможностях и ценах.
В правке смотрите только три вещи
- Опечатки: имена, бренды и цифры уезжают первыми. Перед публикацией пробегите глазами.
- Длина строки: вертикаль — около 14 китайских знаков или короткое русское предложение; лица не закрывать.
- Появление: строка ~0,1 с до речи, скрыть сразу после конца голоса.
Что обычно ломается
Сильный шум, говорящие поверх друг друга или вертикальный файл, который слушают как горизонтальный, снижают точность. Обрежьте пустые начало и конец до модели. Реплики всё равно просмотрите: модель даёт скорость, последний проход — ваш.
Если дальше нужна озвучка, оставайтесь на той же шкале — см. озвучку ИИ. Перевод — в двуязычных субтитрах, обложки — в постпродакшене автора 2026.
Дочитали? Сделайте одно. Бесплатная квота уже есть.