
一条成片最耗时间的,往往不是剪辑,而是把说话内容变成能看清的字幕。口播五分钟,手打加对轴就能耗掉一个下午。下面这条路径,是我们在处理台里反复走通的:从选片到导出,十分钟内做出能发布的版本。
先判断这条视频适不适合「听写」
有原声、口齿清楚、环境不太吵的口播,最适合走语音识别。如果轨里几乎没人声,只有烧在画面上的字,就改走硬字幕识别,别硬用听写。
上传后处理台会先看时长、分辨率和有没有人声。检测结束再勾选功能,比一上来全开更省额度。
十分钟路径
- 打开处理台,拖入本地 MP4 / MOV。素材留在浏览器里,不会进公共池。
- 等检测结束后,勾选「AI 字幕生成」。嘈杂或口音重时,语言选「自动」往往比锁死中文更稳。
- 识别完成后进入审校:改错字、拆超过一行的长句、把起止点贴到气口上。
- 导出烧录字幕的 MP4,或另存 SRT / VTT 丢进剪映、Premiere。
免费版这项每月 1 次,够你先跑通流程。样式、双语和额度说明见功能介绍与定价。
审校时只盯三件事
- 错字:人名、品牌、数字最容易飘,发布前扫一遍。
- 一行长度:竖屏建议每行不超过 14 个汉字,横屏可以略宽,但不要挡住人脸。
- 出没点:字幕应在开口前约 0.1 秒出现,在收声后马上消失,比「整句贴死」更跟嘴。
常见翻车
录音底噪大、多人抢话、或者把竖屏当横屏去听,准确率都会掉。这时与其反复重跑模型,不如先剪掉片头片尾的空镜,再识别。识别完仍要人工过一眼——模型负责快,你负责最后一公里。
做完字幕如果还要配音,按同一条轴合成,见AI 配音。翻译见双语字幕出海,封面可以看2026 年创作者后期。
看完不如直接做一条。免费额度即开即用。