
字幕识别翻车,经常不是模型不够快,而是选错了入口:有人声却去抠画面上的字,或者片子几乎没人声还硬听写。处理台里听写和硬字幕识别都能出同一条轴,先看轨和画面,再勾一项。不要两项一起开。
先看轨,再看字
上传后处理台会先看时长、分辨率和有没有人声。检测结束再勾选,比一上来全开更省额度。
- 轨里有清楚口播:走语音识别。语言选自动往往比锁死中文或英文更稳。
- 几乎没人声、字已经烧在画面上:走硬字幕识别。先改框,再谈抽帧,见硬字幕 OCR。
- 两种都有:选更干净的那一路。口齿清楚就听写;你要的是画面上那层译文或花字,再改 OCR。不要指望一次跑完再自动合并。
十分钟整条路径见这篇教程。轴出来后再谈样式和导出。
只勾一项的走法
- 打开处理台的字幕,拖入本地 MP4 / MOV。素材留在浏览器里。
- 等检测结束。有人声且环境不太吵,勾选语音识别;几乎没人声,改勾硬字幕识别。
- 走 OCR 时框里只留字幕,台标和时钟留在框外。走听写时先剪掉片头片尾空镜,少浪费额度。
- 识别完先审轴:错字、人名、一行长度。再改样式或导出,见竖屏排版与SRT 还是烧录。
免费版字幕每月 1 次。听写、OCR 和额度见功能介绍与定价。
开跑前只盯三件事
- 人声:听得清就听写。底噪大、多人抢话,先剪再识别,不要立刻改 OCR。
- 画面上的字:只有烧录字幕、对白听不到,才改 OCR。框大到半个画面,台标会被读进去。
- 额度:两项各算一次识别。先选对入口,比连跑两次便宜。
常见翻车
把竖屏当横屏去听:准确率会掉,先确认是口播还是只剩画面字。把已经烧过一层的成片再丢给 OCR,会叠出两层轴,改走听写或先盖住旧字。封面另出,不要用识别框当封面,见从成片抽封面。
看完不如直接做一条。免费额度即开即用。