
硬字幕识别最常翻车的,不是模型「不够聪明」,而是你送给它的画面不对。台标、时钟、花字、进度条,都会被当成要读的字。先改框和抽帧,比换模型更立竿见影。
先改识别框
默认只看画面下方大约 40%。这覆盖了大多数横屏口播,但挡不住这些情况:
- 竖屏字幕贴在中间或顶部
- 右上角台标、左上角日期被框进去
- 弹幕、点赞动画从字幕区刷过
原则很简单:框里只留字幕,框外全是干扰。台标、时钟、人头上的花字,一律排除。框可以略大于字,但不要大到把半个画面都吃进去。
再改抽帧
0.5~2 fps 通常够用。太密会把同一句拆成三五条重复轴;太疏会漏掉一闪而过的短句。
可以这样试:
- 先用 1 fps 跑一遍,看漏句多不多。
- 漏得多,提到 2 fps,不要一上来就 8 fps。
- 同一句被拆碎,降回 0.5 fps,再在审校里合并。
对比度低(黄字叠在浅色背景、描边很细)时,先提高素材亮度或换一段更干净的成片,比盲目加密抽帧有效。
审校仍然省不掉
OCR 会把「了」认成「子」,把英文专名拆开。识别完成后:
- 合并被拆开的同一句
- 删掉误读的台标和水印
- 按气口微调起止点
看完不如直接做一条。免费额度即开即用。